Por que seu LLM fica lento: o casamento difícil entre hardware e modelos
Modelo não roda no vácuo: ele roda numa máquina com memória e VRAM, e é aí que a maioria dos problemas de performance mora. Um livro novo explica esse porão.
Todo mundo fala de prompt e de treino. Pouca gente fala do que parece óbvio: modelo não roda no vácuo. Ele roda numa máquina, com memória, VRAM e barramento. E é aí que a maior parte dos problemas de performance mora.
O que o livro mostra
O livro AI Infra, do Bojieli, abre esse porão. Ele mostra como a quantidade de parâmetros, o tipo de dado (FP16, quantizado) e a arquitetura do modelo se impõem sobre o hardware que você tem. Não adianta rodar um modelo gigante numa placa que não tem VRAM para ele: a saída vira swap para o disco e a vazão desaba.
A lição que importa para quem opera IA no Brasil: local-first é conta, não bandeira. Self-host sai mais barato dependendo do volume, mas o custo de hardware não some. Ele só muda de lugar.
Um caso concreto do radar: a Cloudflare economizou 100TB de RAM com matemática pura, não com mais máquina. E tem dia de pesquisa quebrando a barreira dos 1.58-bit para LLMs ternários. A corrida, então, deixou de ser só sobre modelo maior e passou a ser sobre modelo mais barato por token.
Como diagnosticar
O que observar na sua máquina, em ordem: (1) tamanho do modelo versus VRAM disponível; (2) quantização usada (FP16, 8-bit, 4-bit); (3) a distância entre o que o marketing promete e o que o gerenciador de VRAM entrega. Se o modelo não couber na memória, reduza a quantização antes de trocar de placa.
Tem também o lado esquecido: latência não mora só na velocidade do chip. Ela mora em quantas vezes o modelo precisa ler o mesmo peso da memória. Modelo que não cabe cacheia mal, e cache ruim custa mais caro do que chip lento.
Por onde começar
Comece medindo: quantos tokens por segundo você consegue hoje, e quanto isso custa. A resposta de infraestrutura muda tudo, e o próprio livro não esconde que o campo ainda tem buracos.
Fontes: bojieli/ai-infra-book (Apache-2.0), o post da Cloudflare sobre salvar 100TB de RAM e o artigo que quebra a barreira dos 1.58-bit (arXiv). Eu não li o livro de ponta a ponta; filtrei as partes que valem para uso local.
Acompanhe o canal no Instagram @iakademi.ia para esses estudos de infra local.
Perguntas rápidas
Por que meu modelo local fica lento?
Na maioria das vezes o modelo não cabe na VRAM e a máquina começa a usar o disco. Reduza a quantização (de FP16 para 8 ou 4 bits) antes de trocar de placa.
Local-first sai mais barato?
Depende do volume. Self-host troca o custo por token por custo de hardware e energia. Meça tokens por segundo e o gasto de energia antes de decidir.
- bojieli/ai-infra-book · https://github.com/bojieli/ai-infra-book · licença Apache-2.0
- Saving another 100TB of RAM · https://blog.cloudflare.com/saving-100-tb-of-ram-with-math/
- Breaking the 1.58-bit Barrier · https://arxiv.org/abs/2609.16338