Kadem
akademia.ia IA sem hype
Notícia · EXPLICA

Por que seu LLM fica lento: o casamento difícil entre hardware e modelos

Modelo não roda no vácuo: ele roda numa máquina com memória e VRAM, e é aí que a maioria dos problemas de performance mora. Um livro novo explica esse porão.

Todo mundo fala de prompt e de treino. Pouca gente fala do que parece óbvio: modelo não roda no vácuo. Ele roda numa máquina, com memória, VRAM e barramento. E é aí que a maior parte dos problemas de performance mora.

O que o livro mostra

O livro AI Infra, do Bojieli, abre esse porão. Ele mostra como a quantidade de parâmetros, o tipo de dado (FP16, quantizado) e a arquitetura do modelo se impõem sobre o hardware que você tem. Não adianta rodar um modelo gigante numa placa que não tem VRAM para ele: a saída vira swap para o disco e a vazão desaba.

A lição que importa para quem opera IA no Brasil: local-first é conta, não bandeira. Self-host sai mais barato dependendo do volume, mas o custo de hardware não some. Ele só muda de lugar.

Um caso concreto do radar: a Cloudflare economizou 100TB de RAM com matemática pura, não com mais máquina. E tem dia de pesquisa quebrando a barreira dos 1.58-bit para LLMs ternários. A corrida, então, deixou de ser só sobre modelo maior e passou a ser sobre modelo mais barato por token.

Como diagnosticar

O que observar na sua máquina, em ordem: (1) tamanho do modelo versus VRAM disponível; (2) quantização usada (FP16, 8-bit, 4-bit); (3) a distância entre o que o marketing promete e o que o gerenciador de VRAM entrega. Se o modelo não couber na memória, reduza a quantização antes de trocar de placa.

Tem também o lado esquecido: latência não mora só na velocidade do chip. Ela mora em quantas vezes o modelo precisa ler o mesmo peso da memória. Modelo que não cabe cacheia mal, e cache ruim custa mais caro do que chip lento.

Por onde começar

Comece medindo: quantos tokens por segundo você consegue hoje, e quanto isso custa. A resposta de infraestrutura muda tudo, e o próprio livro não esconde que o campo ainda tem buracos.

Fontes: bojieli/ai-infra-book (Apache-2.0), o post da Cloudflare sobre salvar 100TB de RAM e o artigo que quebra a barreira dos 1.58-bit (arXiv). Eu não li o livro de ponta a ponta; filtrei as partes que valem para uso local.

Acompanhe o canal no Instagram @iakademi.ia para esses estudos de infra local.

Perguntas rápidas

Por que meu modelo local fica lento?

Na maioria das vezes o modelo não cabe na VRAM e a máquina começa a usar o disco. Reduza a quantização (de FP16 para 8 ou 4 bits) antes de trocar de placa.

Local-first sai mais barato?

Depende do volume. Self-host troca o custo por token por custo de hardware e energia. Meça tokens por segundo e o gasto de energia antes de decidir.

Fontes
Isso rende um carrossel
A versão visual, slide a slide, sai antes no Instagram.
Seguir @iakademi.ia
← todas as notícias