Tecnologia
Framework chinês roda IA de 744B parâmetros em notebook — startups brasileiras de IA podem cortar custo de GPU
· Clara Lin
Veículos elétricos e bateriasInfraestrutura e construção
O Colibrì, framework open source chinês que usa SSD como memória de vídeo, viralizou no GitHub ao rodar modelos de até 2,8 trilhões de parâmetros em máquinas sem GPU. Para o ecossistema brasileiro de IA, abre caminho para inferência local barata em setores como saúde, jurídico e agronegócio.
Um framework de inferência chinês chamado Colibrì, escrito puramente em linguagem C e sem dependência de engines externas, acumulou 32 mil estrelas no GitHub ao demonstrar que é possível rodar o modelo GLM-5.2, de 744 bilhões de parâmetros, em um notebook com apenas 25 GB de RAM e sem GPU dedicada. O truque: manter na memória apenas os cerca de 9,9 GB de pesos densos e empurrar os 370 GB de especialistas roteados para o SSD NVMe, carregando cada especialista sob demanda conforme o roteador do modelo MoE decide. O projeto já cobre nove famílias de modelos, incluindo DeepSeek V4 Flash, Qwen e o Kimi K3, de 2,8 trilhões de parâmetros, que exige 1,6 TB de disco mas apenas 32 GB de RAM. Para o Brasil, onde o custo de GPU em nuvem ainda é barreira para startups de IA, a técnica pode viabilizar inferência local em setores regulados.
O Colibrì foi criado pelo desenvolvedor conhecido como JustVugg e parte de uma premissa simples: se a memória não comporta o modelo inteiro, não coloque tudo dentro. Em vez de exigir VRAM ou RAM suficiente para os 744 bilhões de parâmetros do GLM-5.2, o framework separa o modelo em duas camadas. A primeira, residente, reúne as partes densas usadas em toda inferência — atenção, embeddings e especialistas compartilhados —, cerca de 17 bilhões de parâmetros que, após quantização int4, ocupam apenas 9,9 GB. A segunda, volátil, concentra os 19.456 especialistas roteados, que somam cerca de 370 GB e ficam armazenados no SSD NVMe. Quando o roteador do modelo MoE seleciona quais especialistas ativar para cada token, o Colibrì verifica se eles já estão em cache na RAM ou na VRAM; só os que deram miss são lidos do disco. O autor descreve a abordagem como um JIT (just-in-time) aplicado aos pesos do modelo, em vez de ao código.
O desempenho em cache frio é modesto: na máquina de desenvolvimento original, com CPU de 12 núcleos e 25 GB de RAM, o GLM-5.2 rodava a 0,05 a 0,1 token por segundo. Mas o framework organiza VRAM, RAM e SSD em uma hierarquia de memória em que especialistas mais usados migram para camadas mais rápidas, reduzindo leituras de disco ao longo do tempo. O projeto já cobre GLM-5.2, GLM-5.3, DeepSeek V4 Flash, Qwen, Inkling (975B) e Kimi K3 (2,8T), com requisito mínimo de 16 GB de RAM e recomendado de 24 GB para o GLM-5.2.
Por que isso chega ao Brasil? O custo de inferência de grandes modelos de linguagem é hoje um dos principais gargalos para startups brasileiras de IA, especialmente as que operam em setores regulados — saúde, jurídico, financeiro — e precisam manter dados no país por exigência da LGPD ou de reguladores como ANVISA e Banco Central. Rodar modelos de grande porte em hardware commodity, sem depender de GPUs caras ou de nuvens estrangeiras, muda a equação de custo para essas empresas. O impacto direto é indireto, via redução de barreira de entrada: não há mudança regulatória ou comercial imediata, mas o custo de infraestrutura de IA local cai potencialmente em uma ordem de magnitude para cargas de trabalho que toleram latência alta.
Os dados mostram que o Colibrì é um projeto de comunidade, sem empresa por trás, com 32 mil estrelas no GitHub e foco inicial no GLM-5.2, modelo da Zhipu AI. Na leitura do CBI, isso indica que a corrida por eficiência de inferência — não apenas por escala de treinamento — está se tornando o novo campo de batalha da IA aberta, e que a vantagem chinesa nesse segmento pode se traduzir em ferramentas que chegam ao Brasil antes de equivalentes ocidentais. A comparação com eventos anteriores é relevante: quando o llama.cpp popularizou inferência de modelos de 7B a 13B em CPU, o ecossistema brasileiro de IA local demorou cerca de 12 meses para absorver a técnica. Desta vez, o salto é de ordem de magnitude — de dezenas de bilhões para trilhões de parâmetros — e a janela de adoção pode ser mais curta.
O que acompanhar: primeiro, se o Colibrì ou forks brasileiros passam a suportar modelos ajustados em português, como os da Maritaca AI ou do projeto Amazônia IA, o que definiria sua utilidade real para o mercado local. Segundo, se provedores de nuvem brasileiros — AWS São Paulo, Google Cloud Osasco, Oracle Vinhedo — lançam instâncias otimizadas para SSD NVMe como camada de memória, sinalizando que a técnica sai do GitHub e entra em produção corporativa. Terceiro, se a Finep ou o BNDES incluem inferência local em editais de IA, o que poderia financiar pilotos em hospitais e escritórios de advocacia ainda em 2026.
Continue por tema
O que isso significa para sua empresa?
A CBI transforma sinais da China em pesquisa de mercado, avaliação de parceiros e apoio à entrada no mercado.
Conversar com a equipe →Receba o briefing diário
3-5 destaques por dia, direto no e-mail. Gratuito.