---
title: "Framework chinês roda IA de 744B parâmetros em notebook — startups brasileiras de IA podem cortar custo de GPU"
slug: framework-chines-roda-ia-de-744b-parametros-em-notebook-startups-brasileiras-de
type: news
direction: 中国
category: 科技平台
published: 2026-09-26
source_url: https://www.qbitai.com/2026/09/497624.html
source: "量子位"
url: https://chinabrazilinsight.com/news/framework-chines-roda-ia-de-744b-parametros-em-notebook-startups-brasileiras-de
event_type: Tendência setorial
verification: unverified
content_level: 编辑整理
---

# Framework chinês roda IA de 744B parâmetros em notebook — startups brasileiras de IA podem cortar custo de GPU

> O Colibrì, framework open source chinês que usa SSD como memória de vídeo, viralizou no GitHub ao rodar modelos de até 2,8 trilhões de parâmetros em máquinas sem GPU. Para o ecossistema brasileiro de IA, abre caminho para inferência local barata em setores como saúde, jurídico e agronegócio.

## 为什么值得关注

Startups brasileiras de IA em saúde, jurídico e finanças podem cortar custo de inferência ao rodar modelos de centenas de bilhões de parâmetros em servidores sem GPU, mantendo dados sob LGPD.

Um framework de inferência chinês chamado Colibrì, escrito puramente em linguagem C e sem dependência de engines externas, acumulou 32 mil estrelas no GitHub ao demonstrar que é possível rodar o modelo GLM-5.2, de 744 bilhões de parâmetros, em um notebook com apenas 25 GB de RAM e sem GPU dedicada. O truque: manter na memória apenas os cerca de 9,9 GB de pesos densos e empurrar os 370 GB de especialistas roteados para o SSD NVMe, carregando cada especialista sob demanda conforme o roteador do modelo MoE decide. O projeto já cobre nove famílias de modelos, incluindo DeepSeek V4 Flash, Qwen e o Kimi K3, de 2,8 trilhões de parâmetros, que exige 1,6 TB de disco mas apenas 32 GB de RAM. Para o Brasil, onde o custo de GPU em nuvem ainda é barreira para startups de IA, a técnica pode viabilizar inferência local em setores regulados.

O Colibrì foi criado pelo desenvolvedor conhecido como JustVugg e parte de uma premissa simples: se a memória não comporta o modelo inteiro, não coloque tudo dentro. Em vez de exigir VRAM ou RAM suficiente para os 744 bilhões de parâmetros do GLM-5.2, o framework separa o modelo em duas camadas. A primeira, residente, reúne as partes densas usadas em toda inferência — atenção, embeddings e especialistas compartilhados —, cerca de 17 bilhões de parâmetros que, após quantização int4, ocupam apenas 9,9 GB. A segunda, volátil, concentra os 19.456 especialistas roteados, que somam cerca de 370 GB e ficam armazenados no SSD NVMe. Quando o roteador do modelo MoE seleciona quais especialistas ativar para cada token, o Colibrì verifica se eles já estão em cache na RAM ou na VRAM; só os que deram miss são lidos do disco. O autor descreve a abordagem como um JIT (just-in-time) aplicado aos pesos do modelo, em vez de ao código.

O desempenho em cache frio é modesto: na máquina de desenvolvimento original, com CPU de 12 núcleos e 25 GB de RAM, o GLM-5.2 rodava a 0,05 a 0,1 token por segundo. Mas o framework organiza VRAM, RAM e SSD em uma hierarquia de memória em que especialistas mais usados migram para camadas mais rápidas, reduzindo leituras de disco ao longo do tempo. O projeto já cobre GLM-5.2, GLM-5.3, DeepSeek V4 Flash, Qwen, Inkling (975B) e Kimi K3 (2,8T), com requisito mínimo de 16 GB de RAM e recomendado de 24 GB para o GLM-5.2.

Por que isso chega ao Brasil? O custo de inferência de grandes modelos de linguagem é hoje um dos principais gargalos para startups brasileiras de IA, especialmente as que operam em setores regulados — saúde, jurídico, financeiro — e precisam manter dados no país por exigência da LGPD ou de reguladores como ANVISA e Banco Central. Rodar modelos de grande porte em hardware commodity, sem depender de GPUs caras ou de nuvens estrangeiras, muda a equação de custo para essas empresas. O impacto direto é indireto, via redução de barreira de entrada: não há mudança regulatória ou comercial imediata, mas o custo de infraestrutura de IA local cai potencialmente em uma ordem de magnitude para cargas de trabalho que toleram latência alta.

Os dados mostram que o Colibrì é um projeto de comunidade, sem empresa por trás, com 32 mil estrelas no GitHub e foco inicial no GLM-5.2, modelo da Zhipu AI. Na leitura do CBI, isso indica que a corrida por eficiência de inferência — não apenas por escala de treinamento — está se tornando o novo campo de batalha da IA aberta, e que a vantagem chinesa nesse segmento pode se traduzir em ferramentas que chegam ao Brasil antes de equivalentes ocidentais. A comparação com eventos anteriores é relevante: quando o llama.cpp popularizou inferência de modelos de 7B a 13B em CPU, o ecossistema brasileiro de IA local demorou cerca de 12 meses para absorver a técnica. Desta vez, o salto é de ordem de magnitude — de dezenas de bilhões para trilhões de parâmetros — e a janela de adoção pode ser mais curta.

O que acompanhar: primeiro, se o Colibrì ou forks brasileiros passam a suportar modelos ajustados em português, como os da Maritaca AI ou do projeto Amazônia IA, o que definiria sua utilidade real para o mercado local. Segundo, se provedores de nuvem brasileiros — AWS São Paulo, Google Cloud Osasco, Oracle Vinhedo — lançam instâncias otimizadas para SSD NVMe como camada de memória, sinalizando que a técnica sai do GitHub e entra em produção corporativa. Terceiro, se a Finep ou o BNDES incluem inferência local em editais de IA, o que poderia financiar pilotos em hospitais e escritórios de advocacia ainda em 2026.

## CBI 观察

Os dados mostram que o Colibrì é um projeto open source sem empresa, com 32 mil estrelas e foco em modelos chineses como GLM-5.2 e Kimi K3. Na leitura do CBI, isso indica que a eficiência de inferência se torna vantagem competitiva chinesa exportável, e que o Brasil pode absorver a técnica em 6 a 12 meses se houver suporte a modelos em português.

---
来源: 量子位
发布: 2026-09-26
© China Brazil Insight — https://chinabrazilinsight.com/news/framework-chines-roda-ia-de-744b-parametros-em-notebook-startups-brasileiras-de