{"editorial":{"content_id":"0cc0c9dc-d712-4c2c-bad5-9d4c51c8d8d0","slug":"ia-chinesa-cria-ponte-entre-modelos-grandes-e-pequenos-custo-de-inferencia-cai","content_type":"news","title":"IA chinesa cria ponte entre modelos grandes e pequenos — custo de inferência cai 95% para empresas brasileiras","summary":"Startup Mostik, com vencedor da Medalha Fields, desenvolveu técnica que conecta estados ocultos de modelos de IA, permitindo que um modelo de 4B rode em celular com desempenho próximo a um de 753B na nuvem, reduzindo custos de inferência em 95%.","body":"Uma startup chinesa de apenas 4 meses, a Mostik, anunciou uma técnica que permite a um pequeno modelo de linguagem (Qwen 3.5, da Alibaba, com 4B de parâmetros) rodando em um celular atingir desempenho próximo ao de um modelo massivo (GLM 5.2, da Zhipu, com 753B de parâmetros) na nuvem, no benchmark ARC-AGI 3. A solução, que ainda não teve detalhes técnicos divulgados, constrói uma 'ponte' que transmite os estados ocultos do modelo grande para o pequeno, eliminando a necessidade de geração de texto pelo modelo maior. Para o mercado brasileiro, o impacto é direto: a redução do custo de inferência para cerca de 1/20 do valor original pode viabilizar a adoção de IA avançada em aplicações locais que hoje são inviáveis financeiramente.\n\nA Mostik, fundada há quatro meses com uma equipe de 15 pessoas (12 delas doutores), incluindo o matemático russo Stanislav Smirnov, vencedor da Medalha Fields, demonstrou uma abordagem inovadora para a colaboração entre modelos de IA. Em vez de permitir que um modelo grande 'explique' o raciocínio a um modelo pequeno via texto, a técnica da startup transmite diretamente os 'estados ocultos' — as representações internas que o modelo grande constrói antes de gerar um token. No processo tradicional, ao gerar um token, um modelo grande descarta cerca de 2 megabytes de informação de estado interno, mantendo apenas 17 bits (o token em si). A Mostik construiu uma 'ponte' treinada que permite que esses estados ocultos sejam transmitidos diretamente ao modelo pequeno, que então gera a resposta final. Os pesos de ambos os modelos permanecem congelados; apenas a ponte é treinada. Segundo a equipe, essa solução permite que um modelo de 4B compense cerca de 50% da diferença de desempenho em relação a um modelo de 753B, aumentando sua precisão em 25% e, em subconjuntos de problemas mais complexos, o ganho chega a 2 vezes. O custo de inferência do lado do modelo grande é reduzido para cerca de um vigésimo do original, pois ele não precisa gerar texto, apenas processar a entrada e transmitir seus estados internos.","why_it_matters":"A redução de 95% no custo de inferência de modelos de IA de grande porte pode tornar viável a implementação de assistentes inteligentes e automação avançada para empresas brasileiras de médio porte, que hoje dependem de APIs caras ou de modelos menores e menos capazes.","cbi_observation":"FATO: A Mostik demonstrou a técnica no benchmark ARC-AGI 3, mas não divulgou os detalhes técnicos, citando a competição em andamento. AVALIAÇÃO: Na leitura do CBI, a abordagem de transmitir estados ocultos, em vez de texto, ataca uma ineficiência fundamental na comunicação entre modelos. Se a técnica for validada de forma independente e escalável, ela pode redefinir a economia da IA, tornando a computação em nuvem um complemento, e não um substituto, para a computação local.","direction_tag":"中国","primary_category":"科技平台","secondary_topics":["电子","zh-tech"],"content_level":"编辑整理","event_type":"Tendência setorial","audience_tags":["Empresas com operações na China","Empreendedores","Instituições financeiras"],"event_location":null,"verification_status":"unverified","published_at":"2026-09-07T11:04:02.789Z","display_date":"2026-09-07","source_published_at":null,"source_url":"https://www.qbitai.com/2026/09/485108.html","source_name":"量子位","source_language":"zh","author_name":"Clara Lin","risk_level":"low","risk_flags":["regulatory_uncertainty"],"opportunity_flags":["market_entry_opportunity","partnership_opportunity"],"trend_signals":["ai_inference_cost_reduction","bilateral_trade_acceleration"]},"intelligence":{"intel_id":"3322aa82-bbd2-4271-9081-e10e5b4f64f7","version":1,"event_type":"产品上线","event_date":null,"main_entities":[{"name":"Mostik","role":"中国AI初创企业，开发了连接大模型与小模型隐藏状态的技术","type":"company","country":"中国","normalized_name":null},{"name":"Qwen 3.5","role":"阿里巴巴旗下4B参数小语言模型，在移动端运行","type":"product","country":"中国","normalized_name":null},{"name":"GLM 5.2","role":"智谱旗下753B参数大语言模型，在云端运行","type":"product","country":"中国","normalized_name":null},{"name":"Stanislav Smirnov","role":"菲尔兹奖得主，Mostik团队成员","type":"person","country":"其他","normalized_name":null}],"main_action":"中国初创公司Mostik发布AI模型桥接技术，让4B参数小模型获得接近753B大模型的性能，推理成本降为约1/20。","key_numbers":[{"unit":"%","label":"推理成本降幅","value":"95"},{"unit":"B","label":"小模型参数规模","value":"4"},{"unit":"B","label":"大模型参数规模","value":"753"},{"unit":"%","label":"精度提升","value":"25"},{"unit":"倍","label":"复杂问题性能增益","value":"2"},{"unit":"bits","label":"大模型生成每token保留信息量","value":"17"},{"unit":"MB","label":"大模型生成每token丢弃信息量","value":"2"}],"facts":[{"verified":false,"statement":"Mostik是一家成立约4个月的中国初创公司，团队有15人，其中12人拥有博士学位。","source_excerpt":null},{"verified":false,"statement":"该技术通过训练一个'桥梁'连接大模型的隐藏状态与小模型，使小模型能利用大模型的内部表征生成回答。","source_excerpt":null},{"verified":false,"statement":"Mostik声称在ARC-AGI 3基准上，4B参数的Qwen 3.5通过该技术获得了接近753B参数GLM 5.2的性能。","source_excerpt":null},{"verified":false,"statement":"该方案中两个模型的权重均保持冻结，只有桥接层被训练。","source_excerpt":null},{"verified":false,"statement":"大模型在生成token时，平均丢弃约2MB内部状态信息，只保留17bit的token本身。","source_excerpt":null},{"verified":false,"statement":"Mostik称该技术可使大模型侧推理成本降至原来的约1/20，即减少95%。","source_excerpt":null}],"assessments":[{"statement":"若该技术声明属实，将显著降低巴西中型企业部署高级AI助手的成本门槛，使其摆脱对昂贵API或能力较弱小模型的依赖。","confidence":"medium","basis_fact_index":null},{"statement":"由于技术细节尚未披露，且评测方法和复现性未验证，对该技术的宣称应保持审慎。","confidence":"high","basis_fact_index":null},{"statement":"此类跨模型隐藏状态传递技术若成熟，可能改变AI推理成本结构，推动AI应用向端侧和边缘设备普及。","confidence":"medium","basis_fact_index":null}],"actions":[{"target":"system","priority":"high","description":"持续跟踪Mostik发布的技术论文、代码或第三方复现结果，验证成本降低与性能提升的真实性。"},{"target":"user","priority":"normal","description":"评估该技术对巴西本地AI市场的影响，识别可作为早期客户或合作伙伴的巴西中型企业。"}],"affected_audience":["巴西中型企业","AI应用开发者","云服务提供商","巴西本地科技创业公司"],"risk_flags":["regulatory_uncertainty"],"opportunity_flags":["market_entry_opportunity","partnership_opportunity"],"trend_signals":["ai_inference_cost_reduction","bilateral_trade_acceleration"],"follow_up_needed":true,"follow_up_questions":["Mostik计划何时发布技术细节或白皮书？","ARC-AGI 3的测试条件和结果是否有第三方验证？","该技术何时可对中国以外市场（如巴西）提供授权或合作？","模型之间隐藏状态传递是否需要特定硬件支持？"],"related_topics":["人工智能","大语言模型","模型压缩","推理成本","中巴科技合作"],"verification_status":"unverified","confidence_score":0.7,"generated_at":"2026-09-07T11:04:22.370Z"},"meta":{"canonical_url":"https://chinabrazilinsight.com/news/ia-chinesa-cria-ponte-entre-modelos-grandes-e-pequenos-custo-de-inferencia-cai","api_url":"https://chinabrazilinsight.com/api/public/content/ia-chinesa-cria-ponte-entre-modelos-grandes-e-pequenos-custo-de-inferencia-cai","markdown_url":"https://chinabrazilinsight.com/api/public/content/ia-chinesa-cria-ponte-entre-modelos-grandes-e-pequenos-custo-de-inferencia-cai?view=markdown","json_url":"https://chinabrazilinsight.com/api/public/content/ia-chinesa-cria-ponte-entre-modelos-grandes-e-pequenos-custo-de-inferencia-cai?view=json","last_updated":"2026-09-07T11:04:22.390Z","platform":"China Brazil Insight","platform_url":"https://chinabrazilinsight.com"}}