{"editorial":{"content_id":"08ee85ca-f9b8-403f-ac44-b0aff0c545d8","slug":"he-kaiming-lanca-vista-andaime-visual-que-pode-redefinir-agentes-de-ia-startups","content_type":"news","title":"He Kaiming lança VISTA, 'andaime visual' que pode redefinir agentes de IA — startups brasileiras de automação ficam em alerta","summary":"A equipe de He Kaiming, referência global em visão computacional, publicou o VISTA, um framework que dá aos modelos multimodais memória visual nativa sem retreinamento.","body":"A equipe de He Kaiming, pesquisador que assina trabalhos seminais como ResNet, Mask R-CNN e MAE, publicou o artigo VISTA: A Visual Harness for Reasoning in an Interactive World, propondo um 'andaime visual nativo' para modelos multimodais. Na prática, o VISTA permite que modelos como Claude Opus 5.0 e GPT-5.6 Sol armazenem quadros originais do ambiente fora da janela de contexto e os recuperem sob demanda durante a inferência — sem treinamento adicional. Nos testes com o benchmark ARC-AGI-3, o Claude Opus 5.0 completou os 25 jogos públicos com pontuação máxima de 100 em eficiência de ações e 57,4% menos movimentos que a linha de base humana na primeira partida. O gancho para o Brasil: qualquer empresa que hoje depende de agentes de IA para navegar sistemas legados, portais de governo ou ERPs ganha, em tese, uma camada de raciocínio visual mais robusta — sem precisar trocar de modelo.\n\nO que aconteceu. A equipe de He Kaiming publicou o VISTA, um framework que funciona como um 'harness' visual nativo para modelos multimodais. A ideia central é simples na descrição e poderosa na execução: em vez de converter o ambiente em texto ou código — abordagem tradicional em benchmarks como o ARC-AGI-3 —, o VISTA armazena cada quadro retornado pelo ambiente exatamente como está, fora da janela de contexto, incluindo quadros intermediários de animação durante as ações. Quando o modelo precisa, ele recupera essas imagens e as reinsere no raciocínio. Isso permite revisar, ampliar e inspecionar detalhes a qualquer momento, sem retreinar o modelo base. Nos testes, o Claude Opus 5.0 completou todos os 25 jogos públicos do ARC-AGI-3 com pontuação máxima de 100 em eficiência relativa ao humano, usando 57,4% menos ações que a linha de base humana na primeira partida. O GPT-5.6 Sol também completou todos, com pontuação 99. A equipe ainda validou o método em jogos de navegador, labirintos e jogos de ligar pontos, e listou tarefas incorporadas mais próximas do mundo físico como direção futura.\n\nPor que isso chega ao Brasil. O impacto direto é indireto, via mecanismo de capacidade de agentes. O VISTA ataca um gargalo que qualquer operação brasileira de automação conhece: agentes de IA falham quando precisam lembrar o que viram em telas, sistemas legados ou interfaces gráficas ao longo de tarefas longas. Setores como serviços financeiros (bancos digitais, fintechs), logística (rastreamento de cargas em portais alfandegários), varejo (integração com ERPs e marketplaces) e compliance (navegação em sistemas da Receita Federal, ANVISA, MAPA) dependem hoje de automações frágeis baseadas em texto ou scripts. Se o VISTA se consolidar como padrão, fornecedores de RPA e plataformas de agentes — incluindo operações brasileiras de integradores como Stefanini, CI&T e startups de IA aplicada — precisarão decidir se adotam a abordagem ou correm o risco de ficar com stacks defasadas. Não há, até agora, anúncio de produto comercial nem disponibilidade pública do código, o que mantém o impacto no campo do planejamento, não da urgência.\n\nA interpretação do CBI. Os dados mostram que o VISTA resolve um problema técnico concreto — memória visual persistente fora do contexto — e que os resultados no ARC-AGI-3 são mensuráveis e replicáveis em dois modelos de fronteira distintos. Na leitura do CBI, isso indica três movimentos prováveis nos próximos 6 a 12 meses: primeiro, big techs chinesas (Alibaba, ByteDance, Tencent) e americanas (OpenAI, Anthropic, Google) devem incorporar mecanismos similares em seus SDKs de agentes, tornando o 'harness visual' uma commodity; segundo, fornecedores de RPA e automação no Brasil serão pressionados a integrar essa camada ou perder contratos para concorrentes que o fizerem; terceiro, o custo de entrada para startups brasileiras de agentes verticais cai, porque não será mais necessário treinar modelos do zero para tarefas visuais complexas. Vale comparar com o harness textual que a Anthropic apresentou em novembro do ano passado, baseado em listas de tarefas e arquivos de progresso: aquele mecanismo impulsionou a onda atual de agentes. O VISTA é o análogo visual desse salto — e, se seguir a mesma trajetória, deixa de ser paper e vira feature de produto em poucos trimestres.\n\nO que acompanhar. Primeiro, a publicação de código ou API do VISTA pela equipe de He Kaiming ou por parceiros industriais — é o sinal mais concreto de que a tecnologia sai do laboratório. Segundo, anúncios de plataformas de agentes (nacionais ou internacionais com operação no Brasil) incorporando memória visual nativa em seus produtos, o que definiria o novo padrão competitivo. Terceiro, a reação de fornecedores brasileiros de RPA e automação — se integradores locais começarem a citar 'harness visual' em propostas comerciais, o ciclo de adoção já terá começado. Para quem opera na cadeia Brasil-China, o ponto prático é: não é hora de trocar stack, mas é hora de mapear quais processos internos dependem de raciocínio visual e que hoje falham por perda de contexto.","why_it_matters":"Startups brasileiras de agentes e integradores de RPA precisam avaliar adoção de memória visual nativa antes que big techs empacotem a tecnologia e pressionem contratos em bancos, logística e compliance.","cbi_observation":"Os dados mostram que o VISTA resolve um gargalo técnico real e foi validado em dois modelos de fronteira com métricas claras. Na leitura do CBI, isso indica que o 'harness visual' deve se tornar feature padrão de plataformas de agentes em 6 a 12 meses, pressionando fornecedores brasileiros de automação a se reposicionarem.","direction_tag":"中国","primary_category":"科技平台","secondary_topics":["电子","zh-tech"],"content_level":"编辑整理","event_type":"Tendência setorial","audience_tags":["Empreendedores","Investidores","Empresas com operações na China"],"event_location":null,"verification_status":"unverified","published_at":"2026-10-11T11:02:24.432Z","display_date":"2026-10-11","source_published_at":null,"source_url":"https://www.qbitai.com/2026/10/502628.html","source_name":"量子位","source_language":"zh","author_name":"编辑部","risk_level":"low","risk_flags":[],"opportunity_flags":["market_entry_opportunity","partnership_opportunity","investment_signal"],"trend_signals":["technology_commoditization","ai_agent_capability_upgrade"]},"intelligence":{"intel_id":"00cc886e-2a85-4110-ae15-10bca0c08cd9","version":1,"event_type":"行业趋势","event_date":null,"main_entities":[{"name":"He Kaiming (何恺明)","role":"ResNet、Mask R-CNN、MAE 作者，VISTA 论文团队负责人","type":"person","country":"中国","normalized_name":null},{"name":"VISTA (A Visual Harness for Reasoning in an Interactive World)","role":"面向多模态模型的原生视觉“挽具”框架，提供上下文窗口外的视觉记忆","type":"product","country":"中国","normalized_name":null},{"name":"ARC-AGI-3","role":"用于验证 VISTA 的交互式推理基准，含 25 个公开游戏","type":"platform","country":"其他","normalized_name":null},{"name":"Claude Opus 5.0","role":"测试中完成全部 25 个游戏的模型，动作效率得分 100","type":"product","country":"其他","normalized_name":null},{"name":"GPT-5.6 Sol","role":"测试中完成全部 25 个游戏的模型，得分 99","type":"product","country":"其他","normalized_name":null},{"name":"Stefanini","role":"可能受影响的巴西 IT 集成与自动化服务商","type":"company","country":"巴西","normalized_name":null},{"name":"CI&T","role":"可能受影响的巴西数字服务与自动化集成商","type":"company","country":"巴西","normalized_name":null},{"name":"Alibaba / ByteDance / Tencent","role":"被预判将把类似机制纳入智能体 SDK 的中国大厂","type":"company","country":"中国","normalized_name":null},{"name":"OpenAI / Anthropic / Google","role":"被预判将把类似机制纳入智能体 SDK 的美国大厂","type":"company","country":"其他","normalized_name":null},{"name":"巴西 RPA 与 AI 智能体初创企业","role":"面临技术栈升级压力的直接受影响方","type":"sector","country":"巴西","normalized_name":null},{"name":"巴西金融、物流、零售与合规行业","role":"依赖智能体操作遗留系统、政府门户与 ERP 的需求方","type":"sector","country":"巴西","normalized_name":null}],"main_action":"何恺明团队发布 VISTA 视觉框架，让多模态模型无需重训练即可获得原生视觉记忆，巴西自动化厂商面临技术栈升级压力。","key_numbers":[{"unit":"个","label":"ARC-AGI-3 公开游戏完成数","value":"25"},{"unit":"分","label":"Claude Opus 5.0 动作效率得分","value":"100"},{"unit":"%","label":"Claude Opus 5.0 相对人类基线的动作节省","value":"57.4"},{"unit":"分","label":"GPT-5.6 Sol 得分","value":"99"},{"unit":"个月","label":"预判影响窗口","value":"6-12"}],"facts":[{"verified":false,"statement":"何恺明团队发表了题为《VISTA: A Visual Harness for Reasoning in an Interactive World》的论文，提出面向多模态模型的原生视觉框架。","source_excerpt":null},{"verified":false,"statement":"VISTA 将环境返回的原始帧（含动作过程中的中间动画帧）存储在上下文窗口之外，并在推理时按需检索重新注入，无需对基础模型进行额外训练。","source_excerpt":null},{"verified":false,"statement":"在 ARC-AGI-3 基准测试中，Claude Opus 5.0 完成了全部 25 个公开游戏，动作效率得分为 100，且比人类基线少用 57.4% 的动作。","source_excerpt":null},{"verified":false,"statement":"GPT-5.6 Sol 同样完成了全部 25 个游戏，得分为 99。","source_excerpt":null},{"verified":false,"statement":"研究团队还在浏览器游戏、迷宫和连点游戏中验证了该方法，并将更贴近物理世界的具身任务列为未来方向。","source_excerpt":null},{"verified":false,"statement":"截至报道时，VISTA 尚无商业产品发布，也未公开代码。","source_excerpt":null},{"verified":false,"statement":"Anthropic 曾于去年 11 月推出基于任务清单与进度文件的文本型 harness 机制。","source_excerpt":null},{"verified":false,"statement":"巴西金融服务、物流、零售和合规等行业目前依赖基于文本或脚本的自动化智能体来操作遗留系统与政府门户。","source_excerpt":null}],"assessments":[{"statement":"VISTA 针对的是智能体在长任务中丢失屏幕/图形界面视觉记忆这一具体技术瓶颈，问题定义明确且结果在两个不同前沿模型上可复现。","confidence":"high","basis_fact_index":null},{"statement":"未来 6 至 12 个月内，中国与美国头部大厂很可能将类似的视觉记忆机制纳入智能体 SDK，使“视觉 harness”趋于商品化。","confidence":"medium","basis_fact_index":null},{"statement":"巴西 RPA 厂商与系统集成商若不集成该能力，可能在与已采用者的竞标中失去银行、物流与合规类合同。","confidence":"medium","basis_fact_index":null},{"statement":"对巴西垂直智能体初创企业而言，视觉复杂任务的进入门槛下降，无需从零训练模型。","confidence":"medium","basis_fact_index":null},{"statement":"由于尚无代码或商业 API 发布，当前影响应停留在技术路线规划层面，而非立即替换现有技术栈。","confidence":"high","basis_fact_index":null}],"actions":[{"target":"user","priority":"high","description":"梳理内部与客户流程中依赖视觉推理、且目前因视觉记忆丢失而失败的环节，建立清单。"},{"target":"both","priority":"high","description":"持续监测 VISTA 代码/API 发布，以及主流智能体平台是否上线原生视觉记忆功能。"},{"target":"system","priority":"normal","description":"在巴西 RPA 与系统集成商的商业提案与竞标文件中跟踪“视觉 harness”相关表述，作为采纳周期启动信号。"},{"target":"user","priority":"normal","description":"评估与具备视觉智能体能力的中方技术供应商建立合作或技术引进的可行性。"}],"affected_audience":["巴西 RPA 与自动化集成商","巴西垂直 AI 智能体初创企业","巴西银行与金融科技公司","巴西物流与报关自动化团队","巴西零售 ERP/电商平台集成方","巴西合规与政府系统对接服务商","中巴科技合作与投资机构"],"risk_flags":[],"opportunity_flags":["market_entry_opportunity","partnership_opportunity","investment_signal"],"trend_signals":["technology_commoditization","ai_agent_capability_upgrade"],"follow_up_needed":true,"follow_up_questions":["VISTA 的代码或 API 是否已由何恺明团队或产业伙伴公开发布？","是否有主流智能体平台（国内或国际）宣布集成原生视觉记忆能力？","巴西本地 RPA 厂商与集成商是否开始在商业提案中引用“视觉 harness”？","ARC-AGI-3 的测试结果是否有第三方独立复现？","巴西金融、物流、合规等行业中，哪些具体流程最依赖视觉推理且当前失败率最高？"],"related_topics":["多模态大模型","AI 智能体","视觉记忆","RPA 自动化","ARC-AGI-3","何恺明","巴西自动化市场","技术栈升级","中巴科技合作"],"verification_status":"unverified","confidence_score":0.7,"generated_at":"2026-10-11T11:02:36.909Z"},"meta":{"canonical_url":"https://chinabrazilinsight.com/news/he-kaiming-lanca-vista-andaime-visual-que-pode-redefinir-agentes-de-ia-startups","api_url":"https://chinabrazilinsight.com/api/public/content/he-kaiming-lanca-vista-andaime-visual-que-pode-redefinir-agentes-de-ia-startups","markdown_url":"https://chinabrazilinsight.com/api/public/content/he-kaiming-lanca-vista-andaime-visual-que-pode-redefinir-agentes-de-ia-startups?view=markdown","json_url":"https://chinabrazilinsight.com/api/public/content/he-kaiming-lanca-vista-andaime-visual-que-pode-redefinir-agentes-de-ia-startups?view=json","last_updated":"2026-10-11T11:02:37.228Z","platform":"China Brazil Insight","platform_url":"https://chinabrazilinsight.com"}}