---
title: "He Kaiming lança VISTA, 'andaime visual' que pode redefinir agentes de IA — startups brasileiras de automação ficam em alerta"
slug: he-kaiming-lanca-vista-andaime-visual-que-pode-redefinir-agentes-de-ia-startups
type: news
direction: 中国
category: 科技平台
published: 2026-10-11
source_url: https://www.qbitai.com/2026/10/502628.html
source: "量子位"
url: https://chinabrazilinsight.com/news/he-kaiming-lanca-vista-andaime-visual-que-pode-redefinir-agentes-de-ia-startups
event_type: Tendência setorial
verification: unverified
content_level: 编辑整理
---

# He Kaiming lança VISTA, 'andaime visual' que pode redefinir agentes de IA — startups brasileiras de automação ficam em alerta

> A equipe de He Kaiming, referência global em visão computacional, publicou o VISTA, um framework que dá aos modelos multimodais memória visual nativa sem retreinamento.

## 为什么值得关注

Startups brasileiras de agentes e integradores de RPA precisam avaliar adoção de memória visual nativa antes que big techs empacotem a tecnologia e pressionem contratos em bancos, logística e compliance.

A equipe de He Kaiming, pesquisador que assina trabalhos seminais como ResNet, Mask R-CNN e MAE, publicou o artigo VISTA: A Visual Harness for Reasoning in an Interactive World, propondo um 'andaime visual nativo' para modelos multimodais. Na prática, o VISTA permite que modelos como Claude Opus 5.0 e GPT-5.6 Sol armazenem quadros originais do ambiente fora da janela de contexto e os recuperem sob demanda durante a inferência — sem treinamento adicional. Nos testes com o benchmark ARC-AGI-3, o Claude Opus 5.0 completou os 25 jogos públicos com pontuação máxima de 100 em eficiência de ações e 57,4% menos movimentos que a linha de base humana na primeira partida. O gancho para o Brasil: qualquer empresa que hoje depende de agentes de IA para navegar sistemas legados, portais de governo ou ERPs ganha, em tese, uma camada de raciocínio visual mais robusta — sem precisar trocar de modelo.

O que aconteceu. A equipe de He Kaiming publicou o VISTA, um framework que funciona como um 'harness' visual nativo para modelos multimodais. A ideia central é simples na descrição e poderosa na execução: em vez de converter o ambiente em texto ou código — abordagem tradicional em benchmarks como o ARC-AGI-3 —, o VISTA armazena cada quadro retornado pelo ambiente exatamente como está, fora da janela de contexto, incluindo quadros intermediários de animação durante as ações. Quando o modelo precisa, ele recupera essas imagens e as reinsere no raciocínio. Isso permite revisar, ampliar e inspecionar detalhes a qualquer momento, sem retreinar o modelo base. Nos testes, o Claude Opus 5.0 completou todos os 25 jogos públicos do ARC-AGI-3 com pontuação máxima de 100 em eficiência relativa ao humano, usando 57,4% menos ações que a linha de base humana na primeira partida. O GPT-5.6 Sol também completou todos, com pontuação 99. A equipe ainda validou o método em jogos de navegador, labirintos e jogos de ligar pontos, e listou tarefas incorporadas mais próximas do mundo físico como direção futura.

Por que isso chega ao Brasil. O impacto direto é indireto, via mecanismo de capacidade de agentes. O VISTA ataca um gargalo que qualquer operação brasileira de automação conhece: agentes de IA falham quando precisam lembrar o que viram em telas, sistemas legados ou interfaces gráficas ao longo de tarefas longas. Setores como serviços financeiros (bancos digitais, fintechs), logística (rastreamento de cargas em portais alfandegários), varejo (integração com ERPs e marketplaces) e compliance (navegação em sistemas da Receita Federal, ANVISA, MAPA) dependem hoje de automações frágeis baseadas em texto ou scripts. Se o VISTA se consolidar como padrão, fornecedores de RPA e plataformas de agentes — incluindo operações brasileiras de integradores como Stefanini, CI&T e startups de IA aplicada — precisarão decidir se adotam a abordagem ou correm o risco de ficar com stacks defasadas. Não há, até agora, anúncio de produto comercial nem disponibilidade pública do código, o que mantém o impacto no campo do planejamento, não da urgência.

A interpretação do CBI. Os dados mostram que o VISTA resolve um problema técnico concreto — memória visual persistente fora do contexto — e que os resultados no ARC-AGI-3 são mensuráveis e replicáveis em dois modelos de fronteira distintos. Na leitura do CBI, isso indica três movimentos prováveis nos próximos 6 a 12 meses: primeiro, big techs chinesas (Alibaba, ByteDance, Tencent) e americanas (OpenAI, Anthropic, Google) devem incorporar mecanismos similares em seus SDKs de agentes, tornando o 'harness visual' uma commodity; segundo, fornecedores de RPA e automação no Brasil serão pressionados a integrar essa camada ou perder contratos para concorrentes que o fizerem; terceiro, o custo de entrada para startups brasileiras de agentes verticais cai, porque não será mais necessário treinar modelos do zero para tarefas visuais complexas. Vale comparar com o harness textual que a Anthropic apresentou em novembro do ano passado, baseado em listas de tarefas e arquivos de progresso: aquele mecanismo impulsionou a onda atual de agentes. O VISTA é o análogo visual desse salto — e, se seguir a mesma trajetória, deixa de ser paper e vira feature de produto em poucos trimestres.

O que acompanhar. Primeiro, a publicação de código ou API do VISTA pela equipe de He Kaiming ou por parceiros industriais — é o sinal mais concreto de que a tecnologia sai do laboratório. Segundo, anúncios de plataformas de agentes (nacionais ou internacionais com operação no Brasil) incorporando memória visual nativa em seus produtos, o que definiria o novo padrão competitivo. Terceiro, a reação de fornecedores brasileiros de RPA e automação — se integradores locais começarem a citar 'harness visual' em propostas comerciais, o ciclo de adoção já terá começado. Para quem opera na cadeia Brasil-China, o ponto prático é: não é hora de trocar stack, mas é hora de mapear quais processos internos dependem de raciocínio visual e que hoje falham por perda de contexto.

## CBI 观察

Os dados mostram que o VISTA resolve um gargalo técnico real e foi validado em dois modelos de fronteira com métricas claras. Na leitura do CBI, isso indica que o 'harness visual' deve se tornar feature padrão de plataformas de agentes em 6 a 12 meses, pressionando fornecedores brasileiros de automação a se reposicionarem.

## 情报摘要

**核心动作**: 何恺明团队发布 VISTA 视觉框架，让多模态模型无需重训练即可获得原生视觉记忆，巴西自动化厂商面临技术栈升级压力。

**事实**:
- 何恺明团队发表了题为《VISTA: A Visual Harness for Reasoning in an Interactive World》的论文，提出面向多模态模型的原生视觉框架。
- VISTA 将环境返回的原始帧（含动作过程中的中间动画帧）存储在上下文窗口之外，并在推理时按需检索重新注入，无需对基础模型进行额外训练。
- 在 ARC-AGI-3 基准测试中，Claude Opus 5.0 完成了全部 25 个公开游戏，动作效率得分为 100，且比人类基线少用 57.4% 的动作。
- GPT-5.6 Sol 同样完成了全部 25 个游戏，得分为 99。
- 研究团队还在浏览器游戏、迷宫和连点游戏中验证了该方法，并将更贴近物理世界的具身任务列为未来方向。
- 截至报道时，VISTA 尚无商业产品发布，也未公开代码。
- Anthropic 曾于去年 11 月推出基于任务清单与进度文件的文本型 harness 机制。
- 巴西金融服务、物流、零售和合规等行业目前依赖基于文本或脚本的自动化智能体来操作遗留系统与政府门户。

**评估**:
- VISTA 针对的是智能体在长任务中丢失屏幕/图形界面视觉记忆这一具体技术瓶颈，问题定义明确且结果在两个不同前沿模型上可复现。 (high)
- 未来 6 至 12 个月内，中国与美国头部大厂很可能将类似的视觉记忆机制纳入智能体 SDK，使“视觉 harness”趋于商品化。 (medium)
- 巴西 RPA 厂商与系统集成商若不集成该能力，可能在与已采用者的竞标中失去银行、物流与合规类合同。 (medium)
- 对巴西垂直智能体初创企业而言，视觉复杂任务的进入门槛下降，无需从零训练模型。 (medium)
- 由于尚无代码或商业 API 发布，当前影响应停留在技术路线规划层面，而非立即替换现有技术栈。 (high)

**机会标记**: market_entry_opportunity, partnership_opportunity, investment_signal

---
来源: 量子位
发布: 2026-10-11
© China Brazil Insight — https://chinabrazilinsight.com/news/he-kaiming-lanca-vista-andaime-visual-que-pode-redefinir-agentes-de-ia-startups