TecnologiaMonitorar

He Kaiming lança VISTA, 'andaime visual' que pode redefinir agentes de IA — startups brasileiras de automação ficam em alerta

· Redação CBI

A equipe de He Kaiming, referência global em visão computacional, publicou o VISTA, um framework que dá aos modelos multimodais memória visual nativa sem retreinamento.

A equipe de He Kaiming, pesquisador que assina trabalhos seminais como ResNet, Mask R-CNN e MAE, publicou o artigo VISTA: A Visual Harness for Reasoning in an Interactive World, propondo um 'andaime visual nativo' para modelos multimodais. Na prática, o VISTA permite que modelos como Claude Opus 5.0 e GPT-5.6 Sol armazenem quadros originais do ambiente fora da janela de contexto e os recuperem sob demanda durante a inferência — sem treinamento adicional. Nos testes com o benchmark ARC-AGI-3, o Claude Opus 5.0 completou os 25 jogos públicos com pontuação máxima de 100 em eficiência de ações e 57,4% menos movimentos que a linha de base humana na primeira partida. O gancho para o Brasil: qualquer empresa que hoje depende de agentes de IA para navegar sistemas legados, portais de governo ou ERPs ganha, em tese, uma camada de raciocínio visual mais robusta — sem precisar trocar de modelo. O que aconteceu. A equipe de He Kaiming publicou o VISTA, um framework que funciona como um 'harness' visual nativo para modelos multimodais. A ideia central é simples na descrição e poderosa na execução: em vez de converter o ambiente em texto ou código — abordagem tradicional em benchmarks como o ARC-AGI-3 —, o VISTA armazena cada quadro retornado pelo ambiente exatamente como está, fora da janela de contexto, incluindo quadros intermediários de animação durante as ações. Quando o modelo precisa, ele recupera essas imagens e as reinsere no raciocínio. Isso permite revisar, ampliar e inspecionar detalhes a qualquer momento, sem retreinar o modelo base. Nos testes, o Claude Opus 5.0 completou todos os 25 jogos públicos do ARC-AGI-3 com pontuação máxima de 100 em eficiência relativa ao humano, usando 57,4% menos ações que a linha de base humana na primeira partida. O GPT-5.6 Sol também completou todos, com pontuação 99. A equipe ainda validou o método em jogos de navegador, labirintos e jogos de ligar pontos, e listou tarefas incorporadas mais próximas do mundo físico como direção futura. Por que isso chega ao Brasil. O impacto direto é indireto, via mecanismo de capacidade de agentes. O VISTA ataca um gargalo que qualquer operação brasileira de automação conhece: agentes de IA falham quando precisam lembrar o que viram em telas, sistemas legados ou interfaces gráficas ao longo de tarefas longas. Setores como serviços financeiros (bancos digitais, fintechs), logística (rastreamento de cargas em portais alfandegários), varejo (integração com ERPs e marketplaces) e compliance (navegação em sistemas da Receita Federal, ANVISA, MAPA) dependem hoje de automações frágeis baseadas em texto ou scripts. Se o VISTA se consolidar como padrão, fornecedores de RPA e plataformas de agentes — incluindo operações brasileiras de integradores como Stefanini, CI&T e startups de IA aplicada — precisarão decidir se adotam a abordagem ou correm o risco de ficar com stacks defasadas. Não há, até agora, anúncio de produto comercial nem disponibilidade pública do código, o que mantém o impacto no campo do planejamento, não da urgência. A interpretação do CBI. Os dados mostram que o VISTA resolve um problema técnico concreto — memória visual persistente fora do contexto — e que os resultados no ARC-AGI-3 são mensuráveis e replicáveis em dois modelos de fronteira distintos. Na leitura do CBI, isso indica três movimentos prováveis nos próximos 6 a 12 meses: primeiro, big techs chinesas (Alibaba, ByteDance, Tencent) e americanas (OpenAI, Anthropic, Google) devem incorporar mecanismos similares em seus SDKs de agentes, tornando o 'harness visual' uma commodity; segundo, fornecedores de RPA e automação no Brasil serão pressionados a integrar essa camada ou perder contratos para concorrentes que o fizerem; terceiro, o custo de entrada para startups brasileiras de agentes verticais cai, porque não será mais necessário treinar modelos do zero para tarefas visuais complexas. Vale comparar com o harness textual que a Anthropic apresentou em novembro do ano passado, baseado em listas de tarefas e arquivos de progresso: aquele mecanismo impulsionou a onda atual de agentes. O VISTA é o análogo visual desse salto — e, se seguir a mesma trajetória, deixa de ser paper e vira feature de produto em poucos trimestres. O que acompanhar. Primeiro, a publicação de código ou API do VISTA pela equipe de He Kaiming ou por parceiros industriais — é o sinal mais concreto de que a tecnologia sai do laboratório. Segundo, anúncios de plataformas de agentes (nacionais ou internacionais com operação no Brasil) incorporando memória visual nativa em seus produtos, o que definiria o novo padrão competitivo. Terceiro, a reação de fornecedores brasileiros de RPA e automação — se integradores locais começarem a citar 'harness visual' em propostas comerciais, o ciclo de adoção já terá começado. Para quem opera na cadeia Brasil-China, o ponto prático é: não é hora de trocar stack, mas é hora de mapear quais processos internos dependem de raciocínio visual e que hoje falham por perda de contexto.

Nota sobre a fonte

A 量子位 é mídia chinesa de tecnologia com histórico de tom promocional sobre avanços de pesquisadores chineses, e o texto original exagera ao sugerir 'redefinição' de agentes quando ainda não há código, API ou produto — o impacto prático no Brasil é de planejamento, não de adoção imediata.

O que isso significa para sua empresa?

A CBI transforma sinais da China em pesquisa de mercado, avaliação de parceiros e apoio à entrada no mercado.

Conversar com a equipe →

Receba o briefing diário

3-5 destaques por dia, direto no e-mail. Gratuito.