---
title: "Exclusivo | Hu Han, responsável pela compreensão multimodal do Hunyuan, pede demissão para empreender; equipe original pode focar em modelo mundial"
slug: exclusivo-hu-han-responsvel-pela-compreenso-multimodal-do-hunyuan-pede-demisso-p
type: news
direction: 中国
category: 宏观市场
published: 2026-07-23
source_url: https://36kr.com/p/3907934819521670?f=rss
source: "36氪"
url: https://chinabrazilinsight.com/news/exclusivo-hu-han-responsvel-pela-compreenso-multimodal-do-hunyuan-pede-demisso-p
verification: unverified
content_level: 编辑整理
---

# Exclusivo | Hu Han, responsável pela compreensão multimodal do Hunyuan, pede demissão para empreender; equipe original pode focar em modelo mundial

> Hu Han, responsável pela compreensão multimodal do Tencent Hunyuan, pediu demissão. Yao Shunyu reorganiza equipes e foca em modelos de linguagem de grande escala, prioridade do Hunyuan. A Tencent busca acelerar desenvolvimento de IA com novos talentos e recursos.

Texto | Zhou Xinyu
Edição | Zhang Yuxin O “Inteligência Emergente” apurou com exclusividade que, recentemente, Hu Han, responsável pela compreensão multimodal do Tencent Hunyuan, pediu demissão.
Anteriormente, ele atuou como pesquisador-chefe do Grupo de Computação Visual da Microsoft Research Asia. No início de 2025, após ingressar na Tencent, ficou responsável pela pesquisa de modelos de visão de grande escala. Em ajustes posteriores, ele se juntou ao grupo de pesquisa de tecnologia de ponta “Frontier”, subordinado ao Departamento de Modelos de Linguagem de Grande Escala, responsável por pesquisas relacionadas à compreensão multimodal, reportando-se a Yao Shunyu.
Sabe-se que Hu Han também esteve envolvido no desenvolvimento de modelos mundiais.
Enquanto isso, Yao Shunyu, chefe do Departamento de Modelos de Linguagem de Grande Escala da Tencent, vem recentemente reorganizando intensamente suas equipes. O grupo de pesquisa onde Hu Han estava anteriormente pode se concentrar em pesquisas de ponta sobre modelos mundiais.
Até o fechamento desta edição, a Tencent não respondeu às informações acima. Modelos de linguagem de grande escala continuam sendo a prioridade mais importante do Hunyuan
Desde meados de 2026, mudanças de pessoal no sistema Hunyuan vêm ocorrendo constantemente. No início de julho, Tian Yonglong, ex-pesquisador da OpenAI e doutor pelo MIT, ingressou no Departamento de Modelos de Linguagem de Grande Escala — soubemos que ele substituirá Hu Han na direção de pesquisa de modelos de linguagem visual (VLM), reportando-se a Yao Shunyu.
Desde a chegada de Yao Shunyu, suprir as deficiências e elevar rapidamente a capacidade do modelo base Hunyuan ao primeiro escalão tornou-se a linha principal da IA da Tencent.
Reorganizar a alocação de recursos, concentrando talentos e poder computacional no desenvolvimento de modelos base sob responsabilidade do Departamento de Modelos de Linguagem de Grande Escala, é uma das medidas centrais de Yao Shunyu desde que assumiu o cargo.
Por exemplo, após a dissolução do AI Lab da Tencent, os principais pesquisadores foram todos incorporados ao Departamento de Modelos de Linguagem de Grande Escala. O esforço de recrutamento de talentos em modelos de linguagem de grande escala também aumentou com a chegada de Yao Shunyu, como várias pessoas das equipes Seed Infra e pós-treinamento da ByteDance.
Posteriormente, em 5 de junho, na Conferência de Aplicações Industriais de IA da Tencent Cloud, Tang Daosheng, Vice-Presidente Executivo Sênior do Grupo Tencent e CEO do Grupo de Indústrias de Nuvem e Inteligência, de certa forma fez uma pergunta contundente a Yao Shunyu em nome do público: Muitos dizem que a Tencent está lenta na IA. Você acha que realmente estamos lentos?
Mas, na verdade, “Shunyu está mais ansioso do que os altos executivos da Tencent”, disse um pesquisador do Hunyuan ao “Inteligência Emergente”. Ele mencionou que Yao Shunyu várias vezes solicitou aos executivos da Tencent mais recursos computacionais para o Hunyuan.
Outro detalhe: “LatePost” mencionou que, um mês antes do lançamento do Hy3, um lote de dados apresentou problemas. Yao Shunyu advertiu a equipe com um tom raramente severo: “Os dados são muito importantes. Se isso acontecer novamente, pode se retirar imediatamente.” Reavaliando os retornos da compreensão multimodal
Quando todas as frentes de IA ainda não alcançaram uma posição de liderança, para a Tencent se destacar, é necessário reavaliar os retornos de cada direção tecnológica de IA.
Por um lado, a pesquisa em compreensão multimodal conduzida por Hu Han já se tornou relativamente madura, e os retornos de continuar investindo recursos são bastante limitados.
“Na pesquisa de compreensão multimodal, a precisão do reconhecimento de texto, imagem e vídeo geralmente atinge mais de 85%”, disse um pesquisador multimodal. “O difícil é, na verdade, o raciocínio visual, ou seja, fazer o modelo entender o que as imagens e vídeos significam. Esse passo não pode ser alcançado apenas com pesquisa multimodal; é necessário melhorar a capacidade de raciocínio do modelo de linguagem.”
Com os dividendos tecnológicos diminuindo, os benefícios comerciais que a compreensão multimodal pode trazer também não são claros.
Anteriormente, a pesquisa multimodal ocupou uma posição central no sistema de IA da Tencent. A razão principal é que a tecnologia de visão computacional pode ser diretamente integrada a negócios “vacas leiteiras”, como publicidade, jogos e áudio e vídeo, gerando receita para a Tencent.
No entanto, em comparação com a tecnologia generativa, cenários como “reconhecimento de imagem” e “descrever imagens com texto”, correspondentes à compreensão multimodal, não podem ser diretamente comercializados.
“Nenhum usuário está disposto a pagar por reconhecimento de imagem; há muitos produtos gratuitos substitutos no mercado”, mencionou um gerente de produto do Yuanbao. O que os usuários realmente estão dispostos a pagar são cenários de escritório, como processamento de documentos, criação de PPT e elaboração de relatórios de pesquisa — por trás disso, estão as capacidades de raciocínio, codificação e agentic do modelo.
Por outro lado, os recursos computacionais da Tencent são limitados, não tendo vantagem em comparação com ByteDance e Alibaba.
O relatório financeiro de 2025 da Tencent mostra que os gastos de capital anuais da empresa foram de 79,2 bilhões de yuans; em contraste, até março de 2026, os gastos de capital do ano fiscal da Alibaba atingiram 126 bilhões de yuans; e, de acordo com a Bloomberg, em 2026 a ByteDance planeja aumentar o investimento em infraestrutura de IA para até 70 bilhões de dólares.
Com recursos limitados, é inevitável que o Hunyuan enfrente uma situação de “muitos monges e pouca comida”. Nesse momento, desacelerar a pesquisa em compreensão multimodal, com dividendos tecnológicos limitados, e focar em direções de pesquisa de ponta mais representativas do futuro, é uma escolha da Tencent após ponderar os retornos.
Em 6 de julho, Yao Shunyu apresentou sua primeira resposta formal desde que ingressou na Tencent, o modelo de grande escala Hy3. Entre modelos de tamanho médio com parâmetros equivalentes, o Hy3 já consegue competir com o GLM-5.2 e o DeepSeek V4 Pro.
No próprio sistema de coordenadas da IA da Tencent, a reorganização organizacional desde a chegada de Yao Shunyu, a reestruturação da infraestrutura (dados, Infra, avaliação) e a estratégia de retorno ao modelo base permitiram que o Hunyuan, em apenas meio ano, tivesse qualificação para entrar na mesa do primeiro escalão da IA.
(O autor do “Inteligência Emergente”, Li Zhaofeng, também contribuiu.)

## 情报摘要

**核心动作**: 腾讯混元多模态理解负责人胡涵离职创业，姚顺宇重组团队聚焦大语言模型并引入新研究员

**事实**:
- 胡涵曾任微软亚研计算视觉组首席研究员，2025年初加入腾讯负责多模态理解研究。
- 胡涵已从腾讯离职，其原团队可能转向世界模型研究。
- 前OpenAI研究员田永龙已加入腾讯大语言模型部门，接替胡涵负责视觉语言模型研究，向姚顺宇汇报。
- 姚顺宇自上任后重组资源，将AI Lab解散后核心人员并入大语言模型部门。

**评估**:
- 腾讯正将资源集中至大语言模型，多模态理解的商业回报被认为有限。 (high)
- 胡涵离职创业可能反映中国AI人才向创业方向流动的趋势。 (medium)

**机会标记**: market_entry_opportunity, partnership_opportunity

---
来源: 36氪
发布: 2026-07-23
© China Brazil Insight — https://chinabrazilinsight.com/news/exclusivo-hu-han-responsvel-pela-compreenso-multimodal-do-hunyuan-pede-demisso-p