Macro & Mercados

Exclusivo | Hu Han, responsável pela compreensão multimodal do Hunyuan, pede demissão para empreender; equipe original pode focar em modelo mundial

· Clara Lin

Hu Han, responsável pela compreensão multimodal do Tencent Hunyuan, pediu demissão. Yao Shunyu reorganiza equipes e foca em modelos de linguagem de grande escala, prioridade do Hunyuan. A Tencent busca acelerar desenvolvimento de IA com novos talentos e recursos.

Texto | Zhou Xinyu Edição | Zhang Yuxin O “Inteligência Emergente” apurou com exclusividade que, recentemente, Hu Han, responsável pela compreensão multimodal do Tencent Hunyuan, pediu demissão. Anteriormente, ele atuou como pesquisador-chefe do Grupo de Computação Visual da Microsoft Research Asia. No início de 2025, após ingressar na Tencent, ficou responsável pela pesquisa de modelos de visão de grande escala. Em ajustes posteriores, ele se juntou ao grupo de pesquisa de tecnologia de ponta “Frontier”, subordinado ao Departamento de Modelos de Linguagem de Grande Escala, responsável por pesquisas relacionadas à compreensão multimodal, reportando-se a Yao Shunyu. Sabe-se que Hu Han também esteve envolvido no desenvolvimento de modelos mundiais. Enquanto isso, Yao Shunyu, chefe do Departamento de Modelos de Linguagem de Grande Escala da Tencent, vem recentemente reorganizando intensamente suas equipes. O grupo de pesquisa onde Hu Han estava anteriormente pode se concentrar em pesquisas de ponta sobre modelos mundiais. Até o fechamento desta edição, a Tencent não respondeu às informações acima. Modelos de linguagem de grande escala continuam sendo a prioridade mais importante do Hunyuan Desde meados de 2026, mudanças de pessoal no sistema Hunyuan vêm ocorrendo constantemente. No início de julho, Tian Yonglong, ex-pesquisador da OpenAI e doutor pelo MIT, ingressou no Departamento de Modelos de Linguagem de Grande Escala — soubemos que ele substituirá Hu Han na direção de pesquisa de modelos de linguagem visual (VLM), reportando-se a Yao Shunyu. Desde a chegada de Yao Shunyu, suprir as deficiências e elevar rapidamente a capacidade do modelo base Hunyuan ao primeiro escalão tornou-se a linha principal da IA da Tencent. Reorganizar a alocação de recursos, concentrando talentos e poder computacional no desenvolvimento de modelos base sob responsabilidade do Departamento de Modelos de Linguagem de Grande Escala, é uma das medidas centrais de Yao Shunyu desde que assumiu o cargo. Por exemplo, após a dissolução do AI Lab da Tencent, os principais pesquisadores foram todos incorporados ao Departamento de Modelos de Linguagem de Grande Escala. O esforço de recrutamento de talentos em modelos de linguagem de grande escala também aumentou com a chegada de Yao Shunyu, como várias pessoas das equipes Seed Infra e pós-treinamento da ByteDance. Posteriormente, em 5 de junho, na Conferência de Aplicações Industriais de IA da Tencent Cloud, Tang Daosheng, Vice-Presidente Executivo Sênior do Grupo Tencent e CEO do Grupo de Indústrias de Nuvem e Inteligência, de certa forma fez uma pergunta contundente a Yao Shunyu em nome do público: Muitos dizem que a Tencent está lenta na IA. Você acha que realmente estamos lentos? Mas, na verdade, “Shunyu está mais ansioso do que os altos executivos da Tencent”, disse um pesquisador do Hunyuan ao “Inteligência Emergente”. Ele mencionou que Yao Shunyu várias vezes solicitou aos executivos da Tencent mais recursos computacionais para o Hunyuan. Outro detalhe: “LatePost” mencionou que, um mês antes do lançamento do Hy3, um lote de dados apresentou problemas. Yao Shunyu advertiu a equipe com um tom raramente severo: “Os dados são muito importantes. Se isso acontecer novamente, pode se retirar imediatamente.” Reavaliando os retornos da compreensão multimodal Quando todas as frentes de IA ainda não alcançaram uma posição de liderança, para a Tencent se destacar, é necessário reavaliar os retornos de cada direção tecnológica de IA. Por um lado, a pesquisa em compreensão multimodal conduzida por Hu Han já se tornou relativamente madura, e os retornos de continuar investindo recursos são bastante limitados. “Na pesquisa de compreensão multimodal, a precisão do reconhecimento de texto, imagem e vídeo geralmente atinge mais de 85%”, disse um pesquisador multimodal. “O difícil é, na verdade, o raciocínio visual, ou seja, fazer o modelo entender o que as imagens e vídeos significam. Esse passo não pode ser alcançado apenas com pesquisa multimodal; é necessário melhorar a capacidade de raciocínio do modelo de linguagem.” Com os dividendos tecnológicos diminuindo, os benefícios comerciais que a compreensão multimodal pode trazer também não são claros. Anteriormente, a pesquisa multimodal ocupou uma posição central no sistema de IA da Tencent. A razão principal é que a tecnologia de visão computacional pode ser diretamente integrada a negócios “vacas leiteiras”, como publicidade, jogos e áudio e vídeo, gerando receita para a Tencent. No entanto, em comparação com a tecnologia generativa, cenários como “reconhecimento de imagem” e “descrever imagens com texto”, correspondentes à compreensão multimodal, não podem ser diretamente comercializados. “Nenhum usuário está disposto a pagar por reconhecimento de imagem; há muitos produtos gratuitos substitutos no mercado”, mencionou um gerente de produto do Yuanbao. O que os usuários realmente estão dispostos a pagar são cenários de escritório, como processamento de documentos, criação de PPT e elaboração de relatórios de pesquisa — por trás disso, estão as capacidades de raciocínio, codificação e agentic do modelo. Por outro lado, os recursos computacionais da Tencent são limitados, não tendo vantagem em comparação com ByteDance e Alibaba. O relatório financeiro de 2025 da Tencent mostra que os gastos de capital anuais da empresa foram de 79,2 bilhões de yuans; em contraste, até março de 2026, os gastos de capital do ano fiscal da Alibaba atingiram 126 bilhões de yuans; e, de acordo com a Bloomberg, em 2026 a ByteDance planeja aumentar o investimento em infraestrutura de IA para até 70 bilhões de dólares. Com recursos limitados, é inevitável que o Hunyuan enfrente uma situação de “muitos monges e pouca comida”. Nesse momento, desacelerar a pesquisa em compreensão multimodal, com dividendos tecnológicos limitados, e focar em direções de pesquisa de ponta mais representativas do futuro, é uma escolha da Tencent após ponderar os retornos. Em 6 de julho, Yao Shunyu apresentou sua primeira resposta formal desde que ingressou na Tencent, o modelo de grande escala Hy3. Entre modelos de tamanho médio com parâmetros equivalentes, o Hy3 já consegue competir com o GLM-5.2 e o DeepSeek V4 Pro. No próprio sistema de coordenadas da IA da Tencent, a reorganização organizacional desde a chegada de Yao Shunyu, a reestruturação da infraestrutura (dados, Infra, avaliação) e a estratégia de retorno ao modelo base permitiram que o Hunyuan, em apenas meio ano, tivesse qualificação para entrar na mesa do primeiro escalão da IA. (O autor do “Inteligência Emergente”, Li Zhaofeng, também contribuiu.)

Continue por tema

O que isso significa para sua empresa?

A CBI transforma sinais da China em pesquisa de mercado, avaliação de parceiros e apoio à entrada no mercado.

Conversar com a equipe →

Receba o briefing diário

3-5 destaques por dia, direto no e-mail. Gratuito.

Exclusivo | Hu Han, responsável pela compreensão multimodal do Hunyuan, pede demissão para empreender; equipe original pode focar em modelo mundial | China Brazil Insight