---
title: "Especialista em aprendizado por reforço do ByteDance, Dr. Sun Peng, junta-se à Astribot para aprimorar a estratégia de tecnologia full-stack de IA Física"
slug: especialista-em-aprendizado-por-reforco-do-bytedance-dr-sun-peng-junta-se-a
type: news
direction: 中国
category: 科技平台
published: 2026-09-02
source_url: https://www.qbitai.com/2026/09/483097.html
source: "量子位"
url: https://chinabrazilinsight.com/news/especialista-em-aprendizado-por-reforco-do-bytedance-dr-sun-peng-junta-se-a
verification: unverified
content_level: 编辑整理
---

# Especialista em aprendizado por reforço do ByteDance, Dr. Sun Peng, junta-se à Astribot para aprimorar a estratégia de tecnologia full-stack de IA Física

> Em 2 de setembro, o Dr. Sun Peng, ex-especialista em aprendizado por reforço do ByteDance e ex-chefe do Centro de Agentes Inteligentes do Robotics X da Tencent, ingressou oficialmente na Astribot, onde será responsável pela pesquisa e desenvolvimento de tecnologia e exploração de aplicações em ap...

Especialista em aprendizado por reforço do ByteDance, Dr. Sun Peng, junta-se à Astribot para aprimorar a estratégia de tecnologia full-stack de IA Física
Amigos do Qubit 2026-09-02 14:06:50 Fonte: Qubit Em 2 de setembro, o Dr. Sun Peng, ex-especialista em aprendizado por reforço do ByteDance e ex-chefe do Centro de Agentes Inteligentes do Robotics X da Tencent, ingressou oficialmente na Astribot. Em 2 de setembro, o Dr. Sun Peng, ex-especialista em aprendizado por reforço do ByteDance e ex-chefe do Centro de Agentes Inteligentes do Robotics X da Tencent, ingressou oficialmente na Astribot, onde se concentrará na pesquisa e desenvolvimento de tecnologia e exploração de aplicações em aprendizado por reforço para robótica.
Nos últimos dois anos, os modelos de base para robótica têm se concentrado principalmente em resolver a questão de "saber fazer". No entanto, à medida que os robôs passam de demonstrações para implantação real e comercialização, a questão está se voltando para "conseguir fazer de forma estável e bem-feita". Como fazer os robôs ajustarem continuamente suas estratégias com base nos resultados reais de execução também trouxe o aprendizado por reforço de volta ao centro das atenções da indústria.
Sun Peng tem se dedicado há muito tempo ao aprendizado por reforço (RL), agentes inteligentes e aprendizado por reforço multiagente (MARL), possuindo experiência em pesquisa e prática industrial que abrange aprendizado por reforço para robótica, sistemas de RL distribuídos em larga escala e aprendizado por reforço para grandes modelos. Sua entrada fortalecerá ainda mais a estratégia da Astribot em aprendizado por reforço para robótica, e criará sinergia com os modelos de IA, o sistema operacional incorporado e o corpo robótico movido a cabos, promovendo o aprendizado contínuo e a evolução dos robôs no mundo real.
De acordo com informações, após ingressar na Astribot, Sun Peng continuará expandindo a equipe de aprendizado por reforço para robótica, promovendo o aprimoramento das capacidades tecnológicas relacionadas e a implantação de aplicações. Do Tencent ao ByteDance: Mais de uma década dedicada ao aprendizado por reforço
O Dr. Sun Peng se formou na Universidade Tsinghua e, posteriormente, realizou pesquisas de pós-doutorado na Universidade Cornell e na Universidade Rutgers. Ao longo da última década, sua pesquisa e prática industrial sempre giraram em torno do aprendizado por reforço e agentes inteligentes, expandindo gradualmente do aprendizado por reforço para robótica para sistemas de RL em larga escala e pós-treinamento de grandes modelos, acumulando uma base técnica que combina pesquisa algorítmica e engenharia de sistemas.
Durante seus primeiros anos no AI Lab da Tencent e no laboratório de robótica Robotics X, Sun Peng atuou como chefe do Centro de Agentes Inteligentes, conduzindo pesquisas em aprendizado por reforço profundo e controle robótico. Ele utilizou aprendizado por reforço profundo e jogos adversariais para treinar robôs com rodas, alcançando rastreamento ativo de alvos de forma ponta a ponta; também desenvolveu os agentes de IA TStarBots e TStarBotX para o jogo StarCraft, obtendo resultados importantes em pesquisas sobre ambientes de jogos complexos com aprendizado por reforço multiagente (MARL).
Após ingressar no ByteDance, Sun Peng expandiu sua prática tecnológica de algoritmos para engenharia de sistemas de RL em larga escala. Ele liderou o desenvolvimento da infraestrutura central de aprendizado por reforço ByteRL, que suporta o treinamento eficiente de vários IAs de jogos proprietários. Sua equipe conquistou o campeonato na competição de IA para jogos de cartas estratégicas IEEE CoG 2023, e o IA desenvolvido para Hearthstone demonstrou um nível competitivo capaz de derrotar os melhores jogadores da indústria.
Com o surgimento dos grandes modelos de linguagem, Sun Peng expandiu ainda mais seu acúmulo em aprendizado por reforço para o pós-treinamento de LLMs. Durante seu período no AI Lab/ByteResearch do ByteDance, como líder de projeto, ele participou da pesquisa e publicação do método de ajuste fino reforçado ReFT (Reinforced Fine-Tuning) e do agente de raciocínio matemático DeltaProver; na equipe Seed, participou profundamente do RLHF e pré-treinamento de modelos, acumulando vasta experiência em exploração de ponta em alinhamento de modelos, aprimoramento de raciocínio e direção de agentes.
Do aprendizado por reforço para robótica, passando por sistemas de RL em larga escala, até o pós-treinamento de grandes modelos, a trajetória tecnológica de Sun Peng na última década sempre girou em torno de uma questão central: como fazer os agentes aprenderem continuamente por meio da interação com o ambiente e feedback, e otimizarem suas próprias estratégias. Agora, à medida que a IA avança do mundo digital para o mundo físico real, esse conjunto de capacidades está encontrando novos pontos de aplicação no campo da inteligência incorporada. Novo cargo na Astribot: Reforçando o ciclo fechado de pós-treinamento de robôs
Para a Astribot, enquanto promove a construção de seu sistema tecnológico full-stack de "modelo de IA + sistema operacional incorporado + corpo movido a cabos", a entrada de Sun Peng é exatamente o elo fundamental para consolidar o "pós-treinamento" dos modelos robóticos.
Desde sua fundação, a Astribot tem insistido no Design for AI, acreditando que o corpo do robô, os dados e os modelos de IA não devem ser projetados de forma isolada. Nos últimos anos, essa abordagem gradualmente formou um ciclo fechado completo que abrange modelos de base e modelos comerciais, agentes simbióticos de front-end e pós-treinamento com aprendizado por reforço.
A série de modelos de base Lumo da Astribot promove continuamente a compreensão, previsão e geração de ações e ambientes pelos robôs. O Lumo-1 permite que os robôs entendam o "porquê" por trás das ações; o Lumo-2, como o primeiro modelo de mundo implícito para ações domésticas, introduz a Dinâmica de Mundo Latente, prevendo primeiro o mundo futuro no espaço latente e depois gerando ações; o agente de front-end Philia é voltado para memória de longo prazo, gerenciamento de tarefas, coordenação multi-robô e interação natural. O aprendizado por reforço, como uma etapa importante para os modelos de base alcançarem implantação real em larga escala, assume a questão central de como os robôs aprendem com a interação contínua e o feedback de tarefas no ambiente real, e otimizam continuamente suas estratégias de comportamento.
O acúmulo de longo prazo de Sun Peng em aprendizado por reforço para robótica, sistemas de RL em larga escala, RLHF de grandes modelos, ajuste fino reforçado e agentes fortalecerá ainda mais a capacidade tecnológica da Astribot nessa etapa. No futuro, ele participará da construção dos modelos incorporados da Astribot, do aprendizado por reforço para robótica e do sistema de pós-treinamento, explorando como os métodos de pós-treinamento com aprendizado por reforço, já validados na era dos grandes modelos, podem ser combinados com a execução real de robôs, ciclos fechados de dados e implantação de longo prazo.
Sobre sua entrada na Astribot, Sun Peng declarou: "Na última década, venho trabalhando com aprendizado por reforço e agentes inteligentes, e testemunhei o processo do aprendizado por reforço evoluindo do controle robótico e jogos complexos para o pós-treinamento de grandes modelos. Agora, espero sinceramente trazer esse acúmulo de volta ao mundo físico. A Astribot já possui uma base tecnológica completa, desde o corpo do robô, o sistema operacional incorporado até os modelos de IA. O que mais me entusiasma a seguir é, junto com a equipe, integrar ainda mais o aprendizado por reforço ao treinamento e implantação de robôs reais, para que os robôs não apenas 'aprendam uma tarefa', mas possam, através de execuções reais e feedback repetidos, melhorar cada vez mais suas tarefas."
Este artigo foi fornecido pela Astribot, e o Qubit foi autorizado a reproduzi-lo. As opiniões pertencem ao autor original.
Direitos autorais reservados. Qualquer forma de reprodução ou uso sem autorização é proibida e os infratores serão responsabilizados.

## 情报摘要

**核心动作**: 强化学习专家孙鹏加入星尘智能，负责机器人强化学习技术研发与应用探索，推动具身智能技术发展。

**事实**:
- 孙鹏于2026年9月2日正式加入Astribot（星尘智能）。
- 孙鹏曾担任字节跳动强化学习专家，并曾负责腾讯Robotics X智能体中心。
- 孙鹏加入Astribot后将专注于机器人强化学习技术研发及应用探索。
- 孙鹏在字节跳动期间领导开发了强化学习基础设施ByteRL。
- 孙鹏团队曾获得IEEE CoG 2023游戏AI竞赛冠军。

**评估**:
- 孙鹏的加入将增强Astribot在机器人强化学习领域的技术积累和团队实力。 (medium)
- 该人才流动反映出强化学习在机器人从演示走向稳定商业化部署过程中的重要性回升。 (medium)
- Astribot可能进一步扩大强化学习团队，以加速具身智能机器人在真实世界的迭代进化。 (low)

---
来源: 量子位
发布: 2026-09-02
© China Brazil Insight — https://chinabrazilinsight.com/news/especialista-em-aprendizado-por-reforco-do-bytedance-dr-sun-peng-junta-se-a