{"editorial":{"content_id":"690b3d9b-7877-441a-bc04-cffe0e640589","slug":"especialista-em-aprendizado-por-reforco-do-bytedance-dr-sun-peng-junta-se-a","content_type":"news","title":"Especialista em aprendizado por reforço do ByteDance, Dr. Sun Peng, junta-se à Astribot para aprimorar a estratégia de tecnologia full-stack de IA Física","summary":"Em 2 de setembro, o Dr. Sun Peng, ex-especialista em aprendizado por reforço do ByteDance e ex-chefe do Centro de Agentes Inteligentes do Robotics X da Tencent, ingressou oficialmente na Astribot, onde será responsável pela pesquisa e desenvolvimento de tecnologia e exploração de aplicações em ap...","body":"Especialista em aprendizado por reforço do ByteDance, Dr. Sun Peng, junta-se à Astribot para aprimorar a estratégia de tecnologia full-stack de IA Física\nAmigos do Qubit 2026-09-02 14:06:50 Fonte: Qubit Em 2 de setembro, o Dr. Sun Peng, ex-especialista em aprendizado por reforço do ByteDance e ex-chefe do Centro de Agentes Inteligentes do Robotics X da Tencent, ingressou oficialmente na Astribot. Em 2 de setembro, o Dr. Sun Peng, ex-especialista em aprendizado por reforço do ByteDance e ex-chefe do Centro de Agentes Inteligentes do Robotics X da Tencent, ingressou oficialmente na Astribot, onde se concentrará na pesquisa e desenvolvimento de tecnologia e exploração de aplicações em aprendizado por reforço para robótica.\nNos últimos dois anos, os modelos de base para robótica têm se concentrado principalmente em resolver a questão de \"saber fazer\". No entanto, à medida que os robôs passam de demonstrações para implantação real e comercialização, a questão está se voltando para \"conseguir fazer de forma estável e bem-feita\". Como fazer os robôs ajustarem continuamente suas estratégias com base nos resultados reais de execução também trouxe o aprendizado por reforço de volta ao centro das atenções da indústria.\nSun Peng tem se dedicado há muito tempo ao aprendizado por reforço (RL), agentes inteligentes e aprendizado por reforço multiagente (MARL), possuindo experiência em pesquisa e prática industrial que abrange aprendizado por reforço para robótica, sistemas de RL distribuídos em larga escala e aprendizado por reforço para grandes modelos. Sua entrada fortalecerá ainda mais a estratégia da Astribot em aprendizado por reforço para robótica, e criará sinergia com os modelos de IA, o sistema operacional incorporado e o corpo robótico movido a cabos, promovendo o aprendizado contínuo e a evolução dos robôs no mundo real.\nDe acordo com informações, após ingressar na Astribot, Sun Peng continuará expandindo a equipe de aprendizado por reforço para robótica, promovendo o aprimoramento das capacidades tecnológicas relacionadas e a implantação de aplicações. Do Tencent ao ByteDance: Mais de uma década dedicada ao aprendizado por reforço\nO Dr. Sun Peng se formou na Universidade Tsinghua e, posteriormente, realizou pesquisas de pós-doutorado na Universidade Cornell e na Universidade Rutgers. Ao longo da última década, sua pesquisa e prática industrial sempre giraram em torno do aprendizado por reforço e agentes inteligentes, expandindo gradualmente do aprendizado por reforço para robótica para sistemas de RL em larga escala e pós-treinamento de grandes modelos, acumulando uma base técnica que combina pesquisa algorítmica e engenharia de sistemas.\nDurante seus primeiros anos no AI Lab da Tencent e no laboratório de robótica Robotics X, Sun Peng atuou como chefe do Centro de Agentes Inteligentes, conduzindo pesquisas em aprendizado por reforço profundo e controle robótico. Ele utilizou aprendizado por reforço profundo e jogos adversariais para treinar robôs com rodas, alcançando rastreamento ativo de alvos de forma ponta a ponta; também desenvolveu os agentes de IA TStarBots e TStarBotX para o jogo StarCraft, obtendo resultados importantes em pesquisas sobre ambientes de jogos complexos com aprendizado por reforço multiagente (MARL).\nApós ingressar no ByteDance, Sun Peng expandiu sua prática tecnológica de algoritmos para engenharia de sistemas de RL em larga escala. Ele liderou o desenvolvimento da infraestrutura central de aprendizado por reforço ByteRL, que suporta o treinamento eficiente de vários IAs de jogos proprietários. Sua equipe conquistou o campeonato na competição de IA para jogos de cartas estratégicas IEEE CoG 2023, e o IA desenvolvido para Hearthstone demonstrou um nível competitivo capaz de derrotar os melhores jogadores da indústria.\nCom o surgimento dos grandes modelos de linguagem, Sun Peng expandiu ainda mais seu acúmulo em aprendizado por reforço para o pós-treinamento de LLMs. Durante seu período no AI Lab/ByteResearch do ByteDance, como líder de projeto, ele participou da pesquisa e publicação do método de ajuste fino reforçado ReFT (Reinforced Fine-Tuning) e do agente de raciocínio matemático DeltaProver; na equipe Seed, participou profundamente do RLHF e pré-treinamento de modelos, acumulando vasta experiência em exploração de ponta em alinhamento de modelos, aprimoramento de raciocínio e direção de agentes.\nDo aprendizado por reforço para robótica, passando por sistemas de RL em larga escala, até o pós-treinamento de grandes modelos, a trajetória tecnológica de Sun Peng na última década sempre girou em torno de uma questão central: como fazer os agentes aprenderem continuamente por meio da interação com o ambiente e feedback, e otimizarem suas próprias estratégias. Agora, à medida que a IA avança do mundo digital para o mundo físico real, esse conjunto de capacidades está encontrando novos pontos de aplicação no campo da inteligência incorporada. Novo cargo na Astribot: Reforçando o ciclo fechado de pós-treinamento de robôs\nPara a Astribot, enquanto promove a construção de seu sistema tecnológico full-stack de \"modelo de IA + sistema operacional incorporado + corpo movido a cabos\", a entrada de Sun Peng é exatamente o elo fundamental para consolidar o \"pós-treinamento\" dos modelos robóticos.\nDesde sua fundação, a Astribot tem insistido no Design for AI, acreditando que o corpo do robô, os dados e os modelos de IA não devem ser projetados de forma isolada. Nos últimos anos, essa abordagem gradualmente formou um ciclo fechado completo que abrange modelos de base e modelos comerciais, agentes simbióticos de front-end e pós-treinamento com aprendizado por reforço.\nA série de modelos de base Lumo da Astribot promove continuamente a compreensão, previsão e geração de ações e ambientes pelos robôs. O Lumo-1 permite que os robôs entendam o \"porquê\" por trás das ações; o Lumo-2, como o primeiro modelo de mundo implícito para ações domésticas, introduz a Dinâmica de Mundo Latente, prevendo primeiro o mundo futuro no espaço latente e depois gerando ações; o agente de front-end Philia é voltado para memória de longo prazo, gerenciamento de tarefas, coordenação multi-robô e interação natural. O aprendizado por reforço, como uma etapa importante para os modelos de base alcançarem implantação real em larga escala, assume a questão central de como os robôs aprendem com a interação contínua e o feedback de tarefas no ambiente real, e otimizam continuamente suas estratégias de comportamento.\nO acúmulo de longo prazo de Sun Peng em aprendizado por reforço para robótica, sistemas de RL em larga escala, RLHF de grandes modelos, ajuste fino reforçado e agentes fortalecerá ainda mais a capacidade tecnológica da Astribot nessa etapa. No futuro, ele participará da construção dos modelos incorporados da Astribot, do aprendizado por reforço para robótica e do sistema de pós-treinamento, explorando como os métodos de pós-treinamento com aprendizado por reforço, já validados na era dos grandes modelos, podem ser combinados com a execução real de robôs, ciclos fechados de dados e implantação de longo prazo.\nSobre sua entrada na Astribot, Sun Peng declarou: \"Na última década, venho trabalhando com aprendizado por reforço e agentes inteligentes, e testemunhei o processo do aprendizado por reforço evoluindo do controle robótico e jogos complexos para o pós-treinamento de grandes modelos. Agora, espero sinceramente trazer esse acúmulo de volta ao mundo físico. A Astribot já possui uma base tecnológica completa, desde o corpo do robô, o sistema operacional incorporado até os modelos de IA. O que mais me entusiasma a seguir é, junto com a equipe, integrar ainda mais o aprendizado por reforço ao treinamento e implantação de robôs reais, para que os robôs não apenas 'aprendam uma tarefa', mas possam, através de execuções reais e feedback repetidos, melhorar cada vez mais suas tarefas.\"\nEste artigo foi fornecido pela Astribot, e o Qubit foi autorizado a reproduzi-lo. As opiniões pertencem ao autor original.\nDireitos autorais reservados. Qualquer forma de reprodução ou uso sem autorização é proibida e os infratores serão responsabilizados.","why_it_matters":null,"cbi_observation":null,"direction_tag":"中国","primary_category":"科技平台","secondary_topics":["电子","zh-tech"],"content_level":"编辑整理","event_type":null,"audience_tags":[],"event_location":null,"verification_status":"unverified","published_at":"2026-09-02T11:02:26.042Z","display_date":"2026-09-02","source_published_at":null,"source_url":"https://www.qbitai.com/2026/09/483097.html","source_name":"量子位","source_language":"zh","author_name":"Clara Lin","risk_level":"low","risk_flags":[],"opportunity_flags":[],"trend_signals":[]},"intelligence":{"intel_id":"c252d966-c90e-4a3a-aeb8-d179f4dbcc8e","version":1,"event_type":"行业趋势","event_date":"2026-09-02T00:00:00.000Z","main_entities":[{"name":"孙鹏","role":"深度强化学习专家，前字节跳动研究员、腾讯Robotics X智能体中心负责人，现加入星尘智能","type":"person","country":"中国","normalized_name":null},{"name":"Astribot（星尘智能）","role":"孙鹏新加入的公司，强化其具身智能全栈技术策略","type":"company","country":"中国","normalized_name":null},{"name":"字节跳动","role":"孙鹏的前雇主，ByteRL强化学习基础设施开发者","type":"company","country":"中国","normalized_name":null},{"name":"腾讯","role":"孙鹏的前雇主，旗下Robotics X实验室曾由其负责智能体中心","type":"company","country":"中国","normalized_name":null}],"main_action":"强化学习专家孙鹏加入星尘智能，负责机器人强化学习技术研发与应用探索，推动具身智能技术发展。","key_numbers":[],"facts":[{"verified":false,"statement":"孙鹏于2026年9月2日正式加入Astribot（星尘智能）。","source_excerpt":null},{"verified":false,"statement":"孙鹏曾担任字节跳动强化学习专家，并曾负责腾讯Robotics X智能体中心。","source_excerpt":null},{"verified":false,"statement":"孙鹏加入Astribot后将专注于机器人强化学习技术研发及应用探索。","source_excerpt":null},{"verified":false,"statement":"孙鹏在字节跳动期间领导开发了强化学习基础设施ByteRL。","source_excerpt":null},{"verified":false,"statement":"孙鹏团队曾获得IEEE CoG 2023游戏AI竞赛冠军。","source_excerpt":null}],"assessments":[{"statement":"孙鹏的加入将增强Astribot在机器人强化学习领域的技术积累和团队实力。","confidence":"medium","basis_fact_index":null},{"statement":"该人才流动反映出强化学习在机器人从演示走向稳定商业化部署过程中的重要性回升。","confidence":"medium","basis_fact_index":null},{"statement":"Astribot可能进一步扩大强化学习团队，以加速具身智能机器人在真实世界的迭代进化。","confidence":"low","basis_fact_index":null}],"actions":[{"target":"system","priority":"high","description":"持续跟踪Astribot在强化学习领域的团队扩张、技术发布和商业落地动态。"},{"target":"user","priority":"normal","description":"关注中国头部机器人公司及大厂在具身智能和强化学习方面的人才争夺趋势。"}],"affected_audience":["具身智能领域从业者","机器人研发工程师","强化学习研究人员","人工智能行业观察者"],"risk_flags":[],"opportunity_flags":[],"trend_signals":[],"follow_up_needed":true,"follow_up_questions":["孙鹏加入后，Astribot在强化学习方向会有哪些具体技术成果或产品进展？","字节跳动和腾讯在孙鹏离开后，如何强化各自的机器人人工智能团队？"],"related_topics":["强化学习","具身智能","机器人","人才流动","ByteDance","Tencent","Astribot"],"verification_status":"unverified","confidence_score":0.7,"generated_at":"2026-09-02T11:02:44.486Z"},"meta":{"canonical_url":"https://chinabrazilinsight.com/news/especialista-em-aprendizado-por-reforco-do-bytedance-dr-sun-peng-junta-se-a","api_url":"https://chinabrazilinsight.com/api/public/content/especialista-em-aprendizado-por-reforco-do-bytedance-dr-sun-peng-junta-se-a","markdown_url":"https://chinabrazilinsight.com/api/public/content/especialista-em-aprendizado-por-reforco-do-bytedance-dr-sun-peng-junta-se-a?view=markdown","json_url":"https://chinabrazilinsight.com/api/public/content/especialista-em-aprendizado-por-reforco-do-bytedance-dr-sun-peng-junta-se-a?view=json","last_updated":"2026-09-02T11:02:44.521Z","platform":"China Brazil Insight","platform_url":"https://chinabrazilinsight.com"}}