Tecnologia

Especialista em aprendizado por reforço do ByteDance, Dr. Sun Peng, junta-se à Astribot para aprimorar a estratégia de tecnologia full-stack de IA Física

· Clara Lin

Em 2 de setembro, o Dr. Sun Peng, ex-especialista em aprendizado por reforço do ByteDance e ex-chefe do Centro de Agentes Inteligentes do Robotics X da Tencent, ingressou oficialmente na Astribot, onde será responsável pela pesquisa e desenvolvimento de tecnologia e exploração de aplicações em ap...

Especialista em aprendizado por reforço do ByteDance, Dr. Sun Peng, junta-se à Astribot para aprimorar a estratégia de tecnologia full-stack de IA Física Amigos do Qubit 2026-09-02 14:06:50 Fonte: Qubit Em 2 de setembro, o Dr. Sun Peng, ex-especialista em aprendizado por reforço do ByteDance e ex-chefe do Centro de Agentes Inteligentes do Robotics X da Tencent, ingressou oficialmente na Astribot. Em 2 de setembro, o Dr. Sun Peng, ex-especialista em aprendizado por reforço do ByteDance e ex-chefe do Centro de Agentes Inteligentes do Robotics X da Tencent, ingressou oficialmente na Astribot, onde se concentrará na pesquisa e desenvolvimento de tecnologia e exploração de aplicações em aprendizado por reforço para robótica. Nos últimos dois anos, os modelos de base para robótica têm se concentrado principalmente em resolver a questão de "saber fazer". No entanto, à medida que os robôs passam de demonstrações para implantação real e comercialização, a questão está se voltando para "conseguir fazer de forma estável e bem-feita". Como fazer os robôs ajustarem continuamente suas estratégias com base nos resultados reais de execução também trouxe o aprendizado por reforço de volta ao centro das atenções da indústria. Sun Peng tem se dedicado há muito tempo ao aprendizado por reforço (RL), agentes inteligentes e aprendizado por reforço multiagente (MARL), possuindo experiência em pesquisa e prática industrial que abrange aprendizado por reforço para robótica, sistemas de RL distribuídos em larga escala e aprendizado por reforço para grandes modelos. Sua entrada fortalecerá ainda mais a estratégia da Astribot em aprendizado por reforço para robótica, e criará sinergia com os modelos de IA, o sistema operacional incorporado e o corpo robótico movido a cabos, promovendo o aprendizado contínuo e a evolução dos robôs no mundo real. De acordo com informações, após ingressar na Astribot, Sun Peng continuará expandindo a equipe de aprendizado por reforço para robótica, promovendo o aprimoramento das capacidades tecnológicas relacionadas e a implantação de aplicações. Do Tencent ao ByteDance: Mais de uma década dedicada ao aprendizado por reforço O Dr. Sun Peng se formou na Universidade Tsinghua e, posteriormente, realizou pesquisas de pós-doutorado na Universidade Cornell e na Universidade Rutgers. Ao longo da última década, sua pesquisa e prática industrial sempre giraram em torno do aprendizado por reforço e agentes inteligentes, expandindo gradualmente do aprendizado por reforço para robótica para sistemas de RL em larga escala e pós-treinamento de grandes modelos, acumulando uma base técnica que combina pesquisa algorítmica e engenharia de sistemas. Durante seus primeiros anos no AI Lab da Tencent e no laboratório de robótica Robotics X, Sun Peng atuou como chefe do Centro de Agentes Inteligentes, conduzindo pesquisas em aprendizado por reforço profundo e controle robótico. Ele utilizou aprendizado por reforço profundo e jogos adversariais para treinar robôs com rodas, alcançando rastreamento ativo de alvos de forma ponta a ponta; também desenvolveu os agentes de IA TStarBots e TStarBotX para o jogo StarCraft, obtendo resultados importantes em pesquisas sobre ambientes de jogos complexos com aprendizado por reforço multiagente (MARL). Após ingressar no ByteDance, Sun Peng expandiu sua prática tecnológica de algoritmos para engenharia de sistemas de RL em larga escala. Ele liderou o desenvolvimento da infraestrutura central de aprendizado por reforço ByteRL, que suporta o treinamento eficiente de vários IAs de jogos proprietários. Sua equipe conquistou o campeonato na competição de IA para jogos de cartas estratégicas IEEE CoG 2023, e o IA desenvolvido para Hearthstone demonstrou um nível competitivo capaz de derrotar os melhores jogadores da indústria. Com o surgimento dos grandes modelos de linguagem, Sun Peng expandiu ainda mais seu acúmulo em aprendizado por reforço para o pós-treinamento de LLMs. Durante seu período no AI Lab/ByteResearch do ByteDance, como líder de projeto, ele participou da pesquisa e publicação do método de ajuste fino reforçado ReFT (Reinforced Fine-Tuning) e do agente de raciocínio matemático DeltaProver; na equipe Seed, participou profundamente do RLHF e pré-treinamento de modelos, acumulando vasta experiência em exploração de ponta em alinhamento de modelos, aprimoramento de raciocínio e direção de agentes. Do aprendizado por reforço para robótica, passando por sistemas de RL em larga escala, até o pós-treinamento de grandes modelos, a trajetória tecnológica de Sun Peng na última década sempre girou em torno de uma questão central: como fazer os agentes aprenderem continuamente por meio da interação com o ambiente e feedback, e otimizarem suas próprias estratégias. Agora, à medida que a IA avança do mundo digital para o mundo físico real, esse conjunto de capacidades está encontrando novos pontos de aplicação no campo da inteligência incorporada. Novo cargo na Astribot: Reforçando o ciclo fechado de pós-treinamento de robôs Para a Astribot, enquanto promove a construção de seu sistema tecnológico full-stack de "modelo de IA + sistema operacional incorporado + corpo movido a cabos", a entrada de Sun Peng é exatamente o elo fundamental para consolidar o "pós-treinamento" dos modelos robóticos. Desde sua fundação, a Astribot tem insistido no Design for AI, acreditando que o corpo do robô, os dados e os modelos de IA não devem ser projetados de forma isolada. Nos últimos anos, essa abordagem gradualmente formou um ciclo fechado completo que abrange modelos de base e modelos comerciais, agentes simbióticos de front-end e pós-treinamento com aprendizado por reforço. A série de modelos de base Lumo da Astribot promove continuamente a compreensão, previsão e geração de ações e ambientes pelos robôs. O Lumo-1 permite que os robôs entendam o "porquê" por trás das ações; o Lumo-2, como o primeiro modelo de mundo implícito para ações domésticas, introduz a Dinâmica de Mundo Latente, prevendo primeiro o mundo futuro no espaço latente e depois gerando ações; o agente de front-end Philia é voltado para memória de longo prazo, gerenciamento de tarefas, coordenação multi-robô e interação natural. O aprendizado por reforço, como uma etapa importante para os modelos de base alcançarem implantação real em larga escala, assume a questão central de como os robôs aprendem com a interação contínua e o feedback de tarefas no ambiente real, e otimizam continuamente suas estratégias de comportamento. O acúmulo de longo prazo de Sun Peng em aprendizado por reforço para robótica, sistemas de RL em larga escala, RLHF de grandes modelos, ajuste fino reforçado e agentes fortalecerá ainda mais a capacidade tecnológica da Astribot nessa etapa. No futuro, ele participará da construção dos modelos incorporados da Astribot, do aprendizado por reforço para robótica e do sistema de pós-treinamento, explorando como os métodos de pós-treinamento com aprendizado por reforço, já validados na era dos grandes modelos, podem ser combinados com a execução real de robôs, ciclos fechados de dados e implantação de longo prazo. Sobre sua entrada na Astribot, Sun Peng declarou: "Na última década, venho trabalhando com aprendizado por reforço e agentes inteligentes, e testemunhei o processo do aprendizado por reforço evoluindo do controle robótico e jogos complexos para o pós-treinamento de grandes modelos. Agora, espero sinceramente trazer esse acúmulo de volta ao mundo físico. A Astribot já possui uma base tecnológica completa, desde o corpo do robô, o sistema operacional incorporado até os modelos de IA. O que mais me entusiasma a seguir é, junto com a equipe, integrar ainda mais o aprendizado por reforço ao treinamento e implantação de robôs reais, para que os robôs não apenas 'aprendam uma tarefa', mas possam, através de execuções reais e feedback repetidos, melhorar cada vez mais suas tarefas." Este artigo foi fornecido pela Astribot, e o Qubit foi autorizado a reproduzi-lo. As opiniões pertencem ao autor original. Direitos autorais reservados. Qualquer forma de reprodução ou uso sem autorização é proibida e os infratores serão responsabilizados.

Continue por tema

O que isso significa para sua empresa?

A CBI transforma sinais da China em pesquisa de mercado, avaliação de parceiros e apoio à entrada no mercado.

Conversar com a equipe →

Receba o briefing diário

3-5 destaques por dia, direto no e-mail. Gratuito.