Tecnologia
IA chinesa satura FrontierMath Tier 4 — o que isso muda para o setor de tecnologia brasileiro
· Clara Lin
Veículos elétricos e bateriasMinério de ferroPetróleo e gás
O GPT-6 Astra, da OpenAI, resolveu o último problema em aberto do FrontierMath Tier 4, conjunto de testes matemáticos de nível de pesquisa criado pela Epoch AI com apoio de medalhistas Fields. A saturação do benchmark sinaliza que modelos de IA estão avançando mais rápido do que o esperado em rac...
O FrontierMath Tier 4, conjunto de 50 problemas matemáticos de nível de pesquisa criado pela Epoch AI em julho de 2025, foi oficialmente saturado. O GPT-6 Astra, da OpenAI, resolveu o último problema que ainda resistia à IA, elevando a taxa de acerto do modelo para 97,6% segundo dados da própria OpenAI. Quando o Tier 4 foi lançado, há pouco mais de um ano, a melhor pontuação no ranking era de apenas 5%. O autor do problema derrubado, o professor Jay Pantone, da Universidade Marquette, admitiu que a solução da IA ficou próxima da sua. Para o Brasil, o sinal é claro: a fronteira da IA em matemática avançada está se movendo mais rápido do que os ciclos de adoção corporativa, e setores como engenharia, finanças quantitativas e P&D industrial precisam recalibrar suas apostas tecnológicas.
O FrontierMath foi criado em novembro de 2024 pela Epoch AI em parceria com mais de 60 matemáticos, incluindo medalhistas Fields como Terence Tao, Timothy Gowers e Richard Borcherds. O objetivo era construir um benchmark que resistisse por anos à pressão dos grandes modelos de linguagem. Na primeira rodada, a taxa de acerto dos modelos líderes ficou abaixo de 2%. O banco original tinha 300 problemas divididos em três níveis: Tier 1 (universitário avançado e olimpíadas), Tier 2 (pós-graduação) e Tier 3 (pesquisa inicial de doutorado). Com a chegada dos modelos de raciocínio, a Epoch adicionou em julho de 2025 o Tier 4, com 50 problemas elaborados por professores e pós-doutores a partir de pesquisas de curto prazo em suas próprias áreas — análise, teoria dos números, combinatória, topologia e geometria algébrica. No lançamento, apenas 3 dos 50 problemas haviam sido resolvidos, e mesmo assim com suposições não totalmente demonstradas. A Epoch chegou a afirmar publicamente que alguns daqueles problemas talvez não fossem resolvidos pela IA nem em décadas. Pouco mais de um ano depois, todos foram superados.
Por que isso chega ao Brasil? O avanço em raciocínio matemático de nível de pesquisa não é um exercício acadêmico isolado. Ele se traduz diretamente em capacidade de modelagem de risco, otimização logística, design de materiais, química computacional e engenharia de processos — áreas em que empresas brasileiras de setores como mineração (Vale), petróleo (Petrobras), agronegócio (Embrapa, cooperativas do Mato Grosso) e serviços financeiros (bancos com mesas quantitativas) já investem em IA. O impacto direto é indireto, via aceleração da oferta de modelos de fronteira por provedores globais (OpenAI, Google, Anthropic) e chineses (DeepSeek, Alibaba, Baidu), que chegam ao mercado brasileiro via APIs e parcerias locais. Reguladores como o Banco Central, a CVM e a ANPD precisarão acompanhar a velocidade com que esses modelos passam a ser usados em decisões reguladas — de crédito a auditoria — sem que os frameworks de validação acompanhem o ritmo.
Os dados mostram que a trajetória do FrontierMath Tier 4 foi de menos de 5% de acerto no lançamento para 97,6% em pouco mais de 14 meses. Na leitura do CBI, isso indica que benchmarks de matemática deixaram de ser um filtro útil para separar modelos de fronteira — a Epoch já declarou o Tier 4 saturado. O episódio também expõe uma fragilidade: a própria Epoch admitiu que o banco de questões continha mais erros do que o esperado, e a OpenAI identificou falhas durante os testes. Ou seja, a corrida entre avaliadores e modelos está ficando assimétrica, com os avaliadores perdendo capacidade de criar barreiras duradouras. Para o empresário brasileiro, isso significa que decisões de compra de tecnologia baseadas em rankings de benchmark têm prazo de validade cada vez mais curto — o que importa é a integração real ao fluxo de trabalho, não a posição no leaderboard.
O que acompanhar: primeiro, o ritmo de lançamento de novos benchmarks pela Epoch AI e por instituições como o MLCommons, que podem tentar reconstruir barreiras em matemática aplicada e raciocínio científico. Segundo, a resposta dos provedores chineses — DeepSeek, Qwen (Alibaba) e Ernie (Baidu) — que costumam replicar avanços ocidentais em semanas e podem oferecer capacidade matemática de fronteira a custo menor para empresas brasileiras. Terceiro, a agenda regulatória do Banco Central e da CVM sobre uso de IA em decisões financeiras, que deve ganhar urgência à medida que modelos com esse nível de raciocínio se tornam commodities acessíveis via API.
Continue por tema
O que isso significa para sua empresa?
A CBI transforma sinais da China em pesquisa de mercado, avaliação de parceiros e apoio à entrada no mercado.
Conversar com a equipe →Receba o briefing diário
3-5 destaques por dia, direto no e-mail. Gratuito.