TecnologiaMonitorar
DeepSeek falha de forma intermitente — pesquisa da ByteDance expõe risco oculto para empresas brasileiras que usam IA chinesa
· Redação CBI
Pesquisadores da ByteDance identificaram que o DeepSeek-V4 erra respostas de forma periódica a cada 4 tokens, dependendo da posição da informação na entrada, com variação de até 40 pontos percentuais na precisão.
Pesquisadores da equipe Seed da ByteDance descobriram que o DeepSeek-V4, um dos modelos de inteligência artificial mais adotados por empresas brasileiras que buscam alternativas de baixo custo aos sistemas americanos, apresenta falhas intermitentes e periódicas: a mesma pergunta, com a mesma informação, pode receber respostas corretas ou erradas dependendo apenas da posição dos dados na entrada. Em testes com contexto de 128 mil tokens, a precisão de recuperação variou até 40,2 pontos percentuais apenas movendo a informação de lugar. O problema está ligado à técnica de compressão de KV Cache em blocos, adotada pelo DeepSeek para tornar o processamento de textos longos mais econômico em memória.
A equipe Seed da ByteDance realizou uma série de experimentos controlados com o DeepSeek-V4-Flash-Base e documentou um comportamento que descreveu como 'divino e demoníaco'. No primeiro teste, os pesquisadores extraíram um trecho de código de quantização FP8 do próprio repositório oficial do DeepSeek e pediram ao modelo para completar o último token. A resposta correta era 8, mas o modelo frequentemente insistia em 32. Ao inserir uma docstring decorativa com sinais de igual repetidos antes do código, sem alterar nada mais, a resposta começou a oscilar com período de 4 tokens: quando o comprimento de preenchimento dividido por 4 dava resto 0 ou 1, o modelo tendia ao erro 32; com resto 2 ou 3, acertava o 8. Em um conjunto de posições, a probabilidade média da resposta errada chegou a 71,3%, enquanto a correta ficou em 26,4%. Em outro conjunto, a situação se invertia: 91,5% para a resposta certa e 7,2% para a errada. A equipe ampliou os testes para a tarefa clássica de recuperação em contexto longo, conhecida como 'agulha no palheiro', construindo um contexto de até 128 mil tokens com cerca de 16 mil pares chave-valor. Mantendo a relação chave-valor, a pergunta e o comprimento total constantes, e ajustando apenas a posição da informação-alvo em relação à fronteira da janela de compressão, a curva de precisão da série DeepSeek-V4 apresentou flutuações periódicas claras. O problema está diretamente relacionado à técnica de compressão de KV Cache em blocos, que o DeepSeek adotou para reduzir o consumo de memória e tornar o processamento de textos longos mais eficiente. A compressão, no entanto, introduz uma sensibilidade posicional que faz o modelo tratar de forma diferente informações idênticas dependendo de onde estejam no texto de entrada. Para o mercado brasileiro, o achado tem implicações concretas. Empresas de tecnologia, fintechs e prestadores de serviços que utilizam o DeepSeek via API — atraídos pelo custo significativamente menor em relação a modelos como GPT-4 ou Claude — podem estar operando com sistemas que apresentam falhas silenciosas e não determinísticas. Um chatbot de atendimento ao cliente pode dar uma resposta correta em um dia e errada no dia seguinte, sem que nada tenha mudado no prompt ou na base de conhecimento. Um sistema de análise de contratos longos pode extrair uma cláusula crítica ou ignorá-la dependendo de quantos caracteres a antecedem. Os dados mostram que a variação não é aleatória, mas periódica e previsível em laboratório — o que, na leitura do CBI, indica que o problema é estrutural e não um bug isolado. Isso significa que ajustes simples de prompt ou de formatação de entrada podem mitigar o risco, mas não eliminá-lo. A comparação com eventos anteriores é relevante: em 2024, quando o DeepSeek ganhou tração global pelo custo baixo, empresas brasileiras correram para integrá-lo sem que houvesse literatura robusta sobre suas limitações em produção. Agora, a própria ByteDance — concorrente direta do DeepSeek no mercado chinês de IA — documenta uma fragilidade que pode afetar desde startups de automação jurídica até bancos que usam o modelo para triagem de crédito. O que acompanhar: primeiro, se o DeepSeek publicará uma correção ou nota técnica sobre a compressão de KV Cache nas próximas semanas; segundo, se provedores brasileiros de nuvem que hospedam o modelo — como AWS, Google Cloud ou Alibaba Cloud — emitirão alertas de compliance para clientes; terceiro, se a ANVISA ou o Banco Central, que já sinalizaram atenção ao uso de IA em setores regulados, incluirão esse tipo de falha posicional em suas diretrizes de validação de sistemas automatizados.
Nota sobre a fonte
A fonte 量子位 (QbitAI) reporta pesquisa conduzida pela ByteDance, concorrente direta do DeepSeek no mercado chinês de IA, o que pode amplificar o tom alarmista do achado em detrimento do contexto de que outras arquiteturas de atenção longa também apresentam sensibilidade posicional.
O que isso significa para sua empresa?
A CBI transforma sinais da China em pesquisa de mercado, avaliação de parceiros e apoio à entrada no mercado.
Conversar com a equipe →Receba o briefing diário
3-5 destaques por dia, direto no e-mail. Gratuito.