IA

DeepSeek V4.1 Flash: 552 bilhões de parâmetros, 8 bilhões ativos, cache 60% mais barata e empate com Opus 5

Adrian Kessler

O DeepSeek V4.1 Flash opera em uma nova arquitetura que a empresa chama de Causal Encoder-Decoder. Seus 552 bilhões de parâmetros abrangem um codificador de 20 camadas e um decodificador de 20 camadas, mas apenas 8 bilhões ativam nos tokens de entrada e 16 bilhões na saída. Isso o torna estruturalmente mais enxuto do que modelos que ativam fatias maiores de parâmetros para cada operação — uma escolha de projeto que compensa diretamente no custo de inferência e na eficiência de memória.

Os ganhos de memória são específicos. O cache KV do V4.1 Flash tem 890 bytes por token, aproximadamente um quarto do V4-Flash. O cache FP4 e o Compressed Sparse Attention 2 reduzem a pegada do cache persistente para um oitavo da geração anterior. A entrada em cache agora custa US$ 0,003 por milhão de tokens no período de menor demanda — queda de 60% em relação ao V4-Flash. A entrada não em cache caiu 33%, e a saída, 11%.

Nos benchmarks que os desenvolvedores mais acompanham, o modelo se mantém firme. O DeepSWE v1.1 — o teste autônomo de engenharia de software — lhe atribui 74,2, ligeiramente à frente do Opus 5 da Anthropic, com 74,0, e acima do GPT-5.6 Sol, com 73,0. O GPQA Diamond marca 90,9. A diferença que se destaca é o Terminal-Bench 3.0: 30,0 ante 43,3 do Opus 5, uma diferença real em tarefas que exigem depuração interativa prolongada.

A visão é incorporada desde o pré-treinamento. Anteriormente, o V4 dividia a visão em uma variante separada, o Vision-Exp. O V4.1 Flash substitui ambos por um modelo único construído em torno do DeepSeek-ViT, um codificador treinado sob medida e codesenvolvido com o modelo de linguagem desde o início. O nível multimodal desapareceu — toda chamada recebe visão por padrão.

A janela de contexto é de 1 milhão de tokens, com a saída limitada a 384.000, suficiente para análise de documentos longos e fluxos de trabalho agentivos extensos sem a necessidade de dividir o conteúdo. Os chamadores de API existentes que usam os códigos antigos deepseek-v4-flash e deepseek-v4-flash-vision-exp já estão sendo direcionados para o V4.1 Flash. Em 14 de setembro, o tráfego do DeepSeek V4 Pro também será migrado — mantendo-se o preço do Flash.

A DeepSeek descreveu o V4.1 Flash como “o menor modelo em nossa nova família de arquiteturas”. Um V4.1 Pro maior, baseado no mesmo design Causal Encoder-Decoder, está implícito. Se ele mantiver a trajetória de eficiência do Flash, estenderá o desempenho por dólar dessa arquitetura ainda mais na curva de benchmarks — para um território atualmente ocupado por modelos que custam significativamente mais por milhão de tokens.

O ponto arquitetônico importa além da tabela de preços. O crescimento do cache KV é uma das principais restrições para executar grandes modelos com contexto longo, e ele escala com cada token processado. A abordagem do V4.1 Flash — menos parâmetros ativos, cache comprimido — enfrenta essa restrição diretamente. É um modelo utilizável para implantações de contexto longo, não uma otimização de nicho.

Tags: , , , , ,

Discussão

Há 0 comentários.