IA

Fable 5.1 da Anthropic corta custos de cache em 75% e mais que dobra pontuações agênticas

Susan Hill

Anthropic atualizou o Claude em 1º de setembro com o Fable 5.1, reduzindo o custo de tokens de entrada em cache de US$ 1,00 para US$ 0,25 por milhão — uma redução de 75% que chega no momento em que a maioria dos desenvolvedores de IA em produção descobriu que o acúmulo de contexto, e não o poder computacional bruto, é onde seus orçamentos de infraestrutura realmente se concentram. Em uma sessão agentiva ao vivo, uma única conversa do Claude pode conter centenas de milhares de tokens em cache à medida que o contexto se acumula ao longo das interações. A US$ 0,25 por milhão, esse acúmulo se torna uma escolha deliberada de design, em vez de um teto de custo que o desenvolvedor precisa contornar.

Os resultados de benchmark que acompanham a mudança de preço mostram ganhos de desempenho que reforçam o caso econômico. No Terminal-Bench-Science 0.1, que mede raciocínio científico em múltiplas etapas exigindo design experimental e análise iterativa, o Fable 5.1 obteve 52,6% contra 24,7% do Fable 5 — mais que dobrando o resultado anterior. O AutomationBench melhorou de 17,1% para 31,4%, e o Terminal-Bench 4.0, uma avaliação mais ampla de capacidade agentiva, subiu de 42,0% para 55,8%. O CursorBench 3.2.0 ficou em 73,4%. O padrão em todas as quatro avaliações é consistente: o Fable 5.1 não é incrementalmente melhor na margem — é substancialmente mais confiável nas categorias de tarefas que definem o valor agentivo.

O efeito combinado reescreve a aritmética de custos de construir com o Claude. Uma aplicação agentiva que conclui uma tarefa em menos interações — porque o modelo é mais confiável — consome menos ciclos totais de tokens no caminho para um resultado bem-sucedido. Aplique o corte de 75% no cache aos tokens que ela usa, e a redução efetiva de custo por tarefa em fluxos de trabalho agentivos com alta reutilização chega a 45% ou mais. A Anthropic não publicou um único número principal para a economia composta, mas desenvolvedores que modelarem sua própria economia de tokens chegarão a valores nessa faixa para cargas de trabalho pesadas em contexto.

O Fable 5.1 está disponível imediatamente através da API direta da Anthropic sob o identificador de modelo claude-fable-5-1, e através do Amazon Web Services Bedrock, Google Cloud Platform e Microsoft Azure. A Anthropic anunciou o Enterprise Frontier Safeguards como uma capacidade simultânea: retenção de dados controlada pelo cliente, chaves de criptografia gerenciadas pelo cliente e implantação dentro do tenant de infraestrutura em nuvem existente de cada cliente, incluídas sem custo adicional além dos custos de nuvem subjacentes.

Junto com o lançamento geral, a Anthropic introduziu o Mythos 5.1, uma variante do mesmo modelo subjacente operando com o que a empresa descreve como salvaguardas mais permissivas para organizações verificadas. O acesso é restrito a instituições de pesquisa em cibersegurança e empresas de ciências da vida verificadas. A empresa citou aplicações demonstradas incluindo design de ligantes de proteínas e otimização de modelos biológicos com até 2,5 vezes a taxa de inferência da versão padrão. O acesso ao Mythos 5.1 não é autoatendido: a Anthropic analisa as inscrições individualmente e não publicou o tamanho do grupo inscrito.

Os números agentivos do Fable 5.1, particularmente no Terminal-Bench-Science, colocam os resultados publicados da Anthropic à frente dos números mais recentemente divulgados pela OpenAI em avaliações comparáveis. Comparações de benchmark entre empresas trazem ressalvas metodológicas — fornecedores selecionam avaliações que favorecem seus modelos, e os testes específicos que a Anthropic destacou foram presumivelmente escolhidos por seus resultados favoráveis. O que é mais difícil de explicar é o padrão de duplicação interna: o Fable 5.1 não é o mesmo modelo com um desconto de preço anexado. A mudança de desempenho é grande o suficiente para que a história do preço e a história do desempenho não possam ser separadas.

Para desenvolvedores que atualmente não usam o Claude, a mudança no preço do cache é o número que vale a pena traduzir para sua própria economia de tokens. Qualquer provedor de IA que não se aproxime de US$ 0,25 por milhão de tokens em cache agora enfrentará perguntas diretas de comparação de custos em conversas de vendas empresariais. O preço de cache da Anthropic já era mais baixo que o de vários concorrentes antes dessa redução; a diferença aumentou. Melhorias de desempenho são mais difíceis de generalizar entre casos de uso, mas no segmento agentivo e de raciocínio científico, o Fable 5.1 estabelece um nível de referência contra o qual o próximo grande lançamento de qualquer provedor será medido.

Tags: , , , ,

Discussão

Há 0 comentários.