IA

Fable 5.1 d’Anthropic réduit les coûts de cache de 75% et plus que double les scores agentiques

Susan Hill

Anthropic a mis à jour Claude le 1er septembre avec Fable 5.1, réduisant le coût des tokens d’entrée mis en cache de 1,00 $ à 0,25 $ par million — une réduction de 75 % qui intervient au moment où la plupart des développeurs d’IA en production ont découvert que l’accumulation de contexte, et non le calcul brut, concentre en réalité leurs budgets d’infrastructure. Dans une session agentique en direct, une seule conversation Claude peut contenir des centaines de milliers de tokens en cache à mesure que le contexte s’accumule d’un tour à l’autre. À 0,25 $ par million, cette accumulation devient un choix de conception délibéré plutôt qu’un plafond de coût que le développeur contourne.

Les résultats de référence accompagnant le changement de prix montrent des gains de performance qui renforcent l’argument économique. Sur Terminal-Bench-Science 0.1, qui mesure le raisonnement scientifique multi-étapes nécessitant une conception expérimentale et une analyse itérative, Fable 5.1 a obtenu 52,6 % contre 24,7 % pour Fable 5 — soit plus du double du résultat précédent. AutomationBench est passé de 17,1 % à 31,4 %, et Terminal-Bench 4.0, une évaluation plus large des capacités agentiques, est passé de 42,0 % à 55,8 %. CursorBench 3.2.0 a atteint 73,4 %. La tendance à travers les quatre évaluations est cohérente : Fable 5.1 n’est pas marginalement meilleur, il est nettement plus fiable sur les catégories de tâches qui définissent la valeur agentique.

L’effet combiné réécrit l’arithmétique des coûts de construction avec Claude. Une application agentique qui termine une tâche en moins de tours — parce que le modèle est plus fiable — consomme moins de cycles de tokens totaux sur le chemin d’un résultat réussi. Appliquez la réduction de 75 % sur les tokens qu’elle utilise effectivement, et la réduction effective du coût par tâche dans les workflows agentiques à forte réutilisation atteint 45 % ou plus. Anthropic n’a pas publié un seul chiffre global pour les économies combinées, mais les développeurs qui modélisent leur propre économie des tokens arriveront à des chiffres dans cette fourchette pour les charges de travail lourdes en contexte.

Fable 5.1 est disponible immédiatement via l’API directe d’Anthropic sous l’identifiant de modèle claude-fable-5-1, et via Amazon Web Services Bedrock, Google Cloud Platform, et Microsoft Azure. Anthropic a annoncé les Enterprise Frontier Safeguards comme une capacité concurrente : conservation des données contrôlée par le client, clés de chiffrement gérées par le client, et déploiement dans le tenant d’infrastructure cloud existant de chaque client, inclus sans frais supplémentaires au-delà des coûts cloud sous-jacents.

Parallèlement à la version générale, Anthropic a introduit Mythos 5.1, une variante du même modèle sous-jacent fonctionnant avec ce que l’entreprise décrit comme des garde-fous plus permissifs pour les organisations vérifiées. L’accès est restreint aux institutions de recherche en cybersécurité vérifiées et aux entreprises de sciences de la vie. L’entreprise a cité des applications démontrées, notamment la conception de liants protéiques et l’optimisation de modèles biologiques, avec un débit d’inférence jusqu’à 2,5 fois supérieur à celui de la version standard. L’accès à Mythos 5.1 n’est pas en libre-service : Anthropic examine les candidatures individuellement et n’a pas publié la taille de la cohorte inscrite.

Les chiffres agentiques de Fable 5.1, en particulier sur Terminal-Bench-Science, placent les résultats publiés d’Anthropic au-dessus des chiffres les plus récemment divulgués d’OpenAI sur des évaluations comparables. Les comparaisons de benchmarks entre entreprises comportent une mise en garde méthodologique — les fournisseurs sélectionnent des évaluations qui favorisent leurs modèles, et les tests spécifiques mis en avant par Anthropic ont probablement été choisis pour leurs résultats favorables. Ce qui est plus difficile à expliquer, c’est le schéma de doublement interne : Fable 5.1 n’est pas le même modèle avec une réduction de prix attachée. Le changement de performance est suffisamment important pour que l’histoire du prix et l’histoire de la performance ne puissent être séparées.

Pour les développeurs qui n’utilisent pas actuellement Claude, la décision tarifaire sur le cache est le chiffre qui vaut la peine d’être traduit dans leur propre économie des tokens. Tout fournisseur d’IA qui n’atteint pas 0,25 $ par million de tokens mis en cache sera désormais confronté à des questions directes de comparaison de coûts dans les conversations commerciales avec les entreprises. Le prix de cache d’Anthropic était déjà inférieur à celui de plusieurs concurrents avant cette réduction ; l’écart s’est creusé. Les améliorations de performance sont plus difficiles à généraliser d’un cas d’usage à l’autre, mais dans le segment agentique et du raisonnement scientifique, Fable 5.1 établit un niveau de référence par rapport auquel la prochaine version majeure de tout fournisseur sera mesurée.

Étiquettes: , , , ,

Discussion

Il y a 0 commentaire.