Claude Opus 5.5 : 1M de contexte et 40% moins cher

Anthropic a fait fort mardi en publiant claude-opus-5-5, qui devient le modèle par défaut sur l'API et dans les apps Claude. Le gros morceau, c'est le passage à 1 million de tokens de contexte, on rejoint enfin Gemini sur ce terrain. Fini les contorsions pour faire tenir un gros repo ou une base documentaire dans la fenêtre.

Côté tarifs, on est à 4$/20$ par million de tokens en input/output, et surtout 0,20$ par Mtoken pour les lectures de cache. Anthropic annonce aussi 40% de coût d'exécution en moins par rapport à Opus 5, tout en gardant des perfs équivalentes à Fable 5.1. C'est cohérent avec la trajectoire du concurrent depuis six mois : baisser les prix sans sacrifier la qualité.

En pratique, si vous êtes déjà sur l'API Anthropic, la bascule est transparente, le modèle est servi par défaut. Ceux qui pinnent explicitement une version dans leur code, pensez à tester avant de merger. Détails dans le changelog officiel et le CHANGELOG de Claude Code.

OpenAI riposte avec GPT-6 Sol et Luna

Le même jour, coïncidence ou pas, OpenAI a annoncé deux nouveaux modèles dans la famille GPT-6 : Sol et Luna. La promesse commerciale, c'est de couvrir les usages quotidiens avec un équilibre différent entre capacité et prix. Sol pour les tâches qui demandent un peu plus de muscle, Luna pour du volume à coût maîtrisé, en gros.

Le communiqué reste vague sur les benchmarks précis, on aurait aimé plus de chiffres. Mais les identifiants sont déjà disponibles dans les SDK, avec la v3.18.0 du client Python et la v7.22.0 du client Node. Donc vous pouvez tester dès aujourd'hui sans attendre. Le billet de présentation est ici.

Autre annonce OpenAI qui mérite l'attention : le prompt caching de GPT-6 a été revu. Taux de hit améliorés, nouveaux diagnostics pour tracer les performances du cache, et surtout des points d'arrêt explicites pour contrôler où la coupe se fait. Ça, c'est du concret pour quiconque a déjà galéré à comprendre pourquoi son cache ratait sur des prompts pourtant très similaires. Les détails dans l'annonce dédiée.

Pour rappel, on avait déjà vu GPT-6 Astra débarquer la semaine dernière et s'installer chez Hex. Cette semaine, il continue son bonhomme de chemin : Harvey l'utilise pour générer des drafts juridiques plus structurés, et Parallel annonce avoir divisé par deux le temps et le coût de ses recherches sur le marché du travail grâce à Astra. C'est du use case client, à prendre pour ce que ça vaut, mais ça donne une idée du positionnement du modèle.

GPT-5.6 : les cas d'usage s'accumulent

Deux annonces cette semaine autour de GPT-5.6, le modèle intermédiaire qui commence à trouver sa place. V7 l'utilise pour transformer des dossiers d'entreprise épars en agents contextuels, l'idée étant de faire une mémoire institutionnelle accessible aux équipes plutôt qu'un chatbot générique. Chaque agent peut citer ses sources, ce qui reste indispensable en usage pro.

De son côté, Ringg a bâti des agents vocaux multilingues capables de gérer 65% des appels clients, avec une baisse de coût annoncée de 90% par rapport à GPT-4.1. Le chiffre est marketing, forcément, mais l'ordre de grandeur reflète bien la trajectoire des tarifs depuis 18 mois. Ces deux annonces montrent qu'on est sorti de la phase démo pour entrer dans le déploiement à l'échelle.

Google pousse Gemini 3.8 Flash TTS

Google continue son travail patient sur l'audio. Deux nouveaux modèles TTS passent en GA cette semaine : gemini-3.8-flash-tts pour la synthèse vocale créative avec fidélité studio et stabilité multi-turn, et gemini-3.8-flash-lite-tts pour du temps réel économique.

Le point intéressant pour les devs, c'est le nouvel endpoint Voices qui expose plus de 150 voix préconstruites et permet de créer des voix personnalisées. Si vous bossez sur un produit qui a besoin de TTS de qualité, ça vaut probablement le coup de comparer avec ElevenLabs et OpenAI voice, les tarifs Google restent traditionnellement agressifs. Le changelog Gemini a les détails.

Ce qu'il faut retenir

La convergence sur le million de tokens de contexte est actée, Anthropic rejoint Google et OpenAI sur ce terrain. Reste à voir qui optimisera le mieux la latence et le coût de cache sur des prompts massifs, parce que 1M de tokens à traiter à chaque requête, c'est vite ruineux si on ne cache pas bien.

Côté OpenAI, la stratégie de famille GPT-6 se dessine plus clairement : Astra pour la recherche et l'analyse, Sol et Luna pour les usages généralistes à différents niveaux. Beaucoup de modèles, beaucoup de segmentations, ça commence à faire beaucoup à documenter pour les équipes qui doivent choisir.