Outils IA Projets Annuaire
🏆 Classement 📡 Actualités ✨ Invites ⚖️ Comparer les Modèles 🔧 Outils 📦 Projets 🚀 Espaces
Blog
Comparaison de modèles

Le sommet du classement est un plateau — et l'un des quatre est en open weights

Claude Opus 5, Claude Fable 5, GPT-5.6 Sol et Kimi K3 se situent à 3.6 points les uns des autres en intelligence. Leurs prix de sortie varient de 3.3×. Cet écart entre capacité et prix est toute l'histoire.

Mis à jour le 28 juillet 2026·8 min de lecture·Pas de mur payant

TL;DR — la version courte

Claude Opus 5 est en tête des deux indices et coûte la moitié de ce que coûte Claude Fable 5. Le modèle phare d'Anthropic n'est pas le meilleur modèle d'Anthropic selon ces mesures.

Kimi K3 est un modèle en open weights et se situe à 3.6 points derrière le leader, à 30 % du prix de sortie de Fable 5. À 15 $ par million de tokens de sortie, il coûte exactement ce que coûte GPT-5.6 Terra — et obtient 2.1 points de plus.

Le prix ne suit plus la capacité au sommet. Choisissez en fonction de la latence, de la licence et de la fenêtre de contexte, car c'est là que ces quatre modèles diffèrent réellement.

Les chiffres, ce matin

Tout ce qui suit provient de notre fusion de benchmark quotidienne, sourcée auprès d'Artificial Analysis et reconstruite chaque matin. Deux indices composites — Intelligence et Codage — plus le débit et le prix que nous suivons nous-mêmes. Pas d'estimations, pas d'arrondis.

ModèleIntelligenceCodage$ / 1M sortieTokens / sPoids
Claude Opus 560.778.0$2562.8Fermé
Claude Fable 559.976.5$5071.3Fermé
GPT-5.6 Sol58.977.4$3090.2Fermé
Kimi K357.176.2$1532.9Ouvert
GPT-5.6 Terra55.076.7$15165.4Fermé
GPT-5.6 Luna51.271.4$6220.4Fermé
DeepSeek V4 Flash40.356.2$0.28125.4Ouvert

Lisez à nouveau les quatre premières lignes. L'écart entre Kimi K3 et Opus 5 est 3.6 points d'intelligence — environ six pour cent. L'écart de prix de sortie entre ces quatre modèles est 15 $ à 50 $. La capacité s'est compressée ; les prix non.

Le modèle phare d'Anthropic n'est pas son meilleur modèle

Claude Fable 5 est le modèle qu'Anthropic met en avant, et c'est le plus cher des sept à 50 $ par million de tokens de sortie. Claude Opus 5 le bat sur les deux indices — 60.7 contre 59.9 en intelligence, 78.0 contre 76.5 en codage — pour la moitié du prix.

Opus 5 est également plus rapide pour le premier token : 31 secondes contre 80. Lors d'une longue exécution agentique, cette différence s'accumule.

Claude Opus 5 versus Claude Fable 5: output price per million tokens
Opus 5 est en tête des deux indices à moitié prix. Redessiné quotidiennement à partir des prix en direct.

Il y a un avertissement qui mérite d'être énoncé clairement : Fable 5 fonctionne avec une configuration de raisonnement adaptatif avec un retour à Opus 4.8, donc les deux ne sont pas des produits identiques. Mais sur les chiffres qu'un acheteur compare réellement — score, prix, latence — le moins cher gagne sur les trois.

Un modèle open weights égale désormais la gamme moyenne d'OpenAI, au même prix

Kimi K3, de Moonshot AI, est livré avec des open weights. Il obtient 57.1 en intelligence. GPT-5.6 Terra obtient 55.0. Les deux coûtent $15 par million de tokens de sortie.

C'est la phrase pour laquelle ce site a été construit. Un modèle en open weights, que vous pouvez télécharger et exécuter vous-même, surpasse un modèle fermé de milieu de gamme au même prix. Il y a deux ans, l'écart ouvert était mesuré en générations ; ici, il est de 3.6 points derrière le leader absolu.

Kimi K3 versus GPT-5.6 Terra: output price per million tokens
Même prix, 2.1 points d'écart — et l'un d'eux expédie ses poids.
Kimi K3 paie cela avec un débit : 32.9 tokens par seconde, le plus lent des sept. GPT-5.6 Terra fonctionne à 165.4 — cinq fois plus vite. Si vos utilisateurs attendent la sortie, cela compte plus que deux points d'indice.

GPT-5.6 est quatre modèles, pas un.

“GPT-5.6” désigne une famille, et les variantes sont très différentes. Sol obtient 58.9 à 30 $. Terra obtient 55.0 à 15 $. Luna obtient 51.2 à 6 $.

Considérez cela comme une échelle plutôt qu'une liste : chaque étape descendante coûte deux fois moins et abandonne trois à quatre points.Luna coûte un cinquième du prix de Sol pour 87 % de son score d'intelligence, et c'est la chose la plus rapide ici à 220 tokens par seconde. Pour la classification, l'extraction ou la synthèse, payer pour Sol, c'est payer pour une marge que vous n'utiliserez pas.

Ce que le classement ne vous dit pas

Opus 5 obtient 89.1 sur Terminal-Bench et 93.2 sur GPQA.Il obtient également 30.3 sur τ-Bench Banking.Le modèle le mieux classé au monde réussit environ un tiers d'une tâche réaliste d'agent bancaire.

Les indices composites moyennent exactement ce type de variance. Un modèle qui est excellent pour le travail terminal et médiocre pour l'utilisation d'outils multi-tours ressemble à un seul nombre, et ce nombre ne prédit pas comment il se comporte sur votre tâche. Testez sur votre propre charge de travail avant de vous engager.

Il en va de même pour le temps jusqu'au premier token, que aucun de ces indices n'inclut. DeepSeek V4 Flash répond en moins d'une seconde.Kimi K3 prend 126 secondes pour démarrer. Pour une interface de chat, ce sont des produits différents, peu importe ce que leurs scores disent.

Comment choisir

Raisonnement le plus difficile, coût secondaire. Claude Opus 5. Il mène les deux indices et sous-cote Fable 5 de moitié.

Vous voulez la vitesse avant tout. GPT-5.6 Luna à 220 tokens par seconde, ou DeepSeek V4 Flash si la latence sous la seconde compte plus que les dix derniers points de score.

Vous avez besoin des poids. Kimi K3 — pour l'auditabilité, le déploiement sur site, ou parce qu'un changement de licence dans une API fermée est un risque que vous ne pouvez pas prendre. Vous acceptez la pénalité de débit en connaissance de cause.

Volume élevé, tâches ordinaires. DeepSeek V4 Flash. À 0,28 $ par million de tokens de sortie, il est 179 fois moins cher que Fable 5, et il est quatre fois plus rapide. Il obtient deux tiers aussi bien, ce qui est suffisant pour l'extraction et la classification.

Ces chiffres changent chaque matin

Prix, fenêtres de contexte et indices de référence pour plus de 500 modèles, reconstruits quotidiennement. Gratuit, sans inscription.

Ouvrez le comparateur →

Le constat

La frontière s'est aplatie. Lorsque quatre modèles se situent à six pour cent les uns des autres en capacité tandis que leurs prix varient de 3,3×, le classement cesse d'être un guide d'achat. Ce qui les sépare encore, c'est le débit, la latence, la fenêtre de contexte et si vous êtes autorisé à conserver les poids.

Et le côté ouvert de cette table n'est plus un compromis que vous expliquez à votre conseil. C'est une ligne, 3,6 points en dessous, à 30 % du prix.