Quel niveau de GPT-5.6 ? La mauvaise question
Sol, Terra et Luna ont été expédiés le même jour à 30 $, 15 $ et 6 $ par million de tokens de sortie. À l'effort maximum, ils se situent à 7,7 points d'intelligence d'écart. Les six niveaux d'effort à l'intérieur de Luna à eux seuls se situent à 24,6 points d'écart.
TL;DR — la version courte
GPT-5.6 n'est pas un modèle, et pas trois non plus. Ce sont trois niveaux, chacun exposant six niveaux d'effort — dix-huit configurations mesurées sous un même nom.
Le niveau fixe votre prix unitaire. Le niveau d'effort fixe presque tout le reste.
À travers les trois niveaux à l'effort maximum, l'indice d'intelligence s'étend sur 7,7 points. À l'intérieur du niveau le moins cher, il s'étend sur 24,6.
L'effort maximum n'est pas toujours le meilleur réglage : Sol à xhigh obtient 78,3 en programmation contre 77,4 au maximum, et commence à répondre 48,96 secondes plus tôt.
Trois niveaux, une date de sortie
Les trois niveaux de GPT-5.6 ont la même date de sortie, le 9 juillet 2026. Ils diffèrent par un facteur de cinq en prix et par un mot dans le nom. Les voici à l'effort maximum, comme les classements les listent.
| Niveau | Intelligence | Codage | $ / 1M en | $ / 1M sortie | Tokens / s | Premier jeton |
|---|---|---|---|---|---|---|
| GPT-5.6 Sol (max) | 58.9 | 77.4 | $5 | $30 | 90.2 | 87.13 s |
| GPT-5.6 Terra (max) | 55.0 | 76.7 | $2.5 | $15 | 165.4 | 151.8 s |
| GPT-5.6 Luna (max) | 51.2 | 71.4 | $1 | $6 | 220.4 | 84.29 s |
Lisez ce tableau seul et la décision semble linéaire. Terra coûte exactement la moitié de Sol sur les tokens d'entrée et de sortie et abandonne 3,9 points d'intelligence. Luna coûte un cinquième de Sol et abandonne 7,7. Choisissez un budget, acceptez la coupe correspondante, passez à autre chose.
Deux détails gâchent l'histoire. Terra à l'effort maximum prend 151,8 secondes pour produire son premier token, plus longtemps que Sol à 87,13 et plus longtemps que Luna à 84,29 — le niveau intermédiaire est le plus lent à répondre. Et le débit va dans la direction opposée au prix. Les deux sont des symptômes de la même chose : chaque ligne ci-dessus est mesurée à l'effort maximum, et l'effort maximum est un paramètre de demande, pas un produit.
Six niveaux d'effort, et ils bougent plus que les niveaux
Chaque niveau est évalué à six réglages : max, xhigh, high, medium, low et Non-raisonnement. Cela fait dix-huit lignes, et la grille complète est le seul moyen honnête de regarder cette famille.
| Configuration | Intelligence | Codage | Tokens / s | Premier jeton |
|---|---|---|---|---|
| Sol · 5 $ / 30 $ | ||||
| max | 58.9 | 77.4 | 90.2 | 87.13 s |
| xhigh | 57.7 | 78.3 | 85.1 | 38,17 s |
| high | 55.9 | 77.2 | 81.8 | 8,65 s |
| moyenne | 53.6 | 76.3 | 85.7 | 7.08 s |
| faible | 49.4 | 69.7 | 80.5 | 2.5 s |
| Non-raisonnement | 41.2 | 65.1 | 79.3 | 0.85 s |
| Terra · 2,5 $ / 15 $ | ||||
| max | 55.0 | 76.7 | 165.4 | 151.8 s |
| xhigh | 51.6 | 70.6 | 136.7 | 9.55 s |
| high | 49.0 | 67.1 | 130.2 | 4.24 s |
| moyenne | 45.6 | 64.7 | 136.3 | 1.59 s |
| faible | 40.5 | 58.1 | 129.8 | 1.28 s |
| Non-raisonnement | 34.0 | 52.3 | 134.9 | 0.67 s |
| Luna · 1 $ / 6 $ | ||||
| max | 51.2 | 71.4 | 220.4 | 84.29 s |
| xhigh | 49.1 | 68.6 | 209 | 25.94 s |
| high | 46.1 | 63.3 | 211.7 | 7.66 s |
| moyenne | 38.1 | 50.7 | 197.9 | 2.52 s |
| faible | 33.3 | 44.2 | 202.8 | 1.64 s |
| Non-raisonnement | 26.6 | 39.3 | 201.3 | 0.65 s |
Dix-huit configurations, trois points de prix
Mesurez maintenant les deux axes les uns par rapport aux autres. Entre les niveaux à effort maximum, l'indice d'intelligence passe de 7,7 points, de 58,9 à 51,2. À l'intérieur d'un seul niveau, l'effort le déplace encore plus : 17,7 points sur Sol, de 58,9 à 41,2 ; 21,0 points sur Terra, de 55,0 à 34,0 ; 24,6 points sur Luna, de 51,2 à 26,6.
Le cadran dont personne ne discute lors d'une réunion d'approvisionnement déplace le score plus de trois fois plus loin que celui dont tout le monde discute. Passer de Luna à Sol multiplie votre prix unitaire par cinq et achète 7,7 points ; rester sur Luna et modifier le paramètre d'effort ne coûte rien par jeton et couvre 24,6 points de portée.
L'effort maximum n'est pas le meilleur réglage
Sur l'indice de codage de Sol, xhigh obtient 78,3 et max obtient 77,4. Le réglage le plus rapide est le meilleur programmeur de 0,9 points, et 78,3 est le plus haut indice de codage de tout cet article — au-dessus de Claude Opus 5 à 78,0, et bien au-dessus de Claude Fable 5 à 76,5, qui est listé à 50 $ par million de jetons de sortie.
Il arrive également plus tôt : 38,17 secondes pour le premier jeton contre 87,13, une différence de 48,96 secondes à chaque appel. Payer les prix de Sol à effort maximum pour écrire du code achète un résultat légèrement moins bon et plus de deux fois d'attente. Une ligne plus bas, Sol à moyenne obtient toujours 76,3 et commence en 7,08 secondes. Sur les quatre meilleurs réglages de Sol, l'indice de codage s'étend sur 2,0 points tandis que le temps jusqu'au premier jeton s'étend de 7,08 à 87,13 secondes, et Luna répète le schéma : xhigh abandonne 2,1 points par rapport à max, 49,1 par rapport à 51,2, et commence 58,35 secondes plus tôt.
Terra est la seule véritable exception. Passer de max à xhigh lui coûte 3,4 points d'intelligence et 6,1 points de codage, de 76,7 à 70,6 — un effondrement plutôt qu'une erreur d'arrondi — en échange d'un premier jeton en 9,55 secondes au lieu de 151,8.
Le débit fonctionne à l'envers de la liste des prix
Une fois la génération commencée, le niveau le moins cher est le plus rapide. Luna maintient 220,4 jetons par seconde, Terra 165,4, Sol 90,2. Le niveau qui coûte cinq fois plus livre du texte à environ deux cinquièmes de la vitesse.
La grille montre également où chaque type de vitesse se situe. Le débit répond à peine à l'effort : à travers ses six réglages, Luna reste entre 197,9 et 220,4 jetons par seconde, Terra entre 129,8 et 165,4, Sol entre 79,3 et 90,2. La latence ne répond à rien d'autre, allant de 0,85 à 87,13 secondes sur Sol, de 0,67 à 151,8 sur Terra et de 0,65 à 84,29 sur Luna.
Où les niveaux diffèrent réellement
Les indices composites cachent la forme d'un modèle. Voici les benchmarks individuels pour les trois niveaux à effort maximum, qui est là où les décompositions publiées existent.
| Benchmark | Sol | Terra | Luna |
|---|---|---|---|
| GPQA | 94.1 | 92.5 | 91.1 |
| Examen Final de l'Humanité | 47.2 | 41.8 | 37.2 |
| IFBench | 72.7 | 71.2 | — |
| Raisonnement sur de longs contextes | 73.7 | 74 | 74 |
| SciCode | 56.1 | 53.9 | 52.5 |
| Terminal-Bench | 88.0 | 88.0 | 80.9 |
| Terminal-Bench Hard | 65.9 | 57.6 | — |
| τ-Bench Banking | 33 | 31.8 | 27.2 |
| τ²-Bench | 85.1 | 86.3 | — |
Les niveaux se séparent sur le raisonnement difficile et peu d'autres choses. L'Examen Final de l'Humanité est l'écart le plus large à 10,0 points, de 47,2 à 37,2 ; GPQA est le plus étroit à 3,0 points, de 94,1 à 91,1. Deux lignes inversent carrément l'ordre des prix : sur le Raisonnement à Long Contexte, à la fois Terra et Luna obtiennent 74 contre 73,7 de Sol, et sur τ²-Bench, Terra obtient 86,3 contre 85,1 de Sol.
La paire Terminal-Bench est la ligne la plus utile ici pour quiconque construit des agents. Sur l'ensemble standard, Terra correspond exactement à Sol à 88,0, à moitié prix ; sur l'ensemble difficile, les deux se séparent, 65,9 contre 57,6. Terra est l'égal de Sol sur le travail de shell jusqu'à ce que le travail de shell devienne difficile, ce qui est précisément quand vous le remarquez.
Et un chiffre pour garder tout le monde honnête : le meilleur des trois niveaux obtient 33 sur τ-Bench Banking. La configuration la plus forte de cette famille répond correctement à une tâche bancaire réaliste multi-tours environ un tiers du temps, et aucun indice composite ne vous le dira.
Les croisements qui décident des factures réelles
Parce que l'effort va plus loin que le niveau, les configurations se croisent. Luna à xhigh obtient 49.1 et Terra à high obtient 49.0 — une dixième de point d'écart, 6 $ contre 15 $ par million de tokens de sortie, 209 tokens par seconde contre 130.2. Il n'y a aucune lecture de cette paire dans laquelle Terra gagne. Il en va de même un cran en dessous : Luna à high obtient 46.1 contre Terra à medium à 45.6, et fonctionne à 211.7 tokens par seconde contre 136.3.
Un cran au-dessus, le commerce s'inverse et devient une question de latence. Terra à xhigh obtient 51.6 et commence en 9.55 secondes ; Luna à max obtient 51.2 et commence en 84.29. Ici, les 9 $ supplémentaires par million de tokens de sortie achètent 74.74 secondes sur chaque première réponse, pas sur la capacité.
Le croisement le plus coûteux est en haut. Si votre seuil est de 55 points, Terra à max atteint exactement 55.0 après avoir attendu 151.8 secondes, tandis que Sol à high atteint 55.9 après 8.65 — 143.15 secondes plus tôt et 0.9 points plus haut, à 30 $ au lieu de 15 $. La règle qui ressort de la grille : trouvez le niveau le moins cher qui atteint votre score cible à un certain niveau d'effort, puis achetez l'effort plutôt que le niveau, sauf si la latence plutôt que le score est la contrainte déterminante.
Contre le reste du tableau
Rien de tout cela ne se produit isolément. Voici le même instantané du matin avec les voisins inclus.
| Modèle | Intelligence | Codage | $ / 1M sortie | Tokens / s | Premier jeton |
|---|---|---|---|---|---|
| Claude Opus 5 | 60.7 | 78.0 | $25 | 62.8 | 31,35 s |
| Claude Fable 5 | 59.9 | 76.5 | $50 | 71.3 | 80,07 s |
| GPT-5.6 Sol (max) | 58.9 | 77.4 | $30 | 90.2 | 87.13 s |
| Kimi K3 | 57.1 | 76.2 | $15 | 32.9 | 125.71 s |
| Claude Opus 4.8 | 55.7 | 74.3 | $25 | 65 | 37,44 s |
| GPT-5.6 Terra (max) | 55.0 | 76.7 | $15 | 165.4 | 151.8 s |
| GPT-5.5 (xhigh) | 54.8 | 74.9 | $30 | — | — |
| Grok 4.5 (high) | 53.8 | 72.4 | $6 | 61.2 | 10.85 s |
| GPT-5.6 Luna (max) | 51.2 | 71.4 | $6 | 220.4 | 84.29 s |
Chaque niveau de GPT-5.6 a un concurrent direct à son prix ou en dessous, et dans chaque cas, le concurrent est en avance sur l'indice composite.
Sol à max, à 30 $ par million de tokens de sortie, est la configuration GPT-5.6 la plus chère répertoriée, et Claude Opus 5 la bat sur les deux indices pour moins d'argent : 60.7 contre 58.9 sur l'intelligence, 78.0 contre 77.4 sur le codage, 25 $ contre 30 $, et 31.35 secondes jusqu'au premier token contre 87.13. La réponse de Sol à cela est une cellule spécifique de la grille, xhigh codage à 78.3.
Terra à max partage son prix de sortie de 15 $ avec Kimi K3, qui obtient 57.1 contre 55.0 sur l'intelligence et 76.2 contre 76.7 sur le codage, expédie des open weights, et porte 2.8 trillions de paramètres avec une fenêtre de contexte de 1 048 576 tokens. Kimi est même plus rapide, 125.71 secondes jusqu'au premier token contre 151.8. Ce que Terra achète à ce prix, c'est un débit soutenu, 165.4 tokens par seconde contre 32.9, et c'est la seule raison de le préférer.
Luna à max partage ses 6 $ avec Grok 4.5 à un effort élevé, qui obtient 53.8 contre 51.2 et 72.4 contre 71.4, et commence à répondre en 10.85 secondes contre 84.29. L'argument contre de Luna est encore le débit : 220.4 tokens par seconde contre 61.2, plus de trois fois plus de texte par seconde une fois qu'il a commencé.
Une ligne mérite sa propre phrase. GPT-5.5 à xhigh est toujours listé à 30 $ par million de tokens de sortie pour 54.8 sur l'intelligence et 74.9 sur le codage, donc le réglage supérieur de la génération précédente coûte deux fois ce que coûte Terra à max et perd contre lui sur les deux indices.
La grille de décision
Chaque ligne ci-dessous nomme une configuration plutôt qu'un niveau, et chaque ligne est décidée par un nombre des tableaux ci-dessus.
| Contrainte déterminante | Configuration | Le nombre qui décide |
|---|---|---|
| Raisonnement le plus difficile | Sol (max) | 47.2 sur HLE |
| Écriture de code | Sol (xhigh) | 78.3 codage |
| Meilleur score sans attente | Sol (high) | 55.9 en 8.65 s |
| Agents Shell, moitié prix | Terra (max) | 88.0 Terminal-Bench |
| Score moyen, premier token rapide | Terra (xhigh) | 51.6 en 9.55 s |
| Récupération à long contexte | Luna (max) | 74 contre 73.7 de Sol |
| Budget limité, travail agentique | Luna (xhigh) | 49.1 à 6 $ |
| Chat en streaming | Luna (élevé) | 211,7 tokens / s |
| Extraction en masse | Luna (Non-raisonnement) | 0,65 s jusqu'au premier token |
| Vous avez besoin des poids | Kimi K3 | 57,1 à Terra’s 15 $ |
| Haut du tableau | Claude Opus 5 | 60,7 et 78,0 à 25 $ |
Terra au maximum est un piège à moins que le travail ne soit exécuté sans surveillance. Terminal-Bench 88,0 à 15 $ est le meilleur prix pour la compétence shell dans cette famille, mais 151,8 secondes jusqu'au premier token est le temps d'attente le plus long de toutes les dix-huit configurations, et Terminal-Bench Hard tombe à 57,6 contre Sol’s 65,9.
Luna à Non-raisonnement est uniquement pour les tâches sans raisonnement. Il répond en 0,65 secondes à 201,3 tokens par seconde, et il obtient 26,6 en intelligence et 39,3 en codage. Tout ce qui implique une décision appartient plutôt à élevé, 46,1, ce qui coûte exactement le même prix par token.
Ces chiffres changent chaque matin
Prix, débit et indices de benchmark pour chaque modèle que nous suivons, reconstruits quotidiennement. Gratuit, sans inscription.
Ouvrir le comparateur →Le constat
La question dans le titre a une petite réponse. Passer à travers les trois niveaux GPT-5.6 avec un effort maximum change l'indice d'intelligence de 7,7 points et votre prix unitaire par un facteur de cinq. La question que personne ne pose sur la diapositive d'approvisionnement a une grande réponse : déplacer le paramètre d'effort à l'intérieur du niveau le moins cher change l'indice de 24,6 points et votre prix unitaire de rien.
Alors faites-le dans cet ordre. Trouvez votre score cible, trouvez le niveau le moins cher qui l'atteint à un certain niveau d'effort, puis dépensez l'effort — et vérifiez le réglage au-dessus et en dessous de celui que vous avez supposé, car sur l'indice de codage de Sol, l'effort maximum n'est pas le score maximum. Ensuite, mettez votre niveau à côté de tout ce qui se liste autour de ce prix : chez Sol’s 30 $, il y a un modèle avec un score plus élevé pour 5 $ de moins, et chez Terra’s 15 $, il y en a un qui expédie ses poids.