KI-Tools Projekte Verzeichnis
🏆 Rangliste 📡 Nachrichten ✨ Eingabeaufforderungen ⚖️ Modelle vergleichen 🔧 Werkzeuge 📦 Projekte 🚀 Räume
Blog
Modellanalyse

Welches GPT-5.6 Niveau? Die falsche Frage

Sol, Terra und Luna wurden am selben Tag zu Preisen von 30 $, 15 $ und 6 $ pro Million Ausgabetokens veröffentlicht. Bei maximalem Aufwand liegen sie 7,7 Intelligenzpunkte auseinander. Die sechs Aufwandsebenen innerhalb von Luna allein liegen 24,6 Punkte auseinander.

Aktualisiert am 28. Juli 2026·9 Min Lesezeit·Keine Bezahlschranke

TL;DR — die kurze Version

GPT-5.6 ist nicht ein Modell und auch nicht drei. Es sind drei Stufen, die jeweils sechs Aufwandsebenen offenlegen — achtzehn gemessene Konfigurationen unter einem Namen.

Die Stufe legt Ihren Einheitspreis fest. Die Aufwandsebene legt fast alles andere fest.

Über die drei Stufen bei maximalem Aufwand spannt der Intelligenzindex 7,7 Punkte. Innerhalb der billigsten Stufe allein spannt er 24,6.

Maximaler Aufwand ist nicht immer die beste Einstellung: Sol bei xhigh erzielt 78,3 in Codierung im Vergleich zu 77,4 bei max und beginnt 48,96 Sekunden früher zu antworten.

Drei Stufen, ein Veröffentlichungsdatum

Alle drei GPT-5.6 Stufen haben dasselbe Veröffentlichungsdatum, den 9. Juli 2026. Sie unterscheiden sich um den Faktor fünf im Preis und um ein Wort im Namen. Hier sind sie bei maximalem Aufwand, so wie sie in den Ranglisten aufgeführt sind.

StufeIntelligenzProgrammierung$ / 1M in$ / 1M ausTokens / sErster Token
GPT-5.6 Sol (max)58.977.4$5$3090.287.13 s
GPT-5.6 Terra (max)55.076.7$2.5$15165.4151.8 s
GPT-5.6 Luna (max)51.271.4$1$6220.484.29 s

Lesen Sie diese Tabelle allein, und die Entscheidung sieht linear aus. Terra kostet genau die Hälfte von Sol sowohl bei Eingabe- als auch bei Ausgabetoken und gibt 3,9 Punkte Intelligenz auf. Luna kostet ein Fünftel von Sol und gibt 7,7 auf. Wählen Sie ein Budget, akzeptieren Sie den entsprechenden Haarschnitt und machen Sie weiter.

Zwei Details verderben die Geschichte. Terra benötigt bei maximalem Aufwand 151,8 Sekunden, um sein erstes Token zu produzieren, länger als Sol bei 87,13 und länger als Luna bei 84,29 — die mittlere Stufe ist die langsamste beim Antworten. Und der Durchsatz läuft in die entgegengesetzte Richtung zum Preis. Beides sind Symptome desselben: Jede Zeile oben ist bei maximalem Aufwand gemessen, und maximaler Aufwand ist ein Anfrageparameter, kein Produkt.

GPT-5.6 Sol, Terra and Luna compared on output price per million tokens
Die drei Stufen bei maximalem Aufwand: 30 $, 15 $ und 6 $ pro Million Ausgabetoken. Täglich aus Live-Preisen neu gezeichnet.

Sechs Aufwandsebenen, und sie bewegen sich mehr als die Stufen.

Jede Stufe wird bei sechs Einstellungen bewertet: max, xhigh, high, medium, low und Non-reasoning. Das sind achtzehn Zeilen, und das vollständige Raster ist der einzige ehrliche Weg, diese Familie zu betrachten.

KonfigurationIntelligenzProgrammierungTokens / sErster Token
Sol · 5 $ / 30 $
max58.977.490.287.13 s
xhigh57.778.385.138,17 s
hoch55.977.281.88,65 s
mittel53.676.385.77.08 s
niedrig49.469.780.52.5 s
Nicht-Argumentation41.265.179.30.85 s
Terra · $2.5 / $15
max55.076.7165.4151.8 s
xhigh51.670.6136.79.55 s
hoch49.067.1130.24.24 s
mittel45.664.7136.31.59 s
niedrig40.558.1129.81.28 s
Nicht-Argumentation34.052.3134.90.67 s
Luna · $1 / $6
max51.271.4220.484.29 s
xhigh49.168.620925.94 s
hoch46.163.3211.77.66 s
mittel38.150.7197.92.52 s
niedrig33.344.2202.81.64 s
Nicht-Argumentation26.639.3201.30.65 s

Achtzehn Konfigurationen, drei Preisstufen

Messen Sie jetzt die beiden Achsen gegeneinander. Zwischen den Stufen bei maximalem Aufwand bewegt sich der Intelligenzindex um 7.7 Punkte, von 58.9 auf 51.2. Innerhalb einer einzigen Stufe bewegt der Aufwand ihn weiter: 17.7 Punkte auf Sol, von 58.9 auf 41.2; 21.0 Punkte auf Terra, von 55.0 auf 34.0; 24.6 Punkte auf Luna, von 51.2 auf 26.6.

Der Drehknopf, über den niemand in einem Beschaffungsmeeting streitet, bewegt den Score mehr als dreimal so weit wie der, über den jeder streitet. Der Kauf von Luna zu Sol multipliziert Ihren Einheitspreis mit fünf und kauft 7.7 Punkte; auf Luna zu bleiben und den Aufwand-Parameter zu ändern, kostet nichts pro Token und deckt 24.6 Punkte ab.

Die Stufe ist der einzige Teil dieser Entscheidung, der den Preis eines Tokens verändert. Der teure Teil hat den kleineren Effekt, und der kostenlose Teil entscheidet, was Sie tatsächlich erhalten.

Maximaler Aufwand ist nicht die beste Einstellung

Auf Sol’s Codierungsindex erzielt xhigh 78.3 und max 77.4. Die schnellere Einstellung ist der bessere Programmierer um 0.9 Punkte, und 78.3 ist der höchste Codierungsindex in diesem Artikel — über Claude Opus 5 mit 78.0 und weit über Claude Fable 5 mit 76.5, das bei $50 pro Million Ausgabetokens gelistet ist.

Es kommt auch schneller an: 38.17 Sekunden bis zum ersten Token im Vergleich zu 87.13, ein Unterschied von 48.96 Sekunden bei jedem Aufruf. Sol-Preise bei maximalem Aufwand für das Schreiben von Code zu zahlen, kauft ein leicht schlechteres Ergebnis und mehr als doppelt so lange Wartezeit. Eine Zeile weiter unten erzielt Sol bei mittel immer noch 76.3 und startet in 7.08 Sekunden. Über Sol’s vier besten Einstellungen spannt der Codierungsindex 2.0 Punkte, während die Zeit bis zum ersten Token von 7.08 bis 87.13 Sekunden reicht, und Luna wiederholt das Muster: xhigh gibt 2.1 Punkte gegenüber max auf, 49.1 gegenüber 51.2, und startet 58.35 Sekunden früher.

Terra ist die einzige echte Ausnahme. Der Wechsel von max zu xhigh kostet 3.4 Punkte Intelligenz und 6.1 Punkte Codierung, 76.7 auf 70.6 — ein Zusammenbruch statt eines Rundungsfehlers — im Austausch für ein erstes Token in 9.55 Sekunden statt 151.8.

Durchsatz läuft rückwärts zur Preisliste

Sobald die Generierung beginnt, ist die billigste Stufe die schnellste. Luna hält 220.4 Tokens pro Sekunde, Terra 165.4, Sol 90.2. Die Stufe, die fünfmal mehr kostet, liefert Text mit ungefähr zwei Fünfteln der Geschwindigkeit.

Das Gitter zeigt auch, wo jede Art von Geschwindigkeit lebt. Durchsatz reagiert kaum auf Aufwand: über seine sechs Einstellungen bleibt Luna zwischen 197.9 und 220.4 Tokens pro Sekunde, Terra zwischen 129.8 und 165.4, Sol zwischen 79.3 und 90.2. Latenz reagiert auf nichts anderes, läuft von 0.85 bis 87.13 Sekunden auf Sol, 0.67 bis 151.8 auf Terra und 0.65 bis 84.29 auf Luna.

Durchsatz ist eine Eigenschaft der Stufe; Latenz ist eine Eigenschaft des Aufwandsniveaus. Wenn die Antwort zu spät beginnt, wird der Wechsel der Stufe das nicht beheben, und der Wechsel des Aufwands wird es auch nicht.

Wo sich die Stufen wirklich unterscheiden

Zusammengesetzte Indizes verbergen die Form eines Modells. Hier sind die einzelnen Benchmarks für die drei Stufen bei maximalem Aufwand, wo die veröffentlichten Aufschlüsselungen existieren.

BenchmarkSolTerraLuna
GPQA94.192.591.1
Humanity’s Last Exam47.241.837.2
IFBench72.771.2
Langzeit-Kontext-Argumentation73.77474
SciCode56.153.952.5
Terminal-Bench88.088.080.9
Terminal-Bench Hard65.957.6
τ-Bench Banking3331.827.2
τ²-Bench85.186.3

Die Stufen trennen sich bei harter Argumentation und wenig anderem. Die letzte Prüfung der Menschheit ist der größte Unterschied mit 10.0 Punkten, 47.2 auf 37.2; GPQA ist der engste mit 3.0 Punkten, 94.1 auf 91.1. Zwei Zeilen kehren die Preisreihenfolge direkt um: Bei Long Context Reasoning erzielen sowohl Terra als auch Luna 74 gegenüber Sol’s 73.7, und bei τ²-Bench erzielt Terra 86.3 gegenüber Sol’s 85.1.

Das Terminal-Bench-Paar ist die nützlichste Linie hier für jeden, der Agenten erstellt. Im Standardset entspricht Terra Sol genau mit 88.0, zum halben Preis; im harten Set trennen sich die beiden, 65.9 gegenüber 57.6. Terra ist Sol’s gleichwertig bei Shell-Arbeiten, bis die Shell-Arbeiten schwierig werden, was genau der Zeitpunkt ist, an dem Sie es bemerken.

Und eine Zahl, um alle ehrlich zu halten: die beste der drei Stufen erzielt 33 auf τ-Bench Banking. Die stärkste Konfiguration in dieser Familie beantwortet eine realistische mehrstufige Bankaufgabe etwa ein Drittel der Zeit korrekt, und kein zusammengesetzter Index wird Ihnen das sagen.

GPT-5.6 Sol against Claude Opus 5 and Kimi K3: output price per million tokens
Sol bei $30 pro Million Ausgabetokens, neben dem Modell darüber und dem offenen Modell darunter.

Die Kreuzungen, die echte Rechnungen entscheiden.

Weil Aufwand weiter geht als Stufe, kreuzen sich Konfigurationen. Luna bei xhigh erzielt 49.1 und Terra bei high erzielt 49.0 — ein Zehntelpunkt auseinander, $6 gegen $15 pro Million Ausgabetokens, 209 Tokens pro Sekunde gegen 130.2. Es gibt keine Lesart dieses Paares, in der Terra gewinnt. Dasselbe gilt eine Stufe tiefer: Luna bei high erzielt 46.1 gegen Terra bei medium mit 45.6 und läuft mit 211.7 Tokens pro Sekunde gegen 136.3.

Eine Stufe höher kehrt sich der Handel um und wird zu einer Latenzfrage. Terra bei xhigh erzielt 51.6 und startet in 9.55 Sekunden; Luna bei max erzielt 51.2 und startet in 84.29. Hier kauft das zusätzliche $9 pro Million Ausgabetokens 74.74 Sekunden von jeder ersten Antwort, nicht Fähigkeit.

Der teuerste Übergang ist ganz oben. Wenn Ihre Schwelle 55 Punkte beträgt, erreicht Terra bei max genau 55.0 nach 151.8 Sekunden Wartezeit, während Sol bei high 55.9 nach 8.65 erreicht — 143.15 Sekunden früher und 0.9 Punkte höher, für $30 statt $15. Die Regel, die aus dem Raster hervorgeht: Finden Sie die günstigste Stufe, die Ihre Zielpunktzahl auf einem bestimmten Aufwand erreicht, und kaufen Sie dann den Aufwand statt der Stufe, es sei denn, Latenz statt Punktzahl ist die bindende Einschränkung.

Gegen den Rest des Boards

Nichts davon geschieht isoliert. Hier ist der Snapshot des gleichen Morgens mit den Nachbarn inkludiert.

ModellIntelligenzProgrammierung$ / 1M ausTokens / sErster Token
Claude Opus 560.778.0$2562.831,35 s
Claude Fable 559.976.5$5071.380,07 s
GPT-5.6 Sol (max)58.977.4$3090.287.13 s
Kimi K357.176.2$1532.9125.71 s
Claude Opus 4.855.774.3$256537,44 s
GPT-5.6 Terra (max)55.076.7$15165.4151.8 s
GPT-5.5 (xhigh)54.874.9$30
Grok 4.5 (high)53.872.4$661.210.85 s
GPT-5.6 Luna (max)51.271.4$6220.484.29 s

Jede GPT-5.6 Stufe hat einen direkten Konkurrenten zu ihrem eigenen Preis oder darunter, und in jedem Fall liegt der Konkurrent im zusammengesetzten Index vorne.

Sol bei max, für $30 pro Million Ausgabetokens, ist die teuerste GPT-5.6 Konfiguration, die aufgeführt ist, und Claude Opus 5 schlägt sie in beiden Indizes für weniger Geld: 60.7 gegen 58.9 in Intelligenz, 78.0 gegen 77.4 im Programmieren, $25 gegen $30, und 31.35 Sekunden bis zum ersten Token gegen 87.13. Sol’s Antwort darauf ist eine spezifische Zelle des Rasters, xhigh Programmieren bei 78.3.

Terra bei max teilt seinen $15 Ausgabepreis mit Kimi K3, das 57.1 gegen 55.0 in Intelligenz und 76.2 gegen 76.7 im Programmieren erzielt, Open Weights liefert und 2.8 Billionen Parameter mit einem Kontextfenster von 1.048.576 Tokens hat. Kimi ist sogar schneller, 125.71 Sekunden bis zum ersten Token gegen 151.8. Was Terra zu diesem Preis kauft, ist nachhaltiger Durchsatz, 165.4 Tokens pro Sekunde gegen 32.9, und das ist der einzige Grund, es vorzuziehen.

Luna bei max teilt sein $6 mit Grok 4.5 bei hohem Aufwand, das 53.8 gegen 51.2 und 72.4 gegen 71.4 erzielt und in 10.85 Sekunden gegen 84.29 zu antworten beginnt. Lunas Gegenargument ist wieder der Durchsatz: 220.4 Tokens pro Sekunde gegen 61.2, mehr als dreimal so viel Text pro Sekunde, sobald es gestartet ist.

Eine Reihe verdient einen eigenen Satz. GPT-5.5 bei xhigh wird immer noch für $30 pro Million Ausgabetokens für 54.8 in Intelligenz und 74.9 im Programmieren gelistet, sodass die obere Einstellung der vorherigen Generation doppelt so viel kostet wie Terra bei max und in beiden Indizes gegen sie verliert.

GPT-5.6 Luna against Grok 4.5: same output price per million tokens
Dasselbe $6 pro Million Ausgabetokens. Der eine startet in 10.85 Sekunden, der andere hält 220.4 Tokens pro Sekunde.

Das Entscheidungsraster

Jede Zeile darunter benennt eine Konfiguration statt einer Stufe, und jede Zeile wird durch eine Zahl aus den obigen Tabellen entschieden.

Bindende EinschränkungKonfigurationDie Zahl, die entscheidet
Schwierigste ArgumentationSol (max)47.2 in HLE
Code schreibenSol (xhigh)78.3 Programmieren
Höchste Punktzahl ohne WartezeitSol (high)55.9 in 8.65 s
Shell-Agenten, halber PreisTerra (max)88.0 Terminal-Bench
Mittlere Punktzahl, schneller erster TokenTerra (xhigh)51.6 in 9.55 s
Langzeit-KontextabrufLuna (max)74 gegen Sol’s 73.7
Begrenztes Budget, agentische ArbeitLuna (xhigh)49.1 bei $6
Streaming-ChatLuna (hoch)211,7 Tokens / s
MassenextraktionLuna (Keine-Argumentation)0,65 s bis zum ersten Token
Sie benötigen die GewichteKimi K357,1 bei Terra’s $15
Oben auf der ListeClaude Opus 560,7 und 78,0 bei $25

Terra auf Maximum ist eine Falle, es sei denn, der Job läuft unbeaufsichtigt. Terminal-Bench 88,0 bei $15 ist der beste Preis für Shell-Kompetenz in dieser Familie, aber 151,8 Sekunden bis zum ersten Token ist die längste Wartezeit von allen achtzehn Konfigurationen, und Terminal-Bench Hard fällt auf 57,6 gegenüber Sol’s 65,9.

Luna bei Keine-Argumentation ist nur für Aufgaben ohne Argumentation geeignet. Es antwortet in 0,65 Sekunden mit 201,3 Tokens pro Sekunde und erzielt 26,6 in Intelligenz und 39,3 in Programmierung. Alles mit einer Entscheidung gehört stattdessen zu hoch, 46,1, was genau gleich viel pro Token kostet.

Diese Zahlen ändern sich jeden Morgen

Preise, Durchsatz und Benchmark-Indizes für jedes Modell, das wir verfolgen, täglich neu erstellt. Kostenlos, keine Anmeldung erforderlich.

Öffnen Sie den Vergleich →

Das Fazit

Die Frage im Titel hat eine kleine Antwort. Der Wechsel zwischen den drei GPT-5.6-Tiers bei maximalem Aufwand ändert den Intelligenzindex um 7,7 Punkte und Ihren Stückpreis um den Faktor fünf. Die Frage, die niemand auf die Beschaffungsfolie setzt, hat eine große Antwort: Der Wechsel des Aufwandparameters innerhalb des günstigsten Tiers allein ändert den Index um 24,6 Punkte und Ihren Stückpreis um nichts.

Also tun Sie es in dieser Reihenfolge. Finden Sie Ihre Zielpunktzahl, finden Sie das günstigste Tier, das es bei einem bestimmten Aufwand erreicht, und investieren Sie dann den Aufwand — und überprüfen Sie die Einstellung über und unter der, die Sie angenommen haben, denn bei Sol’s Programmierindex ist maximaler Aufwand nicht die maximale Punktzahl. Dann stellen Sie Ihr Tier neben alles andere, was um diesen Preis herum aufgelistet ist: bei Sol’s $30 gibt es ein höher bewertetes Modell für $5 weniger, und bei Terra’s $15 gibt es eines, das seine Gewichte mitliefert.