Quale livello di GPT-5.6? La domanda sbagliata
Sol, Terra e Luna sono stati rilasciati lo stesso giorno a $30, $15 e $6 per milione di token di output. Con il massimo sforzo si trovano a 7.7 punti di intelligenza di distanza. I sei livelli di sforzo all'interno di Luna da soli si trovano a 24.6 punti di distanza.
TL;DR — la versione breve
GPT-5.6 non è un modello, e non sono nemmeno tre. Sono tre livelli, ognuno dei quali espone sei livelli di sforzo — diciotto configurazioni misurate sotto un nome.
Il livello imposta il tuo prezzo unitario. Il livello di sforzo imposta quasi tutto il resto.
Attraverso i tre livelli al massimo sforzo, l'indice di intelligenza si estende per 7.7 punti. All'interno del livello più economico si estende per 24.6.
Il massimo sforzo non è sempre la migliore impostazione: Sol a xhigh segna 78.3 in codifica contro 77.4 al massimo, e inizia a rispondere 48.96 secondi prima.
Tre livelli, una data di rilascio
Tutti e tre i livelli di GPT-5.6 hanno la stessa data di rilascio, 9 luglio 2026. Differiscono per un fattore di cinque nel prezzo e per una parola nel nome. Ecco come sono al massimo sforzo, come li elencano le classifiche.
| Livello | Intelligenza | Codifica | $ / 1M in | $ / 1M out | Token / s | Primo token |
|---|---|---|---|---|---|---|
| GPT-5.6 Sol (max) | 58.9 | 77.4 | $5 | $30 | 90.2 | 87.13 s |
| GPT-5.6 Terra (max) | 55.0 | 76.7 | $2.5 | $15 | 165.4 | 151.8 s |
| GPT-5.6 Luna (max) | 51.2 | 71.4 | $1 | $6 | 220.4 | 84.29 s |
Leggi quella tabella da sola e la decisione sembra lineare. Terra costa esattamente la metà di Sol sia in token di input che di output e cede 3.9 punti di intelligenza. Luna costa un quinto di Sol e cede 7.7. Scegli un budget, accetta il taglio corrispondente, vai avanti.
Due dettagli rovinano la storia. Terra al massimo sforzo impiega 151.8 secondi per produrre il suo primo token, più a lungo di Sol a 87.13 e più a lungo di Luna a 84.29 — il livello intermedio è il più lento a rispondere. E il throughput corre in direzione opposta al prezzo. Entrambi sono sintomi della stessa cosa: ogni riga sopra è misurata al massimo sforzo, e il massimo sforzo è un parametro di richiesta, non un prodotto.
Sei livelli di sforzo, e si muovono più dei livelli
Ogni livello è benchmarkato a sei impostazioni: max, xhigh, high, medium, low e Non-ragionamento. Sono diciotto righe, e la griglia completa è l'unico modo onesto per guardare questa famiglia.
| Configurazione | Intelligenza | Codifica | Token / s | Primo token |
|---|---|---|---|---|
| Sol · $5 / $30 | ||||
| max | 58.9 | 77.4 | 90.2 | 87.13 s |
| xhigh | 57.7 | 78.3 | 85.1 | 38.17 s |
| high | 55.9 | 77.2 | 81.8 | 8.65 s |
| medio | 53.6 | 76.3 | 85.7 | 7.08 s |
| basso | 49.4 | 69.7 | 80.5 | 2.5 s |
| Non-razionale | 41.2 | 65.1 | 79.3 | 0.85 s |
| Terra · $2.5 / $15 | ||||
| max | 55.0 | 76.7 | 165.4 | 151.8 s |
| xhigh | 51.6 | 70.6 | 136.7 | 9.55 s |
| high | 49.0 | 67.1 | 130.2 | 4.24 s |
| medio | 45.6 | 64.7 | 136.3 | 1.59 s |
| basso | 40.5 | 58.1 | 129.8 | 1.28 s |
| Non-razionale | 34.0 | 52.3 | 134.9 | 0.67 s |
| Luna · $1 / $6 | ||||
| max | 51.2 | 71.4 | 220.4 | 84.29 s |
| xhigh | 49.1 | 68.6 | 209 | 25.94 s |
| high | 46.1 | 63.3 | 211.7 | 7.66 s |
| medio | 38.1 | 50.7 | 197.9 | 2.52 s |
| basso | 33.3 | 44.2 | 202.8 | 1.64 s |
| Non-razionale | 26.6 | 39.3 | 201.3 | 0.65 s |
Diciotto configurazioni, tre fasce di prezzo
Ora misura i due assi l'uno contro l'altro. Tra i livelli a sforzo massimo, l'indice di intelligenza si sposta di 7.7 punti, da 58.9 a 51.2. All'interno di un singolo livello, lo sforzo lo sposta ulteriormente: 17.7 punti su Sol, da 58.9 a 41.2; 21.0 punti su Terra, da 55.0 a 34.0; 24.6 punti su Luna, da 51.2 a 26.6.
Il dial che nessuno contesta in una riunione di approvvigionamento sposta il punteggio più di tre volte rispetto a quello su cui tutti discutono. Passare da Luna a Sol moltiplica il prezzo unitario per cinque e acquista 7.7 punti; rimanere su Luna e muovere il parametro di sforzo non costa nulla per token e copre 24.6 punti di intervallo.
Lo sforzo massimo non è la migliore impostazione
Sull'indice di codifica di Sol, xhigh ottiene 78.3 e max ottiene 77.4. L'impostazione più veloce è il miglior programmatore di 0.9 punti, e 78.3 è il più alto indice di codifica in questo articolo — sopra Claude Opus 5 a 78.0, e ben sopra Claude Fable 5 a 76.5, che si elenca a $50 per milione di token di output.
Arriva anche prima: 38.17 secondi per il primo token contro 87.13, una differenza di 48.96 secondi ad ogni chiamata. Pagare i prezzi di Sol a sforzo massimo per scrivere codice acquista un risultato leggermente peggiore e più del doppio dell'attesa. Una riga più in basso, Sol a medio ottiene ancora 76.3 e inizia in 7.08 secondi. Tra le prime quattro impostazioni di Sol, l'indice di codifica si estende per 2.0 punti mentre il tempo per il primo token si estende da 7.08 a 87.13 secondi, e Luna ripete il modello: xhigh cede 2.1 punti rispetto a max, 49.1 rispetto a 51.2, e inizia 58.35 secondi prima.
Terra è l'unica vera eccezione. Passare da max a xhigh costa 3.4 punti di intelligenza e 6.1 punti di codifica, da 76.7 a 70.6 — un crollo piuttosto che un errore di arrotondamento — in cambio di un primo token in 9.55 secondi invece di 151.8.
Il throughput corre all'indietro rispetto alla lista dei prezzi
Una volta che la generazione inizia, il livello più economico è il più veloce. Luna sostiene 220.4 token al secondo, Terra 165.4, Sol 90.2. Il livello che costa cinque volte di più fornisce testo a circa due quinti della velocità.
La griglia mostra anche dove vive ciascun tipo di velocità. Il throughput risponde appena allo sforzo: tra le sue sei impostazioni, Luna rimane tra 197.9 e 220.4 token al secondo, Terra tra 129.8 e 165.4, Sol tra 79.3 e 90.2. La latenza non risponde a nient'altro, variando da 0.85 a 87.13 secondi su Sol, da 0.67 a 151.8 su Terra e da 0.65 a 84.29 su Luna.
Dove i livelli differiscono realmente
Gli indici compositi nascondono la forma di un modello. Ecco i benchmark individuali per i tre livelli a sforzo massimo, che è dove esistono le suddivisioni pubblicate.
| Benchmark | Sol | Terra | Luna |
|---|---|---|---|
| GPQA | 94.1 | 92.5 | 91.1 |
| Ultimo Esame dell'Umanità | 47.2 | 41.8 | 37.2 |
| IFBench | 72.7 | 71.2 | — |
| Ragionamento su contesti lunghi | 73.7 | 74 | 74 |
| SciCode | 56.1 | 53.9 | 52.5 |
| Terminal-Bench | 88.0 | 88.0 | 80.9 |
| Terminal-Bench Hard | 65.9 | 57.6 | — |
| τ-Bench Banking | 33 | 31.8 | 27.2 |
| τ²-Bench | 85.1 | 86.3 | — |
I livelli si separano su ragionamenti difficili e poco altro. L'Ultimo Esame dell'Umanità è il divario più ampio a 10.0 punti, da 47.2 a 37.2; GPQA è il più stretto a 3.0 punti, da 94.1 a 91.1. Due righe invertono completamente l'ordine dei prezzi: su Long Context Reasoning sia Terra che Luna ottengono 74 contro 73.7 di Sol, e su τ²-Bench Terra ottiene 86.3 contro 85.1 di Sol.
La coppia Terminal-Bench è la linea più utile qui per chiunque costruisca agenti. Sul set standard, Terra corrisponde esattamente a Sol a 88.0, a metà prezzo; sul set difficile i due si separano, 65.9 contro 57.6. Terra è pari a Sol nel lavoro di shell fino a quando il lavoro di shell diventa difficile, che è precisamente quando lo noti.
E un numero per mantenere tutti onesti: il migliore dei tre livelli ottiene 33 su τ-Bench Banking. La configurazione più forte in questa famiglia risponde correttamente a un compito bancario multi-turno realistico circa un terzo delle volte, e nessun indice composito te lo dirà.
I crossover che decidono le fatture reali
Perché lo sforzo si spinge oltre il livello, le configurazioni si incrociano. Luna a xhigh segna 49.1 e Terra a high segna 49.0 — un decimo di punto di distanza, $6 contro $15 per milione di token di output, 209 token al secondo contro 130.2. Non c'è lettura di quella coppia in cui Terra vince. Lo stesso vale un gradino più in basso: Luna a high segna 46.1 contro Terra a medium su 45.6, e funziona a 211.7 token al secondo contro 136.3.
Un gradino più in alto, il commercio si inverte e diventa una questione di latenza. Terra a xhigh segna 51.6 e inizia in 9.55 secondi; Luna a max segna 51.2 e inizia in 84.29. Qui i $9 extra per milione di token di output comprano 74.74 secondi su ogni prima risposta, non capacità.
Il crossover più costoso è in cima. Se la tua soglia è di 55 punti, Terra a max raggiunge esattamente 55.0 dopo aver atteso 151.8 secondi, mentre Sol a high raggiunge 55.9 dopo 8.65 — 143.15 secondi prima e 0.9 punti più alto, a $30 invece di $15. La regola che emerge dalla griglia: trova il livello più economico che raggiunge il tuo punteggio target a un certo livello di sforzo, poi acquista lo sforzo piuttosto che il livello, a meno che la latenza piuttosto che il punteggio non sia il vincolo vincolante.
Contro il resto della classifica
Niente di tutto ciò accade in isolamento. Ecco l'istantanea della stessa mattina con i vicini inclusi.
| Modello | Intelligenza | Codifica | $ / 1M out | Token / s | Primo token |
|---|---|---|---|---|---|
| Claude Opus 5 | 60.7 | 78.0 | $25 | 62.8 | 31.35 s |
| Claude Fable 5 | 59.9 | 76.5 | $50 | 71.3 | 80.07 s |
| GPT-5.6 Sol (max) | 58.9 | 77.4 | $30 | 90.2 | 87.13 s |
| Kimi K3 | 57.1 | 76.2 | $15 | 32.9 | 125.71 s |
| Claude Opus 4.8 | 55.7 | 74.3 | $25 | 65 | 37,44 s |
| GPT-5.6 Terra (max) | 55.0 | 76.7 | $15 | 165.4 | 151.8 s |
| GPT-5.5 (xhigh) | 54.8 | 74.9 | $30 | — | — |
| Grok 4.5 (high) | 53.8 | 72.4 | $6 | 61.2 | 10.85 s |
| GPT-5.6 Luna (max) | 51.2 | 71.4 | $6 | 220.4 | 84.29 s |
Ogni livello di GPT-5.6 ha un concorrente diretto al di sotto o al suo stesso prezzo, e in ogni caso il concorrente è in vantaggio sull'indice composito.
Sol a max, a $30 per milione di token di output, è la configurazione GPT-5.6 più costosa elencata, e Claude Opus 5 la batte su entrambi gli indici per meno soldi: 60.7 contro 58.9 su intelligenza, 78.0 contro 77.4 su coding, $25 contro $30, e 31.35 secondi per il primo token contro 87.13. La risposta di Sol a ciò è una cella specifica della griglia, xhigh coding a 78.3.
Terra a max condivide il suo prezzo di output di $15 con Kimi K3, che segna 57.1 contro 55.0 su intelligenza e 76.2 contro 76.7 su coding, spedisce open weights e porta 2.8 trilioni di parametri con una finestra di contesto di 1.048.576 token. Kimi è anche più veloce, 125.71 secondi per il primo token contro 151.8. Ciò che Terra acquista a quel prezzo è un throughput sostenuto, 165.4 token al secondo contro 32.9, e questa è l'unica ragione per preferirlo.
Luna a max condivide i suoi $6 con Grok 4.5 a sforzo alto, che segna 53.8 contro 51.2 e 72.4 contro 71.4, e inizia a rispondere in 10.85 secondi contro 84.29. L'argomento contro di Luna è di nuovo il throughput: 220.4 token al secondo contro 61.2, più di tre volte tanto testo al secondo una volta che ha iniziato.
Una riga merita una propria frase. GPT-5.5 a xhigh è ancora elencato a $30 per milione di token di output per 54.8 su intelligenza e 74.9 su coding, quindi l'impostazione superiore della generazione precedente costa il doppio di quanto costa Terra a max e perde su entrambi gli indici.
La griglia decisionale
Ogni riga qui sotto nomina una configurazione piuttosto che un livello, e ogni riga è decisa da un numero delle tabelle sopra.
| Vincolo vincolante | Configurazione | Il numero che decide |
|---|---|---|
| Ragionamento più difficile | Sol (max) | 47.2 su HLE |
| Scrivere codice | Sol (xhigh) | 78.3 coding |
| Punteggio massimo senza attesa | Sol (high) | 55.9 in 8.65 s |
| Agenti shell, metà prezzo | Terra (max) | 88.0 Terminal-Bench |
| Punteggio medio, primo token veloce | Terra (xhigh) | 51.6 in 9.55 s |
| Recupero a lungo termine | Luna (max) | 74 contro 73.7 di Sol |
| Budget limitato, lavoro agentico | Luna (xhigh) | 49.1 a $6 |
| Streaming chat | Luna (alta) | 211,7 token / s |
| Estrazione in blocco | Luna (Non-razionale) | 0,65 s al primo token |
| Hai bisogno dei pesi | Kimi K3 | 57,1 a Terra’s $15 |
| In cima alla classifica | Claude Opus 5 | 60,7 e 78,0 a $25 |
Terra al massimo è una trappola a meno che il lavoro non venga eseguito senza supervisione. Terminal-Bench 88,0 a $15 è il miglior prezzo per la competenza shell in questa famiglia, ma 151,8 secondi al primo token è l'attesa più lunga di tutte le diciotto configurazioni, e Terminal-Bench Hard scende a 57,6 contro il 65,9 di Sol’s.
Luna a Non-razionale è solo per compiti senza ragionamento. Risponde in 0,65 secondi a 201,3 token al secondo, e ottiene 26,6 in intelligenza e 39,3 in coding. Qualsiasi cosa con una decisione appartiene a alta invece, 46,1, che costa esattamente lo stesso per token.
Questi numeri cambiano ogni mattina
Prezzi, throughput e indici di benchmark per ogni modello che seguiamo, ricostruiti quotidianamente. Gratuito, senza registrazione.
Apri il comparatore →Il punto fondamentale
La domanda nel titolo ha una piccola risposta. Passare attraverso i tre livelli di GPT-5.6 con il massimo sforzo cambia l'indice di intelligenza di 7,7 punti e il tuo prezzo unitario di un fattore cinque. La domanda che nessuno pone nella slide di approvvigionamento ha una grande risposta: spostare il parametro di sforzo all'interno del livello più economico cambia l'indice di 24,6 punti e il tuo prezzo unitario di nulla.
Quindi fallo in quest'ordine. Trova il tuo punteggio target, trova il livello più economico che lo raggiunge a un certo livello di sforzo, poi spendi lo sforzo — e controlla l'impostazione sopra e sotto quella che hai assunto, perché sull'indice di coding di Sol’s il massimo sforzo non è il punteggio massimo. Poi metti il tuo livello accanto a qualsiasi altra cosa elencata intorno a quel prezzo: a Sol’s $30 c'è un modello con punteggio più alto per $5 in meno, e a Terra’s $15 ce n'è uno che spedisce i suoi pesi.