La vetta è un plateau — e uno dei quattro è open weights
Claude Opus 5, Claude Fable 5, GPT-5.6 Sol e Kimi K3 si trovano entro 3.6 punti l'uno dall'altro in intelligenza. I loro prezzi di output variano di 3.3×. Quel divario tra capacità e prezzo è l'intera storia.
TL;DR — la versione breve
Claude Opus 5 guida entrambi gli indici e costa la metà di quanto costa Claude Fable 5. Il modello di punta di Anthropic non è il miglior modello di Anthropic secondo queste misure.
Kimi K3 è open-weight e si posiziona 3.6 punti dietro il leader, al 30 % del prezzo di output di Fable 5. A $15 per milione di token di output costa esattamente quanto costa GPT-5.6 Terra — e ottiene 2.1 punti in più.
Il prezzo non segue più la capacità al vertice. Scegli in base alla latenza, alla licenza e alla finestra di contesto, perché è lì che questi quattro differiscono realmente.
I numeri, questa mattina
Tutto ciò che segue proviene dalla nostra fusione di benchmark quotidiana, fornita da Artificial Analysis e ricostruita ogni mattina. Due indici compositi — Intelligenza e Coding — più il throughput e il prezzo che monitoriamo noi stessi. Nessuna stima, nessun arrotondamento.
| Modello | Intelligenza | Codifica | $ / 1M out | Token / s | Pesi |
|---|---|---|---|---|---|
| Claude Opus 5 | 60.7 | 78.0 | $25 | 62.8 | Chiuso |
| Claude Fable 5 | 59.9 | 76.5 | $50 | 71.3 | Chiuso |
| GPT-5.6 Sol | 58.9 | 77.4 | $30 | 90.2 | Chiuso |
| Kimi K3 | 57.1 | 76.2 | $15 | 32.9 | Aperto |
| GPT-5.6 Terra | 55.0 | 76.7 | $15 | 165.4 | Chiuso |
| GPT-5.6 Luna | 51.2 | 71.4 | $6 | 220.4 | Chiuso |
| DeepSeek V4 Flash | 40.3 | 56.2 | $0.28 | 125.4 | Aperto |
Leggi di nuovo le prime quattro righe. La differenza da Kimi K3 a Opus 5 è 3.6 punti di intelligenza — circa sei percento. La differenza nel prezzo di output tra quei quattro modelli è $15 a $50. La capacità si è compressa; i prezzi no.
Il modello di punta di Anthropic non è il suo miglior modello
Claude Fable 5 è il modello che Anthropic propone, ed è il più costoso dei sette a $50 per milione di token di output. Claude Opus 5 lo batte in entrambi gli indici — 60.7 contro 59.9 in intelligenza, 78.0 contro 76.5 in coding — per la metà del prezzo.
Opus 5 è anche più veloce al primo token: 31 secondi contro 80. In una lunga corsa agentica quella differenza si accumula.
C'è una avvertenza che vale la pena dichiarare chiaramente: Fable 5 esegue una configurazione di ragionamento adattivo con un fallback di Opus 4.8, quindi i due non sono prodotti identici. Ma sui numeri che un acquirente confronta realmente — punteggio, prezzo, latenza — il più economico vince su tutti e tre.
Un modello open weights ora pareggia la fascia media di OpenAI, allo stesso prezzo
Kimi K3, di Moonshot AI, viene fornito con open weights. Ottiene 57.1 in intelligenza. GPT-5.6 Terra ottiene 55.0. Entrambi costano $15 per milione di token di output.
Questa è la frase che questo sito è stato costruito per poter scrivere. Un modello open-weight, che puoi scaricare e eseguire tu stesso, supera un modello medio chiuso a un prezzo identico. Due anni fa il divario aperto era misurato in generazioni; qui è 3.6 punti dietro il leader assoluto.
GPT-5.6 è quattro modelli, non uno
“GPT-5.6” nomina una famiglia, e le varianti sono molto distanti. Sol ottiene 58.9 a $30. Terra ottiene 55.0 a $15. Luna ottiene 51.2 a $6.
Leggi questo come una scala piuttosto che una lista: ogni gradino in basso costa la metà e cede da tre a quattro punti.Luna costa un quinto del prezzo di Sol per l'87 % del suo punteggio di intelligenza, ed è la cosa più veloce qui a 220 token al secondo. Per classificazione, estrazione o sintesi, pagare per Sol significa pagare per margine che non utilizzerai.
Cosa non ti dice la classifica
Opus 5 ottiene 89.1 su Terminal-Bench e 93.2 su GPQA.Ottiene anche 30.3 su τ-Bench Banking.Il modello meglio classificato al mondo ottiene circa un terzo di un compito realistico per un agente bancario corretto.
Gli indici compositi mediamente eliminano esattamente questo tipo di varianza. Un modello che è eccellente nel lavoro terminale e mediocre nell'uso di strumenti multi-turno appare come un singolo numero, e quel numero non predirà come si comporta nel tuo compito. Testa sul tuo carico di lavoro prima di impegnarti.
Lo stesso vale per il tempo al primo token, che nessuno di questi indici include. DeepSeek V4 Flash risponde in meno di un secondo.Kimi K3 impiega 126 secondi per avviarsi. Per un'interfaccia di chat, questi sono prodotti diversi, qualunque sia il loro punteggio.
Come scegliere
Ragionamento più difficile, costo secondario. Claude Opus 5. Guida entrambi gli indici e sottocosta Fable 5 della metà.
Vuoi velocità sopra ogni cosa. GPT-5.6 Luna a 220 token al secondo, o DeepSeek V4 Flash se la latenza sotto il secondo è più importante degli ultimi dieci punti di punteggio.
Hai bisogno dei pesi. Kimi K3 — per auditabilità, distribuzione on-premise, o perché un cambiamento di licenza in un'API chiusa è un rischio che non puoi sostenere. Accetti consapevolmente la penalità di throughput.
Alto volume, compiti ordinari. DeepSeek V4 Flash. A $0.28 per milione di token di output è 179 volte più economico di Fable 5, ed è quattro volte più veloce. Ottiene due terzi di punteggio, il che per estrazione e classificazione è sufficiente.
Questi numeri cambiano ogni mattina
Prezzi, finestre di contesto e indici di benchmark per oltre 500 modelli, ricostruiti quotidianamente. Gratis, senza registrazione.
Apri il comparatore →Il punto fondamentale
La frontiera si è appiattita. Quando quattro modelli si trovano entro il sei percento l'uno dall'altro in capacità mentre i loro prezzi variano di 3.3×, la classifica smette di essere una guida all'acquisto. Ciò che li separa ancora è throughput, latenza, finestra di contesto e se ti è permesso mantenere i pesi.
E il lato aperto di quella tabella non è più un compromesso che spieghi al tuo consiglio. È una riga, 3.6 punti in basso, al 30 % del prezzo.