Opus 5 contro Fable 5 — più nuovo, migliore, metà prezzo
Claude Opus 5 è stato rilasciato quarantacinque giorni dopo Claude Fable 5. Ottiene punteggi più alti su entrambi gli indici compositi e costa esattamente la metà per token. Non dovrebbe succedere, e il motivo per cui accade è più interessante del ranking.
TL;DR — la versione breve
Opus 5 ottiene 60.7 in intelligenza e 78.0 in programmazione per $5 in e $25 out per milione di token. Fable 5 ottiene 59.9 e 76.5 per $10 in e $50 out. Stesso fornitore, modello più recente, 2× il prezzo per meno punti.
Fable 5 non è battuto ovunque. È più veloce nel throughput sostenuto a 71.3 token al secondo contro 62.8, e vince l'Ultimo Esame dell'Umanità e SciCode senza riserve.
L'impostazione conta più del modello. Opus 5 a sforzo medio ottiene già 56.3, sopra Opus 4.8 al suo massimo sforzo, e inizia a rispondere in 9.83 secondi invece di 37.44. Quella manopola muove la tua latenza e la tua bolletta più della scelta tra questi due modelli.
I due modelli, fianco a fianco
Entrambi i dati qui sotto provengono dallo stesso snapshot giornaliero, letti alle 05:30 del 28 luglio 2026 su 874 modelli misurati. Intelligenza e Programmazione sono indici compositi di Artificial Analysis; throughput, tempo al primo token e prezzo li monitoriamo insieme a loro. I prezzi sono dollari per milione di token.
| Metrica | Claude Opus 5 | Claude Fable 5 |
|---|---|---|
| Rilasciato | 24 luglio 2026 | 9 giugno 2026 |
| Intelligenza | 60.7 | 59.9 |
| Codifica | 78.0 | 76.5 |
| $ / 1M input | $5 | $10 |
| $ / 1M output | $25 | $50 |
| Token / s | 62.8 | 71.3 |
| Tempo al primo token | 31.35 s | 80.07 s |
La linea dei prezzi vale la pena leggerla due volte. Non è all'incirca la metà, è esattamente la metà: $5 contro $10 in input, $25 contro $50 in output. Niente nelle due colonne di punteggio giustifica quel rapporto — il divario è 0.8 punti di intelligenza e 1.5 punti di programmazione, entrambi a favore del modello più economico.
Una avvertenza prima dei benchmark: entrambi i modelli eseguono una configurazione di ragionamento adattivo, quindi nessuno è un modello a passaggio singolo semplice. La colonna di Opus 5 è la sua impostazione a massimo sforzo, una delle cinque che monitoriamo; Fable 5 ha una singola configurazione misurata, che ottiene 59.9. Quel punto finale diventa l'intero argomento più avanti.
La divisione del benchmark non è unilaterale
Gli indici compositi sono medie, e le medie nascondono la forma di un modello. Ecco la stessa coppia sui nove benchmark individuali nel nostro snapshot.
| Benchmark | Claude Opus 5 | Claude Fable 5 |
|---|---|---|
| GPQA | 93.2 | 92.6 |
| Ultimo Esame dell'Umanità | 52.6 | 53.3 |
| Ragionamento su contesti lunghi | 70 | 70 |
| SciCode | 55.7 | 60.2 |
| Terminal-Bench | 89.1 | 84.6 |
| Terminal-Bench Hard | non misurato | 62.9 |
| IFBench | non misurato | 63.5 |
| τ-Bench Banking | 30.3 | 26.8 |
| τ²-Bench | non misurato | 98.5 |
Opus 5 prende Terminal-Bench con 4.5 punti, 89.1 contro 84.6. Prende GPQA con 0.6, 93.2 contro 92.6. E prende τ-Bench Banking con 3.5, 30.3 contro 26.8 — su un benchmark dove il migliore dei due ottiene comunque meno di un terzo di un compito realistico per un agente bancario.
Fable 5 prende l'Ultimo Esame dell'Umanità, 53.3 contro 52.6. E prende SciCode con 4.5 punti, 60.2 contro 55.7 — la dimensione esatta del divario che Opus 5 ha aperto su Terminal-Bench, nell'altra direzione. Su Long Context Reasoning sono identici a 70.
Quindi il riassunto onesto del confronto diretto è: Opus 5 vince i due compositi e tre dei sei benchmark dove entrambi sono misurati, Fable 5 vince due, uno è un pareggio e tre sono irrisolti. Questo è un risultato molto più ristretto di “il modello più recente è migliore,” e arriva comunque a metà prezzo.
Fable 5 è genuinamente più veloce — e genuinamente più lento
La velocità è due numeri diversi e qui non sono d'accordo. Una volta che Fable 5 sta generando, genera più velocemente: 71.3 token al secondo contro 62.8, un vantaggio di 8.5 token al secondo. Ma ci vuole molto più tempo per dire qualsiasi cosa. 80,07 secondi per il primo token contro 31,35.
Quale di questi ti interessa dipende interamente da cosa stai costruendo. Un pipeline batch che riassume diecimila documenti durante la notte si preoccupa del throughput e terminerà prima su Fable 5. Un agente di codifica che effettua quaranta chiamate a strumenti sequenziali paga il costo del primo token quarantasette volte, e su quel tipo di lavoro Fable 5 inizia 48,72 secondi dopo su ognuno di essi, prima che appaia un singolo token di output utile.
Il dial dell'impegno si muove più della scelta del modello
Opus 5 espone un'impostazione di impegno, e ciascuno dei suoi cinque livelli è misurato separatamente. Qui risiede la vera decisione, perché la dispersione all'interno di Opus 5 è maggiore della dispersione tra Opus 5 e Fable 5.
| Impostazione | Intelligenza | Codifica | Token / s | Tempo al primo token |
|---|---|---|---|---|
| Opus 5, impegno massimo | 60.7 | 78.0 | 62.8 | 31.35 s |
| Opus 5, impegno molto alto | 60.1 | 77.0 | 56.9 | 22,36 s |
| Opus 5, impegno alto | 58.9 | 76.5 | 59.1 | 14,56 s |
| Opus 5, impegno medio | 56.3 | 74.3 | 59.3 | 9,83 s |
| Opus 5, impegno basso | 50.6 | 66.9 | 59.7 | 3,01 s |
| Opus 4.8, impegno massimo | 55.7 | 74.3 | 65 | 37,44 s |
Leggi prima la colonna del throughput, perché è la sorpresa. Si muove a malapena: 62,8, 56,9, 59,1, 59,3, 59,7. Abbassare l'impegno non fa generare più velocemente Opus 5. Ciò che collassa è il tempo per il primo token, da 31,35 secondi al massimo a 3,01 secondi al minimo.L'impostazione dell'impegno è un dial di tempo di riflessione, non un dial di velocità.
Ora la riga che dovrebbe cambiare come configuri le cose. Opus 5 a impegno medio ottiene 56,3. Opus 4.8 al suo impegno massimo ottiene 55,7. Il nuovo modello, deliberatamente limitato al centro della sua gamma, è 0,6 punti avanti rispetto alla generazione precedente che lavora al massimo — e inizia a rispondere in 9,83 secondi invece di 37,44. Nella codifica i due raggiungono esattamente la stessa cifra, 74,3 contro 74,3.
Opus 4.8 è prezzato identicamente a Opus 5, a $5 in e $25 out. Quindi su questa coppia l'upgrade è gratuito nel prezzo di listino e vale 5 punti di intelligenza al top della gamma: 60,7 contro 55,7. Non esiste una versione dell'aritmetica in cui rimanere su 4.8 al massimo impegno sia la scelta efficiente.
Opus 5 non supera Fable 5 in ogni impostazione
Il confronto principale utilizza Opus 5 al massimo impegno, e quella cornice lo lusinga. Abbassalo di un livello e il risultato si inverte.
Opus 5 a impegno alto (58,9) scende sotto il 59,9 misurato di Fable 5. Configurato in quel modo, il modello più economico e nuovo perde il composito di un punto. Nella codifica i due sono a livello: 76,5 e 76,5.
L'impostazione che vince effettivamente il confronto su entrambi gli assi è xhigh: 60,1 intelligenza contro 59,9, 77,0 codifica contro 76,5, primo token in 22,36 secondi contro 80,07, a metà del prezzo pubblicato. Questa è la configurazione da citare se stai sostituendo Fable 5 in un sistema in esecuzione — non max, che acquista 0,6 punti di intelligenza in più per nove secondi di latenza prima che inizi l'output.
I livelli di impegno non cambiano il prezzo pubblicato per token, quindi la fattura si muove attraverso quanti token il modello spende prima di rispondere, non attraverso il tariffario. La nostra istantanea misura quella spesa indirettamente, come tempo per il primo token, e attraverso le cinque impostazioni di Opus 5 che vanno da 31,35 secondi a 3,01.
Cosa significa questo per una fattura reale
Tre conclusioni pratiche, nell'ordine in cui un team di solito ne ha bisogno.
Se oggi sei su Fable 5, passa a Opus 5 a impegno molto alto. Guadagni 0,2 punti di intelligenza e 0,5 di codifica, riduci la latenza del primo token da 80,07 secondi a 22,36, e il tariffario si dimezza sia in entrata che in uscita. L'unica cosa che perdi è il throughput sostenuto, 56,9 token al secondo contro 71,3, che conta per la generazione di massa e non molto altro.
Se stai scegliendo un'impostazione piuttosto che un modello, il medio è quello sottovalutato. Con 56,3 di intelligenza e 74,3 di codifica è sopra il tetto del precedente flagship, e 9,83 secondi per il primo token è all'interno dell'intervallo in cui uno strumento interattivo si sente ancora reattivo. L'impegno massimo esiste per i problemi in cui 4,4 punti di indice decidono realmente l'esito; la maggior parte del traffico di produzione non è quei problemi.
Se il tuo carico di lavoro è seguire istruzioni o utilizzare strumenti multi-turno, esegui un benchmark prima di passare. Fable 5 è l'unico dei due con numeri pubblicati su IFBench, Terminal-Bench Hard e τ²-Bench. Non inferiremo i punteggi di Opus 5 da quello composito, e neanche tu dovresti farlo.
Questi numeri cambiano ogni mattina
Prezzi, throughput e indici di benchmark per 874 modelli misurati, ricostruiti quotidianamente. Gratuito, senza registrazione.
Apri il comparatore →Il punto fondamentale
Un modello più recente che ottiene punteggi più alti e costa esattamente la metà non è un errore di prezzo, è ciò che accade quando un fornitore spedisce due prodotti per due motivi diversi a quarantacinque giorni di distanza. Fable 5 mantiene un reale vantaggio di throughput e due vittorie nei benchmark. Opus 5 prende i compositi, il lavoro terminale e la latenza.
Ma il numero da ricordare in questo articolo non è 60.7 contro 59.9. È 56.3 contro 55.7, a 9.83 secondi contro 37.44 — il precedente flagship battuto da un'impostazione di medio sforzo sul nuovo. La leva con il maggior impatto sulla tua fattura è quella all'interno del modello che hai già scelto.