Strumenti AI Progetti Directory
🏆 Classifica 📡 Notizie ✨ Prompts ⚖️ Confronta Modelli 🔧 Strumenti 📦 Progetti 🚀 Spazi
Blog
Confronto dei modelli

Opus 5 contro Fable 5 — più nuovo, migliore, metà prezzo

Claude Opus 5 è stato rilasciato quarantacinque giorni dopo Claude Fable 5. Ottiene punteggi più alti su entrambi gli indici compositi e costa esattamente la metà per token. Non dovrebbe succedere, e il motivo per cui accade è più interessante del ranking.

Aggiornato il 28 luglio 2026·9 min di lettura·Nessun paywall

TL;DR — la versione breve

Opus 5 ottiene 60.7 in intelligenza e 78.0 in programmazione per $5 in e $25 out per milione di token. Fable 5 ottiene 59.9 e 76.5 per $10 in e $50 out. Stesso fornitore, modello più recente, 2× il prezzo per meno punti.

Fable 5 non è battuto ovunque. È più veloce nel throughput sostenuto a 71.3 token al secondo contro 62.8, e vince l'Ultimo Esame dell'Umanità e SciCode senza riserve.

L'impostazione conta più del modello. Opus 5 a sforzo medio ottiene già 56.3, sopra Opus 4.8 al suo massimo sforzo, e inizia a rispondere in 9.83 secondi invece di 37.44. Quella manopola muove la tua latenza e la tua bolletta più della scelta tra questi due modelli.

I due modelli, fianco a fianco

Entrambi i dati qui sotto provengono dallo stesso snapshot giornaliero, letti alle 05:30 del 28 luglio 2026 su 874 modelli misurati. Intelligenza e Programmazione sono indici compositi di Artificial Analysis; throughput, tempo al primo token e prezzo li monitoriamo insieme a loro. I prezzi sono dollari per milione di token.

MetricaClaude Opus 5Claude Fable 5
Rilasciato24 luglio 20269 giugno 2026
Intelligenza60.759.9
Codifica78.076.5
$ / 1M input$5$10
$ / 1M output$25$50
Token / s62.871.3
Tempo al primo token31.35 s80.07 s

La linea dei prezzi vale la pena leggerla due volte. Non è all'incirca la metà, è esattamente la metà: $5 contro $10 in input, $25 contro $50 in output. Niente nelle due colonne di punteggio giustifica quel rapporto — il divario è 0.8 punti di intelligenza e 1.5 punti di programmazione, entrambi a favore del modello più economico.

Claude Opus 5 versus Claude Fable 5: intelligence score and output price per million tokens
Due modelli dello stesso fornitore, a quarantacinque giorni di distanza. Ridisegnati quotidianamente dai prezzi in tempo reale.

Una avvertenza prima dei benchmark: entrambi i modelli eseguono una configurazione di ragionamento adattivo, quindi nessuno è un modello a passaggio singolo semplice. La colonna di Opus 5 è la sua impostazione a massimo sforzo, una delle cinque che monitoriamo; Fable 5 ha una singola configurazione misurata, che ottiene 59.9. Quel punto finale diventa l'intero argomento più avanti.

La divisione del benchmark non è unilaterale

Gli indici compositi sono medie, e le medie nascondono la forma di un modello. Ecco la stessa coppia sui nove benchmark individuali nel nostro snapshot.

BenchmarkClaude Opus 5Claude Fable 5
GPQA93.292.6
Ultimo Esame dell'Umanità52.653.3
Ragionamento su contesti lunghi7070
SciCode55.760.2
Terminal-Bench89.184.6
Terminal-Bench Hardnon misurato62.9
IFBenchnon misurato63.5
τ-Bench Banking30.326.8
τ²-Benchnon misurato98.5

Opus 5 prende Terminal-Bench con 4.5 punti, 89.1 contro 84.6. Prende GPQA con 0.6, 93.2 contro 92.6. E prende τ-Bench Banking con 3.5, 30.3 contro 26.8 — su un benchmark dove il migliore dei due ottiene comunque meno di un terzo di un compito realistico per un agente bancario.

Fable 5 prende l'Ultimo Esame dell'Umanità, 53.3 contro 52.6. E prende SciCode con 4.5 punti, 60.2 contro 55.7 — la dimensione esatta del divario che Opus 5 ha aperto su Terminal-Bench, nell'altra direzione. Su Long Context Reasoning sono identici a 70.

Tre delle nove righe non hanno affatto un numero di Opus 5: Terminal-Bench Hard, IFBench e τ²-Bench. Fable 5 pubblica 62.9, 63.5 e 98.5 su di esse. Una misurazione mancante non è un punteggio basso e non la tratteremo come tale — ma se il tuo carico di lavoro assomiglia a seguire istruzioni o utilizzo di strumenti multi-turno, Fable 5 è quello con evidenze pubblicate e Opus 5 è quello che devi testare tu stesso.

Quindi il riassunto onesto del confronto diretto è: Opus 5 vince i due compositi e tre dei sei benchmark dove entrambi sono misurati, Fable 5 vince due, uno è un pareggio e tre sono irrisolti. Questo è un risultato molto più ristretto di “il modello più recente è migliore,” e arriva comunque a metà prezzo.

Fable 5 è genuinamente più veloce — e genuinamente più lento

La velocità è due numeri diversi e qui non sono d'accordo. Una volta che Fable 5 sta generando, genera più velocemente: 71.3 token al secondo contro 62.8, un vantaggio di 8.5 token al secondo. Ma ci vuole molto più tempo per dire qualsiasi cosa. 80,07 secondi per il primo token contro 31,35.

Quale di questi ti interessa dipende interamente da cosa stai costruendo. Un pipeline batch che riassume diecimila documenti durante la notte si preoccupa del throughput e terminerà prima su Fable 5. Un agente di codifica che effettua quaranta chiamate a strumenti sequenziali paga il costo del primo token quarantasette volte, e su quel tipo di lavoro Fable 5 inizia 48,72 secondi dopo su ognuno di essi, prima che appaia un singolo token di output utile.

Il dial dell'impegno si muove più della scelta del modello

Opus 5 espone un'impostazione di impegno, e ciascuno dei suoi cinque livelli è misurato separatamente. Qui risiede la vera decisione, perché la dispersione all'interno di Opus 5 è maggiore della dispersione tra Opus 5 e Fable 5.

ImpostazioneIntelligenzaCodificaToken / sTempo al primo token
Opus 5, impegno massimo60.778.062.831.35 s
Opus 5, impegno molto alto60.177.056.922,36 s
Opus 5, impegno alto58.976.559.114,56 s
Opus 5, impegno medio56.374.359.39,83 s
Opus 5, impegno basso50.666.959.73,01 s
Opus 4.8, impegno massimo55.774.36537,44 s

Leggi prima la colonna del throughput, perché è la sorpresa. Si muove a malapena: 62,8, 56,9, 59,1, 59,3, 59,7. Abbassare l'impegno non fa generare più velocemente Opus 5. Ciò che collassa è il tempo per il primo token, da 31,35 secondi al massimo a 3,01 secondi al minimo.L'impostazione dell'impegno è un dial di tempo di riflessione, non un dial di velocità.

Ora la riga che dovrebbe cambiare come configuri le cose. Opus 5 a impegno medio ottiene 56,3. Opus 4.8 al suo impegno massimo ottiene 55,7. Il nuovo modello, deliberatamente limitato al centro della sua gamma, è 0,6 punti avanti rispetto alla generazione precedente che lavora al massimo — e inizia a rispondere in 9,83 secondi invece di 37,44. Nella codifica i due raggiungono esattamente la stessa cifra, 74,3 contro 74,3.

Claude Opus 5, Claude Fable 5 and Claude Opus 4.8: intelligence score against output price
Opus 5, Fable 5 e Opus 4.8 — due dei tre condividono un prezzo.

Opus 4.8 è prezzato identicamente a Opus 5, a $5 in e $25 out. Quindi su questa coppia l'upgrade è gratuito nel prezzo di listino e vale 5 punti di intelligenza al top della gamma: 60,7 contro 55,7. Non esiste una versione dell'aritmetica in cui rimanere su 4.8 al massimo impegno sia la scelta efficiente.

Opus 5 non supera Fable 5 in ogni impostazione

Il confronto principale utilizza Opus 5 al massimo impegno, e quella cornice lo lusinga. Abbassalo di un livello e il risultato si inverte.

Opus 5 a impegno alto (58,9) scende sotto il 59,9 misurato di Fable 5. Configurato in quel modo, il modello più economico e nuovo perde il composito di un punto. Nella codifica i due sono a livello: 76,5 e 76,5.

L'impostazione che vince effettivamente il confronto su entrambi gli assi è xhigh: 60,1 intelligenza contro 59,9, 77,0 codifica contro 76,5, primo token in 22,36 secondi contro 80,07, a metà del prezzo pubblicato. Questa è la configurazione da citare se stai sostituendo Fable 5 in un sistema in esecuzione — non max, che acquista 0,6 punti di intelligenza in più per nove secondi di latenza prima che inizi l'output.

I livelli di impegno non cambiano il prezzo pubblicato per token, quindi la fattura si muove attraverso quanti token il modello spende prima di rispondere, non attraverso il tariffario. La nostra istantanea misura quella spesa indirettamente, come tempo per il primo token, e attraverso le cinque impostazioni di Opus 5 che vanno da 31,35 secondi a 3,01.

Cosa significa questo per una fattura reale

Tre conclusioni pratiche, nell'ordine in cui un team di solito ne ha bisogno.

Se oggi sei su Fable 5, passa a Opus 5 a impegno molto alto. Guadagni 0,2 punti di intelligenza e 0,5 di codifica, riduci la latenza del primo token da 80,07 secondi a 22,36, e il tariffario si dimezza sia in entrata che in uscita. L'unica cosa che perdi è il throughput sostenuto, 56,9 token al secondo contro 71,3, che conta per la generazione di massa e non molto altro.

Se stai scegliendo un'impostazione piuttosto che un modello, il medio è quello sottovalutato. Con 56,3 di intelligenza e 74,3 di codifica è sopra il tetto del precedente flagship, e 9,83 secondi per il primo token è all'interno dell'intervallo in cui uno strumento interattivo si sente ancora reattivo. L'impegno massimo esiste per i problemi in cui 4,4 punti di indice decidono realmente l'esito; la maggior parte del traffico di produzione non è quei problemi.

Se il tuo carico di lavoro è seguire istruzioni o utilizzare strumenti multi-turno, esegui un benchmark prima di passare. Fable 5 è l'unico dei due con numeri pubblicati su IFBench, Terminal-Bench Hard e τ²-Bench. Non inferiremo i punteggi di Opus 5 da quello composito, e neanche tu dovresti farlo.

Questi numeri cambiano ogni mattina

Prezzi, throughput e indici di benchmark per 874 modelli misurati, ricostruiti quotidianamente. Gratuito, senza registrazione.

Apri il comparatore →

Il punto fondamentale

Un modello più recente che ottiene punteggi più alti e costa esattamente la metà non è un errore di prezzo, è ciò che accade quando un fornitore spedisce due prodotti per due motivi diversi a quarantacinque giorni di distanza. Fable 5 mantiene un reale vantaggio di throughput e due vittorie nei benchmark. Opus 5 prende i compositi, il lavoro terminale e la latenza.

Ma il numero da ricordare in questo articolo non è 60.7 contro 59.9. È 56.3 contro 55.7, a 9.83 secondi contro 37.44 — il precedente flagship battuto da un'impostazione di medio sforzo sul nuovo. La leva con il maggior impatto sulla tua fattura è quella all'interno del modello che hai già scelto.