Kimi K3 è open-weight — e questo non è lo stesso che eseguibile
Ottiene 57.1 in intelligenza a $15 per milione di token di output, davanti a GPT-5.6 Terra allo stesso prezzo e 1.8 punti dietro GPT-5.6 Sol, che costa il doppio. Poi leggi il conteggio dei parametri: 2.8 trilioni.
TL;DR — la versione breve
Kimi K3 ottiene 57.1 in intelligenza per $15 per milione di token di output. GPT-5.6 Terra costa lo stesso $15 e ottiene 55.0. GPT-5.6 Sol ottiene 58.9 e costa $30.
I pesi sono pubblicati. Il modello ha 2.8 trilioni di parametri. Entrambi i fatti si trovano nella stessa voce del catalogo, e insieme formano l'articolo: i open weights ti dicono cosa puoi detenere, non cosa sei attrezzato per eseguire.
La fattura arriva come latenza: 32.9 token al secondo e 125.71 secondi per il primo token, il throughput più lento dei sei modelli in cima alla nostra classifica.
I numeri, questa mattina
Moonshot AI ha rilasciato Kimi K3 il 16 luglio 2026. Tutto ciò che segue è stato letto il 28 luglio dalla nostra fusione quotidiana dei benchmark, proveniente da Artificial Analysis. Intelligence e Coding sono indici compositi; prezzo, throughput e tempo per il primo token li monitoriamo noi stessi. Ogni riga è la configurazione di massimo sforzo del fornitore, che conta in seguito.
| Modello | Intelligenza | Codifica | $ / 1M out | Token / s | Primo token | Pesi |
|---|---|---|---|---|---|---|
| Claude Opus 5 | 60.7 | 78.0 | $25 | 62.8 | 31.35 s | Chiuso |
| Claude Fable 5 | 59.9 | 76.5 | $50 | 71.3 | 80.07 s | Chiuso |
| GPT-5.6 Sol | 58.9 | 77.4 | $30 | 90.2 | 87.13 s | Chiuso |
| Kimi K3 | 57.1 | 76.2 | $15 | 32.9 | 125.71 s | Aperto |
| GPT-5.6 Terra | 55.0 | 76.7 | $15 | 165.4 | 151.8 s | Chiuso |
| GPT-5.6 Luna | 51.2 | 71.4 | $6 | 220.4 | 84.29 s | Chiuso |
Una riga spedisce i suoi pesi. È la quarta riga e non l'ultima, ed è prezzata nel mezzo della classifica piuttosto che in fondo. Entrambi questi sono nuovi, e entrambi costano qualcosa.
A $15 supera il modello da $15
GPT-5.6 Terra e Kimi K3 costano entrambi $15 per milione di token di output. Terra ottiene 55.0 in intelligenza, Kimi K3 ottiene 57.1: 2.1 punti rispetto al modello open-weight a un prezzo di output identico, con un lato di input troppo vicino per decidere qualcosa a $2.50 contro $3.
Il confronto un passo sopra è quello che dovrebbe preoccupare un fornitore. GPT-5.6 Sol ottiene 58.9 per $30 per milione di token di output — 1.8 punti per il doppio del prezzo. Quei 1.8 punti sono reali su ragionamento difficile, ma ora sono una voce di costo piuttosto che un motivo per smettere di cercare. Coding è l'unico indice che va nell'altra direzione allo stesso prezzo: Terra 76.7 contro 76.2 di Kimi K3.
Dove vince, e dove non vince
Un indice composito media la varianza che decide il lavoro reale, quindi ecco i benchmark individuali. La nostra istantanea porta nove per questo livello e Kimi K3 ha un risultato su sei, senza alcuno su IFBench, Terminal-Bench Hard o τ²-Bench — vero anche per Claude Opus 5 e GPT-5.6 Luna, quindi leggi una cella vuota come un gap nella misurazione piuttosto che un fallimento.
| Benchmark | Kimi K3 | Il migliore degli altri cinque |
|---|---|---|
| Ragionamento su contesti lunghi | 74.7 | 74.0 · GPT-5.6 Terra e Luna |
| τ-Bench Banking | 33.4 | 33.0 · GPT-5.6 Sol |
| GPQA | 93.5 | 94.1 · GPT-5.6 Sol |
| SciCode | 58.7 | 60.2 · Claude Fable 5 |
| Terminal-Bench | 85.0 | 89.1 · Claude Opus 5 |
| Ultimo Esame dell'Umanità | 44.3 | 53.3 · Claude Fable 5 |
Due primi, e non del tipo decorativo. Long Context Reasoning 74.7 è il migliore dei sei, davanti a entrambe le varianti di GPT-5.6 a 74.0 e chiaro di Opus 5 e Fable 5, che si trovano entrambi a 70. τ-Bench Banking 33.4 battendo il 33.0 di Sol’, il che mette il modello a open weights in testa al set di frontiera in un compito multi-turno con strumenti — il carico di lavoro a cui ogni fornitore chiuso mira nella sua marketing.
GPQA è un pareggio in pratica, 93.5 contro 94.1. Le tre perdite sono più informative: SciCode 58.7 è 1.5 punti sotto Claude Fable 5, Terminal-Bench 85.0 è 4.1 punti sotto Opus 5, e Humanity’s Last Exam 44.3 è 9.0 punti sotto Fable 5. Se il tuo lavoro assomiglia alla parte più difficile del ragionamento non assistito, quel divario di nove punti è ciò che ti costa la riga aperta.
Poi leggi il conteggio dei parametri
La nostra voce di catalogo descrive Kimi K3 come “un modello di ragionamento multimodale a open weights con 2.8T di parametri”. Questo è 2.8 trilioni di parametri, e riorganizza tutto sopra.
È anche l'unico conteggio di parametri in questo articolo, il che non è un'oversight. Nessun modello chiuso qui pubblica uno, quindi il confronto non può essere fatto affatto. Ottieni il numero precisamente perché i pesi sono aperti — la prima cosa che i open weights ti comprano è sapere quanto è grande la cosa prima di impegnarti.
La seconda cosa che ti compra è un download. Non compra la macchina che tiene il download in memoria, e a questa dimensione quella macchina è l'intero progetto. Non pubblichiamo stime hardware e dovresti diffidare di qualsiasi cifra singola ti venga data, perché la risposta onesta dipende dalla quantizzazione, dalla dimensione del batch, dall'interconnessione e dalla latenza che tollererai — quattro decisioni che sono tue, non dell'editore.
I open weights sono un permesso, non un'implementazione
Tre affermazioni si fondono nella frase, e separarle è gran parte del lavoro di scelta.
I open weights non significano gratuiti. Kimi K3 è servito a $3 in e $15 out per milione di token, un prezzo di frontiera piuttosto che un prezzo di merce. Chiunque serva quei pesi paga comunque per l'hardware che tiene 2.8 trilioni di parametri, e quel costo si riflette nel prezzo indipendentemente da chi pubblica il checkpoint.
I open weights non significano auto-ospitabili alla tua scala. Per un modello di sette miliardi di parametri i due sono quasi la stessa frase. A 2.8 trilioni sono progetti diversi con budget diversi, e l'auto-ospitare smette di essere una questione di licenza e diventa una questione di pianificazione della capacità.
I open weights descrivono la disponibilità, non un concessione di licenza. I nostri dati registrano questo modello come a open weights e nulla di più preciso, quindi se la tua ragione per voler i pesi è legale — audit, ridistribuzione, diritti di fine-tuning, una giurisdizione che vieta l'invio di prompt all'estero — i termini allegati al checkpoint sono il documento di cui hai bisogno, e una tabella di benchmark non è un sostituto per leggerli.
Ciò che sopravvive a quelle tre sottrazioni è ancora sostanziale: puoi ispezionare il modello, fissare una versione che nessun fornitore può deprecare sotto di te, e eseguirlo in un luogo a tua scelta se puoi permetterti quel luogo. Per alcuni acquirenti quel profilo di rischio è l'unica cosa che conta in questa pagina.
Il prezzo che paghi effettivamente è throughput
Kimi K3 genera 32.9 token al secondo. Nello stesso snapshot Opus 5 funziona a 62.8, Sol a 90.2, Terra a 165.4 e Luna a 220.4. Terra è cinque volte più veloce; Luna è quasi sette volte più veloce.
Un agente rende questo peggiore di una finestra di chat, perché non produce una lunga risposta — produce una breve, chiama uno strumento, legge il risultato e produce un'altra. Moltiplica la penalità su venti andate e ritorni e l'indice di intelligenza smette di essere il numero decisivo.
Il tempo per il primo token punta nella stessa direzione, con un'onesta avvertenza. Kimi K3 impiega 125.71 secondi per avviarsi, contro 31.35 per Opus 5 e 87.13 per Sol — ma Terra al massimo sforzo impiega 151.8, il che è peggio. Quindi queste cifre appartengono a configurazioni di ragionamento a massimo sforzo piuttosto che a Kimi K3 specificamente, e questo stabilisce la vera differenza.
I modelli chiusi forniscono un dial di latenza
Il nostro snapshot contiene cinque livelli di sforzo per Claude Opus 5 e sei per ciascuna variante GPT-5.6. Kimi K3 appare come una singola riga.
Quell'asimmetria vale denaro, perché i livelli sono un commercio documentato di punteggio contro tempo. Sol ad alto sforzo segna 55.9 e inizia in 8.65 secondi. Terra a sforzo xhigh segna 51.6 in 9.55 secondi. Opus 5 a basso sforzo segna 50.6 in 3.01 secondi. Quindi il confronto equo per un servizio vincolato dalla latenza non è Kimi K3 contro Sol a massimo sforzo; è 57.1 in 125.71 secondi contro 55.9 in 8.65 secondi. Rinuncia a 1.2 punti di indice e inizia quattordici volte prima.
Per un lavoro batch notturno il dial non vale nulla e la riga aperta vince sul prezzo. Con una persona o un ciclo di agente in attesa all'altra estremità, il dial vale più dei 1.8 punti tra Kimi K3 e Sol.
Un milione di token di contesto, e cosa vale
La voce di catalogo elenca una finestra di contesto di 1,048,576 token, modalità testo+immagine→testo, e supporto per chiamate a strumenti. Il benchmark supporta la finestra piuttosto che semplicemente affermarla: 74.7 su Long Context Reasoning è il migliore dei sei, che è l'evidenza che vuoi prima di fidarti di un prompt di un milione di token con qualsiasi cosa.
Sii chiaro su cosa compra il $15, però. Ventinove altre voci nello stesso catalogo di 184 modelli elencano una finestra di un milione di token o più, e ventotto di esse addebitano meno di $15 per milione di token di output — la mediana è $0.98, e quindici sono sotto $1. Una finestra molto grande non è più una caratteristica premium. Ciò che il $15 compra è il 57.1, il 33.4 sul banking e il 93.5 su GPQA — ragionamento che regge attraverso la finestra, non la finestra stessa.
Questi numeri cambiano ogni mattina
Prezzi, finestre di contesto e indici di benchmark per centinaia di modelli, ricostruiti quotidianamente. Gratis, senza registrazione.
Apri il comparatore →Come scegliere
Hai bisogno dei pesi nelle tue mani. Kimi K3, e budget per 2,8 trilioni di parametri piuttosto che per un download. Fai prima il lavoro di capacità e leggi i termini allegati al checkpoint se il motivo è legale piuttosto che tecnico.
Vuoi il top della classifica e il costo è secondario. Claude Opus 5, a 60.7 e 78.0 per $25 per milione di token di output, e la configurazione top-effort più veloce per iniziare a 31.35 secondi.
Il tuo ciclo agente è limitato dalla latenza. GPT-5.6 Sol a alto sforzo — 55.9 in 8.65 secondi — o 165.4 token al secondo di Terra se la generazione sostenuta è il collo di bottiglia. Per un alto volume su compiti ordinari, GPT-5.6 Luna a $6 e 220.4 token al secondo segna 51.2, che è il margine che hai già per classificazione ed estrazione.
Documenti lunghi e utilizzo di strumenti multi-turn. Kimi K3 di nuovo, sui due benchmark guida a 74.7 e 33.4. Se puoi assorbire il throughput, questo è il carico di lavoro in cui non è affatto un compromesso.
Il punto fondamentale
Un modello a open weights ora supera uno chiuso allo stesso prezzo e si avvicina a 1.8 punti da un modello che costa il doppio, mentre guida il set di frontiera su ragionamento a lungo contesto e su un compito realistico di agente bancario. Questo è ciò che dice la classifica, ed è vero.
L'entry del catalogo racconta l'altra metà: 2.8 trilioni di parametri, 32.9 token al secondo, 125.71 secondi prima del primo token. I pesi sono tuoi da tenere; la macchina non è inclusa e la latenza non è opzionale, e nessuno dei due appare in un punteggio di 57.1. I open weights hanno smesso di essere un compromesso sulla capacità e sono diventati una decisione sull'infrastruttura — un problema molto più interessante da avere.