Kimi K3 est open-weight — et ce n'est pas la même chose que runnable
Il obtient un score de 57,1 en intelligence à 15 $ par million de tokens de sortie, devant GPT-5.6 Terra au même prix et à 1,8 point derrière GPT-5.6 Sol, qui coûte deux fois plus cher. Ensuite, vous lisez le nombre de paramètres : 2,8 trillions.
TL;DR — la version courte
Kimi K3 obtient 57.1 en intelligence pour 15 $ par million de tokens de sortie. GPT-5.6 Terra coûte le même 15 $ et obtient 55.0. GPT-5.6 Sol obtient 58.9 et coûte 30 $.
Les poids sont publiés. Le modèle a 2.8 trillions de paramètres. Les deux faits se trouvent dans la même entrée de catalogue, et ensemble ils constituent l'article : les open weights vous disent ce que vous pouvez détenir, pas ce que vous êtes équipé pour exécuter.
La facture arrive sous forme de latence : 32.9 tokens par seconde et 125.71 secondes jusqu'au premier token, le débit le plus lent des six modèles en tête de notre tableau.
Les chiffres, ce matin
Moonshot AI a publié Kimi K3 le 16 juillet 2026. Tout ce qui suit a été lu le 28 juillet à partir de notre fusion quotidienne de benchmarks, provenant d'Artificial Analysis. Intelligence et Codage sont des indices composites ; prix, débit et temps jusqu'au premier token que nous suivons nous-mêmes. Chaque ligne est la configuration d'effort maximum du fournisseur, ce qui compte plus tard.
| Modèle | Intelligence | Codage | $ / 1M sortie | Tokens / s | Premier jeton | Poids |
|---|---|---|---|---|---|---|
| Claude Opus 5 | 60.7 | 78.0 | $25 | 62.8 | 31,35 s | Fermé |
| Claude Fable 5 | 59.9 | 76.5 | $50 | 71.3 | 80,07 s | Fermé |
| GPT-5.6 Sol | 58.9 | 77.4 | $30 | 90.2 | 87.13 s | Fermé |
| Kimi K3 | 57.1 | 76.2 | $15 | 32.9 | 125.71 s | Ouvert |
| GPT-5.6 Terra | 55.0 | 76.7 | $15 | 165.4 | 151.8 s | Fermé |
| GPT-5.6 Luna | 51.2 | 71.4 | $6 | 220.4 | 84.29 s | Fermé |
Une ligne expédie ses poids. C'est la quatrième ligne et non la dernière, et elle est tarifée au milieu du tableau plutôt qu'en bas. Les deux sont nouveaux, et les deux coûtent quelque chose.
À 15 $, elle surpasse le modèle à 15 $
GPT-5.6 Terra et Kimi K3 coûtent tous deux 15 $ par million de tokens de sortie. Terra obtient 55.0 en intelligence, Kimi K3 obtient 57.1: 2.1 points par rapport au modèle en open weights à un prix de sortie identique, avec un côté d'entrée trop proche pour décider quoi que ce soit à 2.50 $ contre 3 $.
La comparaison un cran au-dessus est celle qui devrait inquiéter un fournisseur. GPT-5.6 Sol obtient 58.9 pour $30 par million de tokens de sortie — 1.8 points pour le double du prix. Ces 1.8 points sont réels sur un raisonnement difficile, mais ils sont maintenant un élément de coût que vous pouvez chiffrer plutôt qu'une raison d'arrêter vos achats. Le codage est le seul indice qui va dans l'autre sens au même prix : Terra 76.7 contre 76.2 de Kimi K3.
Où il gagne, et où il ne gagne pas
Un indice composite moyenne la variance qui décide du travail réel, voici donc les benchmarks individuels. Notre snapshot contient neuf pour ce niveau et Kimi K3 a un résultat sur six, sans aucun sur IFBench, Terminal-Bench Hard ou τ²-Bench — c'est également vrai pour Claude Opus 5 et GPT-5.6 Luna, donc lisez une cellule vide comme un écart dans la mesure plutôt qu'un échec.
| Benchmark | Kimi K3 | Meilleur des cinq autres |
|---|---|---|
| Raisonnement sur de longs contextes | 74.7 | 74.0 · GPT-5.6 Terra et Luna |
| τ-Bench Banking | 33.4 | 33.0 · GPT-5.6 Sol |
| GPQA | 93.5 | 94.1 · GPT-5.6 Sol |
| SciCode | 58.7 | 60.2 · Claude Fable 5 |
| Terminal-Bench | 85.0 | 89.1 · Claude Opus 5 |
| Examen Final de l'Humanité | 44.3 | 53.3 · Claude Fable 5 |
Deux premiers, et pas du genre décoratif. Raisonnement sur un long contexte 74.7 est le meilleur des six, devant les deux variantes de GPT-5.6 à 74.0 et loin d'Opus 5 et Fable 5, qui sont tous deux à 70. τ-Bench Banking 33.4 battant Sol’s 33.0, ce qui place le modèle en open weights en tête de l'ensemble de la frontière sur une tâche multi-tour avec des outils — la charge de travail à laquelle chaque fournisseur fermé cible son marketing.
GPQA est une égalité en pratique, 93.5 contre 94.1. Les trois pertes sont plus informatives : SciCode 58.7 est 1.5 points en dessous de Claude Fable 5, Terminal-Bench 85.0 est 4.1 points en dessous d'Opus 5, et Humanity’s Last Exam 44.3 est 9.0 points en dessous de Fable 5. Si votre travail ressemble à l'extrémité la plus difficile du raisonnement non assisté, cet écart de neuf points est ce que la ligne ouverte vous coûte.
Ensuite, vous lisez le nombre de paramètres
Notre entrée de catalogue décrit Kimi K3 comme “un modèle de raisonnement multimodal en open weights de 2.8T paramètres”. C'est 2.8 trillions de paramètres, et cela réorganise tout au-dessus.
C'est aussi le seul nombre de paramètres dans cet article, ce qui n'est pas un oubli. Aucun modèle fermé ici ne publie un, donc la comparaison ne peut pas être faite du tout. Vous obtenez le nombre précisément parce que les poids sont ouverts — la première chose que les open weights vous achètent réellement est de savoir à quel point la chose est grande avant de vous y engager.
La deuxième chose qu'ils vous achètent est un téléchargement. Cela n'achète pas la machine qui conserve le téléchargement en mémoire, et à cette taille, cette machine est l'ensemble du projet. Nous ne publions aucune estimation matérielle et vous devriez vous méfier de tout chiffre unique qui vous est remis, car la réponse honnête dépend de la quantification, de la taille des lots, de l'interconnexion et de la latence que vous tolérerez — quatre décisions qui vous appartiennent, pas à l'éditeur.
Les open weights sont une permission, pas un déploiement
Trois revendications se regroupent dans la phrase, et les séparer est la majeure partie du travail de choix.
Les open weights ne signifient pas gratuit. Kimi K3 est servi à 3 $ en entrée et 15 $ en sortie par million de tokens, un prix de frontière plutôt qu'un prix de commodité. Quiconque sert ces poids paie toujours pour le matériel qui contient 2.8 trillions de paramètres, et ce coût se retrouve dans le prix peu importe qui publie le point de contrôle.
Les open weights ne signifient pas auto-hébergeable à votre échelle. Pour un modèle de sept milliards de paramètres, les deux sont presque la même phrase. À 2.8 trillions, ce sont des projets différents avec des budgets différents, et l'auto-hébergement cesse d'être une question de licence et devient une question de planification de capacité.
Les open weights décrivent la disponibilité, pas une concession de licence. Nos données enregistrent ce modèle comme en open weights et rien de plus précis, donc si votre raison de vouloir les poids est légale — audit, redistribution, droits de fine-tuning, une juridiction qui interdit l'envoi de prompts à l'étranger — les termes attachés au point de contrôle sont le document dont vous avez besoin, et un tableau de référence ne remplace pas la lecture de ceux-ci.
Ce qui survit à ces trois soustractions est encore substantiel : vous pouvez inspecter le modèle, épingler une version qu'aucun fournisseur ne peut déprécier sous vous, et l'exécuter quelque part de votre choix si vous pouvez vous permettre ce quelque part. Pour certains acheteurs, ce profil de risque est la seule chose sur cette page qui compte.
Le prix que vous payez réellement est le débit
Kimi K3 génère 32.9 tokens par seconde. Dans le même instantané, Opus 5 fonctionne à 62.8, Sol à 90.2, Terra à 165.4 et Luna à 220.4. Terra est cinq fois plus rapide ; Luna est presque sept fois plus rapide.
Un agent rend cela pire qu'une fenêtre de chat, car il ne produit pas une longue réponse — il produit une courte, appelle un outil, lit le résultat et produit une autre. Multipliez la pénalité sur vingt allers-retours et l'indice d'intelligence cesse d'être le nombre décisif.
Le temps jusqu'au premier token pointe dans la même direction, avec une cave honnête. Kimi K3 prend 125.71 secondes pour démarrer, contre 31.35 pour Opus 5 et 87.13 pour Sol — mais Terra à l'effort maximal prend 151.8, ce qui est pire. Donc ces chiffres appartiennent à des configurations de raisonnement à effort maximal plutôt qu'à Kimi K3 spécifiquement, et cela établit la vraie différence.
Les modèles fermés expédient un cadran de latence
Notre instantané comporte cinq niveaux d'effort pour Claude Opus 5 et six pour chaque variante GPT-5.6. Kimi K3 apparaît comme une seule ligne.
Cette asymétrie vaut de l'argent, car les niveaux sont un échange documenté de score contre temps. Sol à haut effort marque 55.9 et commence en 8.65 secondes. Terra à xhigh marque 51.6 en 9.55 secondes. Opus 5 à faible effort marque 50.6 en 3.01 secondes. Donc la comparaison équitable pour un service limité par la latence n'est pas Kimi K3 contre Sol à effort maximal ; c'est 57.1 en 125.71 secondes contre 55.9 en 8.65 secondes. Abandonnez 1.2 points d'indice et commencez quatorze fois plus tôt.
Pour un travail par lot de nuit, le cadran ne vaut rien et la ligne ouverte gagne sur le prix. Avec une personne ou une boucle d'agent attendant à l'autre bout, le cadran vaut plus que les 1.8 points entre Kimi K3 et Sol.
Un million de tokens de contexte, et ce que cela vaut
L'entrée du catalogue liste une fenêtre de contexte de 1,048,576 tokens, modalité texte+image→texte, et appel d'outil pris en charge. Le benchmark soutient la fenêtre plutôt que de simplement l'affirmer : 74.7 sur le Raisonnement de Long Contexte est le meilleur des six, ce qui est la preuve que vous voulez avant de faire confiance à un prompt d'un million de tokens avec quoi que ce soit.
Soyez clair sur ce que les 15 $ achètent, cependant. Vingt-neuf autres entrées dans le même catalogue de 184 modèles listent une fenêtre d'un million de tokens ou plus, et vingt-huit d'entre elles facturent moins de 15 $ par million de tokens de sortie — la médiane est de 0.98 $, et quinze sont en dessous de 1 $. Une très grande fenêtre n'est plus une fonctionnalité premium. Ce que les 15 $ achètent, c'est le 57.1, le 33.4 sur la banque et le 93.5 sur GPQA — un raisonnement qui se maintient à travers la fenêtre, pas la fenêtre elle-même.
Ces chiffres changent chaque matin
Prix, fenêtres de contexte et indices de benchmark pour des centaines de modèles, reconstruits quotidiennement. Gratuit, sans inscription.
Ouvrez le comparateur →Comment choisir
Vous devez avoir les poids entre vos mains. Kimi K3, et prévoyez 2,8 trillions de paramètres plutôt qu'un téléchargement. Faites d'abord le travail de capacité et lisez les conditions attachées au point de contrôle si la raison est légale plutôt que technique.
Vous voulez le haut du tableau et le coût est secondaire. Claude Opus 5, à 60,7 et 78,0 pour 25 $ par million de tokens de sortie, et la configuration de meilleur effort la plus rapide à commencer à 31,35 secondes.
Votre boucle d'agent est limitée par la latence. GPT-5.6 Sol à fort effort — 55,9 en 8,65 secondes — ou 165,4 tokens par seconde de Terra si la génération soutenue est le goulot d'étranglement. Pour un volume élevé sur des tâches ordinaires, GPT-5.6 Luna à 6 $ et 220,4 tokens par seconde obtient 51,2, ce qui est une marge que vous avez déjà pour la classification et l'extraction.
Documents longs et utilisation d'outils multi-tours. Kimi K3 encore, sur les deux benchmarks, il est en tête avec 74,7 et 33,4. Si vous pouvez absorber le débit, c'est la charge de travail où ce n'est pas un compromis du tout.
Le constat
Un modèle en open weights bat maintenant un modèle fermé au même prix et se rapproche à 1,8 points d'un modèle qui coûte le double, tout en étant en tête de la frontière sur le raisonnement à long contexte et sur une tâche d'agent bancaire réaliste. C'est ce que dit le leaderboard, et c'est vrai.
L'entrée du catalogue dit l'autre moitié : 2,8 trillions de paramètres, 32,9 tokens par seconde, 125,71 secondes avant le premier token. Les poids sont à vous ; la machine n'est pas incluse et la latence n'est pas optionnelle, et aucune des deux n'apparaît dans un score de 57,1. Les open weights ont cessé d'être un compromis sur la capacité et sont devenus une décision sur l'infrastructure — un problème beaucoup plus intéressant à avoir.