KI-Tools Projekte Verzeichnis
🏆 Rangliste 📡 Nachrichten ✨ Eingabeaufforderungen ⚖️ Modelle vergleichen 🔧 Werkzeuge 📦 Projekte 🚀 Räume
Blog
Offene Gewichte

Kimi K3 ist open-weight — und das ist nicht dasselbe wie ausführbar

Es erzielt 57,1 in der Intelligenz bei 15 $ pro Million Ausgabetokens, vor GPT-5.6 Terra zum gleichen Preis und 1,8 Punkte hinter GPT-5.6 Sol, das doppelt so viel kostet. Dann liest man die Parameteranzahl: 2,8 Billionen.

Aktualisiert am 28. Juli 2026·9 Min Lesezeit·Keine Bezahlschranke

TL;DR — die kurze Version

Kimi K3 erzielt 57.1 bei Intelligence für $15 pro Million Ausgabetokens. GPT-5.6 Terra kostet ebenfalls $15 und erzielt 55.0. GPT-5.6 Sol erzielt 58.9 und kostet $30.

Die Gewichte sind veröffentlicht. Das Modell hat 2.8 Billionen Parameter. Beide Fakten befinden sich im selben Katalogeintrag, und zusammen bilden sie den Artikel: Open Weights sagen dir, was du halten darfst, nicht was du ausführen kannst.

Die Rechnung kommt als Latenz: 32.9 Tokens pro Sekunde und 125.71 Sekunden bis zum ersten Token, der langsamste Durchsatz der sechs Modelle an der Spitze unserer Liste.

Die Zahlen, heute Morgen

Moonshot AI veröffentlichte Kimi K3 am 16. Juli 2026. Alles Folgende wurde am 28. Juli aus unserer täglichen Benchmark-Fusion gelesen, die von Artificial Analysis stammt. Intelligence und Coding sind zusammengesetzte Indizes; Preis, Durchsatz und Zeit bis zum ersten Token verfolgen wir selbst. Jede Zeile ist die Top-Effort-Konfiguration des Anbieters, die später wichtig ist.

ModellIntelligenzProgrammierung$ / 1M ausTokens / sErster TokenGewichte
Claude Opus 560.778.0$2562.831,35 sGeschlossen
Claude Fable 559.976.5$5071.380,07 sGeschlossen
GPT-5.6 Sol58.977.4$3090.287.13 sGeschlossen
Kimi K357.176.2$1532.9125.71 sOffen
GPT-5.6 Terra55.076.7$15165.4151.8 sGeschlossen
GPT-5.6 Luna51.271.4$6220.484.29 sGeschlossen

Eine Zeile liefert ihre Gewichte. Es ist die vierte Zeile und nicht die letzte, und sie ist preislich in der Mitte der Liste angesiedelt, nicht am unteren Ende. Beides ist neu, und beides kostet etwas.

Für $15 übertrifft sie das $15-Modell

GPT-5.6 Terra und Kimi K3 kosten beide $15 pro Million Ausgabetokens. Terra erzielt 55.0 bei Intelligence, Kimi K3 erzielt 57.1: 2.1 Punkte zum open-weight Modell zu einem identischen Ausgabepreis, mit einer Eingangsseite, die zu nah ist, um etwas zu entscheiden bei $2.50 gegen $3.

Der Vergleich eine Stufe höher ist der, der einen Anbieter beunruhigen sollte. GPT-5.6 Sol erzielt 58.9 für $30 pro Million Ausgabetokens — 1.8 Punkte für den doppelten Preis. Diese 1.8 Punkte sind real bei schwierigen Überlegungen, aber sie sind jetzt ein Posten, den du kalkulieren kannst, anstatt einen Grund, mit dem Einkaufen aufzuhören. Coding ist der eine Index, der zum gleichen Preis in die andere Richtung geht: Terra 76.7 gegen Kimi K3’s 76.2.

Kimi K3, GPT-5.6 Terra and GPT-5.6 Sol: output price per million tokens
Die drei Modelle, die die Frage umreißen: gleicher Preis wie Terra, halb so teuer wie Sol. Täglich neu gezeichnet aus Live-Preisen.

Wo es gewinnt, und wo nicht

Ein zusammengesetzter Index mittelt die Varianz, die die echte Arbeit entscheidet, also hier sind die einzelnen Benchmarks. Unser Snapshot enthält neun für diese Stufe und Kimi K3 hat ein Ergebnis auf sechs, mit keinem auf IFBench, Terminal-Bench Hard oder τ²-Bench — das gilt auch für Claude Opus 5 und GPT-5.6 Luna, also lies eine leere Zelle als eine Lücke in der Messung und nicht als ein Versagen.

BenchmarkKimi K3Das Beste der anderen fünf
Langzeit-Kontext-Argumentation74.774.0 · GPT-5.6 Terra und Luna
τ-Bench Banking33.433.0 · GPT-5.6 Sol
GPQA93.594.1 · GPT-5.6 Sol
SciCode58.760.2 · Claude Fable 5
Terminal-Bench85.089.1 · Claude Opus 5
Humanity’s Last Exam44.353.3 · Claude Fable 5

Zwei erste Plätze, und nicht die dekorativen Art. Long Context Reasoning 74.7 ist das Beste der sechs, vor beiden GPT-5.6 Varianten mit 74.0 und klar vor Opus 5 und Fable 5, die beide bei 70 liegen. τ-Bench Banking 33.4 übertrifft Sol’s 33.0, was das Open-Weight-Modell an die Spitze des Grenzsets bei einer Multi-Turn-Aufgabe mit Tools bringt — die Arbeitslast, auf die jeder geschlossene Anbieter sein Marketing ausrichtet.

GPQA ist in der Praxis ein Unentschieden, 93.5 gegen 94.1. Die drei Verluste sind informativer: SciCode 58.7 liegt 1.5 Punkte unter Claude Fable 5, Terminal-Bench 85.0 liegt 4.1 Punkte unter Opus 5, und Humanity’s Last Exam 44.3 liegt 9.0 Punkte unter Fable 5. Wenn Ihre Arbeit wie das härteste Ende des unassisted Reasoning aussieht, kostet Sie diese neun Punkte die offene Reihe.

Die Form ist wichtiger als der Rang: am stärksten, wenn der Kontext lang und die Aufgabe agentisch ist, am schwächsten bei schwierigen Einzelaufgaben. Ein Wert von 57.1 kann Ihnen das nicht sagen.

Dann lesen Sie die Parameteranzahl

Unser Katalogeintrag beschreibt Kimi K3 als “ein 2.8T Parameter Open-Weight multimodales Reasoning-Modell”. Das sind 2.8 Billionen Parameter, und es reorganisiert alles darüber.

Es ist auch die einzige Parameteranzahl in diesem Artikel, was kein Versehen ist. Kein geschlossenes Modell veröffentlicht hier eine, daher kann der Vergleich überhaupt nicht angestellt werden. Sie erhalten die Zahl genau, weil die Gewichte offen sind — das erste, was Open Weights Ihnen tatsächlich kaufen, ist zu wissen, wie groß das Ding ist, bevor Sie sich dafür entscheiden.

Das zweite, was es Ihnen kauft, ist ein Download. Es kauft nicht die Maschine, die den Download im Speicher hält, und bei dieser Größe ist diese Maschine das gesamte Projekt. Wir veröffentlichen keine Hardware-Schätzung und Sie sollten jeder einzelnen Zahl, die Ihnen gegeben wird, misstrauen, denn die ehrliche Antwort hängt von Quantisierung, Batch-Größe, Interconnect und der Latenz ab, die Sie tolerieren werden — vier Entscheidungen, die Ihre sind, nicht die des Herausgebers.

Offene Gewichte sind eine Erlaubnis, kein Deployment.

Drei Ansprüche werden in den Ausdruck zusammengefasst, und sie zu trennen ist der größte Teil der Arbeit bei der Auswahl.

Offene Gewichte bedeuten nicht kostenlos. Kimi K3 wird mit 3 $ in und 15 $ aus pro Million Tokens angeboten, ein Grenzpreis und kein Warenpreis. Wer diese Gewichte bereitstellt, zahlt immer noch für Hardware, die 2.8 Billionen Parameter hält, und diese Kosten fließen in den Preis ein, egal wer den Checkpoint veröffentlicht.

Offene Gewichte bedeuten nicht, dass Sie es in Ihrem Maßstab selbst hosten können. Für ein Modell mit sieben Milliarden Parametern sind die beiden fast dasselbe Satz. Bei 2.8 Billionen sind es unterschiedliche Projekte mit unterschiedlichen Budgets, und das Selbst-Hosting hört auf, eine Lizenzfrage zu sein, und wird zu einer Kapazitätsplanungsfrage.

Offene Gewichte beschreiben die Verfügbarkeit, nicht die Lizenzgewährung. Unsere Daten verzeichnen dieses Modell als Open-Weight und nichts Genaueres, also wenn Ihr Grund, die Gewichte haben zu wollen, rechtlicher Natur ist — Audit, Redistribution, Feinabstimmungsrechte, eine Gerichtsbarkeit, die das Versenden von Eingabeaufforderungen ins Ausland verbietet — sind die Bedingungen, die an den Checkpoint angehängt sind, das Dokument, das Sie benötigen, und eine Benchmark-Tabelle ist kein Ersatz für das Lesen dieser.

Was von diesen drei Subtraktionen übrig bleibt, ist immer noch erheblich: Sie können das Modell inspizieren, eine Version festlegen, die kein Anbieter unter Ihnen abwerten kann, und es irgendwo Ihrer Wahl ausführen, wenn Sie sich das irgendwo leisten können. Für einige Käufer ist dieses Risikoprofil das einzige, was auf dieser Seite zählt.

Der Preis, den Sie tatsächlich zahlen, ist der Durchsatz.

Kimi K3 generiert 32,9 Tokens pro Sekunde. Im selben Snapshot läuft Opus 5 bei 62.8, Sol bei 90.2, Terra bei 165.4 und Luna bei 220.4. Terra ist fünfmal schneller; Luna ist fast siebenmal schneller.

Ein Agent macht das schlimmer als ein Chatfenster, weil er nicht eine lange Antwort produziert — er produziert eine kurze, ruft ein Tool auf, liest das Ergebnis und produziert eine weitere. Multiplizieren Sie die Strafe über zwanzig Rundreisen und der Intelligenzindex hört auf, die entscheidende Zahl zu sein.

Die Zeit bis zum ersten Token zeigt in die gleiche Richtung, mit einer ehrlichen Einschränkung. Kimi K3 benötigt 125.71 Sekunden zum Start, gegen 31.35 für Opus 5 und 87.13 für Sol — aber Terra benötigt bei maximalem Aufwand 151.8, was schlechter ist. Diese Zahlen gehören also zu maximalen Aufwand-Reasoning-Konfigurationen und nicht speziell zu Kimi K3, und das stellt den echten Unterschied her.

Kimi K3, Claude Opus 5 and GPT-5.6 Luna: output price per million tokens
Die drei Ecken des Handels, absichtlich gewählt: Opus 5 die höchste Punktzahl bei 25 $, Luna die schnellste mit 220.4 Tokens pro Sekunde und 6 $, Kimi K3 die offene Reihe bei 15 $. Der Preis sagt Ihnen nichts über den Rest.

Die geschlossenen Modelle haben einen Latenzregler.

Unser Snapshot enthält fünf Aufwandstufen für Claude Opus 5 und sechs für jede GPT-5.6-Variante. Kimi K3 erscheint als eine einzige Reihe.

Diese Asymmetrie ist Geld wert, denn die Stufen sind ein dokumentierter Handel von Punktzahl gegen Zeit. Sol erzielt bei hohem Aufwand 55.9 und startet in 8.65 Sekunden. Terra bei xhigh erzielt 51.6 in 9.55 Sekunden. Opus 5 bei niedrigem Aufwand erzielt 50.6 in 3.01 Sekunden. Der faire Vergleich für einen latenzgebundenen Dienst ist also nicht Kimi K3 gegen Sol bei maximalem Aufwand; es ist 57.1 in 125.71 Sekunden gegen 55.9 in 8.65 Sekunden. Geben Sie 1.2 Punkte des Index auf und starten Sie vierzehn Mal schneller.

Für einen nächtlichen Batch-Job ist der Regler nichts wert und die offene Reihe gewinnt im Preis. Mit einer Person oder einer Agentenschleife, die am anderen Ende wartet, ist der Regler mehr wert als die 1.8 Punkte zwischen Kimi K3 und Sol.

Eine Million Tokens Kontext und was es wert ist.

Der Katalogeintrag listet ein Kontextfenster von 1,048,576 Tokens, Modalität Text+Bild→Text und unterstützt das Aufrufen von Tools. Die Benchmark unterstützt das Fenster, anstatt es nur zu behaupten: 74.7 bei Long Context Reasoning ist das Beste der sechs, was der Beweis ist, den Sie wollen, bevor Sie einer Million-Token-Eingabeaufforderung mit irgendetwas vertrauen.

Seien Sie sich jedoch klar darüber, was die 15 $ kaufen. Neunundzwanzig andere Einträge im selben Katalog mit 184 Modellen listen ein Fenster von einer Million Tokens oder mehr, und achtundzwanzig von ihnen verlangen weniger als 15 $ pro Million Ausgabetokens — der Median liegt bei 0.98 $, und fünfzehn liegen unter 1 $. Ein sehr großes Fenster ist kein Premium-Feature mehr. Was die 15 $ kauft, sind die 57.1, die 33.4 beim Banking und die 93.5 bei GPQA — Reasoning, das über das Fenster hinweg standhält, nicht das Fenster selbst.

Diese Zahlen ändern sich jeden Morgen

Preise, Kontextfenster und Benchmark-Indizes für Hunderte von Modellen, täglich neu aufgebaut. Kostenlos, keine Anmeldung.

Öffne den Vergleich →

Wie man wählt

Sie müssen die Gewichte in Ihren Händen halten. Kimi K3 und budgetieren Sie für 2,8 Billionen Parameter anstelle eines Downloads. Machen Sie zuerst die Kapazitätsarbeit und lesen Sie die Bedingungen, die an den Checkpoint angehängt sind, wenn der Grund rechtlicher und nicht technischer Natur ist.

Sie wollen die Spitze der Rangliste, und die Kosten sind sekundär. Claude Opus 5, bei 60,7 und 78,0 für 25 $ pro Million Ausgabetoken, und die schnellste Top-Bemühungskonfiguration beginnt bei 31,35 Sekunden.

Ihre Agentenschleife ist latenzgebunden. GPT-5.6 Sol bei hohem Aufwand — 55,9 in 8,65 Sekunden — oder Terras 165,4 Token pro Sekunde, wenn die nachhaltige Generierung der Engpass ist. Für hohes Volumen bei gewöhnlichen Aufgaben erzielt GPT-5.6 Luna bei 6 $ und 220,4 Token pro Sekunde 51,2, was Spielraum ist, den Sie bereits für Klassifizierung und Extraktion haben.

Lange Dokumente und mehrstufige Tool-Nutzung. Kimi K3 erneut, bei den beiden Benchmarks führt es mit 74,7 und 33,4. Wenn Sie den Durchsatz aufnehmen können, ist dies die Arbeitslast, bei der es überhaupt keinen Kompromiss gibt.

Das Fazit

Ein offenes Gewichtmodell schlägt jetzt ein geschlossenes zum gleichen Preis und kommt innerhalb von 1,8 Punkten an ein Modell heran, das doppelt so viel kostet, während es die Grenzwerte für langkontextuelles Denken und bei einer realistischen Bankagentenaufgabe anführt. Das sagt die Rangliste, und es ist wahr.

Der Katalogeintrag erzählt die andere Hälfte: 2,8 Billionen Parameter, 32,9 Token pro Sekunde, 125,71 Sekunden bis zum ersten Token. Die Gewichte gehören Ihnen; die Maschine ist nicht enthalten und die Latenz ist nicht optional, und beides zeigt sich nicht in einem Wert von 57,1. Offene Gewichte haben aufgehört, ein Kompromiss in der Fähigkeit zu sein, und sind zu einer Entscheidung über die Infrastruktur geworden — ein viel interessanteres Problem.