KI-Tools Projekte Verzeichnis
🏆 Rangliste 📡 Nachrichten ✨ Eingabeaufforderungen ⚖️ Modelle vergleichen 🔧 Werkzeuge 📦 Projekte 🚀 Räume
Blog
Modellvergleich

Die Spitze ist ein Plateau — und eines der vier ist open weights

Claude Opus 5, Claude Fable 5, GPT-5.6 Sol und Kimi K3 liegen innerhalb von 3,6 Punkten voneinander in Bezug auf Intelligenz. Ihre Ausgabepreise variieren um das 3,3-Fache. Diese Kluft zwischen Fähigkeit und Preis ist die ganze Geschichte.

Aktualisiert am 28. Juli 2026·8 Min Lesezeit·Keine Bezahlschranke

TL;DR — die kurze Version

Claude Opus 5 führt in beiden Indizes und kostet die Hälfte von dem, was Claude Fable 5 kostet. Das Flaggschiff von Anthropic ist nicht das beste Modell von Anthropic nach diesen Maßstäben.

Kimi K3 ist ein offenes Modell und liegt 3,6 Punkte hinter dem Führenden, bei 30 % des Ausgabepreises von Fable 5. Bei 15 $ pro Million Ausgabetokens kostet es genau so viel wie GPT-5.6 Terra — und erzielt 2,1 Punkte mehr.

Der Preis verfolgt nicht mehr die Fähigkeit an der Spitze. Wählen Sie nach Latenz, Lizenz und Kontextfenster, denn dort unterscheiden sich diese vier wirklich.

Die Zahlen, heute Morgen

Alles Folgende stammt aus unserem täglichen Benchmark-Fusion, bezogen von Artificial Analysis und jeden Morgen neu erstellt. Zwei zusammengesetzte Indizes — Intelligenz und Codierung — plus den Durchsatz und Preis, die wir selbst verfolgen. Keine Schätzungen, keine Aufrundungen.

ModellIntelligenzProgrammierung$ / 1M ausTokens / sGewichte
Claude Opus 560.778.0$2562.8Geschlossen
Claude Fable 559.976.5$5071.3Geschlossen
GPT-5.6 Sol58.977.4$3090.2Geschlossen
Kimi K357.176.2$1532.9Offen
GPT-5.6 Terra55.076.7$15165.4Geschlossen
GPT-5.6 Luna51.271.4$6220.4Geschlossen
DeepSeek V4 Flash40.356.2$0.28125.4Offen

Lesen Sie die oberen vier Zeilen erneut. Die Spanne von Kimi K3 zu Opus 5 beträgt 3,6 Punkte Intelligenz — etwa sechs Prozent. Die Spanne im Ausgabepreis über diese vier Modelle beträgt 15 $ bis 50 $. Die Fähigkeit hat sich verringert; die Preise nicht.

Das Flaggschiff von Anthropic ist nicht sein bestes Modell

Claude Fable 5 ist das Modell, das Anthropic vorstellt, und es ist das teuerste der sieben mit 50 $ pro Million Ausgabetokens. Claude Opus 5 schlägt es in beiden Indizes — 60,7 gegen 59,9 bei der Intelligenz, 78,0 gegen 76,5 bei der Codierung — zum halben Preis.

Opus 5 ist auch schneller beim ersten Token: 31 Sekunden gegen 80. Bei einem langen agentischen Lauf summiert sich dieser Unterschied.

Claude Opus 5 versus Claude Fable 5: output price per million tokens
Opus 5 führt beide Indizes zum halben Preis. Täglich neu gezeichnet aus Live-Preisen.

Es gibt einen Vorbehalt, den man klar aussprechen sollte: Fable 5 läuft mit einer adaptiven Denk-Konfiguration mit einem Opus 4.8-Backup, sodass die beiden keine identischen Produkte sind. Aber bei den Zahlen, die ein Käufer tatsächlich vergleicht — Punktzahl, Preis, Latenz — gewinnt das günstigere Modell in allen drei Kategorien.

Ein Open-Weights-Modell erreicht jetzt OpenAIs Mittelklasse, zum gleichen Preis

Kimi K3, von Moonshot AI, wird mit Open Weights geliefert. Es erzielt 57.1 bei der Intelligenz. GPT-5.6 Terra erzielt 55.0. Beide kosten $15 pro Million Ausgabetokens.

Das ist der Satz, für den diese Seite erstellt wurde. Ein offenes Modell, das Sie herunterladen und selbst ausführen können, übertrifft ein geschlossenes Modell im mittleren Preissegment zu einem identischen Preis. Vor zwei Jahren wurde die offene Lücke in Generationen gemessen; hier liegt es 3,6 Punkte hinter dem absoluten Führer.

Kimi K3 versus GPT-5.6 Terra: output price per million tokens
Gleicher Preis, 2,1 Punkte Unterschied — und eines von ihnen liefert seine Gewichte mit.
Kimi K3 bezahlt dafür mit Durchsatz: 32,9 Tokens pro Sekunde, das langsamste der sieben. GPT-5.6 Terra läuft mit 165,4 — fünfmal schneller. Wenn Ihre Benutzer auf die Ausgabe warten, ist das wichtiger als zwei Punkte im Index.

GPT-5.6 sind vier Modelle, nicht eines.

“GPT-5.6” bezeichnet eine Familie, und die Varianten sind weit auseinander. Sol erzielt 58.9 bei $30. Terra erzielt 55.0 bei $15. Luna erzielt 51.2 bei $6.

Lese das als eine Leiter und nicht als eine Aufstellung: Jeder Schritt nach unten kostet halb so viel und gibt drei bis vier Punkte auf.Luna kostet ein Fünftel von Sol’s Preis für 87 % seines Intelligenzscores und ist das schnellste hier mit 220 Tokens pro Sekunde. Für Klassifikation, Extraktion oder Zusammenfassung bedeutet das, für Sol zu bezahlen, ist, für Spielraum zu bezahlen, den du nicht nutzen wirst.

Was das Ranking nicht sagt

Opus 5 erzielt 89.1 bei Terminal-Bench und 93.2 bei GPQA.Es erzielt auch 30.3 bei τ-Bench Banking.Das bestplatzierte Modell der Welt löst ungefähr ein Drittel einer realistischen Aufgabe eines Bankagenten richtig.

Zusammengesetzte Indizes gleichen genau diese Art von Varianz aus. Ein Modell, das bei Terminalarbeit hervorragend und bei Mehrfach-Tool-Nutzung mittelmäßig ist, sieht wie eine einzelne Zahl aus, und diese Zahl wird nicht vorhersagen, wie es sich bei deiner Aufgabe verhält. Teste mit deiner eigenen Arbeitslast, bevor du dich festlegst.

Das Gleiche gilt für die Zeit bis zum ersten Token, die keiner dieser Indizes enthält. DeepSeek V4 Flash antwortet in unter einer Sekunde.Kimi K3 benötigt 126 Sekunden zum Starten. Für eine Chat-Oberfläche sind das unterschiedliche Produkte, egal was ihre Scores sagen.

Wie man wählt

Schwierigste Argumentation, Kosten sekundär. Claude Opus 5. Es führt beide Indizes an und unterbietet Fable 5 um die Hälfte.

Du willst Geschwindigkeit über alles. GPT-5.6 Luna mit 220 Tokens pro Sekunde oder DeepSeek V4 Flash, wenn eine Latenz unter einer Sekunde wichtiger ist als die letzten zehn Punkte des Scores.

Du benötigst die Gewichte. Kimi K3 — für Nachvollziehbarkeit, lokale Bereitstellung oder weil eine Lizenzänderung in einer geschlossenen API ein Risiko ist, das du nicht tragen kannst. Du akzeptierst die Durchsatzstrafe wissentlich.

Hohe Volumen, gewöhnliche Aufgaben. DeepSeek V4 Flash. Bei $0.28 pro Million Ausgabetokens ist es 179 Mal günstiger als Fable 5 und es ist viermal schneller. Es erzielt zwei Drittel so gut, was für Extraktion und Klassifikation ausreicht.

Diese Zahlen ändern sich jeden Morgen

Preise, Kontextfenster und Benchmark-Indizes für über 500 Modelle, täglich neu erstellt. Kostenlos, keine Anmeldung erforderlich.

Öffne den Vergleich →

Das Fazit

Die Grenze hat sich abgeflacht. Wenn vier Modelle innerhalb von sechs Prozent ihrer Fähigkeiten liegen, während ihre Preise sich um 3.3× erstrecken, hört das Ranking auf, ein Einkaufsführer zu sein. Was sie noch trennt, ist Durchsatz, Latenz, Kontextfenster und ob du die Gewichte behalten darfst.

Und die offene Seite dieser Tabelle ist kein Kompromiss mehr, den du deinem Vorstand erklären musst. Es ist eine Zeile, 3.6 Punkte tiefer, bei 30 % des Preises.