La cima es un plateau — y uno de los cuatro es open weights
Claude Opus 5, Claude Fable 5, GPT-5.6 Sol y Kimi K3 están dentro de 3.6 puntos unos de otros en inteligencia. Sus precios de salida varían en 3.3×. Esa brecha entre capacidad y precio es toda la historia.
TL;DR — la versión corta
Claude Opus 5 lidera en ambos índices y cuesta la mitad de lo que cuesta Claude Fable 5. El buque insignia de Anthropic no es el mejor modelo de Anthropic en estas medidas.
Kimi K3 es de open weights y se sitúa 3.6 puntos detrás del líder, al 30 % del precio de salida de Fable 5. A $15 por millón de tokens de salida, cuesta exactamente lo que cuesta GPT-5.6 Terra — y puntúa 2.1 puntos más alto.
El precio ya no sigue la capacidad en la parte superior. Elige según latencia, licencia y ventana de contexto, porque ahí es donde estos cuatro realmente difieren.
Los números, esta mañana
Todo lo que sigue proviene de nuestra fusión de referencia diaria, obtenida de Artificial Analysis y reconstruida cada mañana. Dos índices compuestos — Inteligencia y Codificación — más el rendimiento y el precio que rastreamos nosotros mismos. Sin estimaciones, sin redondeos.
| Modelo | Inteligencia | Codificación | $ / 1M salida | Tokens / s | Pesos |
|---|---|---|---|---|---|
| Claude Opus 5 | 60.7 | 78.0 | $25 | 62.8 | Cerrado |
| Claude Fable 5 | 59.9 | 76.5 | $50 | 71.3 | Cerrado |
| GPT-5.6 Sol | 58.9 | 77.4 | $30 | 90.2 | Cerrado |
| Kimi K3 | 57.1 | 76.2 | $15 | 32.9 | Abierto |
| GPT-5.6 Terra | 55.0 | 76.7 | $15 | 165.4 | Cerrado |
| GPT-5.6 Luna | 51.2 | 71.4 | $6 | 220.4 | Cerrado |
| DeepSeek V4 Flash | 40.3 | 56.2 | $0.28 | 125.4 | Abierto |
Lee de nuevo las cuatro primeras filas. La diferencia de Kimi K3 a Opus 5 es 3.6 puntos de inteligencia — alrededor del seis por ciento. La diferencia en el precio de salida entre esos mismos cuatro modelos es $15 a $50. La capacidad se ha comprimido; el precio no.
El buque insignia de Anthropic no es su mejor modelo
Claude Fable 5 es el modelo que Anthropic presenta, y es el más caro de los siete a $50 por millón de tokens de salida. Claude Opus 5 lo supera en ambos índices — 60.7 contra 59.9 en inteligencia, 78.0 contra 76.5 en codificación — por la mitad del precio.
Opus 5 también es más rápido en el primer token: 31 segundos contra 80. En una larga ejecución agente, esa diferencia se acumula.
Hay una advertencia que vale la pena declarar claramente: Fable 5 ejecuta una configuración de razonamiento adaptativo con un retroceso a Opus 4.8, por lo que los dos no son productos idénticos. Pero en los números que un comprador realmente compara — puntuación, precio, latencia — el más barato gana en los tres.
Un modelo open weights ya iguala la gama media de OpenAI, al mismo precio
Kimi K3, de Moonshot AI, se envía con open weights. Puntúa 57.1 en inteligencia. GPT-5.6 Terra puntúa 55.0. Ambos cuestan $15 por millón de tokens de salida.
Esa es la frase para la que se construyó este sitio. Un modelo de open weights, que puedes descargar y ejecutar tú mismo, supera a un modelo cerrado de nivel medio al mismo precio. Hace dos años, la brecha abierta se medía en generaciones; aquí está 3.6 puntos detrás del líder absoluto.
GPT-5.6 son cuatro modelos, no uno
“GPT-5.6” nombra una familia, y las variantes están muy distantes. Sol puntúa 58.9 a $30. Terra puntúa 55.0 a $15. Luna puntúa 51.2 a $6.
Lee esto como una escalera en lugar de una alineación: cada paso hacia abajo cuesta la mitad y cede de tres a cuatro puntos.Luna es una quinta parte del precio de Sol para el 87 % de su puntuación de inteligencia, y es lo más rápido aquí con 220 tokens por segundo. Para clasificación, extracción o resumir, pagar por Sol es pagar por un margen que no usarás.
Lo que la tabla de clasificación no te dice
Opus 5 puntúa 89.1 en Terminal-Bench y 93.2 en GPQA.También puntúa 30.3 en τ-Bench Banking.El modelo mejor clasificado en el mundo acierta aproximadamente un tercio de una tarea real de agente bancario.
Los índices compuestos promedian exactamente este tipo de variación. Un modelo que es excelente en trabajo terminal y mediocre en uso de herramientas de múltiples turnos parece un solo número, y ese número no predecirá cómo se comporta en tu tarea. Prueba con tu propia carga de trabajo antes de comprometerte.
Lo mismo se aplica al tiempo hasta el primer token, que ninguno de estos índices incluye. DeepSeek V4 Flash responde en menos de un segundo.Kimi K3 tarda 126 segundos en comenzar. Para una interfaz de chat, esos son productos diferentes, digan lo que digan sus puntuaciones.
Cómo elegir
Razonamiento más difícil, costo secundario. Claude Opus 5. Lidera ambos índices y subcorta a Fable 5 por la mitad.
Quieres velocidad sobre todo. GPT-5.6 Luna a 220 tokens por segundo, o DeepSeek V4 Flash si la latencia de menos de un segundo importa más que los últimos diez puntos de puntuación.
Necesitas los pesos. Kimi K3 — por auditabilidad, implementación en las instalaciones, o porque un cambio de licencia en una API cerrada es un riesgo que no puedes asumir. Aceptas la penalización de rendimiento a sabiendas.
Alto volumen, tareas ordinarias. DeepSeek V4 Flash. A $0.28 por millón de tokens de salida, es 179 veces más barato que Fable 5, y es cuatro veces más rápido. Puntúa dos tercios tan bien, lo cual es suficiente para extracción y clasificación.
Estos números cambian cada mañana
Precios, ventanas de contexto e índices de referencia para más de 500 modelos, reconstruidos diariamente. Gratis, sin registro.
Abre el comparador →La conclusión
La frontera se ha aplanado. Cuando cuatro modelos están dentro del seis por ciento entre sí en capacidad mientras sus precios varían en 3.3×, la tabla de clasificación deja de ser una guía de compra. Lo que aún los separa es el rendimiento, la latencia, la ventana de contexto y si se te permite mantener los pesos.
Y el lado abierto de esa tabla ya no es un compromiso que expliques a tu junta. Es una fila, 3.6 puntos abajo, al 30 % del precio.