Herramientas de IA Proyectos Directorio
🏆 Tabla de Clasificación 📡 Noticias ✨ Prompts ⚖️ Comparar Modelos 🔧 Herramientas 📦 Proyectos 🚀 Espacios
Blog
Comparación de modelos

La cima es un plateau — y uno de los cuatro es open weights

Claude Opus 5, Claude Fable 5, GPT-5.6 Sol y Kimi K3 están dentro de 3.6 puntos unos de otros en inteligencia. Sus precios de salida varían en 3.3×. Esa brecha entre capacidad y precio es toda la historia.

Actualizado el 28 de julio de 2026·8 min de lectura·Sin muro de pago

TL;DR — la versión corta

Claude Opus 5 lidera en ambos índices y cuesta la mitad de lo que cuesta Claude Fable 5. El buque insignia de Anthropic no es el mejor modelo de Anthropic en estas medidas.

Kimi K3 es de open weights y se sitúa 3.6 puntos detrás del líder, al 30 % del precio de salida de Fable 5. A $15 por millón de tokens de salida, cuesta exactamente lo que cuesta GPT-5.6 Terra — y puntúa 2.1 puntos más alto.

El precio ya no sigue la capacidad en la parte superior. Elige según latencia, licencia y ventana de contexto, porque ahí es donde estos cuatro realmente difieren.

Los números, esta mañana

Todo lo que sigue proviene de nuestra fusión de referencia diaria, obtenida de Artificial Analysis y reconstruida cada mañana. Dos índices compuestos — Inteligencia y Codificación — más el rendimiento y el precio que rastreamos nosotros mismos. Sin estimaciones, sin redondeos.

ModeloInteligenciaCodificación$ / 1M salidaTokens / sPesos
Claude Opus 560.778.0$2562.8Cerrado
Claude Fable 559.976.5$5071.3Cerrado
GPT-5.6 Sol58.977.4$3090.2Cerrado
Kimi K357.176.2$1532.9Abierto
GPT-5.6 Terra55.076.7$15165.4Cerrado
GPT-5.6 Luna51.271.4$6220.4Cerrado
DeepSeek V4 Flash40.356.2$0.28125.4Abierto

Lee de nuevo las cuatro primeras filas. La diferencia de Kimi K3 a Opus 5 es 3.6 puntos de inteligencia — alrededor del seis por ciento. La diferencia en el precio de salida entre esos mismos cuatro modelos es $15 a $50. La capacidad se ha comprimido; el precio no.

El buque insignia de Anthropic no es su mejor modelo

Claude Fable 5 es el modelo que Anthropic presenta, y es el más caro de los siete a $50 por millón de tokens de salida. Claude Opus 5 lo supera en ambos índices — 60.7 contra 59.9 en inteligencia, 78.0 contra 76.5 en codificación — por la mitad del precio.

Opus 5 también es más rápido en el primer token: 31 segundos contra 80. En una larga ejecución agente, esa diferencia se acumula.

Claude Opus 5 versus Claude Fable 5: output price per million tokens
Opus 5 lidera ambos índices a la mitad del precio. Redibujado diariamente a partir de precios en vivo.

Hay una advertencia que vale la pena declarar claramente: Fable 5 ejecuta una configuración de razonamiento adaptativo con un retroceso a Opus 4.8, por lo que los dos no son productos idénticos. Pero en los números que un comprador realmente compara — puntuación, precio, latencia — el más barato gana en los tres.

Un modelo open weights ya iguala la gama media de OpenAI, al mismo precio

Kimi K3, de Moonshot AI, se envía con open weights. Puntúa 57.1 en inteligencia. GPT-5.6 Terra puntúa 55.0. Ambos cuestan $15 por millón de tokens de salida.

Esa es la frase para la que se construyó este sitio. Un modelo de open weights, que puedes descargar y ejecutar tú mismo, supera a un modelo cerrado de nivel medio al mismo precio. Hace dos años, la brecha abierta se medía en generaciones; aquí está 3.6 puntos detrás del líder absoluto.

Kimi K3 versus GPT-5.6 Terra: output price per million tokens
Mismo precio, 2.1 puntos de diferencia — y uno de ellos envía sus pesos.
Kimi K3 paga por esto con rendimiento: 32.9 tokens por segundo, el más lento de los siete. GPT-5.6 Terra funciona a 165.4 — cinco veces más rápido. Si tus usuarios están esperando la salida, eso importa más que dos puntos de índice.

GPT-5.6 son cuatro modelos, no uno

“GPT-5.6” nombra una familia, y las variantes están muy distantes. Sol puntúa 58.9 a $30. Terra puntúa 55.0 a $15. Luna puntúa 51.2 a $6.

Lee esto como una escalera en lugar de una alineación: cada paso hacia abajo cuesta la mitad y cede de tres a cuatro puntos.Luna es una quinta parte del precio de Sol para el 87 % de su puntuación de inteligencia, y es lo más rápido aquí con 220 tokens por segundo. Para clasificación, extracción o resumir, pagar por Sol es pagar por un margen que no usarás.

Lo que la tabla de clasificación no te dice

Opus 5 puntúa 89.1 en Terminal-Bench y 93.2 en GPQA.También puntúa 30.3 en τ-Bench Banking.El modelo mejor clasificado en el mundo acierta aproximadamente un tercio de una tarea real de agente bancario.

Los índices compuestos promedian exactamente este tipo de variación. Un modelo que es excelente en trabajo terminal y mediocre en uso de herramientas de múltiples turnos parece un solo número, y ese número no predecirá cómo se comporta en tu tarea. Prueba con tu propia carga de trabajo antes de comprometerte.

Lo mismo se aplica al tiempo hasta el primer token, que ninguno de estos índices incluye. DeepSeek V4 Flash responde en menos de un segundo.Kimi K3 tarda 126 segundos en comenzar. Para una interfaz de chat, esos son productos diferentes, digan lo que digan sus puntuaciones.

Cómo elegir

Razonamiento más difícil, costo secundario. Claude Opus 5. Lidera ambos índices y subcorta a Fable 5 por la mitad.

Quieres velocidad sobre todo. GPT-5.6 Luna a 220 tokens por segundo, o DeepSeek V4 Flash si la latencia de menos de un segundo importa más que los últimos diez puntos de puntuación.

Necesitas los pesos. Kimi K3 — por auditabilidad, implementación en las instalaciones, o porque un cambio de licencia en una API cerrada es un riesgo que no puedes asumir. Aceptas la penalización de rendimiento a sabiendas.

Alto volumen, tareas ordinarias. DeepSeek V4 Flash. A $0.28 por millón de tokens de salida, es 179 veces más barato que Fable 5, y es cuatro veces más rápido. Puntúa dos tercios tan bien, lo cual es suficiente para extracción y clasificación.

Estos números cambian cada mañana

Precios, ventanas de contexto e índices de referencia para más de 500 modelos, reconstruidos diariamente. Gratis, sin registro.

Abre el comparador →

La conclusión

La frontera se ha aplanado. Cuando cuatro modelos están dentro del seis por ciento entre sí en capacidad mientras sus precios varían en 3.3×, la tabla de clasificación deja de ser una guía de compra. Lo que aún los separa es el rendimiento, la latencia, la ventana de contexto y si se te permite mantener los pesos.

Y el lado abierto de esa tabla ya no es un compromiso que expliques a tu junta. Es una fila, 3.6 puntos abajo, al 30 % del precio.