Kimi K3 es de open weights — y eso no es lo mismo que ejecutable
Obtiene 57.1 en inteligencia a $15 por millón de tokens de salida, por delante de GPT-5.6 Terra al mismo precio y 1.8 puntos detrás de GPT-5.6 Sol, que cuesta el doble. Luego lees el conteo de parámetros: 2.8 billones.
TL;DR — la versión corta
Kimi K3 obtiene 57.1 en inteligencia por $15 por millón de tokens de salida. GPT-5.6 Terra cuesta lo mismo $15 y obtiene 55.0. GPT-5.6 Sol obtiene 58.9 y cuesta $30.
Los pesos están publicados. El modelo tiene 2.8 billones de parámetros. Ambos hechos están en la misma entrada del catálogo, y juntos son el artículo: los open weights te dicen lo que puedes tener, no lo que estás equipado para ejecutar.
La factura llega como latencia: 32.9 tokens por segundo y 125.71 segundos hasta el primer token, el rendimiento más lento de los seis modelos en la parte superior de nuestra tabla.
Los números, esta mañana
Moonshot AI lanzó Kimi K3 el 16 de julio de 2026. Todo lo que sigue fue leído el 28 de julio de nuestra fusión diaria de benchmarks, obtenida de Artificial Analysis. Inteligencia y Codificación son índices compuestos; precio, rendimiento y tiempo hasta el primer token los rastreamos nosotros mismos. Cada fila es la configuración de mayor esfuerzo del proveedor, que importa más tarde.
| Modelo | Inteligencia | Codificación | $ / 1M salida | Tokens / s | Primer token | Pesos |
|---|---|---|---|---|---|---|
| Claude Opus 5 | 60.7 | 78.0 | $25 | 62.8 | 31.35 s | Cerrado |
| Claude Fable 5 | 59.9 | 76.5 | $50 | 71.3 | 80.07 s | Cerrado |
| GPT-5.6 Sol | 58.9 | 77.4 | $30 | 90.2 | 87.13 s | Cerrado |
| Kimi K3 | 57.1 | 76.2 | $15 | 32.9 | 125.71 s | Abierto |
| GPT-5.6 Terra | 55.0 | 76.7 | $15 | 165.4 | 151.8 s | Cerrado |
| GPT-5.6 Luna | 51.2 | 71.4 | $6 | 220.4 | 84.29 s | Cerrado |
Una fila envía sus pesos. Es la cuarta fila y no la última, y está valorada en el medio de la tabla en lugar de en la parte inferior. Ambas son nuevas, y ambas cuestan algo.
A $15 supera al modelo de $15
GPT-5.6 Terra y Kimi K3 cuestan ambos $15 por millón de tokens de salida. Terra obtiene 55.0 en inteligencia, Kimi K3 obtiene 57.1: 2.1 puntos al modelo de open weights a un precio de salida idéntico, con un lado de entrada demasiado cercano para decidir algo a $2.50 contra $3.
La comparación un paso arriba es la que debería preocupar a un proveedor. GPT-5.6 Sol obtiene 58.9 para $30 por millón de tokens de salida — 1.8 puntos por el doble del precio. Esos 1.8 puntos son reales en razonamiento difícil, pero ahora son un ítem que puedes costear en lugar de una razón para dejar de comprar. Codificación es el único índice que va en la otra dirección al mismo precio: Terra 76.7 contra 76.2 de Kimi K3.
Dónde gana, y dónde no
Un índice compuesto promedia la variación que decide el trabajo real, así que aquí están los benchmarks individuales. Nuestro snapshot lleva nueve para este nivel y Kimi K3 tiene un resultado en seis, sin ninguno en IFBench, Terminal-Bench Hard o τ²-Bench — también es cierto para Claude Opus 5 y GPT-5.6 Luna, así que lee una celda vacía como una brecha en la medición en lugar de un fallo.
| Benchmark | Kimi K3 | Mejor de los otros cinco |
|---|---|---|
| Razonamiento de Contexto Largo | 74.7 | 74.0 · GPT-5.6 Terra y Luna |
| τ-Bench Banking | 33.4 | 33.0 · GPT-5.6 Sol |
| GPQA | 93.5 | 94.1 · GPT-5.6 Sol |
| SciCode | 58.7 | 60.2 · Claude Fable 5 |
| Terminal-Bench | 85.0 | 89.1 · Claude Opus 5 |
| Último Examen de la Humanidad | 44.3 | 53.3 · Claude Fable 5 |
Dos primeros, y no del tipo decorativo. Razonamiento de Contexto Largo 74.7 es el mejor de los seis, por delante de ambas variantes de GPT-5.6 en 74.0 y claro de Opus 5 y Fable 5, que ambos están en 70. τ-Bench Banking 33.4 supera el 33.0 de Sol’s, lo que coloca el modelo de open weights a la cabeza del conjunto de frontera en una tarea de múltiples turnos con herramientas — la carga de trabajo a la que cada proveedor cerrado dirige su marketing.
GPQA es un empate en la práctica, 93.5 contra 94.1. Las tres pérdidas son más informativas: SciCode 58.7 está 1.5 puntos por debajo de Claude Fable 5, Terminal-Bench 85.0 está 4.1 puntos por debajo de Opus 5, y el Último Examen de la Humanidad 44.3 está 9.0 puntos por debajo de Fable 5. Si tu trabajo se asemeja al extremo más difícil del razonamiento no asistido, esa brecha de nueve puntos es lo que te cuesta la fila abierta.
Entonces lees el conteo de parámetros
Nuestra entrada en el catálogo describe a Kimi K3 como “un modelo de razonamiento multimodal de open weights de 2.8T parámetros”. Eso es 2.8 billones de parámetros, y reorganiza todo lo anterior.
También es el único conteo de parámetros en este artículo, lo cual no es un descuido. Ningún modelo cerrado aquí publica uno, así que la comparación no se puede hacer en absoluto. Obtienes el número precisamente porque los pesos son abiertos — lo primero que realmente te compran los open weights es saber cuán grande es la cosa antes de comprometerte con ella.
Lo segundo que te compran es una descarga. No compra la máquina que mantiene la descarga en memoria, y a este tamaño esa máquina es todo el proyecto. No publicamos ninguna estimación de hardware y deberías desconfiar de cualquier cifra única que te entreguen, porque la respuesta honesta depende de la cuantización, el tamaño del lote, la interconexión y la latencia que tolerarás — cuatro decisiones que son tuyas, no del editor.
Los open weights son un permiso, no un despliegue
Tres afirmaciones se colapsan en la frase, y separarlas es la mayor parte del trabajo de elegir.
Los open weights no significan gratis. Kimi K3 se ofrece a $3 en entrada y $15 en salida por millón de tokens, un precio de frontera en lugar de uno de mercancía. Quien sirva esos pesos aún paga por el hardware que sostiene 2.8 billones de parámetros, y ese costo se refleja en el precio sin importar quién publique el punto de control.
Los open weights no significan autoalojable a tu escala. Para un modelo de siete mil millones de parámetros, las dos son casi la misma oración. A 2.8 billones son proyectos diferentes con presupuestos diferentes, y el autoalojamiento deja de ser una cuestión de licencia y se convierte en una de planificación de capacidad.
Los open weights describen disponibilidad, no una concesión de licencia. Nuestros datos registran este modelo como de open weights y nada más preciso, así que si tu razón para querer los pesos es legal — auditoría, redistribución, derechos de ajuste fino, una jurisdicción que prohíbe enviar solicitudes al extranjero — los términos adjuntos al punto de control son el documento que necesitas, y una tabla de referencia no es un sustituto para leerlos.
Lo que sobrevive a esas tres sustracciones sigue siendo sustancial: puedes inspeccionar el modelo, fijar una versión que ningún proveedor puede devaluar bajo ti, y ejecutarlo en algún lugar de tu elección si puedes permitirte el lugar. Para algunos compradores, ese perfil de riesgo es lo único en esta página que importa.
El precio que realmente pagas es el rendimiento
Kimi K3 genera 32.9 tokens por segundo. En la misma instantánea, Opus 5 funciona a 62.8, Sol a 90.2, Terra a 165.4 y Luna a 220.4. Terra es cinco veces más rápido; Luna es casi siete veces más rápido.
Un agente empeora esto más que una ventana de chat, porque no produce una respuesta larga — produce una corta, llama a una herramienta, lee el resultado y produce otra. Multiplica la penalización a través de veinte viajes de ida y vuelta y el índice de inteligencia deja de ser el número decisivo.
El tiempo hasta el primer token apunta en la misma dirección, con una honesta salvedad. Kimi K3 toma 125.71 segundos para comenzar, contra 31.35 para Opus 5 y 87.13 para Sol — pero Terra, en su máximo esfuerzo, toma 151.8, lo cual es peor. Así que estas cifras pertenecen a configuraciones de razonamiento de máximo esfuerzo en lugar de a Kimi K3 específicamente, y eso establece la verdadera diferencia.
Los modelos cerrados envían un dial de latencia
Nuestra instantánea lleva cinco niveles de esfuerzo para Claude Opus 5 y seis para cada variante de GPT-5.6. Kimi K3 aparece como una sola fila.
Esa asimetría vale dinero, porque los niveles son un comercio documentado de puntuación contra tiempo. Sol, a alto esfuerzo, puntúa 55.9 y comienza en 8.65 segundos. Terra, a esfuerzo xalto, puntúa 51.6 en 9.55 segundos. Opus 5, a bajo esfuerzo, puntúa 50.6 en 3.01 segundos. Así que la comparación justa para un servicio limitado por latencia no es Kimi K3 contra Sol a máximo esfuerzo; es 57.1 en 125.71 segundos contra 55.9 en 8.65 segundos. Renuncia a 1.2 puntos de índice y comienza catorce veces antes.
Para un trabajo por lotes nocturno, el dial no vale nada y la fila abierta gana en precio. Con una persona o un bucle de agente esperando al otro lado, el dial vale más que los 1.8 puntos entre Kimi K3 y Sol.
Un millón de tokens de contexto, y lo que vale
La entrada del catálogo lista una ventana de contexto de 1,048,576 tokens, modalidad texto+imagen→texto, y llamada de herramientas soportada. El benchmark respalda la ventana en lugar de simplemente afirmarla: 74.7 en Razonamiento de Contexto Largo es el mejor de los seis, que es la evidencia que deseas antes de confiar en un aviso de un millón de tokens con cualquier cosa.
Sé claro sobre lo que compran los $15, sin embargo. Veintinueve otras entradas en el mismo catálogo de 184 modelos listan una ventana de un millón de tokens o más, y veintiocho de ellas cobran menos de $15 por millón de tokens de salida — la mediana es $0.98, y quince están por debajo de $1. Una ventana muy grande ya no es una característica premium. Lo que compran los $15 es el 57.1, el 33.4 en banca y el 93.5 en GPQA — razonamiento que se mantiene a través de la ventana, no la ventana en sí.
Estos números cambian cada mañana
Precios, ventanas de contexto e índices de referencia para cientos de modelos, reconstruidos diariamente. Gratis, sin registro.
Abre el comparador →Cómo elegir
Necesitas los pesos en tus manos. Kimi K3, y presupuesto para 2.8 billones de parámetros en lugar de para una descarga. Haz primero el trabajo de capacidad y lee los términos adjuntos al punto de control si la razón es legal en lugar de técnica.
Quieres la parte superior de la tabla y el costo es secundario. Claude Opus 5, a 60.7 y 78.0 por $25 por millón de tokens de salida, y la configuración de mayor esfuerzo más rápida para comenzar en 31.35 segundos.
Tu bucle de agente está limitado por la latencia. GPT-5.6 Sol con alto esfuerzo — 55.9 en 8.65 segundos — o 165.4 tokens por segundo de Terra si la generación sostenida es el cuello de botella. Para un alto volumen en tareas ordinarias, GPT-5.6 Luna a $6 y 220.4 tokens por segundo puntúa 51.2, que es el margen que ya tienes para clasificación y extracción.
Documentos largos y uso de herramientas en múltiples turnos. Kimi K3 nuevamente, en los dos benchmarks lidera con 74.7 y 33.4. Si puedes absorber el rendimiento, esta es la carga de trabajo donde no es un compromiso en absoluto.
La conclusión
Un modelo de open weights ahora supera a uno cerrado al mismo precio y se acerca a 1.8 puntos de un modelo que cuesta el doble, mientras lidera el conjunto de frontera en razonamiento de largo contexto y en una tarea realista de agente bancario. Eso es lo que dice el leaderboard, y es cierto.
La entrada del catálogo dice la otra mitad: 2.8 billones de parámetros, 32.9 tokens por segundo, 125.71 segundos antes del primer token. Los pesos son tuyos para sostener; la máquina no está incluida y la latencia no es opcional, y ninguno aparece en una puntuación de 57.1. Los open weights han dejado de ser un compromiso en capacidad y se han convertido en una decisión sobre infraestructura — un problema mucho más interesante de tener.