¿Qué nivel de GPT-5.6? La pregunta equivocada
Sol, Terra y Luna se lanzaron el mismo día a $30, $15 y $6 por millón de tokens de salida. Con el máximo esfuerzo, están a 7.7 puntos de inteligencia de distancia. Los seis niveles de esfuerzo dentro de Luna sola están a 24.6 puntos de distancia.
TL;DR — la versión corta
GPT-5.6 no es un modelo, y tampoco son tres. Son tres niveles, cada uno exponiendo seis niveles de esfuerzo — dieciocho configuraciones medidas bajo un mismo nombre.
El nivel establece tu precio unitario. El nivel de esfuerzo establece casi todo lo demás.
A través de los tres niveles en máximo esfuerzo, el índice de inteligencia abarca 7.7 puntos. Dentro del nivel más barato solo abarca 24.6.
El máximo esfuerzo no siempre es la mejor configuración: Sol en xhigh puntúa 78.3 en codificación frente a 77.4 en máximo, y comienza a responder 48.96 segundos antes.
Tres niveles, una fecha de lanzamiento
Los tres niveles de GPT-5.6 tienen la misma fecha de lanzamiento, 9 de julio de 2026. Difieren por un factor de cinco en precio y por una palabra en nombre. Aquí están en máximo esfuerzo, como los listan los leaderboards.
| Nivel | Inteligencia | Codificación | $ / 1M en | $ / 1M salida | Tokens / s | Primer token |
|---|---|---|---|---|---|---|
| GPT-5.6 Sol (máx) | 58.9 | 77.4 | $5 | $30 | 90.2 | 87.13 s |
| GPT-5.6 Terra (máx) | 55.0 | 76.7 | $2.5 | $15 | 165.4 | 151.8 s |
| GPT-5.6 Luna (máx) | 51.2 | 71.4 | $1 | $6 | 220.4 | 84.29 s |
Lee esa tabla sola y la decisión parece lineal. Terra cuesta exactamente la mitad de Sol tanto en tokens de entrada como de salida y cede 3.9 puntos de inteligencia. Luna cuesta una quinta parte de Sol y cede 7.7. Elige un presupuesto, acepta el recorte correspondiente, sigue adelante.
Dos detalles estropean la historia. Terra en máximo esfuerzo toma 151.8 segundos para producir su primer token, más tiempo que Sol en 87.13 y más que Luna en 84.29 — el nivel medio es el más lento para responder. Y el rendimiento corre en la dirección opuesta al precio. Ambos son síntomas de lo mismo: cada fila anterior se mide en máximo esfuerzo, y el máximo esfuerzo es un parámetro de solicitud, no un producto.
Seis niveles de esfuerzo, y se mueven más que los niveles
Cada nivel se evalúa en seis configuraciones: máximo, xhigh, alto, medio, bajo y No razonamiento. Eso son dieciocho filas, y la cuadrícula completa es la única forma honesta de ver esta familia.
| Configuración | Inteligencia | Codificación | Tokens / s | Primer token |
|---|---|---|---|---|
| Sol · $5 / $30 | ||||
| máx | 58.9 | 77.4 | 90.2 | 87.13 s |
| xhigh | 57.7 | 78.3 | 85.1 | 38.17 s |
| alto | 55.9 | 77.2 | 81.8 | 8.65 s |
| medio | 53.6 | 76.3 | 85.7 | 7.08 s |
| bajo | 49.4 | 69.7 | 80.5 | 2.5 s |
| Sin razonamiento | 41.2 | 65.1 | 79.3 | 0.85 s |
| Terra · $2.5 / $15 | ||||
| máx | 55.0 | 76.7 | 165.4 | 151.8 s |
| xhigh | 51.6 | 70.6 | 136.7 | 9.55 s |
| alto | 49.0 | 67.1 | 130.2 | 4.24 s |
| medio | 45.6 | 64.7 | 136.3 | 1.59 s |
| bajo | 40.5 | 58.1 | 129.8 | 1.28 s |
| Sin razonamiento | 34.0 | 52.3 | 134.9 | 0.67 s |
| Luna · $1 / $6 | ||||
| máx | 51.2 | 71.4 | 220.4 | 84.29 s |
| xhigh | 49.1 | 68.6 | 209 | 25.94 s |
| alto | 46.1 | 63.3 | 211.7 | 7.66 s |
| medio | 38.1 | 50.7 | 197.9 | 2.52 s |
| bajo | 33.3 | 44.2 | 202.8 | 1.64 s |
| Sin razonamiento | 26.6 | 39.3 | 201.3 | 0.65 s |
Dieciocho configuraciones, tres puntos de precio
Ahora mide los dos ejes entre sí. Entre niveles con el máximo esfuerzo, el índice de inteligencia se mueve 7.7 puntos, de 58.9 a 51.2. Dentro de un solo nivel, el esfuerzo lo mueve aún más: 17.7 puntos en Sol, de 58.9 a 41.2; 21.0 puntos en Terra, de 55.0 a 34.0; 24.6 puntos en Luna, de 51.2 a 26.6.
El dial sobre el que nadie discute en una reunión de adquisiciones mueve la puntuación más de tres veces que el que todos discuten. Comprar de Luna a Sol multiplica tu precio unitario por cinco y compra 7.7 puntos; quedarse en Luna y mover el parámetro de esfuerzo no cuesta nada por token y cubre un rango de 24.6 puntos.
El máximo esfuerzo no es la mejor configuración
En el índice de codificación de Sol, xhigh puntúa 78.3 y max puntúa 77.4. La configuración más rápida es el mejor programador por 0.9 puntos, y 78.3 es el índice de codificación más alto en este artículo — por encima de Claude Opus 5 con 78.0, y muy por encima de Claude Fable 5 con 76.5, que se lista a $50 por millón de tokens de salida.
También llega antes: 38.17 segundos hasta el primer token contra 87.13, una diferencia de 48.96 segundos en cada llamada. Pagar precios de Sol con el máximo esfuerzo para escribir código compra un resultado ligeramente peor y más del doble de espera. Una fila más abajo, Sol en medio aún puntúa 76.3 y comienza en 7.08 segundos. A través de las cuatro configuraciones superiores de Sol, el índice de codificación abarca 2.0 puntos mientras que el tiempo hasta el primer token abarca de 7.08 a 87.13 segundos, y Luna repite el patrón: xhigh cede 2.1 puntos contra max, 49.1 contra 51.2, y comienza 58.35 segundos antes.
Terra es la única excepción genuina. Pasar de max a xhigh le cuesta 3.4 puntos de inteligencia y 6.1 puntos de codificación, de 76.7 a 70.6 — un colapso en lugar de un error de redondeo — a cambio de un primer token en 9.55 segundos en lugar de 151.8.
El rendimiento se mueve hacia atrás en la lista de precios
Una vez que comienza la generación, el nivel más barato es el más rápido. Luna sostiene 220.4 tokens por segundo, Terra 165.4, Sol 90.2. El nivel que cuesta cinco veces más entrega texto a aproximadamente dos quintos de la velocidad.
La cuadrícula también muestra dónde vive cada tipo de velocidad. El rendimiento apenas responde al esfuerzo: a través de sus seis configuraciones, Luna se mantiene entre 197.9 y 220.4 tokens por segundo, Terra entre 129.8 y 165.4, Sol entre 79.3 y 90.2. La latencia no responde a nada más, variando de 0.85 a 87.13 segundos en Sol, de 0.67 a 151.8 en Terra y de 0.65 a 84.29 en Luna.
Dónde los niveles realmente difieren
Los índices compuestos ocultan la forma de un modelo. Aquí están los puntos de referencia individuales para los tres niveles con el máximo esfuerzo, que es donde existen los desglose publicados.
| Benchmark | Sol | Terra | Luna |
|---|---|---|---|
| GPQA | 94.1 | 92.5 | 91.1 |
| Último Examen de la Humanidad | 47.2 | 41.8 | 37.2 |
| IFBench | 72.7 | 71.2 | — |
| Razonamiento de Contexto Largo | 73.7 | 74 | 74 |
| SciCode | 56.1 | 53.9 | 52.5 |
| Terminal-Bench | 88.0 | 88.0 | 80.9 |
| Terminal-Bench Duro | 65.9 | 57.6 | — |
| τ-Bench Banking | 33 | 31.8 | 27.2 |
| τ²-Bench | 85.1 | 86.3 | — |
Los niveles se separan en razonamiento difícil y poco más. El Último Examen de la Humanidad es la brecha más amplia con 10.0 puntos, de 47.2 a 37.2; GPQA es la más estrecha con 3.0 puntos, de 94.1 a 91.1. Dos filas invierten el orden de precios por completo: en Razonamiento de Contexto Largo, tanto Terra como Luna puntúan 74 contra 73.7 de Sol, y en τ²-Bench, Terra puntúa 86.3 contra 85.1 de Sol.
El par Terminal-Bench es la línea más útil aquí para cualquiera que esté construyendo agentes. En el conjunto estándar, Terra iguala a Sol exactamente en 88.0, a la mitad del precio; en el conjunto difícil, los dos se separan, 65.9 contra 57.6. Terra es igual a Sol en trabajo de shell hasta que el trabajo de shell se vuelve difícil, que es precisamente cuando lo notas.
Y un número para mantener a todos honestos: el mejor de los tres niveles puntúa 33 en τ-Bench Banking. La configuración más fuerte en esta familia responde a una tarea realista de banca de múltiples turnos correctamente aproximadamente un tercio de las veces, y ningún índice compuesto te dirá eso.
Los cruces que deciden facturas reales
Porque el esfuerzo avanza más que el nivel, las configuraciones se cruzan. Luna en xhigh puntúa 49.1 y Terra en high puntúa 49.0 — una décima de punto de diferencia, $6 contra $15 por millón de tokens de salida, 209 tokens por segundo contra 130.2. No hay lectura de ese par en la que Terra gane. Lo mismo ocurre un nivel más abajo: Luna en high puntúa 46.1 contra Terra en medium con 45.6, y corre a 211.7 tokens por segundo contra 136.3.
Un nivel más arriba, el intercambio se invierte y se convierte en una cuestión de latencia. Terra en xhigh puntúa 51.6 y comienza en 9.55 segundos; Luna en max puntúa 51.2 y comienza en 84.29. Aquí los $9 adicionales por millón de tokens de salida compran 74.74 segundos en cada primera respuesta, no capacidad.
El cruce más caro está en la parte superior. Si tu umbral es de 55 puntos, Terra en max alcanza exactamente 55.0 después de esperar 151.8 segundos, mientras que Sol en high alcanza 55.9 después de 8.65 — 143.15 segundos antes y 0.9 puntos más alto, a $30 en lugar de $15. La regla que se desprende de la cuadrícula: encuentra el nivel más barato que alcance tu puntuación objetivo en algún nivel de esfuerzo, luego compra el esfuerzo en lugar del nivel, a menos que la latencia en lugar de la puntuación sea la restricción vinculante.
Contra el resto de la tabla
Nada de esto sucede en aislamiento. Aquí está la misma instantánea de la mañana con los vecinos incluidos.
| Modelo | Inteligencia | Codificación | $ / 1M salida | Tokens / s | Primer token |
|---|---|---|---|---|---|
| Claude Opus 5 | 60.7 | 78.0 | $25 | 62.8 | 31.35 s |
| Claude Fable 5 | 59.9 | 76.5 | $50 | 71.3 | 80.07 s |
| GPT-5.6 Sol (máx) | 58.9 | 77.4 | $30 | 90.2 | 87.13 s |
| Kimi K3 | 57.1 | 76.2 | $15 | 32.9 | 125.71 s |
| Claude Opus 4.8 | 55.7 | 74.3 | $25 | 65 | 37.44 s |
| GPT-5.6 Terra (máx) | 55.0 | 76.7 | $15 | 165.4 | 151.8 s |
| GPT-5.5 (xhigh) | 54.8 | 74.9 | $30 | — | — |
| Grok 4.5 (high) | 53.8 | 72.4 | $6 | 61.2 | 10.85 s |
| GPT-5.6 Luna (máx) | 51.2 | 71.4 | $6 | 220.4 | 84.29 s |
Cada nivel de GPT-5.6 tiene un competidor directo a su mismo precio o por debajo, y en cada caso el competidor está por delante en el índice compuesto.
Sol en max, a $30 por millón de tokens de salida, es la configuración de GPT-5.6 más cara listada, y Claude Opus 5 lo supera en ambos índices por menos dinero: 60.7 contra 58.9 en inteligencia, 78.0 contra 77.4 en codificación, $25 contra $30, y 31.35 segundos hasta el primer token contra 87.13. La respuesta de Sol a eso es una celda específica de la cuadrícula, xhigh codificación a 78.3.
Terra en max comparte su precio de salida de $15 con Kimi K3, que puntúa 57.1 contra 55.0 en inteligencia y 76.2 contra 76.7 en codificación, envía open weights y tiene 2.8 billones de parámetros con una ventana de contexto de 1,048,576 tokens. Kimi es incluso más rápida, 125.71 segundos hasta el primer token contra 151.8. Lo que Terra compra a ese precio es un rendimiento sostenido, 165.4 tokens por segundo contra 32.9, y esa es la única razón para preferirlo.
Luna en max comparte su $6 con Grok 4.5 en alto esfuerzo, que puntúa 53.8 contra 51.2 y 72.4 contra 71.4, y comienza a responder en 10.85 segundos contra 84.29. El contraargumento de Luna es el rendimiento nuevamente: 220.4 tokens por segundo contra 61.2, más de tres veces más texto por segundo una vez que ha comenzado.
Una fila merece su propia oración. GPT-5.5 en xhigh todavía se lista a $30 por millón de tokens de salida para 54.8 en inteligencia y 74.9 en codificación, por lo que la configuración superior de la generación anterior cuesta el doble de lo que cuesta Terra en max y pierde ante ella en ambos índices.
La cuadrícula de decisiones
Cada fila a continuación nombra una configuración en lugar de un nivel, y cada fila se decide por un número de las tablas anteriores.
| Restricción vinculante | Configuración | El número que decide |
|---|---|---|
| Razonamiento más difícil | Sol (max) | 47.2 en HLE |
| Escribiendo código | Sol (xhigh) | 78.3 codificación |
| Puntuación máxima sin la espera | Sol (high) | 55.9 en 8.65 s |
| Agentes de shell, a mitad de precio | Terra (max) | 88.0 Terminal-Bench |
| Puntuación media, primer token rápido | Terra (xhigh) | 51.6 en 9.55 s |
| Recuperación de contexto largo | Luna (max) | 74 contra 73.7 de Sol |
| Presupuesto limitado, trabajo agente | Luna (xhigh) | 49.1 a $6 |
| Chat en streaming | Luna (alta) | 211.7 tokens / s |
| Extracción masiva | Luna (Sin razonamiento) | 0.65 s hasta el primer token |
| Necesitas los pesos | Kimi K3 | 57.1 en Terra’s $15 |
| Parte superior de la tabla | Claude Opus 5 | 60.7 y 78.0 a $25 |
Terra al máximo es una trampa a menos que el trabajo se ejecute sin supervisión. Terminal-Bench 88.0 a $15 es el mejor precio en competencia de shell en esta familia, pero 151.8 segundos hasta el primer token es la espera más larga de las dieciocho configuraciones, y Terminal-Bench Hard cae a 57.6 frente a Sol’s 65.9.
Luna en Sin razonamiento es solo para tareas sin razonamiento. Responde en 0.65 segundos a 201.3 tokens por segundo, y obtiene 26.6 en inteligencia y 39.3 en codificación. Cualquier cosa con una decisión pertenece a alta en su lugar, 46.1, que cuesta exactamente lo mismo por token.
Estos números cambian cada mañana
Precios, rendimiento e índices de referencia para cada modelo que rastreamos, reconstruidos diariamente. Gratis, sin registro.
Abre el comparador →La conclusión
La pregunta en el título tiene una respuesta pequeña. Moverse a través de los tres niveles de GPT-5.6 con el máximo esfuerzo cambia el índice de inteligencia en 7.7 puntos y tu precio unitario en un factor de cinco. La pregunta que nadie pone en la diapositiva de adquisición tiene una respuesta grande: mover el parámetro de esfuerzo dentro del nivel más barato solo cambia el índice en 24.6 puntos y tu precio unitario en nada.
Así que hazlo en ese orden. Encuentra tu puntuación objetivo, encuentra el nivel más barato que la alcance a algún nivel de esfuerzo, luego gasta el esfuerzo — y verifica la configuración por encima y por debajo de la que asumiste, porque en el índice de codificación de Sol el esfuerzo máximo no es la puntuación máxima. Luego coloca tu nivel junto a cualquier otra cosa que liste alrededor de ese precio: en Sol’s $30 hay un modelo con mayor puntuación por $5 menos, y en Terra’s $15 hay uno que envía sus pesos.