Herramientas de IA Proyectos Directorio
🏆 Tabla de Clasificación 📡 Noticias ✨ Prompts ⚖️ Comparar Modelos 🔧 Herramientas 📦 Proyectos 🚀 Espacios
Blog
Análisis del modelo

¿Qué nivel de GPT-5.6? La pregunta equivocada

Sol, Terra y Luna se lanzaron el mismo día a $30, $15 y $6 por millón de tokens de salida. Con el máximo esfuerzo, están a 7.7 puntos de inteligencia de distancia. Los seis niveles de esfuerzo dentro de Luna sola están a 24.6 puntos de distancia.

Actualizado el 28 de julio de 2026·9 min de lectura·Sin muro de pago

TL;DR — la versión corta

GPT-5.6 no es un modelo, y tampoco son tres. Son tres niveles, cada uno exponiendo seis niveles de esfuerzo — dieciocho configuraciones medidas bajo un mismo nombre.

El nivel establece tu precio unitario. El nivel de esfuerzo establece casi todo lo demás.

A través de los tres niveles en máximo esfuerzo, el índice de inteligencia abarca 7.7 puntos. Dentro del nivel más barato solo abarca 24.6.

El máximo esfuerzo no siempre es la mejor configuración: Sol en xhigh puntúa 78.3 en codificación frente a 77.4 en máximo, y comienza a responder 48.96 segundos antes.

Tres niveles, una fecha de lanzamiento

Los tres niveles de GPT-5.6 tienen la misma fecha de lanzamiento, 9 de julio de 2026. Difieren por un factor de cinco en precio y por una palabra en nombre. Aquí están en máximo esfuerzo, como los listan los leaderboards.

NivelInteligenciaCodificación$ / 1M en$ / 1M salidaTokens / sPrimer token
GPT-5.6 Sol (máx)58.977.4$5$3090.287.13 s
GPT-5.6 Terra (máx)55.076.7$2.5$15165.4151.8 s
GPT-5.6 Luna (máx)51.271.4$1$6220.484.29 s

Lee esa tabla sola y la decisión parece lineal. Terra cuesta exactamente la mitad de Sol tanto en tokens de entrada como de salida y cede 3.9 puntos de inteligencia. Luna cuesta una quinta parte de Sol y cede 7.7. Elige un presupuesto, acepta el recorte correspondiente, sigue adelante.

Dos detalles estropean la historia. Terra en máximo esfuerzo toma 151.8 segundos para producir su primer token, más tiempo que Sol en 87.13 y más que Luna en 84.29 — el nivel medio es el más lento para responder. Y el rendimiento corre en la dirección opuesta al precio. Ambos son síntomas de lo mismo: cada fila anterior se mide en máximo esfuerzo, y el máximo esfuerzo es un parámetro de solicitud, no un producto.

GPT-5.6 Sol, Terra and Luna compared on output price per million tokens
Los tres niveles en máximo esfuerzo: $30, $15 y $6 por millón de tokens de salida. Redibujados diariamente a partir de precios en vivo.

Seis niveles de esfuerzo, y se mueven más que los niveles

Cada nivel se evalúa en seis configuraciones: máximo, xhigh, alto, medio, bajo y No razonamiento. Eso son dieciocho filas, y la cuadrícula completa es la única forma honesta de ver esta familia.

ConfiguraciónInteligenciaCodificaciónTokens / sPrimer token
Sol · $5 / $30
máx58.977.490.287.13 s
xhigh57.778.385.138.17 s
alto55.977.281.88.65 s
medio53.676.385.77.08 s
bajo49.469.780.52.5 s
Sin razonamiento41.265.179.30.85 s
Terra · $2.5 / $15
máx55.076.7165.4151.8 s
xhigh51.670.6136.79.55 s
alto49.067.1130.24.24 s
medio45.664.7136.31.59 s
bajo40.558.1129.81.28 s
Sin razonamiento34.052.3134.90.67 s
Luna · $1 / $6
máx51.271.4220.484.29 s
xhigh49.168.620925.94 s
alto46.163.3211.77.66 s
medio38.150.7197.92.52 s
bajo33.344.2202.81.64 s
Sin razonamiento26.639.3201.30.65 s

Dieciocho configuraciones, tres puntos de precio

Ahora mide los dos ejes entre sí. Entre niveles con el máximo esfuerzo, el índice de inteligencia se mueve 7.7 puntos, de 58.9 a 51.2. Dentro de un solo nivel, el esfuerzo lo mueve aún más: 17.7 puntos en Sol, de 58.9 a 41.2; 21.0 puntos en Terra, de 55.0 a 34.0; 24.6 puntos en Luna, de 51.2 a 26.6.

El dial sobre el que nadie discute en una reunión de adquisiciones mueve la puntuación más de tres veces que el que todos discuten. Comprar de Luna a Sol multiplica tu precio unitario por cinco y compra 7.7 puntos; quedarse en Luna y mover el parámetro de esfuerzo no cuesta nada por token y cubre un rango de 24.6 puntos.

El nivel es la única mitad de esta decisión que cambia lo que cuesta un token. La mitad cara tiene el efecto más pequeño, y la mitad gratuita decide lo que realmente obtienes.

El máximo esfuerzo no es la mejor configuración

En el índice de codificación de Sol, xhigh puntúa 78.3 y max puntúa 77.4. La configuración más rápida es el mejor programador por 0.9 puntos, y 78.3 es el índice de codificación más alto en este artículo — por encima de Claude Opus 5 con 78.0, y muy por encima de Claude Fable 5 con 76.5, que se lista a $50 por millón de tokens de salida.

También llega antes: 38.17 segundos hasta el primer token contra 87.13, una diferencia de 48.96 segundos en cada llamada. Pagar precios de Sol con el máximo esfuerzo para escribir código compra un resultado ligeramente peor y más del doble de espera. Una fila más abajo, Sol en medio aún puntúa 76.3 y comienza en 7.08 segundos. A través de las cuatro configuraciones superiores de Sol, el índice de codificación abarca 2.0 puntos mientras que el tiempo hasta el primer token abarca de 7.08 a 87.13 segundos, y Luna repite el patrón: xhigh cede 2.1 puntos contra max, 49.1 contra 51.2, y comienza 58.35 segundos antes.

Terra es la única excepción genuina. Pasar de max a xhigh le cuesta 3.4 puntos de inteligencia y 6.1 puntos de codificación, de 76.7 a 70.6 — un colapso en lugar de un error de redondeo — a cambio de un primer token en 9.55 segundos en lugar de 151.8.

El rendimiento se mueve hacia atrás en la lista de precios

Una vez que comienza la generación, el nivel más barato es el más rápido. Luna sostiene 220.4 tokens por segundo, Terra 165.4, Sol 90.2. El nivel que cuesta cinco veces más entrega texto a aproximadamente dos quintos de la velocidad.

La cuadrícula también muestra dónde vive cada tipo de velocidad. El rendimiento apenas responde al esfuerzo: a través de sus seis configuraciones, Luna se mantiene entre 197.9 y 220.4 tokens por segundo, Terra entre 129.8 y 165.4, Sol entre 79.3 y 90.2. La latencia no responde a nada más, variando de 0.85 a 87.13 segundos en Sol, de 0.67 a 151.8 en Terra y de 0.65 a 84.29 en Luna.

El rendimiento es una propiedad del nivel; la latencia es una propiedad del nivel de esfuerzo. Si la respuesta comienza demasiado tarde, cambiar de nivel no lo solucionará y cambiar el esfuerzo tampoco.

Dónde los niveles realmente difieren

Los índices compuestos ocultan la forma de un modelo. Aquí están los puntos de referencia individuales para los tres niveles con el máximo esfuerzo, que es donde existen los desglose publicados.

BenchmarkSolTerraLuna
GPQA94.192.591.1
Último Examen de la Humanidad47.241.837.2
IFBench72.771.2
Razonamiento de Contexto Largo73.77474
SciCode56.153.952.5
Terminal-Bench88.088.080.9
Terminal-Bench Duro65.957.6
τ-Bench Banking3331.827.2
τ²-Bench85.186.3

Los niveles se separan en razonamiento difícil y poco más. El Último Examen de la Humanidad es la brecha más amplia con 10.0 puntos, de 47.2 a 37.2; GPQA es la más estrecha con 3.0 puntos, de 94.1 a 91.1. Dos filas invierten el orden de precios por completo: en Razonamiento de Contexto Largo, tanto Terra como Luna puntúan 74 contra 73.7 de Sol, y en τ²-Bench, Terra puntúa 86.3 contra 85.1 de Sol.

El par Terminal-Bench es la línea más útil aquí para cualquiera que esté construyendo agentes. En el conjunto estándar, Terra iguala a Sol exactamente en 88.0, a la mitad del precio; en el conjunto difícil, los dos se separan, 65.9 contra 57.6. Terra es igual a Sol en trabajo de shell hasta que el trabajo de shell se vuelve difícil, que es precisamente cuando lo notas.

Y un número para mantener a todos honestos: el mejor de los tres niveles puntúa 33 en τ-Bench Banking. La configuración más fuerte en esta familia responde a una tarea realista de banca de múltiples turnos correctamente aproximadamente un tercio de las veces, y ningún índice compuesto te dirá eso.

GPT-5.6 Sol against Claude Opus 5 and Kimi K3: output price per million tokens
Sol a $30 por millón de tokens de salida, junto al modelo por encima de él y el modelo de open weights por debajo de él.

Los cruces que deciden facturas reales

Porque el esfuerzo avanza más que el nivel, las configuraciones se cruzan. Luna en xhigh puntúa 49.1 y Terra en high puntúa 49.0 — una décima de punto de diferencia, $6 contra $15 por millón de tokens de salida, 209 tokens por segundo contra 130.2. No hay lectura de ese par en la que Terra gane. Lo mismo ocurre un nivel más abajo: Luna en high puntúa 46.1 contra Terra en medium con 45.6, y corre a 211.7 tokens por segundo contra 136.3.

Un nivel más arriba, el intercambio se invierte y se convierte en una cuestión de latencia. Terra en xhigh puntúa 51.6 y comienza en 9.55 segundos; Luna en max puntúa 51.2 y comienza en 84.29. Aquí los $9 adicionales por millón de tokens de salida compran 74.74 segundos en cada primera respuesta, no capacidad.

El cruce más caro está en la parte superior. Si tu umbral es de 55 puntos, Terra en max alcanza exactamente 55.0 después de esperar 151.8 segundos, mientras que Sol en high alcanza 55.9 después de 8.65 — 143.15 segundos antes y 0.9 puntos más alto, a $30 en lugar de $15. La regla que se desprende de la cuadrícula: encuentra el nivel más barato que alcance tu puntuación objetivo en algún nivel de esfuerzo, luego compra el esfuerzo en lugar del nivel, a menos que la latencia en lugar de la puntuación sea la restricción vinculante.

Contra el resto de la tabla

Nada de esto sucede en aislamiento. Aquí está la misma instantánea de la mañana con los vecinos incluidos.

ModeloInteligenciaCodificación$ / 1M salidaTokens / sPrimer token
Claude Opus 560.778.0$2562.831.35 s
Claude Fable 559.976.5$5071.380.07 s
GPT-5.6 Sol (máx)58.977.4$3090.287.13 s
Kimi K357.176.2$1532.9125.71 s
Claude Opus 4.855.774.3$256537.44 s
GPT-5.6 Terra (máx)55.076.7$15165.4151.8 s
GPT-5.5 (xhigh)54.874.9$30
Grok 4.5 (high)53.872.4$661.210.85 s
GPT-5.6 Luna (máx)51.271.4$6220.484.29 s

Cada nivel de GPT-5.6 tiene un competidor directo a su mismo precio o por debajo, y en cada caso el competidor está por delante en el índice compuesto.

Sol en max, a $30 por millón de tokens de salida, es la configuración de GPT-5.6 más cara listada, y Claude Opus 5 lo supera en ambos índices por menos dinero: 60.7 contra 58.9 en inteligencia, 78.0 contra 77.4 en codificación, $25 contra $30, y 31.35 segundos hasta el primer token contra 87.13. La respuesta de Sol a eso es una celda específica de la cuadrícula, xhigh codificación a 78.3.

Terra en max comparte su precio de salida de $15 con Kimi K3, que puntúa 57.1 contra 55.0 en inteligencia y 76.2 contra 76.7 en codificación, envía open weights y tiene 2.8 billones de parámetros con una ventana de contexto de 1,048,576 tokens. Kimi es incluso más rápida, 125.71 segundos hasta el primer token contra 151.8. Lo que Terra compra a ese precio es un rendimiento sostenido, 165.4 tokens por segundo contra 32.9, y esa es la única razón para preferirlo.

Luna en max comparte su $6 con Grok 4.5 en alto esfuerzo, que puntúa 53.8 contra 51.2 y 72.4 contra 71.4, y comienza a responder en 10.85 segundos contra 84.29. El contraargumento de Luna es el rendimiento nuevamente: 220.4 tokens por segundo contra 61.2, más de tres veces más texto por segundo una vez que ha comenzado.

Una fila merece su propia oración. GPT-5.5 en xhigh todavía se lista a $30 por millón de tokens de salida para 54.8 en inteligencia y 74.9 en codificación, por lo que la configuración superior de la generación anterior cuesta el doble de lo que cuesta Terra en max y pierde ante ella en ambos índices.

GPT-5.6 Luna against Grok 4.5: same output price per million tokens
Mismo $6 por millón de tokens de salida. Uno comienza en 10.85 segundos, el otro mantiene 220.4 tokens por segundo.

La cuadrícula de decisiones

Cada fila a continuación nombra una configuración en lugar de un nivel, y cada fila se decide por un número de las tablas anteriores.

Restricción vinculanteConfiguraciónEl número que decide
Razonamiento más difícilSol (max)47.2 en HLE
Escribiendo códigoSol (xhigh)78.3 codificación
Puntuación máxima sin la esperaSol (high)55.9 en 8.65 s
Agentes de shell, a mitad de precioTerra (max)88.0 Terminal-Bench
Puntuación media, primer token rápidoTerra (xhigh)51.6 en 9.55 s
Recuperación de contexto largoLuna (max)74 contra 73.7 de Sol
Presupuesto limitado, trabajo agenteLuna (xhigh)49.1 a $6
Chat en streamingLuna (alta)211.7 tokens / s
Extracción masivaLuna (Sin razonamiento)0.65 s hasta el primer token
Necesitas los pesosKimi K357.1 en Terra’s $15
Parte superior de la tablaClaude Opus 560.7 y 78.0 a $25

Terra al máximo es una trampa a menos que el trabajo se ejecute sin supervisión. Terminal-Bench 88.0 a $15 es el mejor precio en competencia de shell en esta familia, pero 151.8 segundos hasta el primer token es la espera más larga de las dieciocho configuraciones, y Terminal-Bench Hard cae a 57.6 frente a Sol’s 65.9.

Luna en Sin razonamiento es solo para tareas sin razonamiento. Responde en 0.65 segundos a 201.3 tokens por segundo, y obtiene 26.6 en inteligencia y 39.3 en codificación. Cualquier cosa con una decisión pertenece a alta en su lugar, 46.1, que cuesta exactamente lo mismo por token.

Estos números cambian cada mañana

Precios, rendimiento e índices de referencia para cada modelo que rastreamos, reconstruidos diariamente. Gratis, sin registro.

Abre el comparador →

La conclusión

La pregunta en el título tiene una respuesta pequeña. Moverse a través de los tres niveles de GPT-5.6 con el máximo esfuerzo cambia el índice de inteligencia en 7.7 puntos y tu precio unitario en un factor de cinco. La pregunta que nadie pone en la diapositiva de adquisición tiene una respuesta grande: mover el parámetro de esfuerzo dentro del nivel más barato solo cambia el índice en 24.6 puntos y tu precio unitario en nada.

Así que hazlo en ese orden. Encuentra tu puntuación objetivo, encuentra el nivel más barato que la alcance a algún nivel de esfuerzo, luego gasta el esfuerzo — y verifica la configuración por encima y por debajo de la que asumiste, porque en el índice de codificación de Sol el esfuerzo máximo no es la puntuación máxima. Luego coloca tu nivel junto a cualquier otra cosa que liste alrededor de ese precio: en Sol’s $30 hay un modelo con mayor puntuación por $5 menos, y en Terra’s $15 hay uno que envía sus pesos.