Qual nível do GPT-5.6? A pergunta errada
Sol, Terra e Luna foram lançados no mesmo dia a $30, $15 e $6 por milhão de tokens de saída. Com o máximo esforço, eles estão 7.7 pontos de inteligência apartados. Os seis níveis de esforço dentro da Luna sozinha estão 24.6 pontos apartados.
TL;DR — a versão curta
GPT-5.6 não é um modelo, e nem três. São três níveis, cada um expondo seis níveis de esforço — dezoito configurações medidas sob um nome.
O nível define seu preço unitário. O nível de esforço define quase tudo o mais.
Nos três níveis com esforço máximo, o índice de inteligência abrange 7,7 pontos. Dentro do nível mais barato, ele abrange 24,6.
O esforço máximo nem sempre é a melhor configuração: Sol em xhigh marca 78,3 em codificação contra 77,4 em máximo, e começa a responder 48,96 segundos mais cedo.
Três níveis, uma data de lançamento
Todos os três níveis do GPT-5.6 têm a mesma data de lançamento, 9 de julho de 2026. Eles diferem por um fator de cinco em preço e por uma palavra no nome. Aqui estão eles em esforço máximo, da maneira como os leaderboards os listam.
| Nível | Inteligência | Codificação | $ / 1M em | $ / 1M saída | Tokens / s | Primeiro token |
|---|---|---|---|---|---|---|
| GPT-5.6 Sol (máx) | 58.9 | 77.4 | $5 | $30 | 90.2 | 87.13 s |
| GPT-5.6 Terra (máx) | 55.0 | 76.7 | $2.5 | $15 | 165.4 | 151.8 s |
| GPT-5.6 Luna (máx) | 51.2 | 71.4 | $1 | $6 | 220.4 | 84.29 s |
Leia essa tabela sozinha e a decisão parece linear. Terra custa exatamente metade de Sol em tokens de entrada e saída e abre mão de 3,9 pontos de inteligência. Luna custa um quinto de Sol e abre mão de 7,7. Escolha um orçamento, aceite o corte correspondente e siga em frente.
Dois detalhes estragam a história. Terra em esforço máximo leva 151,8 segundos para produzir seu primeiro token, mais longo que Sol em 87,13 e mais longo que Luna em 84,29 — o nível intermediário é o mais lento para responder. E a taxa de transferência corre na direção oposta ao preço. Ambos são sintomas da mesma coisa: cada linha acima é medida em esforço máximo, e o esforço máximo é um parâmetro de solicitação, não um produto.
Seis níveis de esforço, e eles se movem mais do que os níveis
Cada nível é avaliado em seis configurações: máximo, xhigh, alto, médio, baixo e Não-raciocínio. Isso é dezoito linhas, e a grade completa é a única maneira honesta de olhar para esta família.
| Configuração | Inteligência | Codificação | Tokens / s | Primeiro token |
|---|---|---|---|---|
| Sol · $5 / $30 | ||||
| máx | 58.9 | 77.4 | 90.2 | 87.13 s |
| xhigh | 57.7 | 78.3 | 85.1 | 38,17 s |
| alto | 55.9 | 77.2 | 81.8 | 8,65 s |
| médio | 53.6 | 76.3 | 85.7 | 7.08 s |
| baixo | 49.4 | 69.7 | 80.5 | 2.5 s |
| Sem raciocínio | 41.2 | 65.1 | 79.3 | 0.85 s |
| Terra · $2.5 / $15 | ||||
| máx | 55.0 | 76.7 | 165.4 | 151.8 s |
| xhigh | 51.6 | 70.6 | 136.7 | 9.55 s |
| alto | 49.0 | 67.1 | 130.2 | 4.24 s |
| médio | 45.6 | 64.7 | 136.3 | 1.59 s |
| baixo | 40.5 | 58.1 | 129.8 | 1.28 s |
| Sem raciocínio | 34.0 | 52.3 | 134.9 | 0.67 s |
| Luna · $1 / $6 | ||||
| máx | 51.2 | 71.4 | 220.4 | 84.29 s |
| xhigh | 49.1 | 68.6 | 209 | 25.94 s |
| alto | 46.1 | 63.3 | 211.7 | 7.66 s |
| médio | 38.1 | 50.7 | 197.9 | 2.52 s |
| baixo | 33.3 | 44.2 | 202.8 | 1.64 s |
| Sem raciocínio | 26.6 | 39.3 | 201.3 | 0.65 s |
Dezoito configurações, três faixas de preço
Agora meça os dois eixos entre si. Entre os níveis com esforço máximo, o índice de inteligência se move 7.7 pontos, de 58.9 para 51.2. Dentro de um único nível, o esforço o move ainda mais: 17.7 pontos em Sol, de 58.9 para 41.2; 21.0 pontos em Terra, de 55.0 para 34.0; 24.6 pontos em Luna, de 51.2 para 26.6.
O dial que ninguém discute em uma reunião de compras move a pontuação mais de três vezes mais longe do que aquele sobre o qual todos discutem. Comprar de Luna para Sol multiplica seu preço unitário por cinco e compra 7.7 pontos; ficar em Luna e mover o parâmetro de esforço não custa nada por token e cobre 24.6 pontos de alcance.
Esforço máximo não é a melhor configuração
No índice de codificação de Sol, xhigh pontua 78.3 e max pontua 77.4. A configuração mais rápida é o melhor programador por 0.9 pontos, e 78.3 é o índice de codificação mais alto em todo este artigo — acima de Claude Opus 5 com 78.0, e bem acima de Claude Fable 5 com 76.5, que lista a $50 por milhão de tokens de saída.
Ele também chega mais cedo: 38.17 segundos para o primeiro token contra 87.13, uma diferença de 48.96 segundos em cada chamada. Pagar os preços de Sol com esforço máximo para escrever código compra um resultado ligeiramente pior e mais do que o dobro da espera. Uma linha mais abaixo, Sol em médio ainda pontua 76.3 e começa em 7.08 segundos. Ao longo das quatro melhores configurações de Sol, o índice de codificação varia 2.0 pontos enquanto o tempo até o primeiro token varia de 7.08 a 87.13 segundos, e Luna repete o padrão: xhigh cede 2.1 pontos em relação a max, 49.1 em relação a 51.2, e começa 58.35 segundos mais cedo.
Terra é a única exceção genuína. Ir de max para xhigh custa 3.4 pontos de inteligência e 6.1 pontos de codificação, de 76.7 para 70.6 — um colapso em vez de um erro de arredondamento — em troca de um primeiro token em 9.55 segundos em vez de 151.8.
A taxa de transferência corre para trás da lista de preços
Uma vez que a geração começa, o nível mais barato é o mais rápido. Luna sustenta 220.4 tokens por segundo, Terra 165.4, Sol 90.2. O nível que custa cinco vezes mais entrega texto a cerca de dois quintos da velocidade.
A grade também mostra onde cada tipo de velocidade reside. A taxa de transferência mal responde ao esforço: ao longo de suas seis configurações, Luna permanece entre 197.9 e 220.4 tokens por segundo, Terra entre 129.8 e 165.4, Sol entre 79.3 e 90.2. A latência não responde a mais nada, variando de 0.85 a 87.13 segundos em Sol, de 0.67 a 151.8 em Terra e de 0.65 a 84.29 em Luna.
Onde os níveis realmente diferem
Índices compostos escondem a forma de um modelo. Aqui estão os benchmarks individuais para os três níveis com esforço máximo, que é onde as divisões publicadas existem.
| Benchmark | Sol | Terra | Luna |
|---|---|---|---|
| GPQA | 94.1 | 92.5 | 91.1 |
| Último Exame da Humanidade | 47.2 | 41.8 | 37.2 |
| IFBench | 72.7 | 71.2 | — |
| Raciocínio de Longo Contexto | 73.7 | 74 | 74 |
| SciCode | 56.1 | 53.9 | 52.5 |
| Terminal-Bench | 88.0 | 88.0 | 80.9 |
| Terminal-Bench Hard | 65.9 | 57.6 | — |
| τ-Bench Banking | 33 | 31.8 | 27.2 |
| τ²-Bench | 85.1 | 86.3 | — |
Os níveis se separam em raciocínio difícil e pouco mais. O Último Exame da Humanidade é a maior diferença com 10.0 pontos, de 47.2 para 37.2; GPQA é a mais estreita com 3.0 pontos, de 94.1 para 91.1. Duas linhas invertem a ordem de preços completamente: em Raciocínio de Longo Contexto, tanto Terra quanto Luna pontuam 74 contra 73.7 de Sol, e em τ²-Bench, Terra pontua 86.3 contra 85.1 de Sol.
O par Terminal-Bench é a linha mais útil aqui para quem está construindo agentes. No conjunto padrão, Terra iguala exatamente Sol em 88.0, a metade do preço; no conjunto difícil, os dois se separam, 65.9 contra 57.6. Terra é igual a Sol em trabalho de shell até que o trabalho de shell fique difícil, que é precisamente quando você percebe.
E um número para manter todos honestos: o melhor dos três níveis pontua 33 em τ-Bench Banking. A configuração mais forte nesta família responde a uma tarefa realista de banco de múltiplas interações corretamente cerca de um terço das vezes, e nenhum índice composto dirá isso.
Os cruzamentos que decidem faturas reais
Porque o esforço avança mais do que o nível, as configurações se cruzam. Luna em xhigh pontua 49.1 e Terra em high pontua 49.0 — uma décima de ponto de diferença, $6 contra $15 por milhão de tokens de saída, 209 tokens por segundo contra 130.2. Não há leitura dessa dupla em que Terra vença. O mesmo se aplica um nível abaixo: Luna em high pontua 46.1 contra Terra em medium com 45.6, e opera a 211.7 tokens por segundo contra 136.3.
Um nível acima, a troca se inverte e se torna uma questão de latência. Terra em xhigh pontua 51.6 e começa em 9.55 segundos; Luna em max pontua 51.2 e começa em 84.29. Aqui, os $9 extras por milhão de tokens de saída compram 74.74 segundos a menos em cada primeira resposta, não capacidade.
O cruzamento mais caro é no topo. Se seu limite é 55 pontos, Terra em max chega exatamente a 55.0 após esperar 151.8 segundos, enquanto Sol em high chega a 55.9 após 8.65 — 143.15 segundos mais cedo e 0.9 pontos mais alto, a $30 em vez de $15. A regra que se extrai da grade: encontre o nível mais barato que atinge sua pontuação alvo em algum nível de esforço, então compre o esforço em vez do nível, a menos que a latência em vez da pontuação seja a restrição vinculativa.
Contra o resto do quadro
Nada disso acontece isoladamente. Aqui está a mesma captura da manhã com os vizinhos incluídos.
| Modelo | Inteligência | Codificação | $ / 1M saída | Tokens / s | Primeiro token |
|---|---|---|---|---|---|
| Claude Opus 5 | 60.7 | 78.0 | $25 | 62.8 | 31.35 s |
| Claude Fable 5 | 59.9 | 76.5 | $50 | 71.3 | 80.07 s |
| GPT-5.6 Sol (máx) | 58.9 | 77.4 | $30 | 90.2 | 87.13 s |
| Kimi K3 | 57.1 | 76.2 | $15 | 32.9 | 125.71 s |
| Claude Opus 4.8 | 55.7 | 74.3 | $25 | 65 | 37,44 s |
| GPT-5.6 Terra (máx) | 55.0 | 76.7 | $15 | 165.4 | 151.8 s |
| GPT-5.5 (xhigh) | 54.8 | 74.9 | $30 | — | — |
| Grok 4.5 (high) | 53.8 | 72.4 | $6 | 61.2 | 10.85 s |
| GPT-5.6 Luna (máx) | 51.2 | 71.4 | $6 | 220.4 | 84.29 s |
Cada nível do GPT-5.6 tem um concorrente direto a ou abaixo de seu próprio preço, e em cada caso o concorrente está à frente no índice composto.
Sol em max, a $30 por milhão de tokens de saída, é a configuração GPT-5.6 mais cara listada, e Claude Opus 5 a supera em ambos os índices por menos dinheiro: 60.7 contra 58.9 em inteligência, 78.0 contra 77.4 em codificação, $25 contra $30, e 31.35 segundos até o primeiro token contra 87.13. A resposta de Sol a isso é uma célula específica da grade, xhigh codificação em 78.3.
Terra em max compartilha seu preço de saída de $15 com Kimi K3, que pontua 57.1 contra 55.0 em inteligência e 76.2 contra 76.7 em codificação, envia open weights e carrega 2.8 trilhões de parâmetros com uma janela de contexto de 1.048.576 tokens. Kimi é ainda mais rápida, 125.71 segundos até o primeiro token contra 151.8. O que Terra compra a esse preço é um throughput sustentado, 165.4 tokens por segundo contra 32.9, e essa é a única razão para preferi-la.
Luna em max compartilha seus $6 com Grok 4.5 em alto esforço, que pontua 53.8 contra 51.2 e 72.4 contra 71.4, e começa a responder em 10.85 segundos contra 84.29. O contra-argumento de Luna é throughput novamente: 220.4 tokens por segundo contra 61.2, mais de três vezes mais texto por segundo uma vez que começou.
Uma linha merece sua própria frase. GPT-5.5 em xhigh ainda lista a $30 por milhão de tokens de saída para 54.8 em inteligência e 74.9 em codificação, então a configuração superior da geração anterior custa o dobro do que Terra em max custa e perde para ela em ambos os índices.
A grade de decisão
Cada linha abaixo nomeia uma configuração em vez de um nível, e cada linha é decidida por um número das tabelas acima.
| Restrição vinculativa | Configuração | O número que decide |
|---|---|---|
| Raciocínio mais difícil | Sol (max) | 47.2 em HLE |
| Escrevendo código | Sol (xhigh) | 78.3 codificação |
| Pontuação máxima sem a espera | Sol (high) | 55.9 em 8.65 s |
| Agentes shell, metade do preço | Terra (max) | 88.0 Terminal-Bench |
| Pontuação média, primeiro token rápido | Terra (xhigh) | 51.6 em 9.55 s |
| Recuperação de longo contexto | Luna (max) | 74 contra 73.7 de Sol |
| Orçamento limitado, trabalho agente | Luna (xhigh) | 49.1 a $6 |
| Chat em streaming | Luna (alta) | 211,7 tokens / s |
| Extração em massa | Luna (Sem raciocínio) | 0,65 s até o primeiro token |
| Você precisa dos pesos | Kimi K3 | 57,1 no Terra’s $15 |
| Topo do quadro | Claude Opus 5 | 60,7 e 78,0 a $25 |
Terra no máximo é uma armadilha, a menos que o trabalho seja executado sem supervisão. Terminal-Bench 88,0 a $15 é o melhor preço em competência de shell nesta família, mas 151,8 segundos até o primeiro token é a espera mais longa de todas as dezoito configurações, e Terminal-Bench Hard cai para 57,6 contra 65,9 do Sol.
Luna em Sem raciocínio é apenas para tarefas sem raciocínio. Ele responde em 0,65 segundos a 201,3 tokens por segundo, e pontua 26,6 em inteligência e 39,3 em codificação. Qualquer coisa com uma decisão pertence ao alto em vez disso, 46,1, que custa exatamente o mesmo por token.
Esses números mudam toda manhã
Preços, throughput e índices de benchmark para cada modelo que rastreamos, reconstruídos diariamente. Grátis, sem cadastro.
Abra o comparador →A conclusão
A pergunta no título tem uma resposta pequena. Mover-se pelos três níveis do GPT-5.6 com esforço máximo muda o índice de inteligência em 7,7 pontos e seu preço unitário por um fator de cinco. A pergunta que ninguém coloca no slide de aquisição tem uma resposta grande: mover o parâmetro de esforço dentro do nível mais barato sozinho muda o índice em 24,6 pontos e seu preço unitário em nada.
Então faça nessa ordem. Encontre sua pontuação alvo, encontre o nível mais barato que a atinge em algum nível de esforço, então gaste o esforço — e verifique a configuração acima e abaixo da que você assumiu, porque no índice de codificação do Sol, o esforço máximo não é a pontuação máxima. Então coloque seu nível ao lado de qualquer outra lista em torno desse preço: no Sol’s $30 há um modelo com pontuação mais alta por $5 a menos, e no Terra’s $15 há um que envia seus pesos.