Ferramentas AI Projetos Diretório
🏆 Classificação 📡 Notícias ✨ Prompts ⚖️ Comparar Modelos 🔧 Ferramentas 📦 Projetos 🚀 Espaços
Blog
Análise do modelo

Qual nível do GPT-5.6? A pergunta errada

Sol, Terra e Luna foram lançados no mesmo dia a $30, $15 e $6 por milhão de tokens de saída. Com o máximo esforço, eles estão 7.7 pontos de inteligência apartados. Os seis níveis de esforço dentro da Luna sozinha estão 24.6 pontos apartados.

Atualizado em 28 de julho de 2026·9 min de leitura·Sem paywall

TL;DR — a versão curta

GPT-5.6 não é um modelo, e nem três. São três níveis, cada um expondo seis níveis de esforço — dezoito configurações medidas sob um nome.

O nível define seu preço unitário. O nível de esforço define quase tudo o mais.

Nos três níveis com esforço máximo, o índice de inteligência abrange 7,7 pontos. Dentro do nível mais barato, ele abrange 24,6.

O esforço máximo nem sempre é a melhor configuração: Sol em xhigh marca 78,3 em codificação contra 77,4 em máximo, e começa a responder 48,96 segundos mais cedo.

Três níveis, uma data de lançamento

Todos os três níveis do GPT-5.6 têm a mesma data de lançamento, 9 de julho de 2026. Eles diferem por um fator de cinco em preço e por uma palavra no nome. Aqui estão eles em esforço máximo, da maneira como os leaderboards os listam.

NívelInteligênciaCodificação$ / 1M em$ / 1M saídaTokens / sPrimeiro token
GPT-5.6 Sol (máx)58.977.4$5$3090.287.13 s
GPT-5.6 Terra (máx)55.076.7$2.5$15165.4151.8 s
GPT-5.6 Luna (máx)51.271.4$1$6220.484.29 s

Leia essa tabela sozinha e a decisão parece linear. Terra custa exatamente metade de Sol em tokens de entrada e saída e abre mão de 3,9 pontos de inteligência. Luna custa um quinto de Sol e abre mão de 7,7. Escolha um orçamento, aceite o corte correspondente e siga em frente.

Dois detalhes estragam a história. Terra em esforço máximo leva 151,8 segundos para produzir seu primeiro token, mais longo que Sol em 87,13 e mais longo que Luna em 84,29 — o nível intermediário é o mais lento para responder. E a taxa de transferência corre na direção oposta ao preço. Ambos são sintomas da mesma coisa: cada linha acima é medida em esforço máximo, e o esforço máximo é um parâmetro de solicitação, não um produto.

GPT-5.6 Sol, Terra and Luna compared on output price per million tokens
Os três níveis em esforço máximo: $30, $15 e $6 por milhão de tokens de saída. Redesenhados diariamente a partir de preços ao vivo.

Seis níveis de esforço, e eles se movem mais do que os níveis

Cada nível é avaliado em seis configurações: máximo, xhigh, alto, médio, baixo e Não-raciocínio. Isso é dezoito linhas, e a grade completa é a única maneira honesta de olhar para esta família.

ConfiguraçãoInteligênciaCodificaçãoTokens / sPrimeiro token
Sol · $5 / $30
máx58.977.490.287.13 s
xhigh57.778.385.138,17 s
alto55.977.281.88,65 s
médio53.676.385.77.08 s
baixo49.469.780.52.5 s
Sem raciocínio41.265.179.30.85 s
Terra · $2.5 / $15
máx55.076.7165.4151.8 s
xhigh51.670.6136.79.55 s
alto49.067.1130.24.24 s
médio45.664.7136.31.59 s
baixo40.558.1129.81.28 s
Sem raciocínio34.052.3134.90.67 s
Luna · $1 / $6
máx51.271.4220.484.29 s
xhigh49.168.620925.94 s
alto46.163.3211.77.66 s
médio38.150.7197.92.52 s
baixo33.344.2202.81.64 s
Sem raciocínio26.639.3201.30.65 s

Dezoito configurações, três faixas de preço

Agora meça os dois eixos entre si. Entre os níveis com esforço máximo, o índice de inteligência se move 7.7 pontos, de 58.9 para 51.2. Dentro de um único nível, o esforço o move ainda mais: 17.7 pontos em Sol, de 58.9 para 41.2; 21.0 pontos em Terra, de 55.0 para 34.0; 24.6 pontos em Luna, de 51.2 para 26.6.

O dial que ninguém discute em uma reunião de compras move a pontuação mais de três vezes mais longe do que aquele sobre o qual todos discutem. Comprar de Luna para Sol multiplica seu preço unitário por cinco e compra 7.7 pontos; ficar em Luna e mover o parâmetro de esforço não custa nada por token e cobre 24.6 pontos de alcance.

O nível é a única metade dessa decisão que muda o custo de um token. A metade cara tem o efeito menor, e a metade gratuita decide o que você realmente recebe.

Esforço máximo não é a melhor configuração

No índice de codificação de Sol, xhigh pontua 78.3 e max pontua 77.4. A configuração mais rápida é o melhor programador por 0.9 pontos, e 78.3 é o índice de codificação mais alto em todo este artigo — acima de Claude Opus 5 com 78.0, e bem acima de Claude Fable 5 com 76.5, que lista a $50 por milhão de tokens de saída.

Ele também chega mais cedo: 38.17 segundos para o primeiro token contra 87.13, uma diferença de 48.96 segundos em cada chamada. Pagar os preços de Sol com esforço máximo para escrever código compra um resultado ligeiramente pior e mais do que o dobro da espera. Uma linha mais abaixo, Sol em médio ainda pontua 76.3 e começa em 7.08 segundos. Ao longo das quatro melhores configurações de Sol, o índice de codificação varia 2.0 pontos enquanto o tempo até o primeiro token varia de 7.08 a 87.13 segundos, e Luna repete o padrão: xhigh cede 2.1 pontos em relação a max, 49.1 em relação a 51.2, e começa 58.35 segundos mais cedo.

Terra é a única exceção genuína. Ir de max para xhigh custa 3.4 pontos de inteligência e 6.1 pontos de codificação, de 76.7 para 70.6 — um colapso em vez de um erro de arredondamento — em troca de um primeiro token em 9.55 segundos em vez de 151.8.

A taxa de transferência corre para trás da lista de preços

Uma vez que a geração começa, o nível mais barato é o mais rápido. Luna sustenta 220.4 tokens por segundo, Terra 165.4, Sol 90.2. O nível que custa cinco vezes mais entrega texto a cerca de dois quintos da velocidade.

A grade também mostra onde cada tipo de velocidade reside. A taxa de transferência mal responde ao esforço: ao longo de suas seis configurações, Luna permanece entre 197.9 e 220.4 tokens por segundo, Terra entre 129.8 e 165.4, Sol entre 79.3 e 90.2. A latência não responde a mais nada, variando de 0.85 a 87.13 segundos em Sol, de 0.67 a 151.8 em Terra e de 0.65 a 84.29 em Luna.

A taxa de transferência é uma propriedade do nível; a latência é uma propriedade do nível de esforço. Se a resposta começa muito tarde, mudar de nível não resolverá e mudar o esforço também não.

Onde os níveis realmente diferem

Índices compostos escondem a forma de um modelo. Aqui estão os benchmarks individuais para os três níveis com esforço máximo, que é onde as divisões publicadas existem.

BenchmarkSolTerraLuna
GPQA94.192.591.1
Último Exame da Humanidade47.241.837.2
IFBench72.771.2
Raciocínio de Longo Contexto73.77474
SciCode56.153.952.5
Terminal-Bench88.088.080.9
Terminal-Bench Hard65.957.6
τ-Bench Banking3331.827.2
τ²-Bench85.186.3

Os níveis se separam em raciocínio difícil e pouco mais. O Último Exame da Humanidade é a maior diferença com 10.0 pontos, de 47.2 para 37.2; GPQA é a mais estreita com 3.0 pontos, de 94.1 para 91.1. Duas linhas invertem a ordem de preços completamente: em Raciocínio de Longo Contexto, tanto Terra quanto Luna pontuam 74 contra 73.7 de Sol, e em τ²-Bench, Terra pontua 86.3 contra 85.1 de Sol.

O par Terminal-Bench é a linha mais útil aqui para quem está construindo agentes. No conjunto padrão, Terra iguala exatamente Sol em 88.0, a metade do preço; no conjunto difícil, os dois se separam, 65.9 contra 57.6. Terra é igual a Sol em trabalho de shell até que o trabalho de shell fique difícil, que é precisamente quando você percebe.

E um número para manter todos honestos: o melhor dos três níveis pontua 33 em τ-Bench Banking. A configuração mais forte nesta família responde a uma tarefa realista de banco de múltiplas interações corretamente cerca de um terço das vezes, e nenhum índice composto dirá isso.

GPT-5.6 Sol against Claude Opus 5 and Kimi K3: output price per million tokens
Sol a $30 por milhão de tokens de saída, ao lado do modelo acima dele e do modelo de open weights abaixo dele.

Os cruzamentos que decidem faturas reais

Porque o esforço avança mais do que o nível, as configurações se cruzam. Luna em xhigh pontua 49.1 e Terra em high pontua 49.0 — uma décima de ponto de diferença, $6 contra $15 por milhão de tokens de saída, 209 tokens por segundo contra 130.2. Não há leitura dessa dupla em que Terra vença. O mesmo se aplica um nível abaixo: Luna em high pontua 46.1 contra Terra em medium com 45.6, e opera a 211.7 tokens por segundo contra 136.3.

Um nível acima, a troca se inverte e se torna uma questão de latência. Terra em xhigh pontua 51.6 e começa em 9.55 segundos; Luna em max pontua 51.2 e começa em 84.29. Aqui, os $9 extras por milhão de tokens de saída compram 74.74 segundos a menos em cada primeira resposta, não capacidade.

O cruzamento mais caro é no topo. Se seu limite é 55 pontos, Terra em max chega exatamente a 55.0 após esperar 151.8 segundos, enquanto Sol em high chega a 55.9 após 8.65 — 143.15 segundos mais cedo e 0.9 pontos mais alto, a $30 em vez de $15. A regra que se extrai da grade: encontre o nível mais barato que atinge sua pontuação alvo em algum nível de esforço, então compre o esforço em vez do nível, a menos que a latência em vez da pontuação seja a restrição vinculativa.

Contra o resto do quadro

Nada disso acontece isoladamente. Aqui está a mesma captura da manhã com os vizinhos incluídos.

ModeloInteligênciaCodificação$ / 1M saídaTokens / sPrimeiro token
Claude Opus 560.778.0$2562.831.35 s
Claude Fable 559.976.5$5071.380.07 s
GPT-5.6 Sol (máx)58.977.4$3090.287.13 s
Kimi K357.176.2$1532.9125.71 s
Claude Opus 4.855.774.3$256537,44 s
GPT-5.6 Terra (máx)55.076.7$15165.4151.8 s
GPT-5.5 (xhigh)54.874.9$30
Grok 4.5 (high)53.872.4$661.210.85 s
GPT-5.6 Luna (máx)51.271.4$6220.484.29 s

Cada nível do GPT-5.6 tem um concorrente direto a ou abaixo de seu próprio preço, e em cada caso o concorrente está à frente no índice composto.

Sol em max, a $30 por milhão de tokens de saída, é a configuração GPT-5.6 mais cara listada, e Claude Opus 5 a supera em ambos os índices por menos dinheiro: 60.7 contra 58.9 em inteligência, 78.0 contra 77.4 em codificação, $25 contra $30, e 31.35 segundos até o primeiro token contra 87.13. A resposta de Sol a isso é uma célula específica da grade, xhigh codificação em 78.3.

Terra em max compartilha seu preço de saída de $15 com Kimi K3, que pontua 57.1 contra 55.0 em inteligência e 76.2 contra 76.7 em codificação, envia open weights e carrega 2.8 trilhões de parâmetros com uma janela de contexto de 1.048.576 tokens. Kimi é ainda mais rápida, 125.71 segundos até o primeiro token contra 151.8. O que Terra compra a esse preço é um throughput sustentado, 165.4 tokens por segundo contra 32.9, e essa é a única razão para preferi-la.

Luna em max compartilha seus $6 com Grok 4.5 em alto esforço, que pontua 53.8 contra 51.2 e 72.4 contra 71.4, e começa a responder em 10.85 segundos contra 84.29. O contra-argumento de Luna é throughput novamente: 220.4 tokens por segundo contra 61.2, mais de três vezes mais texto por segundo uma vez que começou.

Uma linha merece sua própria frase. GPT-5.5 em xhigh ainda lista a $30 por milhão de tokens de saída para 54.8 em inteligência e 74.9 em codificação, então a configuração superior da geração anterior custa o dobro do que Terra em max custa e perde para ela em ambos os índices.

GPT-5.6 Luna against Grok 4.5: same output price per million tokens
Mesmo $6 por milhão de tokens de saída. Um começa em 10.85 segundos, o outro sustenta 220.4 tokens por segundo.

A grade de decisão

Cada linha abaixo nomeia uma configuração em vez de um nível, e cada linha é decidida por um número das tabelas acima.

Restrição vinculativaConfiguraçãoO número que decide
Raciocínio mais difícilSol (max)47.2 em HLE
Escrevendo códigoSol (xhigh)78.3 codificação
Pontuação máxima sem a esperaSol (high)55.9 em 8.65 s
Agentes shell, metade do preçoTerra (max)88.0 Terminal-Bench
Pontuação média, primeiro token rápidoTerra (xhigh)51.6 em 9.55 s
Recuperação de longo contextoLuna (max)74 contra 73.7 de Sol
Orçamento limitado, trabalho agenteLuna (xhigh)49.1 a $6
Chat em streamingLuna (alta)211,7 tokens / s
Extração em massaLuna (Sem raciocínio)0,65 s até o primeiro token
Você precisa dos pesosKimi K357,1 no Terra’s $15
Topo do quadroClaude Opus 560,7 e 78,0 a $25

Terra no máximo é uma armadilha, a menos que o trabalho seja executado sem supervisão. Terminal-Bench 88,0 a $15 é o melhor preço em competência de shell nesta família, mas 151,8 segundos até o primeiro token é a espera mais longa de todas as dezoito configurações, e Terminal-Bench Hard cai para 57,6 contra 65,9 do Sol.

Luna em Sem raciocínio é apenas para tarefas sem raciocínio. Ele responde em 0,65 segundos a 201,3 tokens por segundo, e pontua 26,6 em inteligência e 39,3 em codificação. Qualquer coisa com uma decisão pertence ao alto em vez disso, 46,1, que custa exatamente o mesmo por token.

Esses números mudam toda manhã

Preços, throughput e índices de benchmark para cada modelo que rastreamos, reconstruídos diariamente. Grátis, sem cadastro.

Abra o comparador →

A conclusão

A pergunta no título tem uma resposta pequena. Mover-se pelos três níveis do GPT-5.6 com esforço máximo muda o índice de inteligência em 7,7 pontos e seu preço unitário por um fator de cinco. A pergunta que ninguém coloca no slide de aquisição tem uma resposta grande: mover o parâmetro de esforço dentro do nível mais barato sozinho muda o índice em 24,6 pontos e seu preço unitário em nada.

Então faça nessa ordem. Encontre sua pontuação alvo, encontre o nível mais barato que a atinge em algum nível de esforço, então gaste o esforço — e verifique a configuração acima e abaixo da que você assumiu, porque no índice de codificação do Sol, o esforço máximo não é a pontuação máxima. Então coloque seu nível ao lado de qualquer outra lista em torno desse preço: no Sol’s $30 há um modelo com pontuação mais alta por $5 a menos, e no Terra’s $15 há um que envia seus pesos.