O topo é um plateau — e um dos quatro é open weights
Claude Opus 5, Claude Fable 5, GPT-5.6 Sol e Kimi K3 estão a 3.6 pontos de distância em inteligência. Seus preços de saída variam em 3.3×. Essa diferença entre capacidade e preço é toda a história.
TL;DR — a versão curta
Claude Opus 5 lidera em ambos os índices e custa metade do que Claude Fable 5 custa. O modelo principal da Anthropic não é o melhor modelo da Anthropic nessas medidas.
Kimi K3 é de open weights e está 3.6 pontos atrás do líder, a 30 % do preço de saída do Fable 5. A $15 por milhão de tokens de saída, custa exatamente o que o GPT-5.6 Terra custa — e pontua 2.1 pontos a mais.
O preço não acompanha mais a capacidade no topo. Escolha com base em latência, licença e janela de contexto, porque é aí que esses quatro realmente diferem.
Os números, esta manhã
Tudo abaixo vem da nossa fusão diária de benchmark, obtida da Artificial Analysis e reconstruída todas as manhãs. Dois índices compostos — Inteligência e Codificação — além do throughput e preço que rastreamos nós mesmos. Sem estimativas, sem arredondamentos.
| Modelo | Inteligência | Codificação | $ / 1M saída | Tokens / s | Pesos |
|---|---|---|---|---|---|
| Claude Opus 5 | 60.7 | 78.0 | $25 | 62.8 | Fechado |
| Claude Fable 5 | 59.9 | 76.5 | $50 | 71.3 | Fechado |
| GPT-5.6 Sol | 58.9 | 77.4 | $30 | 90.2 | Fechado |
| Kimi K3 | 57.1 | 76.2 | $15 | 32.9 | Aberto |
| GPT-5.6 Terra | 55.0 | 76.7 | $15 | 165.4 | Fechado |
| GPT-5.6 Luna | 51.2 | 71.4 | $6 | 220.4 | Fechado |
| DeepSeek V4 Flash | 40.3 | 56.2 | $0.28 | 125.4 | Aberto |
Leia as quatro primeiras linhas novamente. A diferença de Kimi K3 para Opus 5 é 3.6 pontos de inteligência — cerca de seis por cento. A diferença no preço de saída entre esses mesmos quatro modelos é $15 a $50. A capacidade foi comprimida; o preço não.
O modelo principal da Anthropic não é seu melhor modelo
Claude Fable 5 é o modelo que a Anthropic apresenta, e é o mais caro dos sete a $50 por milhão de tokens de saída. Claude Opus 5 o supera em ambos os índices — 60.7 contra 59.9 em inteligência, 78.0 contra 76.5 em codificação — por metade do preço.
Opus 5 também é mais rápido para o primeiro token: 31 segundos contra 80. Em uma execução longa e agente, essa diferença se acumula.
Há uma ressalva que vale a pena afirmar claramente: Fable 5 executa uma configuração de raciocínio adaptativo com um fallback de Opus 4.8, então os dois não são produtos idênticos. Mas nos números que um comprador realmente compara — pontuação, preço, latência — o mais barato vence em todos os três.
Um modelo open weights iguala agora a gama média da OpenAI, ao mesmo preço
Kimi K3, da Moonshot AI, é enviado com open weights. Ele pontua 57.1 em inteligência. GPT-5.6 Terra pontua 55.0. Ambos custam $15 por milhão de tokens de saída.
Essa é a frase que este site foi construído para poder escrever. Um modelo de open weights, que você pode baixar e executar você mesmo, supera um modelo intermediário fechado ao mesmo preço. Dois anos atrás, a diferença aberta era medida em gerações; aqui está 3.6 pontos atrás do líder absoluto.
GPT-5.6 são quatro modelos, não um
“GPT-5.6” nomeia uma família, e as variantes estão bem distantes. Sol pontua 58.9 a $30. Terra pontua 55.0 a $15. Luna pontua 51.2 a $6.
Leia isso como uma escada em vez de uma fila: cada degrau para baixo custa metade e perde de três a quatro pontos.Luna custa um quinto do preço de Sol para 87 % de sua pontuação de inteligência, e é a coisa mais rápida aqui a 220 tokens por segundo. Para classificação, extração ou sumarização, pagar por Sol é pagar por uma margem que você não usará.
O que o leaderboard não te diz
Opus 5 pontua 89.1 no Terminal-Bench e 93.2 no GPQA.Ele também pontua 30.3 no τ-Bench Banking.O modelo melhor classificado do mundo acerta aproximadamente um terço de uma tarefa real de agente bancário.
Índices compostos eliminam exatamente esse tipo de variação. Um modelo que é excelente em trabalho terminal e medíocre em uso de ferramentas de múltiplas interações parece um único número, e esse número não preverá como ele se comporta na sua tarefa. Teste na sua própria carga de trabalho antes de se comprometer.
O mesmo se aplica ao tempo até o primeiro token, que nenhum desses índices inclui. DeepSeek V4 Flash responde em menos de um segundo.Kimi K3 leva 126 segundos para iniciar. Para uma interface de chat, esses são produtos diferentes, independentemente do que suas pontuações dizem.
Como escolher
Raciocínio mais difícil, custo em segundo plano. Claude Opus 5. Ele lidera ambos os índices e subcorta Fable 5 pela metade.
Você quer velocidade acima de tudo. GPT-5.6 Luna a 220 tokens por segundo, ou DeepSeek V4 Flash se a latência abaixo de um segundo for mais importante do que os últimos dez pontos de pontuação.
Você precisa dos pesos. Kimi K3 — para auditabilidade, implantação local, ou porque uma mudança de licença em uma API fechada é um risco que você não pode assumir. Você aceita a penalidade de throughput conscientemente.
Alto volume, tarefas ordinárias. DeepSeek V4 Flash. A $0.28 por milhão de tokens de saída, é 179 vezes mais barato que Fable 5, e é quatro vezes mais rápido. Ele pontua dois terços tão bem, o que para extração e classificação é suficiente.
Esses números mudam toda manhã
Preços, janelas de contexto e índices de benchmark para mais de 500 modelos, reconstruídos diariamente. Grátis, sem inscrição.
Abra o comparador →A conclusão
A fronteira se achatou. Quando quatro modelos estão dentro de seis por cento uns dos outros em capacidade enquanto seus preços variam em 3.3×, o leaderboard deixa de ser um guia de compra. O que ainda os separa é throughput, latência, janela de contexto e se você pode manter os pesos.
E o lado aberto daquela tabela não é mais um compromisso que você explica ao seu conselho. É uma linha, 3.6 pontos abaixo, a 30 % do preço.