Ferramentas AI Projetos Diretório
🏆 Classificação 📡 Notícias ✨ Prompts ⚖️ Comparar Modelos 🔧 Ferramentas 📦 Projetos 🚀 Espaços
Blog
Comparação de modelos

O topo é um plateau — e um dos quatro é open weights

Claude Opus 5, Claude Fable 5, GPT-5.6 Sol e Kimi K3 estão a 3.6 pontos de distância em inteligência. Seus preços de saída variam em 3.3×. Essa diferença entre capacidade e preço é toda a história.

Atualizado em 28 de julho de 2026·8 min de leitura·Sem paywall

TL;DR — a versão curta

Claude Opus 5 lidera em ambos os índices e custa metade do que Claude Fable 5 custa. O modelo principal da Anthropic não é o melhor modelo da Anthropic nessas medidas.

Kimi K3 é de open weights e está 3.6 pontos atrás do líder, a 30 % do preço de saída do Fable 5. A $15 por milhão de tokens de saída, custa exatamente o que o GPT-5.6 Terra custa — e pontua 2.1 pontos a mais.

O preço não acompanha mais a capacidade no topo. Escolha com base em latência, licença e janela de contexto, porque é aí que esses quatro realmente diferem.

Os números, esta manhã

Tudo abaixo vem da nossa fusão diária de benchmark, obtida da Artificial Analysis e reconstruída todas as manhãs. Dois índices compostos — Inteligência e Codificação — além do throughput e preço que rastreamos nós mesmos. Sem estimativas, sem arredondamentos.

ModeloInteligênciaCodificação$ / 1M saídaTokens / sPesos
Claude Opus 560.778.0$2562.8Fechado
Claude Fable 559.976.5$5071.3Fechado
GPT-5.6 Sol58.977.4$3090.2Fechado
Kimi K357.176.2$1532.9Aberto
GPT-5.6 Terra55.076.7$15165.4Fechado
GPT-5.6 Luna51.271.4$6220.4Fechado
DeepSeek V4 Flash40.356.2$0.28125.4Aberto

Leia as quatro primeiras linhas novamente. A diferença de Kimi K3 para Opus 5 é 3.6 pontos de inteligência — cerca de seis por cento. A diferença no preço de saída entre esses mesmos quatro modelos é $15 a $50. A capacidade foi comprimida; o preço não.

O modelo principal da Anthropic não é seu melhor modelo

Claude Fable 5 é o modelo que a Anthropic apresenta, e é o mais caro dos sete a $50 por milhão de tokens de saída. Claude Opus 5 o supera em ambos os índices — 60.7 contra 59.9 em inteligência, 78.0 contra 76.5 em codificação — por metade do preço.

Opus 5 também é mais rápido para o primeiro token: 31 segundos contra 80. Em uma execução longa e agente, essa diferença se acumula.

Claude Opus 5 versus Claude Fable 5: output price per million tokens
Opus 5 lidera ambos os índices a metade do preço. Redesenhado diariamente a partir de preços ao vivo.

Há uma ressalva que vale a pena afirmar claramente: Fable 5 executa uma configuração de raciocínio adaptativo com um fallback de Opus 4.8, então os dois não são produtos idênticos. Mas nos números que um comprador realmente compara — pontuação, preço, latência — o mais barato vence em todos os três.

Um modelo open weights iguala agora a gama média da OpenAI, ao mesmo preço

Kimi K3, da Moonshot AI, é enviado com open weights. Ele pontua 57.1 em inteligência. GPT-5.6 Terra pontua 55.0. Ambos custam $15 por milhão de tokens de saída.

Essa é a frase que este site foi construído para poder escrever. Um modelo de open weights, que você pode baixar e executar você mesmo, supera um modelo intermediário fechado ao mesmo preço. Dois anos atrás, a diferença aberta era medida em gerações; aqui está 3.6 pontos atrás do líder absoluto.

Kimi K3 versus GPT-5.6 Terra: output price per million tokens
Mesmo preço, 2.1 pontos de diferença — e um deles envia seus pesos.
Kimi K3 paga por isso com throughput: 32.9 tokens por segundo, o mais lento dos sete. GPT-5.6 Terra opera a 165.4 — cinco vezes mais rápido. Se seus usuários estão esperando pela saída, isso importa mais do que dois pontos de índice.

GPT-5.6 são quatro modelos, não um

“GPT-5.6” nomeia uma família, e as variantes estão bem distantes. Sol pontua 58.9 a $30. Terra pontua 55.0 a $15. Luna pontua 51.2 a $6.

Leia isso como uma escada em vez de uma fila: cada degrau para baixo custa metade e perde de três a quatro pontos.Luna custa um quinto do preço de Sol para 87 % de sua pontuação de inteligência, e é a coisa mais rápida aqui a 220 tokens por segundo. Para classificação, extração ou sumarização, pagar por Sol é pagar por uma margem que você não usará.

O que o leaderboard não te diz

Opus 5 pontua 89.1 no Terminal-Bench e 93.2 no GPQA.Ele também pontua 30.3 no τ-Bench Banking.O modelo melhor classificado do mundo acerta aproximadamente um terço de uma tarefa real de agente bancário.

Índices compostos eliminam exatamente esse tipo de variação. Um modelo que é excelente em trabalho terminal e medíocre em uso de ferramentas de múltiplas interações parece um único número, e esse número não preverá como ele se comporta na sua tarefa. Teste na sua própria carga de trabalho antes de se comprometer.

O mesmo se aplica ao tempo até o primeiro token, que nenhum desses índices inclui. DeepSeek V4 Flash responde em menos de um segundo.Kimi K3 leva 126 segundos para iniciar. Para uma interface de chat, esses são produtos diferentes, independentemente do que suas pontuações dizem.

Como escolher

Raciocínio mais difícil, custo em segundo plano. Claude Opus 5. Ele lidera ambos os índices e subcorta Fable 5 pela metade.

Você quer velocidade acima de tudo. GPT-5.6 Luna a 220 tokens por segundo, ou DeepSeek V4 Flash se a latência abaixo de um segundo for mais importante do que os últimos dez pontos de pontuação.

Você precisa dos pesos. Kimi K3 — para auditabilidade, implantação local, ou porque uma mudança de licença em uma API fechada é um risco que você não pode assumir. Você aceita a penalidade de throughput conscientemente.

Alto volume, tarefas ordinárias. DeepSeek V4 Flash. A $0.28 por milhão de tokens de saída, é 179 vezes mais barato que Fable 5, e é quatro vezes mais rápido. Ele pontua dois terços tão bem, o que para extração e classificação é suficiente.

Esses números mudam toda manhã

Preços, janelas de contexto e índices de benchmark para mais de 500 modelos, reconstruídos diariamente. Grátis, sem inscrição.

Abra o comparador →

A conclusão

A fronteira se achatou. Quando quatro modelos estão dentro de seis por cento uns dos outros em capacidade enquanto seus preços variam em 3.3×, o leaderboard deixa de ser um guia de compra. O que ainda os separa é throughput, latência, janela de contexto e se você pode manter os pesos.

E o lado aberto daquela tabela não é mais um compromisso que você explica ao seu conselho. É uma linha, 3.6 pontos abaixo, a 30 % do preço.