Kimi K3 é de open weights — e isso não é o mesmo que executável
Ele pontua 57.1 em inteligência a $15 por milhão de tokens de saída, à frente do GPT-5.6 Terra pelo mesmo preço e 1.8 pontos atrás do GPT-5.6 Sol, que custa o dobro. Então você lê a contagem de parâmetros: 2.8 trilhões.
TL;DR — a versão curta
Kimi K3 pontua 57.1 em inteligência por $15 por milhão de tokens de saída. GPT-5.6 Terra custa os mesmos $15 e pontua 55.0. GPT-5.6 Sol pontua 58.9 e custa $30.
Os pesos são publicados. O modelo tem 2.8 trilhões de parâmetros. Ambos os fatos estão na mesma entrada do catálogo, e juntos eles são o artigo: open weights dizem o que você pode ter, não o que você está equipado para executar.
A conta chega como latência: 32.9 tokens por segundo e 125.71 segundos até o primeiro token, o throughput mais lento dos seis modelos no topo do nosso quadro.
Os números, esta manhã
Moonshot AI lançou Kimi K3 em 16 de julho de 2026. Tudo abaixo foi lido em 28 de julho a partir da nossa fusão diária de benchmarks, obtida da Artificial Analysis. Inteligência e Codificação são índices compostos; preço, throughput e tempo até o primeiro token nós rastreamos ourselves. Cada linha é a configuração de maior esforço do fornecedor, que importa mais tarde.
| Modelo | Inteligência | Codificação | $ / 1M saída | Tokens / s | Primeiro token | Pesos |
|---|---|---|---|---|---|---|
| Claude Opus 5 | 60.7 | 78.0 | $25 | 62.8 | 31.35 s | Fechado |
| Claude Fable 5 | 59.9 | 76.5 | $50 | 71.3 | 80.07 s | Fechado |
| GPT-5.6 Sol | 58.9 | 77.4 | $30 | 90.2 | 87.13 s | Fechado |
| Kimi K3 | 57.1 | 76.2 | $15 | 32.9 | 125.71 s | Aberto |
| GPT-5.6 Terra | 55.0 | 76.7 | $15 | 165.4 | 151.8 s | Fechado |
| GPT-5.6 Luna | 51.2 | 71.4 | $6 | 220.4 | 84.29 s | Fechado |
Uma linha envia seus pesos. É a quarta linha e não a última, e está precificada no meio do quadro em vez de na parte inferior. Ambos são novos, e ambos custam algo.
A $15, ela supera o modelo de $15
GPT-5.6 Terra e Kimi K3 custam ambos $15 por milhão de tokens de saída. Terra pontua 55.0 em inteligência, Kimi K3 pontua 57.1: 2.1 pontos para o modelo de open weights a um preço de saída idêntico, com um lado de entrada muito próximo para decidir qualquer coisa a $2.50 contra $3.
A comparação um passo acima é a que deve preocupar um fornecedor. GPT-5.6 Sol pontua 58.9 para $30 por milhão de tokens de saída — 1.8 pontos pelo dobro do preço. Esses 1.8 pontos são reais em raciocínio difícil, mas agora são um item que você pode calcular em vez de uma razão para parar de comprar. Codificação é o único índice que vai na outra direção pelo mesmo preço: Terra 76.7 contra 76.2 do Kimi K3.
Onde vence, e onde não vence
Um índice composto média a variação que decide o trabalho real, então aqui estão os benchmarks individuais. Nosso snapshot carrega nove para este nível e Kimi K3 tem um resultado em seis, sem nenhum no IFBench, Terminal-Bench Hard ou τ²-Bench — também é verdade para Claude Opus 5 e GPT-5.6 Luna, então leia uma célula vazia como uma lacuna na medição em vez de uma falha.
| Benchmark | Kimi K3 | Melhor dos outros cinco |
|---|---|---|
| Raciocínio de Longo Contexto | 74.7 | 74.0 · GPT-5.6 Terra e Luna |
| τ-Bench Banking | 33.4 | 33.0 · GPT-5.6 Sol |
| GPQA | 93.5 | 94.1 · GPT-5.6 Sol |
| SciCode | 58.7 | 60.2 · Claude Fable 5 |
| Terminal-Bench | 85.0 | 89.1 · Claude Opus 5 |
| Último Exame da Humanidade | 44.3 | 53.3 · Claude Fable 5 |
Dois primeiros, e não do tipo decorativo. Raciocínio de Longo Contexto 74.7 é o melhor dos seis, à frente de ambas as variantes do GPT-5.6 em 74.0 e claro de Opus 5 e Fable 5, que ambos estão em 70. τ-Bench Banking 33.4 supera os 33.0 do Sol, o que coloca o modelo de open weights à frente do conjunto de fronteira em uma tarefa de múltiplas interações com ferramentas — a carga de trabalho que todo fornecedor fechado direciona seu marketing.
GPQA é um empate na prática, 93.5 contra 94.1. As três perdas são mais informativas: SciCode 58.7 está 1.5 pontos abaixo do Claude Fable 5, Terminal-Bench 85.0 está 4.1 pontos abaixo do Opus 5, e o Último Exame da Humanidade 44.3 está 9.0 pontos abaixo do Fable 5. Se seu trabalho se assemelha ao extremo mais difícil do raciocínio não assistido, essa diferença de nove pontos é o que a linha aberta custa para você.
Então você lê a contagem de parâmetros
Nossa entrada no catálogo descreve o Kimi K3 como “um modelo de raciocínio multimodal de open weights com 2.8T de parâmetros”. Isso é 2.8 trilhões de parâmetros, e reorganiza tudo acima.
É também a única contagem de parâmetros neste artigo, o que não é uma omissão. Nenhum modelo fechado aqui publica uma, então a comparação não pode ser feita de forma alguma. Você obtém o número precisamente porque os pesos são abertos — a primeira coisa que open weights realmente te compra é saber quão grande é a coisa antes de se comprometer com ela.
A segunda coisa que te compra é um download. Não compra a máquina que mantém o download na memória, e a esse tamanho essa máquina é todo o projeto. Não publicamos nenhuma estimativa de hardware e você deve desconfiar de qualquer número único que lhe seja apresentado, porque a resposta honesta depende de quantização, tamanho do lote, interconexão e a latência que você tolerará — quatro decisões que são suas, não do editor.
open weights são uma permissão, não uma implantação
Três afirmações se colapsam na frase, e separá-las é a maior parte do trabalho de escolha.
open weights não significam grátis. Kimi K3 é servido a $3 na entrada e $15 na saída por milhão de tokens, um preço de fronteira em vez de um preço de commodity. Quem serve esses pesos ainda paga pelo hardware que mantém 2.8 trilhões de parâmetros, e esse custo se reflete no preço, não importa quem publica o checkpoint.
open weights não significam auto-hospedagem na sua escala. Para um modelo de sete bilhões de parâmetros, os dois são praticamente a mesma frase. Com 2.8 trilhões, são projetos diferentes com orçamentos diferentes, e a auto-hospedagem deixa de ser uma questão de licença e se torna uma questão de planejamento de capacidade.
open weights descrevem disponibilidade, não uma concessão de licença. Nossos dados registram este modelo como de open weights e nada mais preciso, então se sua razão para querer os pesos é legal — auditoria, redistribuição, direitos de ajuste fino, uma jurisdição que proíbe o envio de prompts para o exterior — os termos anexados ao checkpoint são o documento que você precisa, e uma tabela de benchmark não substitui a leitura deles.
O que sobrevive a essas três subtrações ainda é substancial: você pode inspecionar o modelo, fixar uma versão que nenhum fornecedor pode depreciar sob você, e executá-lo em algum lugar de sua escolha, se puder arcar com esse lugar. Para alguns compradores, esse perfil de risco é a única coisa nesta página que importa.
O preço que você realmente paga é throughput
Kimi K3 gera 32.9 tokens por segundo. No mesmo instantâneo, o Opus 5 opera a 62.8, o Sol a 90.2, o Terra a 165.4 e a Luna a 220.4. O Terra é cinco vezes mais rápido; a Luna é quase sete vezes mais rápida.
Um agente torna isso pior do que uma janela de chat, porque não produz uma longa resposta — produz uma curta, chama uma ferramenta, lê o resultado e produz outra. Multiplique a penalidade por vinte idas e voltas e o índice de inteligência deixa de ser o número decisivo.
O tempo até o primeiro token aponta na mesma direção, com uma ressalva honesta. Kimi K3 leva 125.71 segundos para iniciar, contra 31.35 para o Opus 5 e 87.13 para o Sol — mas o Terra, no esforço máximo, leva 151.8, o que é pior. Portanto, esses números pertencem a configurações de raciocínio de esforço máximo, em vez de ao Kimi K3 especificamente, e isso estabelece a verdadeira diferença.
Os modelos fechados enviam um controle de latência
Nosso instantâneo contém cinco níveis de esforço para o Claude Opus 5 e seis para cada variante do GPT-5.6. O Kimi K3 aparece como uma única linha.
Essa assimetria vale dinheiro, porque os níveis são uma troca documentada de pontuação contra tempo. O Sol, em alto esforço, pontua 55.9 e começa em 8.65 segundos. O Terra, em esforço máximo, pontua 51.6 em 9.55 segundos. O Opus 5, em baixo esforço, pontua 50.6 em 3.01 segundos. Portanto, a comparação justa para um serviço limitado por latência não é Kimi K3 contra Sol em esforço máximo; é 57.1 em 125.71 segundos contra 55.9 em 8.65 segundos. Desista de 1.2 pontos de índice e comece quatorze vezes mais cedo.
Para um trabalho em lote noturno, o controle não vale nada e a linha aberta vence em preço. Com uma pessoa ou um loop de agente esperando do outro lado, o controle vale mais do que os 1.8 pontos entre Kimi K3 e Sol.
Um milhão de tokens de contexto, e o que vale
A entrada do catálogo lista uma janela de contexto de 1,048,576 tokens, modalidade texto+imagem→texto, e suporte para chamadas de ferramentas. O benchmark apoia a janela em vez de apenas afirmá-la: 74.7 em Raciocínio de Longo Contexto é o melhor dos seis, que é a evidência que você quer antes de confiar em um prompt de um milhão de tokens com qualquer coisa.
Seja claro sobre o que os $15 compram, no entanto. Vinte e nove outras entradas no mesmo catálogo de 184 modelos listam uma janela de um milhão de tokens ou mais, e vinte e oito delas cobram menos de $15 por milhão de tokens de saída — a mediana é $0.98, e quinze estão abaixo de $1. Uma janela muito grande não é mais um recurso premium. O que os $15 compram é o 57.1, o 33.4 em banking e o 93.5 em GPQA — raciocínio que se mantém ao longo da janela, não a janela em si.
Esses números mudam toda manhã
Preços, janelas de contexto e índices de benchmark para centenas de modelos, reconstruídos diariamente. Grátis, sem cadastro.
Abra o comparador →Como escolher
Você precisa dos pesos em suas mãos. Kimi K3, e orçamento para 2,8 trilhões de parâmetros em vez de um download. Faça o trabalho de capacidade primeiro e leia os termos anexados ao checkpoint se a razão for legal em vez de técnica.
Você quer o topo da tabela e o custo é secundário. Claude Opus 5, a 60,7 e 78,0 por $25 por milhão de tokens de saída, e a configuração de maior esforço mais rápida para começar em 31,35 segundos.
Seu loop de agente está limitado por latência. GPT-5.6 Sol com alto esforço — 55,9 em 8,65 segundos — ou 165,4 tokens por segundo da Terra se a geração sustentada for o gargalo. Para alto volume em tarefas comuns, GPT-5.6 Luna a $6 e 220,4 tokens por segundo marca 51,2, que é a margem que você já tem para classificação e extração.
Documentos longos e uso de ferramentas em múltiplas interações. Kimi K3 novamente, nos dois benchmarks, lidera com 74,7 e 33,4. Se você puder absorver a taxa de transferência, esta é a carga de trabalho onde não há compromisso algum.
A conclusão
Um modelo de open weights agora supera um fechado pelo mesmo preço e chega a 1,8 pontos de um modelo que custa o dobro, enquanto lidera o conjunto de fronteira em raciocínio de longo contexto e em uma tarefa realista de agente bancário. É isso que o leaderboard diz, e é verdade.
A entrada do catálogo conta a outra metade: 2,8 trilhões de parâmetros, 32,9 tokens por segundo, 125,71 segundos antes do primeiro token. Os pesos são seus para segurar; a máquina não está incluída e a latência não é opcional, e nenhum dos dois aparece em uma pontuação de 57,1. open weights deixaram de ser um compromisso em capacidade e se tornaram uma decisão sobre infraestrutura — um problema muito mais interessante de se ter.