Opus 5 contra Fable 5 — mais novo, melhor, metade do preço
Claude Opus 5 foi lançado quarenta e cinco dias após Claude Fable 5. Ele pontua mais alto em ambos os índices compostos e custa exatamente metade por token. Isso não deveria acontecer, e a razão pela qual acontece é mais interessante do que a classificação.
TL;DR — a versão curta
Opus 5 pontua 60.7 em inteligência e 78.0 em codificação por $5 de entrada e $25 de saída por milhão de tokens. Fable 5 pontua 59.9 e 76.5 por $10 de entrada e $50 de saída. Mesmo fornecedor, modelo mais novo, 2× o preço por menos pontos.
Fable 5 não é superado em todos os lugares. É mais rápido em throughput sustentado a 71.3 tokens por segundo contra 62.8, e vence o Último Exame da Humanidade e o SciCode de forma clara.
A configuração importa mais do que o modelo. Opus 5 com esforço médio já pontua 56.3, acima do Opus 4.8 em seu máximo esforço, e começa a responder em 9.83 segundos em vez de 37.44. Esse ajuste move sua latência e sua conta mais do que a escolha entre esses dois modelos.
Os dois modelos, lado a lado
Ambas as figuras abaixo vêm do mesmo instantâneo diário, lido às 05:30 em 28 de julho de 2026, em 874 modelos medidos. Inteligência e Codificação são índices compostos da Artificial Analysis; throughput, tempo até o primeiro token e preço nós acompanhamos junto a eles. Os preços são em dólares por milhão de tokens.
| Métrica | Claude Opus 5 | Claude Fable 5 |
|---|---|---|
| Lançado | 24 de julho de 2026 | 9 de junho de 2026 |
| Inteligência | 60.7 | 59.9 |
| Codificação | 78.0 | 76.5 |
| $ / 1M entrada | $5 | $10 |
| $ / 1M saída | $25 | $50 |
| Tokens / s | 62.8 | 71.3 |
| Tempo até o primeiro token | 31.35 s | 80.07 s |
A linha de preço vale a pena ser lida duas vezes. Não é aproximadamente metade, é exatamente metade: $5 contra $10 na entrada, $25 contra $50 na saída. Nada nas duas colunas de pontuação justifica essa proporção — a diferença é 0.8 pontos de inteligência e 1.5 pontos de codificação, ambos a favor do modelo mais barato.
Uma ressalva antes dos benchmarks: ambos os modelos executam uma configuração de raciocínio adaptativo, então nenhum é um modelo de passagem única simples. A coluna do Opus 5 é sua configuração de máximo esforço, uma das cinco que acompanhamos; o Fable 5 tem uma única configuração medida, que pontua 59.9. Esse último ponto se torna todo o argumento mais adiante.
A divisão do benchmark não é unilateral
Índices compostos são médias, e médias escondem a forma de um modelo. Aqui está o mesmo par nos nove benchmarks individuais em nosso instantâneo.
| Benchmark | Claude Opus 5 | Claude Fable 5 |
|---|---|---|
| GPQA | 93.2 | 92.6 |
| Último Exame da Humanidade | 52.6 | 53.3 |
| Raciocínio de Longo Contexto | 70 | 70 |
| SciCode | 55.7 | 60.2 |
| Terminal-Bench | 89.1 | 84.6 |
| Terminal-Bench Hard | não medido | 62.9 |
| IFBench | não medido | 63.5 |
| τ-Bench Banking | 30.3 | 26.8 |
| τ²-Bench | não medido | 98.5 |
Opus 5 leva o Terminal-Bench por 4.5 pontos, 89.1 contra 84.6. Ele leva o GPQA por 0.6, 93.2 contra 92.6. E leva o τ-Bench Banking por 3.5, 30.3 contra 26.8 — em um benchmark onde o melhor dos dois ainda acerta menos de um terço de uma tarefa realista de agente bancário.
Fable 5 leva o Último Exame da Humanidade, 53.3 contra 52.6. E leva o SciCode por 4.5 pontos, 60.2 contra 55.7 — o tamanho exato da diferença que o Opus 5 abriu no Terminal-Bench, na outra direção. No Raciocínio de Longo Contexto, eles são idênticos a 70.
Então, o resumo honesto do confronto é: Opus 5 vence os dois compostos e três dos seis benchmarks onde ambos são medidos, Fable 5 vence dois, um é um empate e três estão não resolvidos. Esse é um resultado muito mais estreito do que “o modelo mais novo é melhor,” e ainda vem a metade do preço.
Fable 5 é genuinamente mais rápido — e genuinamente mais lento
A velocidade são dois números diferentes e eles discordam aqui. Uma vez que o Fable 5 está gerando, ele gera mais rápido: 71.3 tokens por segundo contra 62.8, uma vantagem de 8.5 tokens por segundo. Mas leva muito mais tempo para dizer qualquer coisa. 80,07 segundos até o primeiro token contra 31,35.
Qual deles você se importa depende inteiramente do que você está construindo. Um pipeline em lote que resume dez mil documentos durante a noite se preocupa com a taxa de transferência e terminará mais cedo no Fable 5. Um agente de codificação que faz quarenta chamadas de ferramentas sequenciais paga o custo do primeiro token quarenta vezes, e nesse tipo de trabalho o Fable 5 começa 48,72 segundos mais tarde em cada um deles, antes que um único token de saída útil apareça.
O dial de esforço se move mais do que a escolha do modelo
O Opus 5 expõe uma configuração de esforço, e cada um de seus cinco níveis é medido separadamente. É aqui que a decisão real reside, porque a variação dentro do Opus 5 é maior do que a variação entre o Opus 5 e o Fable 5.
| Configuração | Inteligência | Codificação | Tokens / s | Tempo até o primeiro token |
|---|---|---|---|---|
| Opus 5, esforço máximo | 60.7 | 78.0 | 62.8 | 31.35 s |
| Opus 5, esforço xhigh | 60.1 | 77.0 | 56.9 | 22,36 s |
| Opus 5, esforço alto | 58.9 | 76.5 | 59.1 | 14,56 s |
| Opus 5, esforço médio | 56.3 | 74.3 | 59.3 | 9,83 s |
| Opus 5, esforço baixo | 50.6 | 66.9 | 59.7 | 3,01 s |
| Opus 4.8, esforço máximo | 55.7 | 74.3 | 65 | 37,44 s |
Leia a coluna de taxa de transferência primeiro, porque é a surpresa. Ela mal se move: 62,8, 56,9, 59,1, 59,3, 59,7. Reduzir o esforço não faz o Opus 5 gerar mais rápido. O que colapsa é o tempo até o primeiro token, de 31,35 segundos no máximo para 3,01 segundos no mínimo.A configuração de esforço é um dial de tempo de pensamento, não um dial de velocidade.
Agora a linha que deve mudar como você configura as coisas. Opus 5 com esforço médio pontua 56,3. Opus 4.8 com seu esforço máximo pontua 55,7. O novo modelo, deliberadamente restringido ao meio de sua faixa, está 0,6 pontos à frente da geração anterior funcionando em plena capacidade — e começa a responder em 9,83 segundos em vez de 37,44. Na codificação, os dois chegam exatamente ao mesmo número, 74,3 contra 74,3.
Opus 4.8 é precificado de forma idêntica ao Opus 5, a $5 de entrada e $25 de saída. Portanto, neste par, a atualização é gratuita em preço de lista e vale 5 pontos de inteligência no topo da faixa: 60,7 contra 55,7. Não há versão da aritmética onde permanecer no 4.8 com esforço máximo seja a escolha eficiente.
Opus 5 não supera o Fable 5 em todas as configurações
A comparação principal usa o Opus 5 com esforço máximo, e essa estrutura o favorece. Reduza um nível e o resultado se inverte.
Opus 5 com esforço alto (58,9) fica abaixo do 59,9 medido do Fable 5. Configurado dessa forma, o modelo mais novo e mais barato perde o composto por um ponto. Na codificação, os dois estão empatados: 76,5 e 76,5.
A configuração que realmente vence a comparação em ambos os eixos é xhigh: 60,1 de inteligência contra 59,9, 77,0 de codificação contra 76,5, primeiro token em 22,36 segundos contra 80,07, a metade do preço publicado. Essa é a configuração a ser citada se você estiver substituindo o Fable 5 em um sistema em funcionamento — não o máximo, que compra 0,6 pontos a mais de inteligência por nove segundos a mais de latência antes que a saída comece.
Os níveis de esforço não mudam o preço publicado por token, então a conta se move através de quantos tokens o modelo gasta antes de responder, não através da tabela de preços. Nossa captura mede esse gasto indiretamente, como tempo até o primeiro token, e através das cinco configurações do Opus 5 que vão de 31,35 segundos até 3,01.
O que isso significa para uma fatura real
Três conclusões práticas, na ordem que uma equipe geralmente precisa delas.
Se você está no Fable 5 hoje, mude para o Opus 5 com esforço xhigh. Você ganha 0,2 pontos de inteligência e 0,5 de codificação, reduz a latência do primeiro token de 80,07 segundos para 22,36, e a tabela de preços é reduzida pela metade tanto na entrada quanto na saída. A única coisa que você abre mão é a taxa de transferência sustentada, 56,9 tokens por segundo contra 71,3, que importa para geração em massa e não muito mais.
Se você está escolhendo uma configuração em vez de um modelo, o médio é o subestimado. Com 56,3 de inteligência e 74,3 de codificação, está acima do teto do modelo anterior, e 9,83 segundos até o primeiro token está dentro da faixa onde uma ferramenta interativa ainda parece responsiva. O esforço máximo existe para os problemas onde 4,4 pontos de índice realmente decidem o resultado; a maioria do tráfego de produção não são esses problemas.
Se sua carga de trabalho é seguir instruções ou uso de ferramentas em múltiplas etapas, faça um benchmark antes de mudar. Fable 5 é o único dos dois com números publicados no IFBench, Terminal-Bench Hard e τ²-Bench. Não vamos inferir as pontuações do Opus 5 a partir de seu composto, e você também não deveria.
Esses números mudam toda manhã
Preços, throughput e índices de benchmark para 874 modelos medidos, reconstruídos diariamente. Grátis, sem necessidade de cadastro.
Abra o comparador →A conclusão
Um modelo mais novo que pontua mais alto e custa exatamente metade não é um erro de precificação, é o que acontece quando um fornecedor lança dois produtos por duas razões diferentes com quarenta e cinco dias de intervalo. Fable 5 mantém uma liderança real em throughput e duas vitórias em benchmarks. Opus 5 leva os compostos, o trabalho terminal e a latência.
Mas o número a lembrar deste artigo não é 60.7 contra 59.9. É 56.3 contra 55.7, em 9.83 segundos contra 37.44 — o antigo carro-chefe superado por uma configuração de esforço médio no novo. A alavanca com mais influência na sua fatura é a que está dentro do modelo que você já escolheu.