Opus 5 contra Fable 5 — más nuevo, mejor, a mitad de precio
Claude Opus 5 se lanzó cuarenta y cinco días después de Claude Fable 5. Obtiene una puntuación más alta en ambos índices compuestos y cuesta exactamente la mitad por token. Eso no debería suceder, y la razón por la que sucede es más interesante que el ranking.
TL;DR — la versión corta
Opus 5 obtiene 60.7 en inteligencia y 78.0 en codificación por $5 de entrada y $25 de salida por millón de tokens. Fable 5 obtiene 59.9 y 76.5 por $10 de entrada y $50 de salida. Mismo proveedor, modelo más nuevo, 2× el precio por menos puntos.
Fable 5 no es superado en todas partes. Es más rápido en rendimiento sostenido a 71.3 tokens por segundo frente a 62.8, y gana el Último Examen de la Humanidad y SciCode de manera contundente.
El entorno importa más que el modelo. Opus 5 con esfuerzo medio ya obtiene 56.3, por encima de Opus 4.8 en su máximo esfuerzo, y comienza a responder en 9.83 segundos en lugar de 37.44. Esa perilla mueve tu latencia y tu factura más que la elección entre estos dos modelos.
Los dos modelos, uno al lado del otro
Ambas cifras a continuación provienen de la misma instantánea diaria, leída a las 05:30 del 28 de julio de 2026 a través de 874 modelos medidos. Inteligencia y Codificación son índices compuestos de Artificial Analysis; rendimiento, tiempo hasta el primer token y precio los rastreamos junto a ellos. Los precios son dólares por millón de tokens.
| Métrica | Claude Opus 5 | Claude Fable 5 |
|---|---|---|
| Lanzado | 24 de julio de 2026 | 9 de junio de 2026 |
| Inteligencia | 60.7 | 59.9 |
| Codificación | 78.0 | 76.5 |
| $ / 1M entrada | $5 | $10 |
| $ / 1M salida | $25 | $50 |
| Tokens / s | 62.8 | 71.3 |
| Tiempo hasta el primer token | 31.35 s | 80.07 s |
La línea de precios merece ser leída dos veces. No es aproximadamente la mitad, es exactamente la mitad: $5 contra $10 en entrada, $25 contra $50 en salida. Nada en las dos columnas de puntuación justifica esa proporción — la diferencia es 0.8 puntos de inteligencia y 1.5 puntos de codificación, ambos a favor del modelo más barato.
Una advertencia antes de los benchmarks: ambos modelos ejecutan una configuración de razonamiento adaptativo, por lo que ninguno es un modelo de paso único simple. La columna de Opus 5 es su configuración de máximo esfuerzo, una de las cinco que rastreamos; Fable 5 tiene una única configuración medida, que obtiene 59.9. Ese último punto se convierte en todo el argumento más adelante.
La división del benchmark no es unilateral
Los índices compuestos son promedios, y los promedios ocultan la forma de un modelo. Aquí está el mismo par en los nueve benchmarks individuales en nuestra instantánea.
| Benchmark | Claude Opus 5 | Claude Fable 5 |
|---|---|---|
| GPQA | 93.2 | 92.6 |
| Último Examen de la Humanidad | 52.6 | 53.3 |
| Razonamiento de Contexto Largo | 70 | 70 |
| SciCode | 55.7 | 60.2 |
| Terminal-Bench | 89.1 | 84.6 |
| Terminal-Bench Duro | no medido | 62.9 |
| IFBench | no medido | 63.5 |
| τ-Bench Banking | 30.3 | 26.8 |
| τ²-Bench | no medido | 98.5 |
Opus 5 gana en Terminal-Bench por 4.5 puntos, 89.1 contra 84.6. Gana en GPQA por 0.6, 93.2 contra 92.6. Y gana en τ-Bench Banking por 3.5, 30.3 contra 26.8 — en un benchmark donde el mejor de los dos aún acierta menos de un tercio de una tarea real de agente bancario.
Fable 5 gana en el Último Examen de la Humanidad, 53.3 contra 52.6. Y gana en SciCode por 4.5 puntos, 60.2 contra 55.7 — el tamaño exacto de la brecha que Opus 5 abrió en Terminal-Bench, en la otra dirección. En Razonamiento de Largo Contexto son idénticos a 70.
Así que el resumen honesto del cara a cara es: Opus 5 gana en los dos compuestos y en tres de los seis benchmarks donde ambos son medidos, Fable 5 gana dos, uno es un empate, y tres están sin resolver. Ese es un resultado mucho más estrecho que “el modelo más nuevo es mejor,” y aún así viene a la mitad del precio.
Fable 5 es genuinamente más rápido — y genuinamente más lento
La velocidad son dos números diferentes y no están de acuerdo aquí. Una vez que Fable 5 está generando, genera más rápido: 71.3 tokens por segundo contra 62.8, una ventaja de 8.5 tokens por segundo. Pero tarda mucho más en decir algo en absoluto: 80.07 segundos hasta el primer token frente a 31.35.
Cuál de esos te importa depende completamente de lo que estés construyendo. Un pipeline por lotes que resume diez mil documentos durante la noche se preocupa por el rendimiento y terminará antes en Fable 5. Un agente de codificación que realiza cuarenta llamadas a herramientas secuenciales paga el costo del primer token cuarenta veces, y en esa forma de trabajo Fable 5 comienza 48.72 segundos más tarde en cada una de ellas, antes de que aparezca un solo token de salida útil.
El dial de esfuerzo se mueve más que la elección del modelo
Opus 5 expone una configuración de esfuerzo, y cada uno de sus cinco niveles se mide por separado. Aquí es donde vive la decisión real, porque la variación dentro de Opus 5 es mayor que la variación entre Opus 5 y Fable 5.
| Configuración | Inteligencia | Codificación | Tokens / s | Tiempo hasta el primer token |
|---|---|---|---|---|
| Opus 5, máximo esfuerzo | 60.7 | 78.0 | 62.8 | 31.35 s |
| Opus 5, esfuerzo xhigh | 60.1 | 77.0 | 56.9 | 22.36 s |
| Opus 5, alto esfuerzo | 58.9 | 76.5 | 59.1 | 14.56 s |
| Opus 5, esfuerzo medio | 56.3 | 74.3 | 59.3 | 9.83 s |
| Opus 5, bajo esfuerzo | 50.6 | 66.9 | 59.7 | 3.01 s |
| Opus 4.8, máximo esfuerzo | 55.7 | 74.3 | 65 | 37.44 s |
Lee primero la columna de rendimiento, porque es la sorpresa. Apenas se mueve: 62.8, 56.9, 59.1, 59.3, 59.7. Reducir el esfuerzo no hace que Opus 5 genere más rápido. Lo que colapsa es el tiempo hasta el primer token, de 31.35 segundos en máximo a 3.01 segundos en bajo.La configuración de esfuerzo es un dial de tiempo de pensamiento, no un dial de velocidad.
Ahora la fila que debería cambiar cómo configuras las cosas. Opus 5 en esfuerzo medio puntúa 56.3. Opus 4.8 en su máximo esfuerzo puntúa 55.7. El nuevo modelo, deliberadamente limitado al medio de su rango, está 0.6 puntos por delante de la generación anterior funcionando a máxima capacidad — y comienza a responder en 9.83 segundos en lugar de 37.44. En codificación, los dos llegan exactamente a la misma cifra, 74.3 frente a 74.3.
Opus 4.8 tiene un precio idéntico al de Opus 5, a $5 de entrada y $25 de salida. Así que en este par la actualización es gratuita en precio de lista y vale 5 puntos de inteligencia en la parte superior del rango: 60.7 frente a 55.7. No hay versión de la aritmética donde quedarse en 4.8 en máximo esfuerzo sea la opción eficiente.
Opus 5 no supera a Fable 5 en cada configuración
La comparación principal utiliza Opus 5 en máximo esfuerzo, y ese marco lo favorece. Redúcelo un nivel y el resultado se invierte.
Opus 5 en alto esfuerzo (58.9) cae por debajo del 59.9 medido de Fable 5. Configurado de esa manera, el modelo más nuevo y más barato pierde el compuesto por un punto. En codificación, los dos están a nivel: 76.5 y 76.5.
La configuración que realmente gana la comparación en ambos ejes es xhigh: 60.1 inteligencia frente a 59.9, 77.0 codificación frente a 76.5, primer token en 22.36 segundos frente a 80.07, a la mitad del precio publicado. Esa es la configuración que debes citar si estás reemplazando Fable 5 en un sistema en funcionamiento — no máximo, que compra 0.6 puntos más de inteligencia por nueve segundos más de latencia antes de que comience la salida.
Los niveles de esfuerzo no cambian el precio publicado por token, así que la factura se mueve a través de cuántos tokens gasta el modelo antes de responder, no a través de la tarifa. Nuestra instantánea mide ese gasto indirectamente, como tiempo hasta el primer token, y a través de las cinco configuraciones de Opus 5 que van desde 31.35 segundos hasta 3.01.
Lo que esto significa para una factura real
Tres conclusiones prácticas, en el orden en que un equipo generalmente las necesita.
Si estás en Fable 5 hoy, muévete a Opus 5 en esfuerzo xhigh. Ganas 0.2 puntos de inteligencia y 0.5 de codificación, reduces la latencia del primer token de 80.07 segundos a 22.36, y la tarifa se reduce a la mitad tanto en entrada como en salida. Lo único que pierdes es el rendimiento sostenido, 56.9 tokens por segundo frente a 71.3, que importa para la generación masiva y no mucho más.
Si estás eligiendo una configuración en lugar de un modelo, el medio es el menospreciado. Con 56.3 de inteligencia y 74.3 de codificación está por encima del techo del anterior buque insignia, y 9.83 segundos hasta el primer token está dentro del rango donde una herramienta interactiva aún se siente receptiva. El esfuerzo máximo existe para los problemas donde 4.4 puntos de índice realmente deciden el resultado; la mayoría del tráfico de producción no son esos problemas.
Si tu carga de trabajo es seguir instrucciones o usar herramientas en múltiples turnos, haz una prueba antes de cambiar. Fable 5 es el único de los dos con números publicados en IFBench, Terminal-Bench Hard y τ²-Bench. No vamos a inferir las puntuaciones de Opus 5 allí a partir de su compuesto, y tú tampoco deberías.
Estos números cambian cada mañana
Precios, rendimiento y índices de referencia para 874 modelos medidos, reconstruidos diariamente. Gratis, sin registro.
Abre el comparador →La conclusión
Un modelo más nuevo que obtiene una puntuación más alta y cuesta exactamente la mitad no es un error de precios, es lo que sucede cuando un proveedor envía dos productos por dos razones diferentes con cuarenta y cinco días de diferencia. Fable 5 mantiene una ventaja real en rendimiento y dos victorias en benchmarks. Opus 5 toma los compuestos, el trabajo terminal y la latencia.
Pero el número a recordar de este artículo no es 60.7 contra 59.9. Es 56.3 contra 55.7, en 9.83 segundos contra 37.44 — el anterior buque insignia superado por una configuración de esfuerzo medio en el nuevo. La palanca con más influencia en tu factura es la que está dentro del modelo que ya elegiste.