Contenidos
- Los benchmarks: Sonnet 5 y Opus 4.8 están mucho más cerca de lo que parece
- El precio: la diferencia sí importa cuando trabajas con volumen
- La prueba real en Claude Code: mismo prompt, dos estrategias diferentes
- Más tokens no siempre significa una factura más alta
- El resultado: el modelo barato fue más rápido, más barato y produjo un mejor acabado
- Cuándo usar Claude Sonnet 5
- Cuándo merece la pena pagar por Claude Opus 4.8
- El ahorro real está en asignar el modelo a la tarea
- Preguntas Frecuentes
Cada vez que Anthropic lanza un modelo nuevo de Claude aparece la misma pregunta: ¿con cuál me quedo? Y casi todos caemos en la misma trampa, yo el primero: asumir que necesitamos el modelo más grande, más nuevo, más caro y más potente por si acaso.
Pero casi nunca hace falta. De hecho, al comparar Claude Sonnet 5 con Claude Opus 4.8, la conclusión es bastante más interesante que un simple “el nuevo gana”. Sonnet 5 está jugando en la misma liga que Opus 4.8 en muchas tareas, cuesta mucho menos por token y, para gran parte del trabajo diario, puede ser la decisión más inteligente.
La clave no es elegir siempre el modelo más potente. La clave es asignar el modelo adecuado a cada tarea.
Los benchmarks: Sonnet 5 y Opus 4.8 están mucho más cerca de lo que parece
No tiene mucho sentido comparar Claude Sonnet 5 con su generación anterior. Es lógico que un modelo nuevo mejore al anterior. La comparación interesante es hacia arriba, contra Opus 4.8, el modelo más potente de la familia.
Los números publicados por Anthropic dibujan una situación muy clara: Sonnet ya no es un modelo de segunda división. Las diferencias existen, por supuesto, pero en muchos casos son pequeñas.
- Programación con agentes: Sonnet 5 alcanza un 63,2%, frente al 69,2% de Opus 4.8.
- Tareas de terminal: Sonnet 5 obtiene un 80,4%, mientras que Opus 4.8 llega al 82,7%.
- Razonamiento multidisciplinar sin herramientas: 43,2% para Sonnet 5 frente al 49,8% de Opus 4.8.
- Razonamiento con herramientas: 57,4% frente a 57,9%. Prácticamente un empate.
- Uso del ordenador: 81,2% para Sonnet 5 y 83,4% para Opus 4.8.
- Trabajo de conocimiento: Sonnet 5 supera ligeramente a Opus 4.8, con 1.618 puntos frente a 1.615.
Ese último dato es especialmente revelador. Para tareas de conocimiento, investigación, análisis y trabajo habitual con información, Sonnet 5 incluso se coloca por delante, aunque sea por un margen pequeño.
La traducción de todo esto es sencilla: Opus sigue siendo mejor en las tareas más duras, pero Sonnet 5 está lo bastante cerca como para que pagar más no sea siempre la decisión correcta.
El precio: la diferencia sí importa cuando trabajas con volumen
Los benchmarks están bien, pero la decisión real se toma mirando la factura. Según la documentación de Anthropic, Claude Sonnet 5 tiene un precio promocional, activo hasta el 31 de agosto de 2026, de 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida.
Cuando termine esa promoción, el precio previsto será de 3 dólares por millón de tokens de entrada y 15 dólares por millón de tokens de salida.
Por su parte, Opus 4.8 tiene un precio de 5 dólares por millón de tokens de entrada y 25 dólares por millón de tokens de salida.
Los tokens de salida son los que normalmente pesan más en la factura. Al final, el modelo suele generar mucho más contenido del que recibe. Por eso pasar de 25 a 15 dólares por millón de tokens de salida no es un detalle menor.
En términos generales, Sonnet 5 puede ofrecer una calidad muy parecida por aproximadamente la mitad del coste por token. Y esto cambia totalmente la economía de trabajar con inteligencia artificial.
Durante años, la regla era muy clara: más calidad significaba más precio. Ahora están apareciendo modelos que mantienen un nivel muy alto mientras reducen el coste de forma brutal. Que los modelos mejoren es estupendo. Que mejoren y además cuesten menos, directamente te obliga a replantear cómo montas tus automatizaciones.
La prueba real en Claude Code: mismo prompt, dos estrategias diferentes
Los benchmarks son útiles, pero no hay nada como poner ambos modelos a trabajar sobre el mismo problema. Para comprobarlo, se lanzó Claude Sonnet 5 y Claude Opus 4.8 en dos carpetas independientes, con el mismo modo, el mismo comando /goal y exactamente el mismo prompt.
El encargo era construir un juego llamado Orbit Runner en un único archivo. La idea era controlar una nave espacial equilibrando propulsión y gravedad para mantener una órbita estable, evitar obstáculos y sobrevivir el mayor tiempo posible.
Desde el primer contacto ya se vio que cada modelo tiene una personalidad distinta. Opus 4.8 respondió como un asistente de software que detecta el proyecto, revisa el repositorio y pide contexto antes de actuar. Sonnet 5 respondió de una manera más directa, natural y humana.
Luego llegó la diferencia importante: la estrategia de trabajo.
- Sonnet 5 arrancó rápido, preparó el proyecto y comenzó a construir casi de inmediato.
- Opus 4.8 dedicó más tiempo a pensar, diseñar un plan y estructurar el trabajo antes de modificar archivos.
- Opus 4.8 levantó un servidor y verificó el juego mediante una vista previa en el navegador.
- Sonnet 5 utilizó Playwright por detrás para validar automáticamente los criterios definidos.
Ambos llegaron a un resultado funcional y superaron sus verificaciones. Pero el modo de atacar el problema fue diametralmente opuesto: Opus fue más reflexivo y planificador, mientras que Sonnet fue más directo, ágil y orientado a ejecutar.
Más tokens no siempre significa una factura más alta
En la prueba, Opus 4.8 consumió cerca de 36.000 tokens, mientras que Sonnet 5 utilizó casi 37.000. A simple vista, Sonnet había gastado más.
También hubo una diferencia relevante en caché. Opus se quedó alrededor de 716.000 tokens en caché, mientras que Sonnet utilizó aproximadamente 2,5 millones.
Y aquí está la lección importante: no basta con mirar cuántos tokens consume un modelo. Hay que mirar cuánto cuesta realmente la ejecución, considerando el precio de entrada, salida, caché y el comportamiento del modelo durante toda la tarea.
En este caso, Sonnet 5 usó algo más de tokens, pero terminó costando menos.
El resultado: el modelo barato fue más rápido, más barato y produjo un mejor acabado
Los dos juegos eran funcionales, pero no idénticos en calidad. El primer resultado cumplía lo pedido: una nave, propulsión, obstáculos, puntuación y una mecánica de órbita.
El segundo tenía detalles más cuidados. Incluía un feedback visual más claro, un anillo de órbita mejor definido y, sobre todo, una gravedad que empujaba realmente la nave hacia el planeta cuando no se aplicaba propulsión. Eso era un requisito importante para conseguir una sensación más realista.
El veredicto fue bastante claro: el segundo juego ofrecía mejores mecánicas y un acabado más preciso. Y ese segundo juego lo había generado Sonnet 5.
Los datos finales de Claude Code fueron estos:
- Coste de Opus 4.8: 1,87 dólares.
- Coste de Sonnet 5: 1,71 dólares.
- Tiempo de Opus 4.8: 8 minutos y 36 segundos.
- Tiempo de Sonnet 5: 7 minutos y 17 segundos.
- Líneas de código generadas por Opus 4.8: 609.
- Líneas de código generadas por Sonnet 5: 751.
La diferencia de coste fue de solo 16 céntimos. No es una reducción del 50% en esta ejecución concreta, y eso es precisamente lo honesto. En tareas largas con mucha lectura de caché, las facturas pueden acercarse bastante.
Pero el ahorro se vuelve enorme cuando la tarea no se ejecuta una vez, sino cientos, miles o decenas de miles de veces. Ahí es donde los agentes de IA y las automatizaciones cambian completamente las reglas del juego.
Cuándo usar Claude Sonnet 5
Mi regla base es muy simple: empieza por el modelo más barato y sube al caro solo cuando el barato falle.
Sonnet 5 es una opción excelente para estas situaciones:
- Código del día a día: arreglos, nuevas funcionalidades, scripts, boilerplate y tareas rutinarias.
- Prototipado rápido: crear, probar, iterar y descartar sin preocuparte demasiado por cada token.
- Agentes y automatizaciones: procesos repetitivos que se ejecutan muchas veces y donde el coste acumulado importa de verdad.
- Procesamiento de grandes volúmenes: lotes de información, generación de contenido, clasificación o flujos repetibles.
- Presupuestos ajustados: cuando necesitas mantener calidad sin convertir cada prueba en una factura absurda.
Para el 80% del trabajo cotidiano, Sonnet 5 ofrece calidad de sobra, responde rápido y permite experimentar mucho más sin mirar la factura con lupa.
Cuándo merece la pena pagar por Claude Opus 4.8
Esto no significa que Opus 4.8 haya dejado de tener sentido. Hay tareas donde ese margen adicional de razonamiento, contexto y calidad puede evitar errores muy caros.
Utiliza Opus 4.8 cuando necesites:
- Refactorizaciones grandes: especialmente en bases de código complejas, monorepos o sistemas con muchas piezas conectadas.
- Revisión crítica: cuando un error puede tener un impacto serio y quieres el mejor criterio disponible.
- Arquitectura de software: decisiones profundas donde hay que analizar dependencias, trade-offs y consecuencias a largo plazo.
- Problemas especialmente duros: casos donde ese 5% o 6% extra de calidad puede marcar una diferencia real.
Una prueba construyendo un juego sencillo no representa toda la realidad. Para tareas muy pesadas, complejas o con mucho contexto, Opus sigue siendo una herramienta tremendamente valiosa.
El ahorro real está en asignar el modelo a la tarea
El gran error es usar siempre el modelo más caro por defecto. Mucha gente lo hace por seguridad, por costumbre o porque piensa que así obtiene el mejor resultado posible. Pero muchas veces solo está tirando dinero a la basura sin darse cuenta.
El mejor modelo no es el que obtiene la puntuación más alta en un benchmark. El mejor modelo es el que hace el trabajo que necesitas al menor coste posible.
Esto se nota especialmente en agentes de inteligencia artificial. Si tienes flujos que leen contenido, generan publicaciones, clasifican información, preparan textos o ejecutan tareas de forma recurrente, no tiene sentido asignar el modelo más caro a todo.
Lo pesado y crítico puede ir al modelo más potente. Lo rutinario, repetitivo y bien definido puede ejecutarse con Sonnet 5 o incluso con modelos locales cuando encajen en el flujo. El resultado es el mismo trabajo, pero por una fracción de la factura que habrías pagado hace unos meses.
Si quieres aprender a diseñar este tipo de sistemas, crear agentes con herramientas, bucles de trabajo y criterios de éxito, puedes acceder al curso de Agentes de Inteligencia Artificial. También tienes disponible la Ruta de Inteligencia Artificial de Frogames para profundizar en modelos, automatización y aplicaciones prácticas.
Y si estás buscando más formación para aplicar estas tecnologías, puedes explorar todos los cursos de Inteligencia Artificialdisponibles.
No elijas el modelo más potente por defecto. Elige el modelo adecuado para cada tarea. Esa decisión, repetida cada día en tus automatizaciones, puede ahorrarte muchísimo dinero sin perder calidad.
Preguntas Frecuentes
¿Claude Sonnet 5 es mejor que Claude Opus 4.8?
Depende de la tarea. Sonnet 5 se acerca mucho a Opus 4.8 en rendimiento y puede ofrecer mejores resultados en algunos casos por un coste menor.
¿Cuándo conviene usar Claude Sonnet 5?
Para programación diaria, prototipos, agentes, automatizaciones y tareas repetitivas donde el coste y la velocidad son importantes.
¿Cuándo merece la pena usar Claude Opus 4.8?
En problemas complejos, grandes refactorizaciones, arquitectura de software y tareas críticas donde un pequeño aumento de calidad puede ser importante.
¿Claude Sonnet 5 es más barato que Opus 4.8?
Sí. Su precio por token es considerablemente inferior, aunque el coste final depende del consumo de entrada, salida y caché.
¿Qué modelo debería usar por defecto?
Empieza con Sonnet 5 y utiliza Opus 4.8 cuando la complejidad de la tarea realmente justifique el coste adicional.