Respuesta breve:
Actualmente, Opus 4.6 ofrece una mayor fiabilidad, un menor coste y mejores índices de éxito a la primera en flujos de trabajo de codificación reales, mientras que Opus 4.7 muestra potencial en tareas abiertas, pero requiere un mayor ajuste, presupuestos de tokens más elevados y más intentos para alcanzar resultados similares.

Opus 4.7 frente a Opus 4.6: rendimiento en condiciones reales frente a pruebas de rendimiento
La mayoría de las comparaciones entre Opus 4.7 y Opus 4.6 se basan en pruebas de rendimiento controladas. Sin embargo, cuando se evalúan en el marco de flujos de trabajo de desarrollo reales a lo largo de varios días, se observa una situación diferente.

En una evaluación comparativa de varios días de duración, realizada con miles de interacciones reales de programación:
- Se ha alcanzado la versión 4.6 de Opus 83,81 TP3T: tasa de éxito en un solo intento
- Opus 4.7 bajó a 74.5%
- El índice de éxito en la depuración descendió de 85,31 TP3T → 76,51 TP3T
- El índice de éxito en las tareas de programación descendió de 84,71 TP3T → 75,41 TP3T
Esta diferencia pone de relieve una distinción fundamental:
Las mejoras en los resultados de las pruebas comparativas no se traducen necesariamente en una mayor eficiencia en la producción.
En la práctica, los flujos de trabajo reales generan «ruido»: contexto parcial, requisitos cambiantes y indicaciones imperfectas. En estas condiciones, Opus 4.6 demuestra ser más tolerante y fiable.
Coste y eficiencia de los tokens: por qué Opus 4.7 es considerablemente más caro
Una de las diferencias más evidentes entre Opus 4.7 y Opus 4.6 es la rentabilidad.

A lo largo de miles de llamadas a la API:
- Promedio de tokens por solicitud:
- 4.6: 372
- 4.7: 800+
- Coste por llamada:
- 4.6: $0.112
- 4.7: $0.185 (+65%)
Este aumento no es meramente teórico: se acumula rápidamente en la práctica.
¿A qué se debe el aumento de los costes?
- Mayor nivel de detalle
Las respuestas son considerablemente más largas y, a menudo, incluyen razonamientos redundantes. - Se necesitan más intentos
Los resultados fallidos dan lugar a llamadas adicionales, lo que multiplica los costes. - Menor densidad de señal
Un mayor número de tokens no implica necesariamente mejores respuestas.
En entornos de producción, esto plantea una clara disyuntiva:
Puede que Opus 4.7 sea más eficaz en teoría, pero Opus 4.6 resulta más rentable por cada resultado satisfactorio.
Fiabilidad e iteración: por qué Opus 4.6 destaca en los flujos de trabajo de los desarrolladores
Más allá de las tasas de éxito puras, el coste de las iteraciones es un factor clave para la productividad.
Índices de reintento registrados:
- 4.6: 0,22 reintentos por tarea
- 4.7: 0,46 reintentos por tarea (aproximadamente el doble)
Esto tiene efectos en cadena:
- Más interrupciones en el flujo de trabajo
- Aumento de la carga cognitiva
- Deterioro del contexto a lo largo de varias rondas
Impacto real en los flujos de trabajo
Antes (Opus 4.6):
- Alta probabilidad de obtener un resultado válido a la primera
- Ciclos de corrección mínimos
Después de (Opus 4.7):
- Necesidad más frecuente de perfeccionar las indicaciones
- Mayor probabilidad de que los resultados sean parciales o incorrectos
- Mayor interacción recíproca
El resultado es claro:
Incluso pequeñas pérdidas de precisión en los disparos individuales reducen significativamente la productividad general.
Caso práctico: Evaluación de programación en paralelo de tres días de duración
Configuración
- Entorno: Tareas de desarrollo del mundo real (no pruebas de rendimiento sintéticas)
- Duración:
- Opus 4.7: 3.592 llamadas (3 días)
- Opus 4.6: 8.020 llamadas (8 días)
- Herramientas: Claude Code + Codeburn Analytics
Comparación de indicadores clave
| Métrico | Opus 4.6 | Opus 4.7 |
|---|---|---|
| Éxito a la primera | 83.8% | 74.5% |
| El éxito de la programación | 84.7% | 75.4% |
| Éxito en la depuración | 85.3% | 76.5% |
| Reintentos por tarea | 0.22 | 0.46 |
| Fichas por llamada | 372 | 800+ |
| Coste por llamada | $0.112 | $0.185 |
Conclusión clave
Este conjunto de datos muestra que:
- La regresión en el rendimiento es cuantificable, no anecdótica
- Los costes aumentan, mientras que las tasas de éxito disminuyen
- La sobrecarga de las iteraciones se convierte en el cuello de botella oculto
Caso práctico: Desarrollo de funcionalidades frente al rendimiento en la depuración
Curiosamente, no todas las tareas muestran un retroceso.
En desarrollo de funciones:
- Opus 4.6: Éxito del 71.4%
- Opus 4.7: Éxito del 75%
Aunque se basa en una muestra más reducida, esto sugiere que:
- Opus 4.7 puede ofrecer un mejor rendimiento en:
- Tareas abiertas
- Codificación exploratoria
- Resolución creativa de problemas
Pero le cuesta:
- Depuración determinista
- Lógica de alta precisión
- Requisitos estrictos de corrección
Interpretación
Opus 4.7 parece estar optimizado para exploración, mientras que Opus 4.6 sigue siendo más potente para ejecución.
Estudio de caso: Uso de herramientas y comportamiento de los agentes
Otro hallazgo inesperado es la disminución del uso de herramientas y de la delegación de tareas:
- Herramientas por turno:
- 4.6: 2.77
- 4.7: 1.83
- Tasa de delegación:
- 4.6: 3.1%
- 4.7: 0.6%
Por qué es importante
Los flujos de trabajo modernos de IA se basan en:
- Llamada a una herramienta
- Razonamiento en varias etapas
- Delegación a subagentes
La disminución del uso sugiere que:
- Menor desglose de los problemas
- Respuestas más monolíticas
- Menor eficiencia a nivel del sistema
Esto podría explicar en parte:
- Mayor nivel de detalle
- Índices de éxito más bajos
- Mayor número de reintentos
Sensibilidad de las entradas: por qué Opus 4.7 requiere una nueva optimización
Una conclusión que se repite en todas las pruebas es que Opus 4.7 se comporta de forma más literal.
Diferencias clave
Opus 4.6:
- Deduce la intención del usuario
- Completa los datos que faltan
- Más tolerante con las instrucciones poco claras
Opus 4.7:
- Cumplimiento estricto de las instrucciones
- Menos razonamiento implícito
- Requiere instrucciones muy estructuradas
Repercusiones prácticas
Los equipos que migren a la versión 4.7 se enfrentan a:
- Costes del rediseño inmediato
- Reescritura de mensajes del sistema
- Reajuste del proceso
Sin estos ajustes, el rendimiento podría parecer peor de lo que realmente es.
Creatividad frente a precisión: compensaciones entre el 4,7 y el 4,6
Otro patrón observado en el uso:
- Opus 4.6:
- Más intuitivo
- Mejor para las sesiones de lluvia de ideas
- Un “toque creativo” más marcado”
- Opus 4.7:
- Más rígido
- Más estructurado
- Menor variación estilística
Esto da lugar a una clara disyuntiva:
| Caso de uso | Un modelo mejor |
|---|---|
| Escritura creativa | 4.6 |
| Lluvia de ideas | 4.6 |
| Canalizaciones estructuradas | 4.7 |
| Exploración sin límites | 4.7 |
¿Cuándo conviene utilizar Opus 4.7 en lugar de Opus 4.6?
Elige Opus 4.6 si necesitas:
- Alta precisión en disparos únicos
- Menor coste por tarea
- Depuración fiable
- Ingeniería de prompts mínima
Elige Opus 4.7 si necesitas:
- Razonamiento complejo en varias etapas
- Generación sin límites
- Cumplimiento estricto de las instrucciones
- Control de tuberías
Preguntas frecuentes: Opus 4.7 frente a Opus 4.6
¿Es Opus 4.7 realmente mejor que Opus 4.6?
No de forma sistemática. Ofrece mejores resultados en algunas tareas abiertas, pero presenta un rendimiento inferior en cuanto a fiabilidad en la codificación y rentabilidad.
¿Por qué Opus 4.7 utiliza más tokens?
Genera respuestas más largas y detalladas y, a menudo, requiere más intentos, lo que aumenta el consumo total de tokens.
¿El Opus 4.7 tiene más alucinaciones?
En tareas que requieren precisión (como el razonamiento numérico), presenta más errores en comparación con el 4,6 en flujos de trabajo reales.
¿Debería pasar de la versión 4.6 a la 4.7 de Opus?
Solo si estás dispuesto a:
- Reoptimizar las indicaciones
- Aceptar unos costes más elevados
- Cambia la fiabilidad por la flexibilidad
¿Por qué el Opus 4.7 da la sensación de ser más “rígido”?
Sigue las instrucciones de forma más literal y tiende menos a deducir el contexto que falta, lo que hace que resulte menos intuitivo.
¿El rendimiento de las pruebas de referencia es engañoso?
Sí. Los resultados de las pruebas de rendimiento no siempre reflejan la productividad real, sobre todo en flujos de trabajo iterativos.
¿Por qué hay más reintentos en Opus 4.7?
Una menor precisión en el primer intento conlleva más ciclos de corrección, lo que aumenta el número de reintentos y los costes.
¿Es Opus 4.7 mejor para programar?
En su estado actual, no es adecuado para la mayoría de los flujos de trabajo. Su rendimiento es inferior en tareas de depuración y determinísticas.
¿Opus 4.7 requiere nuevas indicaciones?
Sí. A menudo se necesitan indicaciones más estructuradas y explícitas para obtener resultados óptimos.
¿Sigue mejorándose la versión 4.7 de Opus?
A juzgar por el comportamiento observado, es probable que sea necesario seguir ajustándolo y optimizándolo para que alcance todo su potencial.
Veredicto final
Opus 4.7 supone un giro hacia una IA más estructurada y capaz de seguir instrucciones, pero ese cambio conlleva algunas desventajas.
En la mayoría de los flujos de trabajo reales actuales:
- Opus 4.6 es más eficiente, fiable y rentable
- Opus 4.7 es más experimental y flexible, pero menos predecible
La verdadera conclusión no es qué modelo es “mejor”, sino esto:
El mejor modelo es aquel que minimiza los reintentos, el coste y las dificultades en tu flujo de trabajo real, no el que obtiene la puntuación más alta en las pruebas de rendimiento.


