The New Stack comparó Claude Opus 5 y Opus 5.5 en tres problemas de razonamiento: una cuadrícula lógica, un recuento de ordenaciones con restricciones y un juego de piedras con memoria. Usó las mismas instrucciones y el razonamiento adaptativo predeterminado en ambos modelos. Cada problema se ejecutó una vez por modelo, por lo que la prueba muestra un caso concreto y no una medida estadística de rendimiento general.

Los resultados fueron equivalentes: ambos resolvieron la cuadrícula y el juego, y ambos fallaron el recuento de ordenaciones. Opus 5.5 terminó antes y costó menos en los tres ejercicios. En dos tareas, el ahorro observado fue del 43 % y del 69 %, impulsado principalmente por un menor número de tokens de salida; la reducción del precio unitario explica solo parte de la diferencia. El autor midió una mejora de velocidad de generación del 11 %, por debajo del 30 % que Anthropic anuncia para otros escenarios.

El artículo aconseja evaluar por separado precisión, tiempo y coste por tarea, en vez de asumir que un modelo nuevo razona mejor solo por ser más reciente. También advierte que problemas de conteo pueden consumir muchos tokens sin producir una respuesta correcta: dar acceso a ejecución de código puede ser una mejor estrategia. Las conclusiones se limitan a tres pruebas de razonamiento, sin repeticiones para estimar variabilidad entre ejecuciones.

Glosario

Razonamiento adaptativo
Modo en que el modelo ajusta cuánto trabajo interno dedica a resolver una petición.
Token de salida
Unidad de texto producida por el modelo que contribuye al consumo facturado.
Latencia
Tiempo transcurrido desde la petición hasta que termina la respuesta del modelo.
Prueba de razonamiento
Problema diseñado para medir cómo un modelo deduce respuestas a partir de reglas o datos.