The New Stack comparó GPT-6 Sol y Claude Opus 5.5 en tres tareas de desarrollo ejecutadas cinco veces cada una. En pruebas iniciales ambos resolvían los problemas, de modo que el autor cambió el foco hacia la consistencia: quería saber si el resultado correcto se repetía. Las tareas fueron clasificar fallos de integración continua, analizar registros de un incidente y escribir un resolvedor de dependencias evaluado con pruebas ocultas.
En el triaje de CI, ambos modelos acertaron en las cinco repeticiones. Sol tardó menos y costó alrededor de ocho por ciento de lo que costó Opus en esa tarea. En los registros, Opus respondió correctamente en las cinco ejecuciones y Sol en dos; algunas respuestas de Sol omitieron un cliente o contaron mal fallos. En el resolvedor, Opus volvió a superar todas las pruebas cinco veces, mientras Sol falló una ejecución por un error de sintaxis. En total, Opus completó perfectamente 15 de 15 ejecuciones y Sol 12 de 15. Sol fue más rápido y barato en todas; el coste conjunto de sus ejecuciones fue aproximadamente una sexta parte.
Es una comparación del autor con un conjunto pequeño de tareas, no una medida universal de calidad. El resultado sugiere elegir según el riesgo: Sol puede servir para trabajo revisado por personas o pruebas automáticas; la mayor consistencia observada de Opus puede justificar su coste cuando un fallo es difícil de detectar.
Glosario
- Consistencia
- Capacidad de un modelo para repetir un resultado correcto cuando se ejecuta varias veces la misma tarea.
- Tokens de salida
- Unidades de texto que genera un modelo y que normalmente forman parte del cálculo de coste.
- Triaje de CI
- Clasificación de fallos de integración continua para decidir si reintentar, bloquear o avisar a un equipo.
- Pruebas ocultas
- Casos de evaluación que el modelo no conoce cuando produce una solución de código.