Mujer habla en un atril durante una conferencia sobre inteligencia artificial
Mujer habla en un atril durante una conferencia sobre inteligencia artificial — imagen de archivo de El Forum, ajena al asunto de esta pieza; pendiente de sustituciónEl Forum · Fototeca de El Forum · OWN_WORK

Resultados y benchmarks de GPT-6 Sol y Claude Opus 5.5

El 22 de septiembre de 2026, OpenAI anunció GPT-6 Sol, que alcanzó un 33,2 % en AutomationBench y un 68,8 % en DeepSWE v1.1 según sus propios reportes publicados en SiliconANGLE. Ese mismo día, Anthropic presentó Claude Opus 5.5, que obtuvo un 66,4 % en Terminal-Bench 4.0, cifra citada en India Today y atribuida a Anthropic.

Estos benchmarks miden diferentes aspectos de las capacidades de los modelos. AutomationBench y DeepSWE evalúan automatización y capacidad de programación, mientras que Terminal-Bench se centra en tareas de consola y sistemas basados en terminal, mostrando áreas donde cada modelo puede sobresalir. La comparación directa es relevante porque ambos modelos compiten en el mismo segmento de inteligencia artificial avanzada.

Las cifras del anuncio, comparadasElaboración propia a partir de los datos del expediente%
33,2score en AutomationBench de GPT-6 Sol68,8resultado en DeepSWE v1.1 de GPT-6 Sol66,4valor de Opus 5.5 en Terminal-Bench 4.0
Ver los datos en tabla
Las cifras del anuncio, comparadas
Concepto%
score en AutomationBench de GPT-6 Sol33,2
resultado en DeepSWE v1.1 de GPT-6 Sol68,8
valor de Opus 5.5 en Terminal-Bench 4.066,4

Fuente: Reddit (comunidades de IA)

Contexto de la competencia entre OpenAI y Anthropic

El lanzamiento simultáneo de GPT-6 Sol y Claude Opus 5.5 subraya la competencia directa entre OpenAI y Anthropic en modelos de última generación en 2026. La coincidencia en fecha fue señalada por comunidades de IA en Reddit, que recogieron y compararon benchmarks para visualizar mejor la evolución de ambos.

Cada laboratorio publica cifras propias en diferentes pruebas, lo que complica una evaluación objetiva, pero permite identificar fortalezas en distintos dominios y abre el camino a una competencia saludable que puede acelerar la innovación y ofrecer más opciones a usuarios especializados en diferentes tareas.