Edificio de oficinas de OpenAI en 1515 Third Street, Mission Bay, San Francisco
Edificio de oficinas de OpenAI en 1515 Third Street, Mission Bay, San FranciscoEl Forum · Fototeca de El Forum · OWN_WORK

Qué muestra el caso de estudio de OpenAI sobre Model ML

OpenAI ha publicado en su índice oficial un caso de estudio sobre Model ML, compañía que usa GPT-5.6 Sol dentro de flujos de trabajo financieros para generar archivos de PowerPoint y Excel que quedan editables al terminar, no solo como capturas o PDF estáticos.

Las cifras de rendimiento proceden de Composite, el benchmark propio de Model ML para evaluar IA en servicios financieros, combinado con pruebas internas de la compañía. Según esos datos, GPT-5.6 Sol completó el 100% de los decks de PowerPoint solicitados, frente al 76% de Opus 5, y redujo el consumo de tokens un 21% frente a Fable 5 en decks y un 36% frente a Opus 5 en workbooks de Excel.

OpenAI cita además un caso de uso de un gestor global de activos, sin identificar, que asegura haber reducido a unos 5 minutos la elaboración de una 'tearsheet' personalizada —un resumen de una página con los datos clave de una inversión o fondo— que antes le llevaba aproximadamente una hora.

Las cifras del anuncio, comparadasElaboración propia a partir de los datos del expediente%
100tasa de finalización de PowerPoint con GPT-5.6 Sol36menos tokens por workbook de Excel21menos tokens por deck de PowerPoint43,3readiness para revisión profesional
Ver los datos en tabla
Las cifras del anuncio, comparadas
Concepto%
tasa de finalización de PowerPoint con GPT-5.6 Sol100
menos tokens por workbook de Excel36
menos tokens por deck de PowerPoint21
readiness para revisión profesional43,3

Fuente: OpenAI

Qué mide y qué no mide este benchmark

Todas las cifras de mejora frente a Opus 5 y Fable 5 —tokens, tasa de finalización, calidad de deck, adherencia al brief, jerarquía y consistencia— salen de un benchmark diseñado por la propia Model ML y de pruebas internas de OpenAI, no de una evaluación independiente. El dato de 'readiness para revisión profesional' (43,3% frente a 26,7%) sigue la misma lógica: es una métrica propietaria, no un estándar de la industria.

El material publicado no incluye importes económicos del acuerdo entre OpenAI y Model ML ni la fecha exacta de publicación del artículo. Tampoco se detalla el tamaño de la muestra de documentos usada en las pruebas ni qué versión concreta de Opus o Fable 5 sirvió de comparación.