Transparencia
Microsoft y Hugging Face publican ThinkingBox-Bench con 507 workflows y costes de GPT y Claude
Afirmaciones verificadas
El autor del post es Tuhin Kundu, Microsoft applied scientist, publicado el 2026-10-03.
Estado: Verificada (fuente primaria)
El benchmark contiene 507 workflows/tareas.
Estado: Verificada (fuente primaria)
El benchmark ejecuta 20 runs por tarea.
Estado: Verificada (fuente primaria)
El benchmark se llama "ThinkingBox-Bench".
Estado: Verificada (fuente primaria)
El identificador del paper asociado es "2608.19741".
Estado: Verificada (fuente primaria)
El sandbox/harness se llama "ThinkingBox".
Estado: Verificada (fuente primaria)
GPT-5.6 Sol es el más barato por éxito individual ($0.127) y cuesta $9.76 por tarea fiable.
Estado: Declarada por la fuente · Requiere atribución
La tabla de resultados incluye desempeño de GPT-5.4 (128/20, $869.80), GPT-6 Astra (231/20, $1,720.60), Claude Opus 5.5 (241/20, $1,880.77), GPT-5.6 Sol (82/20, $800), Claude Opus 5 (241/20, $3,206), Claude Sonnet 4.6 (102/20, $1,587.60), GPT-5.2 (44/20, $878), Kimi-K3 (68/20, $1,406.40).
Estado: Declarada por la fuente · Requiere atribución