← Volver al artículo

Transparencia

Microsoft y Hugging Face publican ThinkingBox-Bench con 507 workflows y costes de GPT y Claude

Afirmaciones verificadas

  • El autor del post es Tuhin Kundu, Microsoft applied scientist, publicado el 2026-10-03.

    Estado: Verificada (fuente primaria)

  • El benchmark contiene 507 workflows/tareas.

    Estado: Verificada (fuente primaria)

  • El benchmark ejecuta 20 runs por tarea.

    Estado: Verificada (fuente primaria)

  • El benchmark se llama "ThinkingBox-Bench".

    Estado: Verificada (fuente primaria)

  • El identificador del paper asociado es "2608.19741".

    Estado: Verificada (fuente primaria)

  • El sandbox/harness se llama "ThinkingBox".

    Estado: Verificada (fuente primaria)

  • GPT-5.6 Sol es el más barato por éxito individual ($0.127) y cuesta $9.76 por tarea fiable.

    Estado: Declarada por la fuente · Requiere atribución

  • La tabla de resultados incluye desempeño de GPT-5.4 (128/20, $869.80), GPT-6 Astra (231/20, $1,720.60), Claude Opus 5.5 (241/20, $1,880.77), GPT-5.6 Sol (82/20, $800), Claude Opus 5 (241/20, $3,206), Claude Sonnet 4.6 (102/20, $1,587.60), GPT-5.2 (44/20, $878), Kimi-K3 (68/20, $1,406.40).

    Estado: Declarada por la fuente · Requiere atribución