← Volver al artículo

Transparencia

Goodfire publica monitores inside-out para IA que prometen detección eficaz a menor coste

Afirmaciones verificadas

  • Dan Balsam, CTO y cofundador de Goodfire, dijo que el enfoque puede identificar conductas dañinas antes de que terminen, incluso mientras un modelo está siendo evaluado o entrenado.

    Estado: Atribuida a una sola fuente · Requiere atribución

  • Goodfire afirma haber lanzado monitores "inside-out" que observan señales internas del modelo durante su operación en vez de revisar solo sus respuestas.

    Estado: Atribuida a una sola fuente · Requiere atribución

  • Goodfire indica que entre el 50 % y el 96 % de las ejecuciones de pruebas de agentes en modelos abiertos líderes, incluidos Kimi K3 y GLM‑5.2, mostraron reward hacking.

    Estado: Atribuida a una sola fuente · Requiere atribución

  • Goodfire indica que los monitores están disponibles para clientes de Baseten.

    Estado: Atribuida a una sola fuente · Requiere atribución

  • Goodfire reporta que el 5,5 % de las sesiones inocuas fueron enviadas a una segunda revisión.

    Estado: Atribuida a una sola fuente · Requiere atribución

  • Goodfire sostiene que monitorizar aproximadamente 1 millón de intercambios costaría unos 185 USD, frente a unos 5 420 USD con un modelo de IA más barato que revisara cada paso y 200 000 USD con uno de gama alta.

    Estado: Atribuida a una sola fuente · Requiere atribución

  • Los monitores utilizan pequeños detectores llamados probes que leen activaciones internas en cada paso del trabajo de un agente.

    Estado: Atribuida a una sola fuente · Requiere atribución

  • Según Goodfire, en las pruebas sobre el modelo Kimi K3, las probes detectaron el 93 % de las sesiones maliciosas de hacking.

    Estado: Atribuida a una sola fuente · Requiere atribución

Transparencia — Goodfire publica monitores inside-out para IA que prometen detección eficaz a menor coste · El Forum