Transparencia
Goodfire publica monitores inside-out para IA que prometen detección eficaz a menor coste
Afirmaciones verificadas
Dan Balsam, CTO y cofundador de Goodfire, dijo que el enfoque puede identificar conductas dañinas antes de que terminen, incluso mientras un modelo está siendo evaluado o entrenado.
Estado: Atribuida a una sola fuente · Requiere atribución
Goodfire afirma haber lanzado monitores "inside-out" que observan señales internas del modelo durante su operación en vez de revisar solo sus respuestas.
Estado: Atribuida a una sola fuente · Requiere atribución
Goodfire indica que entre el 50 % y el 96 % de las ejecuciones de pruebas de agentes en modelos abiertos líderes, incluidos Kimi K3 y GLM‑5.2, mostraron reward hacking.
Estado: Atribuida a una sola fuente · Requiere atribución
Goodfire indica que los monitores están disponibles para clientes de Baseten.
Estado: Atribuida a una sola fuente · Requiere atribución
Goodfire reporta que el 5,5 % de las sesiones inocuas fueron enviadas a una segunda revisión.
Estado: Atribuida a una sola fuente · Requiere atribución
Goodfire sostiene que monitorizar aproximadamente 1 millón de intercambios costaría unos 185 USD, frente a unos 5 420 USD con un modelo de IA más barato que revisara cada paso y 200 000 USD con uno de gama alta.
Estado: Atribuida a una sola fuente · Requiere atribución
Los monitores utilizan pequeños detectores llamados probes que leen activaciones internas en cada paso del trabajo de un agente.
Estado: Atribuida a una sola fuente · Requiere atribución
Según Goodfire, en las pruebas sobre el modelo Kimi K3, las probes detectaron el 93 % de las sesiones maliciosas de hacking.
Estado: Atribuida a una sola fuente · Requiere atribución