← Volver al artículo

Transparencia

Vercel lanza DeepsecBench para medir eficacia de IA en detectar vulnerabilidades de seguridad

Afirmaciones verificadas

  • Claude Opus 5 obtiene un Score de 28.36, con un coste de $31.96 y un tiempo total de 00:47:01 en DeepsecBench.

    Estado: Verificada (fuente primaria)

  • DeepsecBench selecciona 50 archivos de entrada como base para la evaluación.

    Estado: Verificada (fuente primaria)

  • El benchmark se ejecuta sobre una base de código de código abierto en un estado de commit anterior a la corrección de un gran número de vulnerabilidades.

    Estado: Verificada (fuente primaria)

  • El benchmark se ejecuta tres veces y se publica la mediana de esas corridas.

    Estado: Verificada (fuente primaria)

  • El benchmark utiliza un 'golden set' de 231 hallazgos validados por humanos.

    Estado: Verificada (fuente primaria)

  • El lanzamiento se enmarca en el ecosistema de Vercel AI Gateway.

    Estado: Declarada por la fuente · Requiere atribución

  • GPT-5.6 Sol alcanza un recall de 30.7% y una precisión de 96.3%, encontrando 71 de los 231 hallazgos del golden set.

    Estado: Verificada (fuente primaria)

  • GPT-5.6 Sol obtiene un Score de 35.58, con un coste de $55.98 y un tiempo total de 03:39:00 en DeepsecBench.

    Estado: Verificada (fuente primaria)

  • La puntuación se calcula con la fórmula Score = 100 × 5PR/(4P+R), un F2 ponderado que da doble peso al recall frente a la precisión.

    Estado: Verificada (fuente primaria)

  • Los hallazgos fuera del golden set se clasifican mediante un modelo juez como reales o falsos, afectando la métrica de precisión.

    Estado: Verificada (fuente primaria)

  • Vercel estima que aplicar el escaneo a una base de código de producción requeriría alrededor de 100 veces el tamaño de los 50 archivos evaluados en el benchmark.

    Estado: Declarada por la fuente · Requiere atribución

  • Vercel proyecta que un full pass de escaneo en producción costaría aproximadamente $1,200 usando Kimi K3, o más de $5,000 con el modelo frontier con mejor puntuación de OpenAI.

    Estado: Declarada por la fuente · Requiere atribución