Transparencia
Vercel lanza DeepsecBench para medir eficacia de IA en detectar vulnerabilidades de seguridad
Afirmaciones verificadas
Claude Opus 5 obtiene un Score de 28.36, con un coste de $31.96 y un tiempo total de 00:47:01 en DeepsecBench.
Estado: Verificada (fuente primaria)
DeepsecBench selecciona 50 archivos de entrada como base para la evaluación.
Estado: Verificada (fuente primaria)
El benchmark se ejecuta sobre una base de código de código abierto en un estado de commit anterior a la corrección de un gran número de vulnerabilidades.
Estado: Verificada (fuente primaria)
El benchmark se ejecuta tres veces y se publica la mediana de esas corridas.
Estado: Verificada (fuente primaria)
El benchmark utiliza un 'golden set' de 231 hallazgos validados por humanos.
Estado: Verificada (fuente primaria)
El lanzamiento se enmarca en el ecosistema de Vercel AI Gateway.
Estado: Declarada por la fuente · Requiere atribución
GPT-5.6 Sol alcanza un recall de 30.7% y una precisión de 96.3%, encontrando 71 de los 231 hallazgos del golden set.
Estado: Verificada (fuente primaria)
GPT-5.6 Sol obtiene un Score de 35.58, con un coste de $55.98 y un tiempo total de 03:39:00 en DeepsecBench.
Estado: Verificada (fuente primaria)
La puntuación se calcula con la fórmula Score = 100 × 5PR/(4P+R), un F2 ponderado que da doble peso al recall frente a la precisión.
Estado: Verificada (fuente primaria)
Los hallazgos fuera del golden set se clasifican mediante un modelo juez como reales o falsos, afectando la métrica de precisión.
Estado: Verificada (fuente primaria)
Vercel estima que aplicar el escaneo a una base de código de producción requeriría alrededor de 100 veces el tamaño de los 50 archivos evaluados en el benchmark.
Estado: Declarada por la fuente · Requiere atribución
Vercel proyecta que un full pass de escaneo en producción costaría aproximadamente $1,200 usando Kimi K3, o más de $5,000 con el modelo frontier con mejor puntuación de OpenAI.
Estado: Declarada por la fuente · Requiere atribución