
Evaluación de 17 modelos y más de 10.000 preguntas financieras
El estudio de Saturn analizó 17 modelos actuales y uno retirado, a través de más de 10.000 preguntas financieras. Su foco fue medir la precisión en distintos temas, con especial énfasis en áreas complejas como deuda, hipotecas, pensiones y fiscalidad.
Los resultados mostraron que el 57 % de las respuestas fueron erróneas, confirmando una brecha significativa en la precisión de los chatbots para temas financieros.
Esta evaluación es una de las más extensas hasta la fecha y destaca que incluso los modelos más avanzados fallan consistentemente en problemas financieros complejos.
Ver los datos en tabla
| Concepto | % |
|---|---|
| tasa global de error en respuestas financieras | 57 |
| errores en preguntas complejas de deuda, hipotecas, pensiones y fiscalidad | 88 |
| tasa de error de Claude Opus 5 (reasoning) | 39 |
Fuente: Radar de temas de El Forum
Diferencias claras entre modelos de pago y gratuitos
Los datos revelaron una diferencia sustancial en la precisión según el modelo: los gratuitos cometieron un 63 % de errores, mientras que los de pago bajaron esa tasa al 49 %.
Esto indica que la inversión y desarrollo detrás de los modelos de pago aporta mejoras notables en precisión, aunque no elimina el problema.
Sin embargo, el margen sigue siendo alto y pone en cuestión la idoneidad de los chatbots para tareas críticas sin supervisión humana.
Claude Opus 5 destaca con menor tasa de error
El chatbot Claude Opus 5 (reasoning) obtuvo el mejor resultado con un 39 % de error, muy por debajo de la media general del 57 %.
Le siguen otros modelos como Claude Haiku 4.5 y Gemini 3.1 Pro con mayores tasas de error (82 % y 73 %, respectivamente).
Esta diferencia señala que, entre los líderes, el rendimiento puede variar mucho y que la elección del modelo es clave para minimizar riesgos.
Implicaciones para el uso financiero de la IA
Los resultados sugieren que la integración de IA en servicios financieros exige evaluaciones rigurosas y controles independientes para evitar riesgos por desinformación.
El alto porcentaje de errores en preguntas complejas socava la confianza en su uso autónomo para asesoramientos o decisiones críticas.
La comunidad debería impulsar estándares y benchmarks más estrictos que permitan validar la precisión real antes de despliegues masivos.