Transparencia
Estudio de Saturn revela que chatbots de IA fallan el 57 % en respuestas financieras
Afirmaciones verificadas
Claude Haiku 4.5, Gemini 3.1 Pro, Grok 4.5 y ChatGPT 5.6 Luna presentaron tasas de errores del 82 %, 73 %, 59 % y 58 % respectivamente.
Estado: Atribuida a una sola fuente · Requiere atribución
Claude Opus 5 (reasoning) obtuvo el mejor rendimiento con 39 % de errores.
Estado: Atribuida a una sola fuente · Requiere atribución
El 43 % de las respuestas fueron correctas.
Estado: Atribuida a una sola fuente · Requiere atribución
El 88 % de los errores se observaron en preguntas complejas de deuda, hipotecas, pensiones y fiscalidad.
Estado: Atribuida a una sola fuente · Requiere atribución
Los chatbots de IA fallaron el 57 % de las preguntas financieras evaluadas, según estudio de Saturn.
Estado: Atribuida a una sola fuente · Requiere atribución
Los modelos gratuitos presentaron un 63 % de errores frente a 49 % en los de pago.
Estado: Atribuida a una sola fuente · Requiere atribución
Más de 10 000 preguntas fueron evaluadas en total.
Estado: Atribuida a una sola fuente · Requiere atribución
Se evaluaron 17 modelos actuales y 1 modelo retirado.
Estado: Atribuida a una sola fuente · Requiere atribución