← Volver al artículo

Transparencia

Estudio de Saturn revela que chatbots de IA fallan el 57 % en respuestas financieras

Afirmaciones verificadas

  • Claude Haiku 4.5, Gemini 3.1 Pro, Grok 4.5 y ChatGPT 5.6 Luna presentaron tasas de errores del 82 %, 73 %, 59 % y 58 % respectivamente.

    Estado: Atribuida a una sola fuente · Requiere atribución

  • Claude Opus 5 (reasoning) obtuvo el mejor rendimiento con 39 % de errores.

    Estado: Atribuida a una sola fuente · Requiere atribución

  • El 43 % de las respuestas fueron correctas.

    Estado: Atribuida a una sola fuente · Requiere atribución

  • El 88 % de los errores se observaron en preguntas complejas de deuda, hipotecas, pensiones y fiscalidad.

    Estado: Atribuida a una sola fuente · Requiere atribución

  • Los chatbots de IA fallaron el 57 % de las preguntas financieras evaluadas, según estudio de Saturn.

    Estado: Atribuida a una sola fuente · Requiere atribución

  • Los modelos gratuitos presentaron un 63 % de errores frente a 49 % en los de pago.

    Estado: Atribuida a una sola fuente · Requiere atribución

  • Más de 10 000 preguntas fueron evaluadas en total.

    Estado: Atribuida a una sola fuente · Requiere atribución

  • Se evaluaron 17 modelos actuales y 1 modelo retirado.

    Estado: Atribuida a una sola fuente · Requiere atribución

Transparencia — Estudio de Saturn revela que chatbots de IA fallan el 57 % en respuestas financieras · El Forum