¿Por qué la IA inventa respuestas? Lo que dicen Stanford y el AI Index
Los mejores modelos inventan entre 1.8% y 5.4% al resumir un documento, y hasta 94% en preguntas abiertas. Por qué pasa y qué significa cuando la pregunta es sobre un seguro.
Los asistentes de inteligencia artificial escriben con tanta seguridad que es fácil olvidar que a veces inventan. En la industria se le llama «alucinación»: una respuesta que suena bien, pero no es cierta. Cuando la pregunta es si una cirugía está cubierta, ese error tiene precio.
Qué tan seguido inventan
Depende mucho de qué se les pida. El AI Index 2026 de Stanford reúne dos mediciones que muestran la diferencia[1]:
La lección es clara: con el documento en la mano, el error baja mucho. De memoria, se dispara.
Ni siquiera con herramientas especializadas
Un estudio de Stanford evaluó herramientas de investigación legal con IA, hechas justamente para trabajar con documentos. Aun así, inventaron entre 17% y 33% de las veces[2]. En salud, un estudio publicado en BMJ Open encontró que cerca de la mitad de las respuestas de cinco chatbots populares fueron problemáticas, y casi 20% muy problemáticas[3].
Por qué pasa
Un modelo de lenguaje no consulta una base de datos: predice la siguiente palabra más probable. Investigadores de OpenAI explican que la forma en que se entrenan y se evalúan estos modelos premia adivinar sobre reconocer que no saben[4]. Un «no sé» no suma puntos en las pruebas; una respuesta inventada a veces sí.
Las empresas lo saben. En la encuesta de McKinsey que recoge el AI Index, la inexactitud es el riesgo de IA que más empresas consideran relevante: 74%[1].
Qué significa para un seguro
Una póliza de gastos médicos está hecha de excepciones: periodos de espera, exclusiones, endosos que cambian la regla general, planes distintos para personas distintas. Un asistente genérico que responde de memoria puede inventar un deducible, dar por cubierto lo que un endoso excluye o mezclar las reglas de dos planes.
Por eso, una IA que responda sobre seguros debería:
- Responder solo con la póliza de quien pregunta, su plan y sus endosos, no con lo que «suele» cubrir un seguro.
- Citar la cláusula de donde sale cada respuesta, para que la persona pueda verificarla.
- Decir «no lo sé» cuando la póliza no lo sostiene, y pasar el caso a una persona.
- Medirse con pruebas propias, versionadas y repetibles, en lugar de confiar en lo que promete el proveedor del modelo.
Así trabajamos en Aura: cada respuesta sale de la póliza de la persona y cita su cláusula; si la póliza no lo sostiene, Aura lo dice y escala. Y lo medimos: en Aura Eval 1.0, 94.7% de respuestas correctas en 322 escenarios de comportamiento.
Fuentes
- Stanford HAI, AI Index Report 2026: alucinación al resumir documentos (Fig. 3.2.5, con datos de Vectara) y en preguntas abiertas (Fig. 3.2.6, con datos de Artificial Analysis), p. 136; riesgos de IA más citados por las empresas (Fig. 3.3.5, encuesta de McKinsey 2025), pp. 141-142.
- Magesh et al. (Stanford RegLab y HAI), «Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools», Journal of Empirical Legal Studies, 2025.
- Estudio en BMJ Open (2026) sobre respuestas de salud de cinco chatbots, resumido por uno de sus autores en The Conversation. 250 preguntas diseñadas para provocar respuestas engañosas.
- Kalai et al. (OpenAI), «Why Language Models Hallucinate», 2025.
Este artículo es informativo. En cualquier caso particular, lo que dicen tu póliza y tu aseguradora es lo que aplica.