La doctoranda Marta Arbizu Gómez analiza la evidencia científica actual sobre las limitaciones de los modelos de lenguaje en el razonamiento clínico y su impacto en la práctica clínica diaria.
Un estudio publicado en JAMA Network Open revela que los modelos de lenguaje (LLM) superan el 80 % de error en el diagnóstico diferencial, a pesar de su precisión final. En evaluación neuropsicológica y neurorrehabilitación, estos datos demuestran que la IA no sustituye el razonamiento clínico humano, debiendo emplearse solo como herramienta complementaria bajo supervisión profesional.
¿Por qué es importante evaluar el razonamiento clínico de la inteligencia artificial?
Los modelos de lenguaje de gran tamaño, conocidos como LLMs, están ganando cada vez más protagonismo en el ámbito sanitario. Se utilizan o se están explorando para resumir historias clínicas, apoyar la toma de decisiones, responder preguntas médicas, generar informes o ayudar en tareas de documentación clínica.
Sin embargo, una cosa es responder correctamente a una pregunta médica aislada y otra muy distinta es reproducir el razonamiento clínico completo que realiza un profesional sanitario ante un paciente real. En la práctica clínica, el diagnóstico no suele surgir de una única respuesta, sino de un proceso progresivo: se recoge información, se plantean hipótesis, se solicitan pruebas, se descartan posibilidades y se decide un plan de manejo.
Hasta ahora, muchas evaluaciones de inteligencia artificial en medicina se han basado en exámenes tipo test, como pruebas de licencia médica o preguntas de opción múltiple. Aunque estos formatos son útiles para medir conocimiento, no capturan del todo la complejidad del razonamiento clínico, especialmente cuando hay incertidumbre.
El estudio publicado en JAMA Network Open aborda precisamente esta cuestión: ¿pueden los LLMs actuales razonar de forma fiable a lo largo de todo el flujo clínico?
¿Cómo se llevó a cabo la investigación sobre los LLMs en medicina?
Los autores evaluaron el rendimiento de 21 modelos de lenguaje de última generación utilizando 29 viñetas clínicas estandarizadas procedentes del MSD Manual. Estas viñetas simulan casos clínicos paso a paso, desde la presentación inicial del paciente hasta el diagnóstico y el manejo.
Los modelos evaluados incluyeron sistemas de diferentes familias, como GPT, Claude, Gemini, DeepSeek y Grok. Entre ellos se encontraban modelos recientes y optimizados para razonamiento, como GPT-5, Claude 4.5 Opus, Gemini 3.0 Pro o Grok 4.
Cada modelo debía responder a preguntas organizadas en cinco dominios del razonamiento clínico:
- Diagnóstico diferencial;
- pruebas diagnósticas;
- diagnóstico final;
- manejo o tratamiento;
- y preguntas clínicas adicionales.
Para evaluar el rendimiento, los investigadores no se limitaron a calcular la precisión global. Introdujeron una nueva métrica llamada PrIME-LLM, que resume el rendimiento equilibrado del modelo en cinco áreas del razonamiento clínico. Esta métrica se representa mediante gráficos tipo radar: cuanto más amplia y equilibrada es el área del gráfico, mejor es el rendimiento del modelo a lo largo de todo el proceso clínico.

¿Qué revelan los resultados clave sobre los LLMs en diagnósticos?
Los resultados muestran un patrón muy claro: los LLMs actuales pueden alcanzar buenos resultados cuando se les pide identificar el diagnóstico final, pero tienen muchas más dificultades cuando deben generar un diagnóstico diferencial.
Este punto es especialmente relevante, porque el diagnóstico diferencial es una parte central del razonamiento médico. Consiste en considerar distintas posibilidades diagnósticas, mantener la incertidumbre y evitar cerrar el caso demasiado pronto. Según los autores, los modelos tienden a converger de forma prematura hacia una única respuesta, en lugar de razonar de manera más flexible como haría un clínico.
Los modelos optimizados para razonamiento obtuvieron mejores resultados que los no optimizados, pero esta mejora no eliminó las limitaciones principales. Incluso los modelos más avanzados siguieron mostrando fallos importantes en las primeras fases del razonamiento clínico.
En conjunto, los mejores resultados en PrIME-LLM los obtuvieron modelos como Grok 4, GPT-5, GPT-4.5, Claude 4.5 Opus, Gemini 3.0 Flash y Gemini 3.0 Pro. Sin embargo, el estudio advierte que una alta precisión global puede ocultar debilidades importantes si el modelo no rinde bien de forma equilibrada en todas las tareas.
| Métrica o resultado | Hallazgo principal |
|---|---|
| Modelos evaluados | 21 LLMs |
| Casos clínicos utilizados | 29 viñetas clínicas |
| Total de respuestas analizadas | 16.254 |
| Mejor rendimiento general | Modelos recientes y optimizados para razonamiento |
| Área más fuerte | Diagnóstico final |
| Área más débil | Diagnóstico diferencial |
| Tasa de fallo en diagnóstico diferencial | Superior a 0,80 en todos los modelos |
| Utilidad de PrIME-LLM | Detecta desequilibrios que la precisión global puede ocultar |
| Conclusión clínica | Los LLMs no son seguros para uso autónomo sin supervisión |
¿Qué implicaciones tiene para la práctica clínica?
Este estudio plantea una advertencia importante: no basta con que un modelo acierte diagnósticos finales para considerarlo seguro en medicina.
En la práctica clínica, uno de los mayores riesgos es que una herramienta genere una respuesta aparentemente correcta, pero sin haber considerado adecuadamente otras posibilidades. Esto puede generar una falsa sensación de seguridad, especialmente en contextos de alta incertidumbre.
Los resultados sugieren que los LLMs pueden tener utilidad en tareas clínicas concretas, especialmente cuando están bien delimitadas y supervisadas por profesionales. Por ejemplo, podrían ayudar a resumir información, estructurar datos, apoyar la revisión de documentación o servir como herramienta complementaria en entornos de baja incertidumbre.
Sin embargo, los autores son claros: los modelos actuales no deberían utilizarse como agentes diagnósticos autónomos ni en contextos patient-facing sin supervisión clínica. Su rendimiento todavía no reproduce la complejidad del razonamiento médico humano, especialmente en las fases iniciales del diagnóstico.
¿Cómo se relaciona este avance con NeuronUP?
En NeuronUP trabajamos con herramientas digitales orientadas a la rehabilitación y estimulación cognitiva basadas en evidencia. En este contexto, estudios como este son especialmente relevantes porque ayudan a definir el papel realista de la inteligencia artificial en salud.
La IA puede aportar valor cuando se integra de forma responsable, transparente y supervisada. Por ejemplo, puede contribuir a:
- Apoyar la organización de información clínica y funcional.
- Facilitar el seguimiento estructurado de pacientes.
- Ayudar a personalizar intervenciones cognitivas a partir de datos objetivos.
- Complementar, pero no sustituir, el criterio de los profesionales.
Este artículo refuerza una idea clave: la tecnología sanitaria debe evaluarse no solo por su capacidad de dar respuestas correctas, sino por su seguridad, fiabilidad y utilidad dentro del proceso clínico completo.
En el caso de la neurorrehabilitación, esto implica avanzar hacia modelos donde la inteligencia artificial pueda apoyar la toma de decisiones, pero siempre integrada en equipos profesionales y con criterios clínicos claros.
Prueba NeuronUP 7 días gratis
Podrás evaluar con nuestras baterías y test, trabajar con cientos de actividades, diseñar sesiones o rehabilitar a distancia.
Conclusión
El estudio muestra que los modelos de lenguaje han avanzado de forma notable y pueden obtener buenos resultados en tareas médicas concretas. Sin embargo, siguen presentando limitaciones importantes en el razonamiento clínico longitudinal, especialmente en la generación de diagnósticos diferenciales y en el manejo de la incertidumbre.
La nueva métrica PrIME-LLM permite evaluar estos modelos de una forma más completa que la precisión global, ya que identifica desequilibrios entre distintas fases del proceso clínico.
En definitiva, los LLMs pueden ser herramientas prometedoras para apoyar determinados procesos sanitarios, pero todavía no están preparados para sustituir el razonamiento clínico humano ni para tomar decisiones diagnósticas de forma autónoma.
Bibliografía
- Rao AS, Esmail KP, Lee RS, Jiang S, Arraiza Carlo B, Gill J, Khanna P, Kalmowitz E, Montagnese B, Heydari K, Jiao Q, Bott E, Nguyen D, Wang G, Hood M, Landman AB, Succi MD. Large Language Model Performance and Clinical Reasoning Tasks. JAMA Network Open. 2026;9(4):e264003. doi:10.1001/jamanetworkopen.2026.4003.
Preguntas frecuentes sobre los LLMs en medicina
1. ¿Pueden los modelos de lenguaje (LLM) realizar diagnósticos clínicos de forma autónoma?
No. Los modelos evaluados presentan una tasa de fallo superior al 80 % en la generación de diagnósticos diferenciales y muestran una tendencia a converger de forma prematura hacia una sola opción. Por ello, no son seguros para operar de manera autónoma sin la supervisión directa de un profesional sanitario.
2. ¿Qué es la métrica PrIME-LLM y por qué es importante?
Es una métrica diseñada para evaluar el rendimiento equilibrado de los modelos en cinco dominios del proceso clínico: diagnóstico diferencial, pruebas, diagnóstico final, tratamiento y preguntas adicionales. Su importancia radica en que detecta debilidades y desequilibrios en el razonamiento que las métricas tradicionales de precisión global suelen ocultar.
3. ¿Cuáles son los principales límites de la inteligencia artificial en el flujo clínico?
Aunque las familias de modelos avanzados (como GPT, Claude, Gemini, Grok o DeepSeek) destacan al identificar el diagnóstico final, sufren un severo retroceso en las fases iniciales. Su mayor limitación es la incapacidad para gestionar la incertidumbre diagnóstica y barajar distintas hipótesis antes de cerrar un caso.
4. ¿Qué implicaciones tienen estos hallazgos para la evaluación y rehabilitación cognitiva?
El estudio demuestra que la IA no debe sustituir el juicio profesional en la valoración neuropsicológica. Sin embargo, la tecnología sigue siendo un excelente recurso complementario para organizar información clínica, personalizar intervenciones cognitivas y optimizar la documentación del paciente bajo el criterio del especialista.







Guía para profesionales: cómo abordar la dislexia en niños con TDAH desde la neuropsicología basada en evidencia



Deja una respuesta