Аспирантка Марта Арбису Гомес анализирует современные научные данные об ограничениях языковых моделей в клиническом рассуждении и их влиянии на повседневную клиническую практику.
Исследование, опубликованное в JAMA Network Open, показывает, что языковые модели (LLM) допускают более 80 % ошибок при проведении дифференциальной диагностики, несмотря на высокую итоговую точность. В нейропсихологической оценке и нейрореабилитации эти данные демонстрируют, что ИИ не заменяет человеческое клиническое мышление и должен использоваться только как вспомогательный инструмент под контролем специалиста.
Почему важно оценивать клиническое рассуждение искусственного интеллекта?
Большие языковые модели, известные как LLM, играют всё более заметную роль в сфере здравоохранения. Их используют или рассматривают для обобщения медицинских карт, поддержки принятия решений, ответов на медицинские вопросы, составления отчётов и помощи в ведении клинической документации.
Однако одно дело — правильно ответить на отдельный медицинский вопрос, и совсем другое — воспроизвести полный процесс клинического рассуждения, который специалист осуществляет при работе с реальным пациентом. В клинической практике диагноз обычно не является результатом одного ответа, а формируется постепенно: собирается информация, выдвигаются гипотезы, назначаются исследования, исключаются возможные варианты и определяется план ведения пациента.
До сих пор многие исследования искусственного интеллекта в медицине основывались на тестах, например экзаменах для получения медицинской лицензии или вопросах с вариантами ответа. Хотя такие форматы полезны для оценки знаний, они не отражают в полной мере сложность клинического рассуждения, особенно в условиях неопределённости.
Исследование, опубликованное в JAMA Network Open, посвящено именно этому вопросу: могут ли современные LLM надёжно рассуждать на протяжении всего клинического процесса?
Как проводилось исследование LLM в медицине?
Авторы оценили работу 21 современной языковой модели, используя 29 стандартизированных клинических виньеток из руководства MSD Manual. Эти виньетки имитируют клинические случаи шаг за шагом — от первичного обращения пациента до постановки диагноза и выбора тактики ведения.
В исследование вошли модели разных семейств, включая GPT, Claude, Gemini, DeepSeek и Grok. Среди них были новые модели, оптимизированные для рассуждения, такие как GPT-5, Claude 4.5 Opus, Gemini 3.0 Pro и Grok 4.
Каждая модель должна была ответить на вопросы, распределённые по пяти областям клинического рассуждения:
- Дифференциальная диагностика;
- диагностические исследования;
- итоговый диагноз;
- ведение или лечение;
- и дополнительные клинические вопросы.
Для оценки результатов исследователи не ограничились расчётом общей точности. Они ввели новую метрику под названием PrIME-LLM, которая отражает сбалансированность работы модели в пяти областях клинического рассуждения. Эта метрика представляется в виде радиальных диаграмм: чем шире и сбалансированнее область диаграммы, тем лучше модель работает на протяжении всего клинического процесса.

Что показывают основные результаты о LLM в диагностике?
Результаты демонстрируют ясную закономерность: современные LLM могут показывать хорошие результаты, когда от них требуется определить итоговый диагноз, но испытывают гораздо больше трудностей при составлении дифференциального диагноза.
Это особенно важно, поскольку дифференциальная диагностика является центральной частью медицинского рассуждения. Она предполагает рассмотрение различных диагностических возможностей, сохранение неопределённости и отказ от слишком раннего завершения поиска. По мнению авторов, модели склонны преждевременно сходиться к одному ответу вместо того, чтобы рассуждать более гибко, как это сделал бы клиницист.
Модели, оптимизированные для рассуждения, показали лучшие результаты, чем неоптимизированные, однако это улучшение не устранило основные ограничения. Даже наиболее продвинутые модели продолжали демонстрировать существенные ошибки на ранних этапах клинического рассуждения.
В целом лучшие результаты по PrIME-LLM показали такие модели, как Grok 4, GPT-5, GPT-4.5, Claude 4.5 Opus, Gemini 3.0 Flash и Gemini 3.0 Pro. Тем не менее исследование предупреждает, что высокая общая точность может скрывать важные слабые стороны, если модель не работает сбалансированно во всех задачах.
| Показатель или результат | Основной вывод |
|---|---|
| Оценённые модели | 21 LLM |
| Использованные клинические случаи | 29 клинических виньеток |
| Общее число проанализированных ответов | 16.254 |
| Лучшие общие результаты | Новые модели, оптимизированные для рассуждения |
| Наиболее сильная область | Итоговый диагноз |
| Наиболее слабая область | Дифференциальная диагностика |
| Доля ошибок при дифференциальной диагностике | Более 0,80 у всех моделей |
| Польза PrIME-LLM | Выявляет дисбаланс, который может скрываться за общей точностью |
| Клинический вывод | LLM небезопасны для автономного использования без контроля |
Каковы последствия для клинической практики?
Это исследование содержит важное предупреждение: одной способности модели правильно определять итоговый диагноз недостаточно, чтобы считать её безопасной в медицине.
В клинической практике один из наиболее серьёзных рисков заключается в том, что инструмент выдаёт внешне правильный ответ, не рассмотрев должным образом другие возможности. Это может создавать ложное ощущение безопасности, особенно в условиях высокой неопределённости.
Результаты показывают, что LLM могут быть полезны для конкретных клинических задач, особенно если эти задачи чётко определены и выполняются под контролем специалистов. Например, они могут помогать обобщать информацию, структурировать данные, поддерживать проверку документации или служить вспомогательным инструментом в условиях низкой неопределённости.
Авторы формулируют вывод однозначно: современные модели не следует использовать в качестве автономных диагностических агентов или в контекстах непосредственного взаимодействия с пациентом без клинического контроля. Их работа пока не воспроизводит сложность человеческого медицинского рассуждения, особенно на начальных этапах диагностики.
Как это достижение связано с NeuronUP?
В NeuronUP мы работаем с цифровыми инструментами для реабилитации и когнитивной стимуляции, основанными на доказательных данных. В этом контексте подобные исследования особенно важны, поскольку помогают определить реалистичную роль искусственного интеллекта в здравоохранении.
ИИ может приносить пользу, если интегрировать его ответственно, прозрачно и под контролем специалистов. Например, он может способствовать:
- Поддержке организации клинической и функциональной информации.
- Упрощению структурированного наблюдения за пациентами.
- Помощи в персонализации когнитивных вмешательств на основе объективных данных.
- Дополнению, но не замене, профессионального суждения специалистов.
Эта статья подтверждает ключевую идею: медицинские технологии следует оценивать не только по способности давать правильные ответы, но и по их безопасности, надёжности и пользе в рамках всего клинического процесса.
В нейрореабилитации это означает движение к моделям, в которых искусственный интеллект может поддерживать принятие решений, но всегда интегрирован в работу профессиональной команды и используется при наличии чётких клинических критериев.
Заключение
Исследование показывает, что языковые модели значительно продвинулись и могут хорошо справляться с отдельными медицинскими задачами. Однако они по-прежнему имеют существенные ограничения в продольном клиническом рассуждении, особенно при составлении дифференциальных диагнозов и работе с неопределённостью.
Новая метрика PrIME-LLM позволяет оценивать эти модели более полно, чем общая точность, поскольку выявляет дисбаланс между различными этапами клинического процесса.
Таким образом, LLM могут стать перспективными инструментами поддержки отдельных процессов в здравоохранении, однако пока они не готовы заменить человеческое клиническое рассуждение или автономно принимать диагностические решения.
Библиография
- Rao AS, Esmail KP, Lee RS, Jiang S, Arraiza Carlo B, Gill J, Khanna P, Kalmowitz E, Montagnese B, Heydari K, Jiao Q, Bott E, Nguyen D, Wang G, Hood M, Landman AB, Succi MD. Large Language Model Performance and Clinical Reasoning Tasks. JAMA Network Open. 2026;9(4):e264003. doi:10.1001/jamanetworkopen.2026.4003.
Часто задаваемые вопросы о LLM в медицине
1. Могут ли языковые модели (LLM) самостоятельно ставить клинические диагнозы?
Нет. У исследованных моделей доля ошибок при составлении дифференциальных диагнозов превышает 80 %, и они демонстрируют тенденцию преждевременно сходиться к одному варианту. Поэтому они небезопасны для автономной работы без непосредственного контроля медицинского специалиста.
2. Что такое метрика PrIME-LLM и почему она важна?
Это метрика, предназначенная для оценки сбалансированности работы моделей в пяти областях клинического процесса: дифференциальной диагностике, исследованиях, итоговом диагнозе, лечении и дополнительных вопросах. Её значение заключается в том, что она выявляет слабые стороны и дисбаланс рассуждения, которые традиционные показатели общей точности часто скрывают.
3. Каковы основные ограничения искусственного интеллекта в клиническом процессе?
Хотя семейства продвинутых моделей, такие как GPT, Claude, Gemini, Grok и DeepSeek, хорошо справляются с определением итогового диагноза, на начальных этапах их результаты резко ухудшаются. Их главное ограничение — неспособность работать с диагностической неопределённостью и рассматривать различные гипотезы до завершения анализа случая.
4. Как эти результаты влияют на когнитивную оценку и реабилитацию?
Исследование показывает, что ИИ не должен заменять профессиональное суждение при нейропсихологической оценке. Однако технология остаётся отличным вспомогательным ресурсом для организации клинической информации, персонализации когнитивных вмешательств и оптимизации документации пациента под контролем специалиста.






Руководство для специалистов: как подходить к дислексии у детей с СДВГ на основе доказательной нейропсихологии
Добавить комментарий