15 Июля 2026 Среда

Исследование: врачи и ИИ по-разному оценили языковые модели в реальных клинических случаях
Дарья Березина
Мединдустрия Искусственный интеллект
7 июля 2026, 16:30

Фото: magnific.com / автор: freepik
1041

Ученые из Китайского университета Гонконга, Имперского и Университетского колледжей Лондона, Пекинской больницы дружбы при Столичном медицинском университете и ряда других научных центров пришли к выводу, что автоматизированная оценка больших языковых моделей (LLM) в контексте клинических случаев пока не может заменить врачебную экспертизу. Несмотря на высокий уровень совпадения с мнением специалистов, алгоритмы не воспроизводят особенности клинического суждения. Работа опубликована в журнале Digital Medicine.

В исследовании принял участие 421 врач семи медицинских специальностей. Их оценки ответов LLM сравнили с результатами такого же числа ИИ-агентов, настроенных на аналогичные профили, что позволило оценить, насколько автоматизированная экспертиза соответствует мнению практикующих врачей.

В отличие от большинства предыдущих исследований, где модели тестировались на вопросах с готовыми вариантами ответов или в искусственно созданных клинических сценариях, ученые использовали семь реальных обезличенных клинических случаев. Врачи и ИИ оценивали ответы пяти популярных языковых моделей – GPT-4o и OpenAI o1 от OpenAI, DeepSeek-R1 от DeepSeek, Qwen-Max от Alibaba Cloud и Claude 3.5 от Anthropic – по шести критериям, включая точность, полноту, логичность, полезность, безопасность и структуру ответа.

Результаты показали, что оценки врачей существенно различались в зависимости от клинического опыта и условий работы. Молодые и опытные специалисты по-разному ранжировали одни и те же модели, а предпочтения также менялись между врачами из разных регионов. При этом совпадение ранжирования между группами врачей с разным стажем составило лишь 3,3%, тогда как у ИИ-агентов этот показатель достигал 76,7% независимо от смоделированного уровня опыта. Это свидетельствует о том, что клиническая экспертиза не является однородной, а качество медицинских ИИ-систем нельзя объективно оценить, опираясь на мнение ограниченной группы экспертов.

ИИ-агенты продемонстрировали высокую согласованность с общими тенденциями человеческих оценок, однако систематически расходились с врачами при выборе лучших моделей. Так, нейросети практически во всех категориях отдавали предпочтение OpenAI o1, тогда как врачи чаще ставили выше GPT-4o и DeepSeek-R1.

По мнению авторов исследования, это показывает, что ИИ способен уловить общее распределение качества между моделями, но не воспроизводит более тонкие различия в клиническом суждении – например, связанные с опытом врача, практической средой и оценкой безопасности ответа в конкретном клиническом контексте. Вместе с тем такие агенты могут использоваться для предварительного отбора или первичного анализа результатов, снижая нагрузку на экспертов.

Этот вывод соответствует общей тенденции внедрения ИИ в здравоохранение. Так, весной 2026 года российский медицинский ИИ-сервис IQDOC сообщил, что врачи все активнее используют такие системы для интерпретации лабораторных исследований, диагностики, выбора тактики ведения пациентов и лекарственной терапии. По оценке аналитиков, ИИ постепенно становится «вторым мнением» и рабочим инструментом врача, помогая быстрее находить клинические рекомендации и разбирать сложные случаи. Однако окончательное клиническое решение и ответственность по-прежнему остаются за специалистом.

Подписывайтесь на наши каналы: в MAX – Vademecum и Vademecum Live, в Telegram – Vademecum и Vademecum Live.

Источник: Digital Medicine

Картина дня: дайджест главных новостей от 14 июля 2026 года

Британский NICE сократит финансирование закупок онкопрепарата Лумикрас от Amgen

Исследование: снижение риска ССЗ зависит от дозировки семаглутида, а не от потерянной массы тела

Системы 72% фармкомпаний не готовы к внедрению ИИ

Исследование выявило почти десятикратное различие риска рака легких между системами нагревания табака и обычными сигаретами

Разработаны правила предоставления допсредств терфондам Белгородской, Брянской и Курской областей

Регуляторы утвердили методологию формирования статистики о числе заболеваний в поликлиниках

Апелляционный суд США восстановил более 500 исков о связи Тайленола с аутизмом

Госдума рассмотрит пакет поправок в № 44-ФЗ

Astellas зарегистрировала в РФ первый препарат от рака желудка с золбетуксимабом