Beyond Body Health

Как выбирать безопасную медицину и надежных врачей

Новость

Аналитики: язык обращения к ИИ может влиять на качество медицинских ответов

По данным Vademecum, исследование показало: язык, на котором формулируется запрос к ИИ-модели, существенно влияет на точность медицинских ответов.

Аналитики: язык обращения к ИИ может влиять на качество медицинских ответов

Результаты указывают на системный дисбаланс в обучающих данных, который создаёт прямые риски для неанглоязычных пользователей.

Языковое неравенство в цифрах

Исследователи проанализировали 442 вопроса из MedQA — набора заданий медицинских лицензионных экзаменов. Вопросы на английском и китайском были переведены на арабский, бенгальский, хинди и португальский, после чего протестированы на четырёх моделях: DeepSeek Chat, Gemini 2.5 Flash, GPT-3.5 Turbo и GPT-4o.

Снижение точности относительно английских ответов: португальский — на 0,73%, хинди — на 4,64%, бенгальский — на 7,24%, арабский — на 10,29%.

Причина — дефицит данных. В медицинском корпусе MMedC объёмом 25,5 млрд токенов 41,4% приходится на английский. Арабский, хинди, бенгальский и португальский в нём отсутствуют. Авторы констатируют, что хорошая способность LLM к переводу не компенсирует нехватку обучающих данных на конкретных языках.

Последствия для пациента на русском языке

Русский не входит в число приоритетных языков крупных разработчиков ИИ. В корпусе ROOTS он не упоминается в числе лидеров. Это означает: даже при корректном запросе модель может пропустить клинически значимые детали или предложить вариант, не соответствующий локальным протоколам.

Исследователи подчёркивают: в здравоохранении значение имеет не только язык, но и страна проживания. Клинические рекомендации и распространённость заболеваний различаются по регионам, поэтому одинаковые ответы модели не всегда подходят пользователям из разных стран.

Это не единичные ошибки, а системный дефицит. Риск неравного доступа к надёжной медицинской информации в зависимости от языка назван авторами как самостоятельная проблема, требующая отдельных критериев оценки медицинских ИИ-систем.

Что отслеживать

Авторы предлагают учитывать местные медицинские стандарты с помощью RAG-систем, подключённых к актуальным региональным клиническим рекомендациям, а также создать международную базу клинических рекомендаций и расширить многоязычные размеченные наборы данных.

Для пациента принципиально следующее:

  • Если ответ ИИ не содержит упоминания российских клинических рекомендаций или не конкретизирует нозологию — это основание для перепроверки через профильного специалиста.
  • Языковой дефицит данных — не ошибка пользователя. Искажённый или неполный ответ может быть следствием не запроса, а структуры обучающего корпуса модели.
  • Ошибки автоматического перевода вопросов авторы называют одним из ограничений эксперимента — это дополнительно демонстрирует несовершенство многоязычной обработки даже на этапе входных данных.