Исследователи из Лидсского университета (Великобритания) и Университета медицинских наук Кютахьи (Турция) Айлин Айдогду Делибай, Чимен Олджай Демир, Ниса Турутген, Хюмейра Килоатар и Симге Донмез проверили, насколько безопасно использовать современные генеративные языковые модели для составления программ реабилитации.
Команда отобрала 75 типичных вопросов о физических нагрузках при рассеянном склерозе — от борьбы со спастичностью мышц до подбора кардиотренировок — и направила их двум системам: ChatGPT-5.4 Thinking и Google Gemini 3 Flash.
Физическая активность при рассеянном склерозе служит обязательной частью терапии: правильно подобранные упражнения помогают сохранять подвижность суставов, снижают хроническую усталость и защищают нервную систему от быстрого прогрессирования нарушений. Из-за дефицита времени на очных приёмах у физических терапевтов пациенты всё чаще обращаются за инструкциями к нейросетям. Ошибка в таком запросе стоит дорого: чрезмерная интенсивность занятий или перегрев тела (симптом Утхоффа) могут спровоцировать временное обострение неврологических симптомов.
Разница в точности между моделями
Ответы оценивали практикующие специалисты по неврологической реабилитации по пятибалльной шкале медицинской точности и глобальной шкале качества информации (GQS). Доля ответов высокого качества у ChatGPT-5.4 Thinking составила 61,3% против 24% у Gemini 3 Flash. При этом 24% рекомендаций Gemini эксперты признали низкокачественными — в них встречались пропуски важных клинических деталей и путаные пояснения.
Наибольший разрыв зафиксирован в разделах, посвящённых планированию тренировочного плана и технике безопасности. ChatGPT показал статистически значимое преимущество при составлении графика занятий и расчёте пауз на отдых, набрав медианный балл точности 3,5–4 по сравнению с 3 баллами у Gemini.
Барьер восприятия текста
Главная проблема обеих систем обнаружилась при анализе читаемости по формуле Флеша (FRE), которая учитывает длину фраз и количество слогов в словах. Тексты для широкой аудитории и пациентов с хроническими диагнозами должны укладываться в диапазон от 80 до 90 баллов, что соответствует уровню понимания ученика шестого класса средней школы.
Средний балл ответов ChatGPT составил 41,70, а у Gemini — 38,21. Вместо коротких практических инструкций модели выдавали перегруженные академические конструкции с формулировками вроде «периферическая нейромышечная фасилитация» и сложными ссылками на механизмы утомления. Пациенту без специального образования приходится разбирать словесный массив уровня первых курсов профильного вуза, что повышает вероятность неправильного выполнения упражнений дома.
Методологические ограничения работы
В исследовании есть методические особенности, требующие осторожности при интерпретации выводов. Во-первых, каждый вопрос задавался каждой нейросети ровно один раз. Поскольку большие языковые модели выдают разные ответы в зависимости от случайного параметра генерации, устойчивость полученных данных при повторных диалогах осталась непроверенной.
Во-вторых, в эксперименте не было контрольной группы с эталонными письменными ответами живых врачей.
В-третьих, по шкале mDISCERN (инструмент проверки ссылок на авторитетные источники) согласованность оценок между самими проверяющими оказалась невысокой: коэффициент надежности составил 0,318 для ответов ChatGPT и 0,439 для Gemini. Это показывает, что даже профильные специалисты по-разному трактуют полноту ссылочной базы в ответах ИИ.