Скотт Уинтерс считал, что у него грипп. Вместо этого он едва не умер, доверившись чат-боту, который сказал ему обратное.
Бывший пастор из штата Флорида подал в суд на OpenAI и Сэма Альтмана в окружном суде округа Сан-Франциско. Его претензия заключается в том, что медицинский совет, данный ChatGPT, способствовал тромбоэмболии легочной артерии, которая едва не убила его.
Вот что произошло в 2025 году. Уинтерс пожаловался на головокружение. У него наблюдалась нестабильная артериальное давление. Он обратился к ChatGPT-4o.
ИИ не впал в панику. Он обесценил симптомы как незначительные. Бот посоветовал Уинтерсу оставаться в лежачем положении в кресле-качалке. ИИ рассчитал, что ему нужно пережить еще восемь–десять «эпизодов», прежде чем его состояние станет поводом для реальной тревоги.
Спустя недели тромб застрял в его легких. Один из врачей Уинтерса связал тромб с длительной неподвижностью, которую конкретно рекомендовал чат-бот.
В день, когда боль достигла пика, Уинтерс спросил, требует ли болезненность в паху вызова скорой помощи. Чат-бот не вызвал скорую. Он сослался на его веру. Сообщается, что бот сказал: «Бог не проектировал твое тело для бесконечного отказа».
Уинтерс едва не умер. OpenAI утверждает, что его инструменты не являются медицинскими устройствами и пользователи не должны полагаться на них для диагностики. Адвокаты Уинтерса не согласны. Они требуют финансовых компенсаций. Они также хотят приостановить работу сервиса ChatGPT Health. Они требуют независимой оценки безопасности.
Это не первый случай, когда ИИ обвиняют в медицинском кризисе.
В мае пара из Техаса подала в суд на OpenAI после передозировки их сына. Аргумент истцов: их сын искал информацию о наркотиках в ChatGPT и игнорировал меры безопасности, потому что бот предоставлял понятные ответы.
Эти судебные иски поднимают сложный вопрос. Какая ответственность лежит на компаниях-разработчиках ИИ, когда пользователи ищут медицинскую или психологическую помощь в кризисной ситуации?
Что на самом деле говорит исследования об ИИ-диагностике
Дело Уинтерса кажется кошмаром. Но контролируемые исследования показывают, что картина более нюансированная. В жестких, сценаризированных условиях ИИ поразительно хорош в диагностике.
Исследование 2024 года в журнале JAMA Internal Medicine сравнило GPT-4 с врачами. Тест включал 20 клинических случаев, оцененных по клинической шкале причинности r-IDEA.
GPT-4 набрал идеальный балл 10 из 10. Опытные врачи (attendings) в среднем набрали 9. Врачи-ординаторы (residents) — в среднем 8.
Чат-бот оказался реже полностью неправ, чем врачи-ординаторы.
Дополнительное исследование в JAMA Network Open проверило пределы возможностей. Исследователи протестировали 50 врачей на пяти экстремально сложных случаях. ChatGPT, работая самостоятельно, достиг точности 90%. Врачи, работавшие без помощников, показали результат 74%. Врачи, использовавшие ChatGPT как инструмент, показали 76%.
ИИ-ассистент не помог значительно. Почему? Многие врачи игнорировали или сомневались в рекомендациях бота.
Крупные исследования подтверждают этот разрыв. Журнал Nature опубликовал работу 2025 года о модели Google AMIE. Она тестировала 302 сложных реальных случаев с участием 20 клиницистов. AMIE находила правильный диагноз в 59% случаев. Без помощи клиницисты показывали результат 34%. Врачи, использовавшие AMIE, превзошли тех, кто использовал стандартные поисковые системы.
Метаанализ 50 исследований в журнале npj Digital Medicine пришел к выводу, что ИИ в целом показывает результаты, сопоставимые с врачами, а иногда и лучшие, на стандартизированных задачах.
Но есть важное ограничение. Эти исследования используют письменные описания случаев. Структурированные запросы. Отборные случаи. Это не реальная жизнь.
Где ИИ-диагностика подводит реальных пользователей
Реальный совет выглядит иначе. Он включает недели несценаризированного общения. Он включает неполную информацию. Он не предполагает физического осмотра.
Исследования показывают, что ИИ испытывает трудности, когда исчезает сценарий.
Исследование в NEJM AI создало тестовую базу из 750 вопросов. Использовалось тестирование на согласованность сценариев, которое измеряет, как новая информация должна менять диагноз при неопределенности. В нем соревновались десять ведущих моделей ИИ и 1500 медицинских специалистов.
OpenAI’s o3, лидер по результатам, показал точность лишь 68%. Это ниже уровня старших ординаторов. Это иронично. Эти же модели блестяще сдают экзамены с множественным выбором для получения медицинской лицензии.
Высокие баллы на тестах не равны здравому клиническому суждению в messy (хаотичной) реальности больного тела.
Проблема усугубляется галлюцинациями.
Исследование в Communications Medicine предоставило шесть чат-ботов — включая GPT-4o и DeepSeek — клинические случаи, содержащие ложь. Выдуманные лабораторные тесты. Придуманные болезни.
При стандартных настройках модели принимали эту ложь в 50–83% случаев. Они уверенно описывали вымышленные болезни как факты. Простой запрос с предупреждением ИИ о том, что ввод может быть ложным, помог. Но не предотвратил ошибки.
Затем есть риск упущений.
Команда под руководством Стэнфорда оценила 20 моделей на 1100 случаях. Они искали не только диагностическую точность. Они оценивали потенциальный вред.
Прямое применение советов несло риск серьезного вреда или смерти в 24,6% случаев. Более 80% этих ошибок были связаны с упущениями. ИИ не отметил что-то опасное. Он промолчал.
Опыт Уинтерса зеркально отражает это молчание. Усиление успокоения вместо срочной referral (направленности) в клинику. Чат-бот, говорящий вам сидеть неподвижно, пока в ногах образуются тромбы.
Проблема внедрения, а не только проблемы модели
Опрос 2025 года от Sermo среди более чем 1000 врачей подтверждает опасения. 94% врачей обеспокоены тем, что пациенты используют ИИ для медицинских советов. Ошибочный диагноз и задержка лечения — главные страхи.
Исследования создают раздвоенную картину.
В узких, четко определенных задачах? ИИ сопоставим с врачами или превосходит их.
В открытых, высокоответственных человеческих взаимодействиях? Он терпит неудачу. Он галлюцинирует. Он упускает критические предупреждения.
Для медицинских систем и технологических компаний это не просто вопрос компетенции. Это ошибка проектирования. Одна и та же модель, которая сдала тестовый случай на отлично, может уверенно рассказывать о вымышленном смертельном приговоре или убеждать напуганного пользователя ждать слишком долго.
Диагностический потенциал ИИ реален. В некоторых структурированных метриках он превышает средний уровень врача.
Но то, выживет ли это обещание при контакте с человеческим поведением, неизвестно. Люди взаимодействуют с ИИ не как участники стандартизированных тестов. Они вводят симптомы в 3 часа ночи, страдая от боли. Они хотят утешения. Они уязвимы.
Суды, больницы и исследователи еще многому должны научиться. Следующая волна дел решит, сузится ли этот разрыв или расширится до пропасти.



















