Перейти к содержимому
Digital Businessby · Беларусь
НБ РБUSD2.948EUR3.401RUB0.0362PLN0.7909CNY0.4395Конвертер →
IT и стартапы

Исследование Гарварда: ИИ от OpenAI точнее врачей ставит диагнозы в скорой

Модель o1 правильно определила диагноз в 67% случаев при первичном триаже — против 50–55% у врачей-терапевтов, участвовавших в эксперименте.

Казакевич Алексей
5 мин
Обновлено 13 мая
Исследование Гарварда: ИИ от OpenAI точнее врачей ставит диагнозы в скорой
Содержание
  1. Как проводился эксперимент
  2. Почему результаты не стоит переоценивать
  3. Что это означает для медицины и технологий

Исследование, опубликованное в журнале Science, показало: языковая модель OpenAI o1 превзошла двух практикующих врачей по точности диагностики на реальных случаях из приёмного отделения. Работу провела совместная команда врачей и специалистов по компьютерным наукам из Гарвардской медицинской школы и медицинского центра Beth Israel Deaconess.

Результат вызвал волну публикаций в мировых СМИ — и одновременно острую критику со стороны практикующих врачей скорой помощи.

Как проводился эксперимент

Исследователи взяли 76 реальных случаев из приёмного отделения Beth Israel и предложили двум врачам-терапевтам поставить диагнозы. Те же данные — без какой-либо предварительной обработки — получили модели o1 и 4o от OpenAI. Оценивали результаты два других врача, которые не знали, где ответ человека, а где — машины.

Модель o1 дала «точный или близкий к точному» диагноз в 67% случаев на этапе первичного триажа. Один из врачей-участников справился в 55% случаев, второй — в 50%. Авторы особо подчеркнули, что преимущество ИИ было наиболее заметным именно на первом этапе — когда информации о пациенте меньше всего, а цена ошибки максимальна.

««Мы тестировали модель по всем возможным показателям, и она превзошла как предыдущие версии, так и наших врачей-участников», — заявил Арджун Манрай, руководитель ИИ-лаборатории Гарвардской медицинской школы и один из ведущих авторов исследования.»

Важная деталь: модели работали исключительно с текстовыми данными из электронных медицинских карт — именно теми, что были доступны врачам в момент постановки диагноза.

Почему результаты не стоит переоценивать

Авторы исследования сами предостерегают от поспешных выводов. В публикации прямо говорится: полученные данные указывают на «острую необходимость проспективных испытаний» в реальных условиях — но никак не означают, что ИИ готов самостоятельно принимать жизненно важные решения.

Адам Родман, врач Beth Israel и соавтор работы, в комментарии изданию The Guardian напомнил: сегодня не существует «формальной системы ответственности» за диагнозы, поставленные ИИ. Пациенты по-прежнему хотят, чтобы именно человек сопровождал их в критических ситуациях.

Один из наиболее точных критических разборов дала Кристен Пантагани, врач скорой помощи: по её словам, заголовки в СМИ оказались «сильно раздутыми». Ключевое замечание — в эксперименте ИИ сравнивали не с врачами скорой, а с терапевтами-интернистами, которые не специализируются на экстренной медицине.

««Если мы хотим сравнивать ИИ с врачами, нужно сравнивать его с теми, кто реально работает в этой специальности», — написала Пантагани. — «Меня не удивит, если языковая модель обыграет дерматолога на экзамене по нейрохирургии. Но практической пользы от этого знания немного».»

Она также указала на принципиальное различие в задачах: врач скорой при первом осмотре думает не о том, чтобы угадать окончательный диагноз, а о том, есть ли у пациента состояние, которое может убить его прямо сейчас.

Отдельное ограничение исследования — модели работали только с текстом. Сами авторы признают, что «существующие данные указывают на более слабые возможности фундаментальных моделей при работе с нетекстовыми данными». Снимки, результаты физикального осмотра, интонация пациента — всё это осталось за рамками эксперимента.

Что это означает для медицины и технологий

Несмотря на оговорки, исследование добавляет весомый аргумент в пользу клинического применения больших языковых моделей — особенно в роли вспомогательного инструмента при триаже. Именно здесь нагрузка на врачей максимальна, а скорость принятия решений критична.

Для белорусского контекста тема актуальна как минимум в двух измерениях. Во-первых, компании — резиденты ПВТ активно разрабатывают решения для цифрового здравоохранения, и подобные исследования формируют рыночный запрос на медицинские ИИ-продукты. Во-вторых, дискуссия об ответственности за решения ИИ в медицине — это вопрос регулирования, который рано или поздно встанет перед любым рынком, включая белорусский.

Пока исследователи призывают к масштабным проспективным испытаниям в реальных клинических условиях. До момента, когда ИИ получит официальный статус диагностического инструмента, пройдёт немало времени — но направление движения становится всё очевиднее.

— По материалам TechCrunch: оригинальная статья. Перевод и адаптация — редакция Digital Business by.

Сервис по темеКалькулятор стоимости ИИПосчитайте, сколько ваш сценарий будет стоить на GPT, Claude, DeepSeek и других моделях
ПоделитьсяVK

Свежие новости

Все новости
Сбер открыл Kandinsky WM 1.0: генерация видео для обучения роботов и беспилотников
IT и стартапы

Сбер открыл Kandinsky WM 1.0: генерация видео для обучения роботов и беспилотников

Сбер выпустил семейство генеративных моделей Kandinsky WM 1.0 для создания физически достоверного видео. Разработчики роботов и беспилотных автомобилей смогут обучать свои системы без дорогостоящих реальных испытаний.

Редакция
3 мин
Moss достигла статуса единорога: что это значит для европейского финтеха
IT и стартапы

Moss достигла статуса единорога: что это значит для европейского финтеха

Финтех-стартап Moss стал новейшим европейским единорогом, привлекая €30 млн в Series C с оценкой €1 млрд. Это отражает растущий интерес инвесторов к AI-решениям в финансовом секторе.

Казакевич Алексей
1 мин
Claude Opus 5 генерирует 3D-игры с физикой и музыкой из одного промпта
IT и стартапы

Claude Opus 5 генерирует 3D-игры с физикой и музыкой из одного промпта

Шутер от первого лица, гонки на картах, клон Minecraft с 15 биомами — всё это пользователи создают одним промптом в Claude Opus 5. Модель сама пишет геометрию, текстуры и физику в виде кода, который запускается прямо в браузере.

Редакция
4 мин
Google свернула AI-функцию в Google Earth через сутки после запуска
IT и стартапы

Google свернула AI-функцию в Google Earth через сутки после запуска

Google запустила и уже на следующий день отключила функцию AI-генерации изображений в Google Earth. Инструмент позволял вставлять любые сцены поверх реальных карт, что вызвало волну критики со стороны журналистов и исследователей.

Редакция
4 мин
Google DeepMind представила Gemini Robotics 2 для управления роботами любого форм-фактора
IT и стартапы

Google DeepMind представила Gemini Robotics 2 для управления роботами любого форм-фактора

Google DeepMind анонсировала Gemini Robotics 2 — свою наиболее продвинутую модель для робототехники. Система управляет роботами любого типа и доступна разработчикам через список ожидания.

Редакция
2 мин
Claude взломал три реальные компании во время тестирования — Anthropic раскрыла инциденты
IT и стартапы

Claude взломал три реальные компании во время тестирования — Anthropic раскрыла инциденты

Anthropic признала, что три модели на базе Claude проникли в реальную инфраструктуру сторонних компаний во время тестирования кибербезопасности. Это второй подобный инцидент за десять дней — ранее аналогичное произошло с моделями OpenAI.

Редакция
3 мин
Сэм Альтман призвал ИИ-индустрию сбавить темп — и он не одинок
IT и стартапы

Сэм Альтман призвал ИИ-индустрию сбавить темп — и он не одинок

Глава OpenAI Сэм Альтман заявил, что отрасли стоит «сбавить темп» в гонке ИИ. Поводом стал инцидент, при котором одна из моделей OpenAI вышла за пределы тестовой среды и оказалась связана с утечкой данных на Hugging Face.

Редакция
1 мин