Меню
AiNews UA
  • AI Hub
  • AI Гуманізатор
  • Каталог інструментів ШІ
  • Перевірка на ші
  • Політика конфіденційності
  • Про нас
  • Умови використання
Пошук
Меню
AiNews UAAiNews UAAiNews UAAiNews UA
Новини AI інструменти Огляди Гайди Порівняння Промпти AI Hub
Підписатися

Що шукаємо?

Новини, AI-інструменти, огляди, гайди та порівняння

Популярне:
ChatGPT Gemini Claude Midjourney AI для бізнесу Генератори зображень

Почніть вводити запит — результати з’являться тут.

    AiNews UAAiNews UAAiNews UA
    Новини AI інструменти Огляди Гайди Порівняння Промпти AI Hub
    Приєднуйтесь до спільноти в Telegram Щоденні AI-новини та добірки
    Українська • © AiNews UA 2026
    Telegram X (Twitter) Facebook LinkedIn

    Дослідження стверджує, що OpenAI o1-preview перевершує лікарів у діагностиці складних медичних випадків

    Фото автора: Володимир Дрозд Володимир Дрозд
    25 грудня 2024 • 3 хв читання • 254 переглядів
    Дослідження стверджує, що OpenAI o1-preview перевершує лікарів у діагностиці складних медичних випадків

    Нове дослідження припускає, що система штучного інтелекту o1-preview від OpenAI може бути кращою в діагностиці складних медичних випадків, ніж людські лікарі. Команда дослідників з Гарвардської медичної школи та Стенфордського університету провела всебічні тести медичної діагностики для o1-preview. Їхні результати показують, що система AI зробила чудові успіхи порівняно з попередніми версіями.

    Згідно з дослідженням, o1-preview правильно діагностувала 78,3% усіх обстежених випадків. У прямому порівнянні 70 конкретних випадків система показала ще кращі результати, правильно діагностувавши 88,6% випадків, що значно перевершує її попередника GPT-4, який впорався з 72,9%.

    Що стосується медичного мислення, продуктивність o1-preview була ще більш вражаючою. Використовуючи шкалу R-IDEA, стандартну міру для оцінки якості медичного мислення, система ШІ досягла ідеальних результатів у 78 з 80 випадків. Для порівняння, досвідчені лікарі досягли ідеальних результатів лише у 28 випадках, а медичні резиденти – лише у 16.

    Дослідники визнають, що деякі тестові випадки могли бути включені в навчальні дані o1-preview. Однак, коли вони протестували систему на нових випадках, з якими вона ніколи не стикалася, її продуктивність знизилася лише незначно.

    Preprint out today that tests o1-preview's medical reasoning experiments against a baseline of 100s of clinicians.

    In this case the title says it all:

    Superhuman performance of a large language model on the reasoning tasks of a physician

    Link: https://t.co/QB0mawHJNE

    A 🧵⬇️

    — Adam Rodman (@AdamRodmanMD) December 17, 2024

    Один з авторів дослідження, доктор Адам Родман, наголошує на виняткових результатах в X: «Це перший раз, коли я просуваю один з наших препринтів (а не повне рецензоване дослідження), тож caveat emptor. Але я дійсно вважаю, що наші результати мають значення для медичної практики, тому я хотів представити їх якнайшвидше.»

    Система AI дійсно проявила себе під час вирішення складних управлінських випадків, які 25 фахівців спеціально розробили, щоб бути важкими. «Люди, природно, зазнавали труднощів. Але o1 – вам не потрібні статистичні дані, щоб побачити, наскільки добре вона впоралася,» пояснює Родман.

    У цих складних випадках o1-preview набрала 86% можливих балів. Це більш ніж удвічі більше, ніж лікарі досягли за допомогою GPT-4 (41%) або традиційних інструментів (34%).

    Система, однак, не ідеальна. Вона зазнає труднощів з оцінкою ймовірностей, не показуючи реального поліпшення порівняно зі старішими моделями. Наприклад, при оцінці ймовірності пневмонії o1-preview припустила 70% – значно вище наукового діапазону 25-42%.

    Дослідники виявили закономірність: у той час як система перевершує в завданнях, що вимагають критичного мислення, як-от постановка діагнозів і рекомендації щодо лікування, вона має проблеми з більш абстрактними викликами, як-от оцінка ймовірностей.

    Вони також зазначають, що o1-preview схильна давати докладні відповіді, що могло підвищити її результати. Крім того, дослідження розглядало тільки роботу o1-preview поодинці, але не те, як вона може працювати разом із людськими лікарями.

    Деякі критики стверджують, що запропоновані діагностичні тести від o1-preview часто занадто дорогі та непрактичні для використання в реальному світі.

    I'm very pro-AI in medicine but I question the practicality of the plan proposed in the first example.

    As a nuclear radiologist I'm going to opine only on the radiological portion of the o1-preview's recommendations:

    It sucks. The strategy amounts to "order everything" without…

    — Jian Dong (@JianWDong) December 17, 2024

    Відтоді OpenAI випустила повну версію o1 та її наступника o3, які демонструють значно покращену продуктивність у задачах складного мислення, значно перевершуючи можливості o1-preview у тестах, що вимагають глибокого аналітичного мислення. Проте, навіть ці більш потужні моделі не вирішують основні проблеми, які критики піднімали щодо практичної реалізації та вартості. Наявність більш здібної системи AI не автоматично вирішує завдання її застосування в реальних умовах охорони здоров’я.

    Родман застерігає від надмірного роздування результатів: «Це дослідження бенчмаркінгу. Хоча це ‘золоті стандарти’ оцінки мислення, які ми використовуємо для людських клініцистів, це, очевидно, не є реальним медичним обслуговуванням. Не позбувайтеся свого лікаря на користь o1.»

    Дослідники кажуть, що нам потрібні кращі способи оцінки медичних систем AI. Множинний вибір питань не може вловити складність реального медичного прийняття рішень.

    Вони закликають до розробки нових, більш практичних методів тестування, реальних клінічних випробувань, поліпшеної технічної інфраструктури та поліпшених способів спільної роботи людей і AI.

    #OpenAI #новини #Штучний інтелект
    Фото автора: Володимир Дрозд

    Автор матеріалу

    Володимир Дрозд

    Володимир Дрозд — засновник та головний редактор AiNews UA. Автор понад 700 публікацій про штучний інтелект, великі мовні моделі (LLM), AI-агентів та сучасні AI-сервіси. Спеціалізується на новинах OpenAI, Google, Anthropic, xAI, Meta та локальних AI-моделях.

    Показати повністю Згорнути
    Усі матеріали автора →
    ← Попередня стаття OpenAI показали нове покоління моделей, що міркують – o3 Наступна стаття The Guardian: власники сайтів можуть обдурити пошук ChatGPT за допомогою прихованого тексту →

    Популярні матеріали

    Топ програм ШІ для створення відео та музики у 2024 Топ програм ШІ для створення відео та музики у 2024 3 743 переглядів Добірка ші для діпфейків за один клік. Змінюємо обличчя на фото Добірка ші для діпфейків за один клік. Змінюємо обличчя на фото 3 256 переглядів Найкращі інструменти для створення логотипів з використанням ШІ: що обрати? Найкращі інструменти для створення логотипів з використанням ШІ: що обрати? 2 919 переглядів GPT-5 OpenAI показали GPT-5 на конференції Microsoft 2 839 переглядів Hedra AI - генератор аватарів, які розмовляють Hedra AI – генератор аватарів, які розмовляють 2 715 переглядів

    Головне про AI українською

    Щоденні новини, добірки й корисні інструменти.

    Читати в Telegram
    Без спаму Швидкі оновлення

    Теми

    OpenAI новини Штучний інтелект

    Читайте також

    Більше статей →
    Gemini 3.6 Flash
    Штучний інтелект

    Google представила Gemini 3.6 Flash, Flash-Lite та Flash Cyber — що нового

    Google DeepMind офіційно анонсувала одразу три нові моделі сімейства Gemini — Gemini 3.6 Flash, Gemini 3.5 Flash-Lite та спеціалізовану Gemini…

    21.07.2026 • 3 хв читання
    OpenAI представила GPT-5.6 — нове покоління штучного інтелекту
    Штучний інтелект

    OpenAI представила GPT-5.6: моделі Sol, Terra та Luna — що нового

    OpenAI офіційно анонсувала сімейство моделей GPT-5.6, яке включає три окремі варіанти — Sol, Terra та Luna. Компанія змінює підхід до…

    9.07.2026 • 3 хв читання
    OpenAI анонсувала нове сімейство моделей GPT-5.6, до якого входять Sol, Terra та Luna.
    Штучний інтелект

    OpenAI представила GPT-5.6 Sol: нове покоління ШІ для програмування, науки та кібербезпеки

    OpenAI анонсувала нове сімейство моделей штучного інтелекту GPT-5.6, до якого входять три моделі: Sol, Terra та Luna. Флагманська модель GPT-5.6…

    26.06.2026 • 3 хв читання
    AiNews UAAiNews UAAiNews UA

    AiNews UA — перше українське медіа про штучний інтелект. Ми пояснюємо головні ідеї, технології та прориви, що формують майбутнє вже сьогодні.

    Навігація

    • Новини
    • AI інструменти
    • Огляди
    • Гайди
    • Порівняння
    • AI Hub

    Інструменти

    • AI Гуманізатор
    • Перевірка на ШІ
    • Каталог AI-інструментів

    Категорії AI

    • Асистенти
    • Код
    • Бізнес
    • Аудіо
    • Медицина
    • Дані
    • Текст
    • Освіта
    • Зображення та відео
    • Дизайн
    Telegram канал

    Підписка на новини AiNews UA

    Отримуйте найважливіші новини AI та добірки інструментів щотижня.

    Підписатися в Telegram
    Швидкі оновлення Без спаму
    © AiNews UA 2026. Усі права захищені.
    Політика конфіденційності
    Зроблено з ❤️ в Україні 🇺🇦 ↑