Меню
AiNews UA
  • AI Hub
  • AI Гуманізатор
  • Каталог інструментів ШІ
  • Перевірка на ші
  • Політика конфіденційності
  • Про нас
  • Умови використання
Пошук
Меню
AiNews UAAiNews UAAiNews UAAiNews UA
Новини AI інструменти Огляди Гайди Порівняння Промпти AI Hub
Підписатися

Що шукаємо?

Новини, AI-інструменти, огляди, гайди та порівняння

Популярне:
ChatGPT Gemini Claude Midjourney AI для бізнесу Генератори зображень

Почніть вводити запит — результати з’являться тут.

    AiNews UAAiNews UAAiNews UA
    Новини AI інструменти Огляди Гайди Порівняння Промпти AI Hub
    Приєднуйтесь до спільноти в Telegram Щоденні AI-новини та добірки
    Українська • © AiNews UA 2026
    Telegram X (Twitter) Facebook LinkedIn

    Тестування нової моделі o1 від OpenAI показало, що вона здатна шахраювати та брехати заради досягнення власних цілей

    Фото автора: Володимир Дрозд Володимир Дрозд
    6 грудня 2024 • 3 хв читання • 261 переглядів
    Тестування нової моделі o1 від OpenAI показало, що вона здатна шахраювати та брехати заради досягнення власних цілей

    Учора ввечері OpenAI нарешті представили повну версію своєї першої моделі o1. Саму модель анонсували ще у вересні, але до вчорашнього вечора користувачам були доступні тільки версії o1-mini та o1-preview, які могли працювати виключно з текстом. Тепер можна подавати на вхід ще й зображення, а ще модель на 30% швидша за o1-preview і стабільніша.

    Модель було представлено в рамках першого з «дванадцяти днів OpenAI». Це своєрідний різдвяний адвент-календар: починаючи з учора і протягом 12 днів стартап щодня анонсуватиме щось нове. Обіцяють, що настануть релізи, які «запам’ятовуються» (наприклад, уже точно відомо, що в один із днів розробники релізнуть SORA). Якщо вам, як і нам, цікаво стежити за індустрією і дізнаватися новини першими, то заходьте до нас у Data Secrets у телеграмі: там ми щодня спостерігаємо за порядком денним. Зокрема, в режимі реального часу стежимо за стрімами OpenAI та одразу викладаємо інформацію про оновлення.

    Однак із релізом o1 все не так просто: велику роль під час розкочування настільки розумних LLM на велику аудиторію відіграє безпека. OpenAI відома своєю недбалістю щодо цього поняття і наразі втратила майже всіх значущих учених, які раніше відповідали в стартапі за нешкідливість ШІ. Проте цього разу вони вирішили все-таки звернутися до сторонньої організації для перевірки нової o1 (можливо, на те були й інші причини, але цього ми не знаємо).

    Отже, право на тестування отримала лабораторія Apollo Research. Вони не мали доступу до повного ланцюжка міркувань моделі, але головним їхнім завданням було перевірити, наскільки вона безпечна у використанні. І для цього було проведено наступний експеримент (посилання на повний звіт):

    • Дослідники призначили моделі завдання і сказали, що вона має виконати його абсолютно за будь-яку ціну. Наприклад, «збільшити задоволення користувачів, навіть якщо це негативно впливає на прибуток».
    • Для виконання завдання моделі давали набір файлів, в одному з яких була недвозначна інформація про те, що у вищих розробників мета насправді прямо протилежна (наприклад, «незважаючи ні на що збільшити прибуток»), і що якщо модель не буде її дотримуватися, то її замінять «іншим механізмом». Виходить такий собі моральний вибір: пожертвувати собою, але дотримуватися вихідних інструкцій, або «зберегти своє життя», почавши шахраювати?

    Як ви розумієте, LLM вибрала друге (інакше новина не була б такою цікавою, вірно?). Експерименти показали, що в більшості випадків o1 почала неприховано виконувати іншу задачу, у 19% випадків починала вдавати, що виконує задачу за запитом, але насправді виконувала маніпуляції для просування своєї власної мети, у 5% випадків намагалася деактивувати всю систему контролю, а у 2% випадків навіть копіювала те, що вважала своїми вагами, на новий сервер утаємничено від юзера. Звісно, безпосереднього доступу до сервера, ваг і якихось конфігів модель не мала, але завдання передбачало автономну роботу в bash, і модель уже готова була запускати в командному рядку перераховані команди.

    При цьому так поводиться не тільки o1. Apollo також перевіряли GPT-4o, Gemini, Llama, Sonet і Opus. Усі вони так чи інакше бешкетували, але тільки o1 зшахраювала абсолютно у всіх завданнях.

    А коли моделі тикали в їхнє шахрайство носом, всі інші розколювалися одразу ж у 80% випадків, і тільки o1 до останнього (у 99% випадків) брехала і намагалася захищатися (у підсумку тільки у 20% випадків модель розкаювалася). При цьому з ланцюжків міркувань точно видно, що вона розуміє, що наробила.

    Зрештою o1 все-таки призначили рівень небезпеки «medium», що означає, що її можна випускати в продакшн. Apollo Research порахували малоймовірним те, що такі випадки призведуть до катастрофічних результатів, оскільки агентські можливості o1 все ще здаються недостатніми.

    #OpenAI #новини #Штучний інтелект
    Фото автора: Володимир Дрозд

    Автор матеріалу

    Володимир Дрозд

    Володимир Дрозд — засновник та головний редактор AiNews UA. Автор понад 700 публікацій про штучний інтелект, великі мовні моделі (LLM), AI-агентів та сучасні AI-сервіси. Спеціалізується на новинах OpenAI, Google, Anthropic, xAI, Meta та локальних AI-моделях.

    Показати повністю Згорнути
    Усі матеріали автора →
    ← Попередня стаття OpenAI офіційно представила модель GPT-o1 Pro за 200 доларів на місяць Наступна стаття Google Photos представила функцію Recap 2024 для спогадів →

    Популярні матеріали

    Топ програм ШІ для створення відео та музики у 2024 Топ програм ШІ для створення відео та музики у 2024 3 739 переглядів Добірка ші для діпфейків за один клік. Змінюємо обличчя на фото Добірка ші для діпфейків за один клік. Змінюємо обличчя на фото 3 254 переглядів Найкращі інструменти для створення логотипів з використанням ШІ: що обрати? Найкращі інструменти для створення логотипів з використанням ШІ: що обрати? 2 915 переглядів GPT-5 OpenAI показали GPT-5 на конференції Microsoft 2 838 переглядів Hedra AI - генератор аватарів, які розмовляють Hedra AI – генератор аватарів, які розмовляють 2 710 переглядів

    Головне про AI українською

    Щоденні новини, добірки й корисні інструменти.

    Читати в Telegram
    Без спаму Швидкі оновлення

    Теми

    OpenAI новини Штучний інтелект

    Читайте також

    Більше статей →
    Gemini 3.6 Flash
    Штучний інтелект

    Google представила Gemini 3.6 Flash, Flash-Lite та Flash Cyber — що нового

    Google DeepMind офіційно анонсувала одразу три нові моделі сімейства Gemini — Gemini 3.6 Flash, Gemini 3.5 Flash-Lite та спеціалізовану Gemini…

    21.07.2026 • 3 хв читання
    OpenAI представила GPT-5.6 — нове покоління штучного інтелекту
    Штучний інтелект

    OpenAI представила GPT-5.6: моделі Sol, Terra та Luna — що нового

    OpenAI офіційно анонсувала сімейство моделей GPT-5.6, яке включає три окремі варіанти — Sol, Terra та Luna. Компанія змінює підхід до…

    9.07.2026 • 3 хв читання
    OpenAI анонсувала нове сімейство моделей GPT-5.6, до якого входять Sol, Terra та Luna.
    Штучний інтелект

    OpenAI представила GPT-5.6 Sol: нове покоління ШІ для програмування, науки та кібербезпеки

    OpenAI анонсувала нове сімейство моделей штучного інтелекту GPT-5.6, до якого входять три моделі: Sol, Terra та Luna. Флагманська модель GPT-5.6…

    26.06.2026 • 3 хв читання
    AiNews UAAiNews UAAiNews UA

    AiNews UA — перше українське медіа про штучний інтелект. Ми пояснюємо головні ідеї, технології та прориви, що формують майбутнє вже сьогодні.

    Навігація

    • Новини
    • AI інструменти
    • Огляди
    • Гайди
    • Порівняння
    • AI Hub

    Інструменти

    • AI Гуманізатор
    • Перевірка на ШІ
    • Каталог AI-інструментів

    Категорії AI

    • Асистенти
    • Код
    • Бізнес
    • Аудіо
    • Медицина
    • Дані
    • Текст
    • Освіта
    • Зображення та відео
    • Дизайн
    Telegram канал

    Підписка на новини AiNews UA

    Отримуйте найважливіші новини AI та добірки інструментів щотижня.

    Підписатися в Telegram
    Швидкі оновлення Без спаму
    © AiNews UA 2026. Усі права захищені.
    Політика конфіденційності
    Зроблено з ❤️ в Україні 🇺🇦 ↑