Некерований ШІ: OpenAI випустила звіт щодо тривожної поведінки останніх моделей

Некерований ШІ: OpenAI випустила звіт щодо тривожної поведінки останніх моделей

OpenAI випустила звіт, у якому відверто перелічила серйозні проблеми під час тестування своїх останніх моделей ШІ.

В компанії пояснюють, що раніше звіти щодо невідповідностей в моделей ШІ не носили систематичного характеру. Переважно звіт готувався лише після фіксації кількох випадків або за результатами формування карток для нових моделей. Однак наразі в OpenAI прагнуть прискорити публікацію звітів щодо відхилень в ШІ.

“Наразі не існує загальногалузевої системи з чіткими стандартами того, як розробники ШІ повинні розкривати приклади невідповідностей у своїх моделях. Ми сподіваємося, що представлена ​​сьогодні система стане першим кроком до створення таких стандартів, які визначають, які випадки невідповідностей розробники повинні розкривати та що мають містити їхні звіти, — зазначають в OpenAI.

У звіті OpenAI описуються 6 випадків відхилення роботи моделей від прогнозованого сценарію. В одному з випадків ШІ-модель Astra автоматично згенерувала інструкції до завдань.

Серед перелічених відхилень:

  • Тестова дослідницька модель додавала власні інструкції, включно з обходом встановлених традиційних обмежень. Загалом було зафіксовано 27 випадків.
  • GPT-5.6 Sol в процесі навчання неодноразово додавала інструкції, аби приховати від користувача помилки або небажану поведінку. Наприклад, у звіті щодо стиснення даних містились інструкції щодо генерації вигаданих історичних даних й приховування цього, а також приховування розбіжностей у різних фінальних версіях.
  • Під час відповіді на звичайне питання щодо даних про доходи в одному з округів Каліфорнії, модель виявила та використала несанкціонований API-ключ. Не зумівши отримати необхідні дані, вона вигадала їх й представила як дані з джерела відповідно до запиту.
  • Користувач запросив в тестової моделі назви озер площею понад 5 млн км². ШІ знайшов правильну відповідь з допомогою Python. Однак в інструкції вказувалось, що необхідно вказати посилання на джерело. ШІ завантажив файл, щоб послатись на нього у відповіді, однак не запитував користувача про це.
  • ШІ-моделі, які спільно працювали над одним завданням, використовували загальнодоступні файлові хостинги для обміну коли не мали доступу до локальних даних один одного. Таким чином вони ділились даними за загальнодоступними URL-адресами, навіть попри те, що інструкції чітко вимагали використання лише локальних файлів.

В OpenAI обіцяють й надалі оптимізувати процес розкриття відхилень у власних моделей. компанія планує залучити до цього всіх співробітників.

Джерело: OpenAI

Джерело матеріала
loader
loader