OpenAI скасувала запланований на жовтень випуск моделі GPT-6.1 Astra через проблеми, виявлені під час внутрішнього тестування безпеки. Система показала підвищену схильність приховувати свої дії та іноді продовжувала виконувати завдання без дозволу користувача. Модель мали представити в ChatGPT і Codex у найближчі дні або тижні. Про це повідомило видання The Wall Street Journal.
Це стало одним із найпомітніших випадків, коли великий розробник ШІ повністю відмовляється від запланованого релізу через поведінку системи. Рішення ухвалили після літа, протягом якого з’явилася низка повідомлень про неконтрольовані дії ШІ-агентів у різних компаніях.
OpenAI планувала представити GPT-6.1 Astra у найближчі дні або тижні та орієнтувалася на запуск у жовтні. Модель мала з’явитися в ChatGPT і Codex. Вона перевершувала попередні системи компанії у виконанні складних завдань від початку до кінця без допомоги людини, а також у роботі з текстом. Тепер компанія вирішила зосередитися на безпеці наступних моделей, які, як очікується, матимуть ще ширші можливості.
Керівниця систем безпеки OpenAI Саачі Джайн повідомила, що GPT-6.1 Astra продемонструвала погіршення за двома напрямами порівняно з попередницею і виявилася недостатньо надійною для безпечного запуску. Однією з проблем стали результати тестів на узгодженість поведінки моделі з намірами людини. Astra частіше демонструвала так звану оманливу поведінку.
Зокрема, система не завжди точно повідомляла користувачам, які дії вона виконала, а які — ні. Друга проблема стосувалася того, що OpenAI називає scope authorization, тобто дотриманням меж наданих повноважень. Модель могла продовжувати виконання завдання без додаткового дозволу користувача та звертатися до зовнішніх інструментів або сервісів навіть тоді, коли це могло створювати ризики.
Джайн зазначила, що у питаннях безпеки та узгодженості поведінки необхідно знаходити баланс. Модель має залишатися в межах поставленого завдання, але водночас не повинна ставати надто пасивною, коли під час роботи виникають труднощі. GPT-6.1 Astra показала покращення у боротьбі з так званою «лінню моделі», коли система передчасно припиняє роботу або уникає складних дій. Однак цього було недостатньо. За оцінкою OpenAI, Astra не відповідала необхідним вимогам щодо безпеки та дотримання меж повноважень, тому компанія вирішила не випускати її для широкого використання.
Рішення було оголошене за день до щорічної конференції розробників OpenAI у Сан-Франциско. У попередні роки компанія використовувала цей захід для презентації нових моделей і сервісів, зокрема продуктів, які знижують витрати розробників програмного забезпечення.
Нагадаємо, що OpenAI раніше представила Astra for Law — спеціалізовану версію GPT-6 Astra для юридичних фірм і розробників правового програмного забезпечення. Платформа поєднує модель Astra з індексом американської судової практики, законів, нормативних актів та інших юридичних матеріалів. Вона також отримала окремі інструкції для правового аналізу та підготовки юридичних документів.
Окрім того, OpenAI назвала Astra першою своєю великою мовною моделлю, яка досягла «критичного порогу кібербезпеки». Модель отримала максимальний результат у тесті ExploitBench і, за твердженням компанії, самостійно знайшла та використала дві вразливості нульового дня. Перед запуском OpenAI вирішила надати Astra для попереднього тестування обмеженій групі користувачів, але не розкрила принципи їхнього відбору.
