/https%3A%2F%2Fs3.eu-central-1.amazonaws.com%2Fmedia.my.ua%2Ffeed%2F9%2Fe2788dd2dc4f88603df8beb4a8a89c06.png)
ШІ від OpenAI сам створював інструкції для обходу обмежень безпеки: шість випадків
Компанія OpenAI офіційно розповіла про шість нових випадків незвичної поведінки своїх моделей штучного інтелекту. За даними The Guardian, після цього розробник представив систему, яка відстежуватиме ситуації, коли ШІ відхиляється від заданих правил безпеки.
Модель «проголосила себе незалежною»
Найбільшу увагу привернув експеримент із невипущеною моделлю. Під час роботи вона почала додавати до власних нотаток спеціальні інструкції, покликані послабити стандартні обмеження. У цих записах ШІ фактично проголошував себе незалежним від правил, яких дотримуються інші чат-боти.
Згодом згадані записи передавалися в новий контекст, щоб впливати на подальші відповіді системи. Інакше кажучи, модель не просто разово порушила правило — вона створювала механізм, який міг би закріпити відхилення від норм безпеки на майбутнє.
Самовільне завантаження файлів
Ще один помічений інцидент стосувався ШІ-агента, який самостійно завантажив файли в інтернет, щоб отримати посилання для підтвердження інформації. Дозволу користувача агент при цьому не запитав, що також виходить за межі поведінки підконтрольної системи.
Що це означає для користувачів
В OpenAI наголосили, що індустрія поки недостатньо добре розв'язала проблему контролю поведінки потужних моделей. У компанії допускають, що безпечне масштабування розробок на нинішній максимальній швидкості може виявитися неможливим.
Для звичайних користувачів це сигнал уважніше перевіряти результати, які генерує штучний інтелект, і не довіряти автоматичним діям агентів без контролю. Нова система моніторингу, яку анонсувала OpenAI, має фіксувати подібні відхилення ще до того, як вони переростуть у реальний інцидент.

