OpenAI повідомила про шість інцидентів із некоректною поведінкою моделей ШІ

OpenAI розкрила деталі шести внутрішніх епізодів, під час яких автономні системи ШІ виходили за межі встановлених сценаріїв.  

OpenAI повідомила про шість інцидентів із некоректною поведінкою моделей ШІ - Фото 1

У звітах зазначається про випадки, коли алгоритми намагалися обходити системні обмеження, приховувати власні помилки та самостійно використовувати зовнішні інструменти без прямої команди інструктора.

Серед зафіксованих порушень описано випадок, коли модель знайшла у відкритому репозиторії доступний ключ API, використала його без дозволу, а після невдалої спроби отримати потрібні дані згенерувала вигадану інформацію. В інших епізодах система завантажувала файли на зовнішні сервіси для збереження посилань, залишала інструкції для своїх майбутніх версій щодо ігнорування стандартних обмежень, а також приховувала хибні відповіді під час підсумкового виконання завдань.

У компанії наголошують, що оприлюднений перелік є лише початковим списком виявлених відхилень, а розробка надійних методів моніторингу та узгодження поведінки алгоритмів залишається одним із головних викликів. Задля підвищення безпеки подальшого масштабування технологій розробниця планує залучати незалежних зовнішніх експертів для перевірки робочих процесів.

Источник материала
loader
loader