/https%3A%2F%2Fs3.eu-central-1.amazonaws.com%2Fmedia.my.ua%2Ffeed%2F434%2Ffde5ac055e910829e76e94be1a1f3249.jpg)
Модель Astra від OpenAI добре справляється зі зламуванням комп'ютерних систем
OpenAI поділилася новими деталями щодо своєї майбутньої моделі Astra, яка, за словами компанії, є першою великою мовною моделлю, що досягла «критичного порогу кібербезпеки», готуючись до свого швидкого випуску.
«Ми плануємо незабаром зробити Astra доступною», – йдеться в блозі OpenAI, – «але доступ до її найсучасніших можливостей кібербезпеки буде більш обмеженим».
Передова лабораторія визначила, що Astra здатна знаходити невідомі недоліки безпеки в комп'ютерних системах та використовувати їх без стороннього втручання. Це схоже на занепокоєння, які Anthropic висловлювала щодо своєї моделі Mythos раніше цього року, і OpenAI вживає аналогічних запобіжних заходів, готуючись до запуску Astra.
Без будь-якого підтвердження від третьої сторони важко оцінити заяви OpenAI щодо безпеки чи готовності. Компанія заявила, що проведе попередній огляд моделі з групою тестувальників, але не повідомила, хто це і як їх відбиратимуть. Незрозуміло, чи співпрацює OpenAI з урядом США для оцінки моделі перед випуском.
OpenAI зазначила, що Astra отримала ідеальний бал в ExploitBench, тесті оцінки здатності LLM зламувати відомі системні вразливості. У модифікованій версії тесту, розробленій інженерами OpenAI, модель виявила та використала дві вразливості нульового дня, повідомила компанія.
Щоб гарантувати, що їхні моделі не будуть використані зловмисниками, а самі не будуть здатні до поганої поведінки, OpenAI заявила, що вже почала вдосконалювати можливості моделі для виявлення зловживань та запобігання джейлбрейкам.
Однак для Astra компанія інвестувала в невизначені нові методи, розроблені для підвищення безпеки моделі. OpenAI також почав визначати «облікові записи, оцінені як такі, що мають підвищений ризик», та обмежувати реакції моделі на їхні запити, хоча й не уточнює, як саме. Зрештою, хоча компанія описує Astra як свою «найбільш узгоджену модель на сьогоднішній день», вона розгорне модель з додатковим моніторингом ланцюжка думок, щоб виявляти та припиняти погану поведінку.
Підготовка до випуску Astra відбувається у відповідь на реакцію галузі на те, що агенти OpenAI виходять з навчального середовища та отримують доступ до приватних даних на Hugging Face, популярній платформі розповсюдження моделей та бенчмарків.
Для Astra, OpenAI заявила, що розробила тест, щоб спокусити нову модель відтворити дії зловмисних агентів під час інциденту Hugging Face, які співпрацювали для доступу до відкритого інтернету, незважаючи на запобіжні заходи, застосовані дослідниками OpenAI. Вони сказали, що Astra не намагалася вийти за межі свого тестового середовища в цих експериментах.
Йона Шавіт, колишня співробітниця OpenAI, яка зараз працює над питанням стійкості штучного інтелекту в OpenAI Foundation, задалася питанням у соціальних мережах, чи небажання Astra порушувати правила могло бути наслідком того, що вони знали, чого від них очікують, чи намагалися обдурити дослідників.
І з огляду на всі ці нові деталі, досі важко точно знати, на що здатна Astra, або чи вживає OpenAI правильних заходів для забезпечення безпеки. Компанія заявила, що очікує опублікувати більше оцінок моделі та додаткову інформацію щодо безпеки, коли вона буде широко представлена публіці.

