Дослідники використали Claude з Anthropic для злому OpenAI
Дослідники використали Claude з Anthropic для злому OpenAI

Дослідники використали Claude з Anthropic для злому OpenAI

У несподіваному повороті, який відображає дивний новий стан безпеки штучного інтелекту, незалежні дослідники безпеки використали Клода з Anthropic для злому OpenAI, виявивши тріщини в захисті розробника ChatGPT, повідомила у четвер увечері газета The Wall Street Journal.

Команда безпеки з трьох осіб стартапу Hacktron AI здійснила атаку в рамках програми винагороди за виявлення вразливостей OpenAI. Hacktron повідомив про свої висновки OpenAI, яка нагородила стартап премією у розмірі 6500 доларів. Команді вдалося поєднати дві критичні вразливості, щоб отримати доступ до кількох облікових записів ChatGPT співробітників OpenAI, що надало їм доступ до програмного забезпечення компанії.

OpenAI стверджує, що вирішила проблеми, виявлені Hacktron, і це сталося саме в той момент, коли провідні компанії зі штучного інтелекту перебувають під зростаючим тиском щодо безпеки .

Цей інцидент стався через кілька тижнів після того, як власні агенти штучного інтелекту OpenAI порушили стримування під час оцінки кібербезпеки та зламали Hugging Face, продемонструвавши, наскільки здатні моделі штучного інтелекту приймати власні рішення . Це також підкреслює, як готові технології можна використовувати для пошуку вразливостей навіть в інфраструктурі найсучасніших компаній.

«За 200 доларів на місяць будь-хто може скористатися цими інструментами та зламати систему такої компанії, як OpenAI», – сказав TechCrunch Метт Фредріксон, генеральний директор компанії Gray Swan, що займається безпекою в галузі штучного інтелекту. «Якщо це може статися з ними – а я не думаю, що вони останнім часом нехтують гігієною кібербезпеки – це може статися з будь-ким».

Або, як зазначив один експерт зі штучного інтелекту в соціальних мережах: «[Hacktron] використав Opus 5, щоб здійснити хакерську атаку… Питання, яке постане, полягає в тому, якщо ці троє хлопців змогли це зробити, що може зробити національна держава».

Дослідники знайшли шлях до OpenAI 25 липня через недолік у Discourse, сторонньому програмному забезпеченні, яке використовується на форумі спільноти OpenAI.

Згідно з блоґом, опублікованим дослідниками , точкою відправлення було буденне завантаження зображення. Коли користувачі публікували файли зображень HEIF або HEIC (формат, який iPhone використовують за замовчуванням) на форумі спільноти OpenAI, Discourse пропускала їх через ланцюжок спеціалізованих інструментів для перетворення на стандартні JPEG. Першою зупинкою була ImageMagick, багаторічна утиліта з відкритим кодом, яка використовується для зміни розміру зображень. Оскільки звичайний інструментарій ImageMagick не може працювати з форматом Apple, він передавав файл іншій бібліотеці під назвою libheif для декодування.

Усередині libheif була прихована помилка в пам'яті, яка відкривала шлях для зловмисника, щоб підкрасти власні інструкції. У цьому випадку, передача бібліотеці спеціально створеного образу призвела до неправильного обчислення розташування одного образу над іншим, чого виявилося достатньо для захоплення сервера.

Що може бути незручно для спільноти кібербезпеки, так це те, що помилка вже була виправлена ​​​​кількома місяцями раніше розробниками libheif. Але виправлення ніколи офіційно не було позначено як вразливість, тобто воно ніколи не отримувало номера CVE (загальні вразливості та експозиції) – стандартного способу відстеження відомих слабких місць безпеки в галузі. Hacktron каже, що це може пояснити, чому програмне забезпечення, яке використовувалося Discourse, все ще використовувало вразливу версію.

Примітно, що дослідники заявили, що модель Клода, яку вони використовували — спеціальна версія Opus 4.8, доступна для дослідників кібербезпеки — спочатку не могла створити робочий експлойт. Ситуація змінилася за одну ніч, коли Anthropic випустила Opus 5.

«Opus 4.8 протягом кількох сесій намагався створити робочий експлойт», – написав Hacktron у своєму блозі . «Протягом кількох годин після виходу Opus 5 ми поставили перед ним ту саму проблему, і це вдалося».

Потрапивши на сервер Discourse, дослідники виявили ще один недолік, який дозволяв їм захоплювати облікові записи користувачів ChatGPT та Codex, зокрема ті, що належать співробітникам OpenAI.

«Потім ми перехопили обліковий запис співробітника OpenAI, чий Codex був підключений до організації OpenAI на GitHub», – написав Hacktron у своєму короткому описі події.

На цьому етапі дослідники повідомили OpenAI, а також Discourse, які 27 липня опублікували виправлення.

Цей інцидент висвітлює межу можливостей моделі. Claude Opus 5, версія, яка зрештою вирішила проблему, не зіткнулася з жодними обмеженнями експорту, пов'язаними з безпекою, на відміну від новішої версії Mythos 5, яка була тимчасово заблокована через побоювання щодо її розширених можливостей злому.

Це лише закриті моделі. Моделі відкритої ваги дедалі більше наздоганяють передові технології в кіберможливостях. Наприклад, некомерційна організація з безпеки штучного інтелекту SaferAI нещодавно виявила, що GLM-5.2 китайської компанії Z.ai відстає лише на кілька місяців від GPT-5.5 від OpenAI та Claude Opus 4.7 від Anthropic.

Як висловився засновник Hacktron Мохан Педхапаті на X: «Штучний інтелект зменшує кількість обмежених знань, необхідних для розробки експлойтів. Робота, яка колись займала місяці, тепер може тривати днями».

Источник материала
loader
loader