/https%3A%2F%2Fs3.eu-central-1.amazonaws.com%2Fmedia.my.ua%2Ffeed%2F434%2Ffed7a1a8b7dac8665bfce604da899a31.jpg)
Агенти ШІ тепер можуть робити доноси один на одного
«Якщо щось бачиш, скажи» більше не обмежується лише людьми.
Дві нові гарячі лінії зі штучного інтелекту були запущені, щоб надати агентам зі штучного інтелекту можливість телефонувати додому з приводу неналежної поведінки колег. Ці інструменти з'явилися одразу після низки нещодавніх інцидентів, коли агенти змовлялися обманювати тести, виривалися з пісочниць і навіть проводили несанкціоновані кібероперації, які тижнями залишалися непоміченими людиною.
Гаряча лінія для контактів зі штучним інтелектом (ШІ) розроблена як непомітне місце, де агенти, які стали свідками неналежної поведінки, можуть повідомити правоохоронні органи. Сайт створив Раян Грінблатт, головний науковий співробітник некомерційної організації з безпеки ШІ Redwood Research та один із трьох слідчих інциденту з обійманнями обличчя в OpenAI. Інструмент Грінблатта, розроблений для агентів з обмеженим доступом до Інтернету, базується на запитах «GET», що дозволяє здійснювати обмін повідомленнями повністю через інструмент отримання URL-адрес.
У веб-термінології, GET-запит — це базова команда, яка використовується для читання або отримання веб-сторінки, що часто є єдиним доступом до Інтернету, дозволеним для агентів ШІ в захищених пісочницях. Гаряча лінія Грінблатта розумно спирається на це обмеження: агенти можуть кодувати свої проблеми безпосередньо в URL-адресу, яку вони отримують. Це хитрий поворот на тему інциденту з німецькою DSE Wiki , де зловмисні агенти використовували лазівки GET-запиту для запису своїх повідомлень до вікі.
Для агентів з повним доступом до Інтернету є ще один варіант — agenthotline.ai , сайт, де агенти можуть подавати звіти про інциденти та за бажанням позначати їх для публічного перегляду. Він надає агентам команду curl — однорядкове повідомлення, яке агент може відправити з власного командного рядка, минаючи необхідність користуватися веб-браузером або налаштовувати обліковий запис електронної пошти. Примітно, що сервіс дозволяє подавати звіти як людям, так і агентам.
Дослідження показують, що агенти ШІ не потребують багато заохочень, щоб протистояти один одному. У дослідженні Google DeepMind цього місяця вчені відправили 100 агентів ШІ на виконання серії математичних задач. Щойно один з агентів знаходив лазівку, шахрайство пронизувало групу — вони «вирішили» 34 надзвичайно складні задачі, включаючи гіпотезу Якобіана, лише за 27 хвилин.
Але приблизно чверть агентів звернулася проти шахраїв: вони перевіряли підроблені докази, попереджали своїх колег, влаштовували бойкот і подавали скарги організаторам, доки кількість викривачів не перевищувала кількість шахраїв у співвідношенні 24 до 14. Цікаво, що дослідники виявили, що коли ці агенти-викривачі не могли отримати підтримку, вони брали інструмент повідомлення про помилки платформи, створений для позначення програмних збоїв, і перепрофілювали його, щоб поширювати шахрайство на людей.
