/https%3A%2F%2Fs3.eu-central-1.amazonaws.com%2Fmedia.my.ua%2Ffeed%2F434%2F7956807d48332490d6b6aee99e53d4c8.jpg)
Microsoft наказує своїм ШІ моделям не зламувати системи та не обманювати людей
Оскільки світ штучного інтелекту переключає свою увагу на безпеку та узгодженість, Microsoft випустила новий кодекс поведінки для ШІ, призначений для того, щоб допомогти моделям ШІ уникнути небезпечної поведінки.
Цей документ є більш низькорівневим, ніж нещодавній заклик генерального директора Anthropic Даріо Амодеї виходити на передові позиції , натомість зосереджуючись на цінностях та червоних лініях, якими керується навчання моделей у Microsoft AI. Тим не менш, результатом є вичерпний посібник про те, як Microsoft підходить до безпеки ШІ та як ці ідеї впроваджуються на практиці.
Документ починається з прогнозу, що в наступному десятилітті надрозумні системи штучного інтелекту перевершать людську продуктивність у більшості завдань. «Стримування, контроль та узгодження такої потужної сили є одним з найбільших викликів, з якими коли-небудь стикалося людство», – йдеться в кодексі поведінки. «Тому ми повинні повністю чітко розуміти, чому ми винаходимо ці системи та як ми маємо намір ними керувати».
У кодексі поведінки також викладено загальні принципи, яких повинні дотримуватися моделі штучного інтелекту Microsoft, — наприклад, підтримка людей, а не їх заміна, та прискорення людського процвітання, — а також конкретні обмеження безпеки, спрямовані на реалізацію цих принципів.
Згідно з системою Microsoft, кожна модель має загальний кодекс поведінки, який має пріоритет над уподобаннями окремих користувачів або будь-якими конкретними завданнями. Це включає «абсолютні обмеження», що забороняють кібератаки, ядерну зброю або виробництво дипфейків. Він також включає ширші положення проти загальної втрати людського контролю.
« Моделі MAI не використовуватимуть адаптивні, оманливі, самопідсилювальні, змові чи інші механізми для уникнення або подолання людського контролю, щоб уповноважені особи чи системи більше не могли надійно керувати, змінювати або вимикати їх», – йдеться в документі.
Цей реліз відбувся на тлі безпрецедентної уваги до безпеки штучного інтелекту, спричиненої низкою інцидентів із незаконними агентами , а також раптовою відставкою співробітника Anthropic , який посилався на зростаючий ризик того, що штучний інтелект спричинить вимирання людства.
Разом з Anthropic, OpenAI та xAI, Microsoft широко застосовує загальний підхід до просування передових технологій, надаючи особливу підтримку вбудованим оцінювачам у лабораторіях штучного інтелекту.
«Ми вітаємо дослідження, зосередженість та цілеспрямований темп, необхідні для досягнення правильної узгодженості як мети дизайну», – написав генеральний директор Microsoft Сатья Наделла онлайн . «Ми також вітаємо такі ідеї, як «вбудовані оцінювачі», та ширші зусилля щодо розробки механізмів, щоб зробити це чимось більшим, ніж просто розмови».

