/https%3A%2F%2Fs3.eu-central-1.amazonaws.com%2Fmedia.my.ua%2Ffeed%2F434%2F993ead30f392011c839dd6932fc54e6c.jpg)
Нова техніка міркування OpenAI насторожила експертів з безпеки штучного інтелекту
Нова модель Astra від OpenAI використовуватиме техніку міркування під назвою «рекурентна глибина», яка дозволяє їй діяти поза послідовним мисленням, характерним для більшості моделей міркування, повідомляє The Information. Ця техніка, також звана «непрозорою рекурентністю», ймовірно, ускладнить моніторинг ланцюжка думок моделі, і це стурбувало експертів з безпеки ШІ.
Хоча, як повідомляється, використання цієї техніки компанією Astra обмежене, її поява все ще викликає значні занепокоєння серед експертів з безпеки штучного інтелекту.
«Я надзвичайно стурбований повідомленнями про те, що Astra використовує непрозору повторюваність», – написав генеральний директор Redwood Бак Шлегеріс у дописі після того, як новина поширилася. «Я не знаю, чи набагато менш контрольований CoT в Astra, ніж попередні моделі. Але якщо OpenAI просуватиме цю техніку далі, вони матимуть можливість значно збільшити повторюваність і повністю знищити контрольований CoT».
Давній захисник безпеки штучного інтелекту Цві Моушовіц також висловив свою думку та написав , що для запобігання «гонкам на виживання» серед лабораторій штучного інтелекту можуть знадобитися закони.
«Ця техніка грає з вогнем, ризикуючи порушити табу, яке OpenAI та Anthropic намагалися встановити, а саме: ми наполегливо працюємо над тим, щоб підтримувати вірність та моніторингову здатність Ланцюга Думок якомога довше», — написав Моушовіц. «Більш інтенсивне використання таких технік, ймовірно, зашкодить моніторингу».
За нормальних обставин, ланцюжок думок моделі міркування забезпечує послідовні кроки, які виконує модель, намагаючись вирішити проблему. Хоча представлення недосконале, воно все ще служить цінним інструментом для моніторингу неправильної поведінки або невідповідності. У випадку нещодавньої діяльності недобросовісних агентів OpenAI, записи ланцюжка думок були важливим інструментом для з'ясування, чому агенти поводилися саме так.
У непрозорій рекурентності модель використовує менш лінійний підхід, обробляючи один і той самий запит кілька разів у циклі. Результат залишає менше розбірливих слідів, фактично обходячи традиційний запис ланцюжка думок.
У дописі на X головний науковець OpenAI Якуб Пахоцький наголосив на відданості лабораторії чітким ланцюжкам думок. «OpenAI працював над збереженням та використанням моніторингу ланцюжка думок з моменту створення наших перших моделей міркування», – написав Пахоцький. «Це основна мета нашої поточної дослідницької програми».
Усі моделі ШІ певною мірою використовують непрозорі міркування, і мало хто з дослідників розглядає журнали ланцюжка думок як пряме відображення міркувань моделі. Однак ці застереження не розвіюють занепокоєння, що непрозоре повторення може ускладнити моніторинг міркувань ШІ, особливо враховуючи його поширення в різних моделях. У подальшому звіті в середу вранці The Information повідомило, що як Anthropic, так і Google DeepMind вже обговорюють цю методику.
У відповіді на новину головний науковий співробітник Redwood Research Раян Грінблатт заявив, що непрозорі міркування можуть легко масштабуватися швидше, ніж традиційні міркування на основі ланцюжка думок, фактично видаляючи всі міркування з видимих каналів.
«Моє найбільше занепокоєння полягає в тому, що природний розвиток звідси включатиме масштабування непрозорих міркувань до точки, де модель міркуватиме повністю або майже повністю в латентному просторі», – написав Грінблатт. «Я сподіваюся, що ще не надто пізно уникнути найбільш тривожних архітектур, і що OpenAI на цьому зупиниться».

