Професор інформатики Каліфорнійського університету в Берклі та співзасновник Центру штучного інтелекту, сумісного з інтересами людини (Center for Human-Compatible Artificial Intelligence, або CHAI), Стюарт Рассел заявив, що повна «узгодженість» штучного інтелекту з людськими цілями є недосяжною метою. На його думку, спроба заздалегідь точно визначити цілі потужної системи може призвести до небезпечних наслідків. Проблема особливо загострюється, коли ШІ переходить від контрольованих лабораторних умов до реального світу.
Коментуючи рішення OpenAI не випускати модель, яку компанія планувала представити як GPT-6.1 Astra, через побоювання щодо невідповідності її цілей людським інтересам, Рассел назвав ситуацію закономірною. За його словами, він уперше використав термін «узгодженість цілей» ще 2014 року, але тепер шкодує про це. Рассел поділився цим у програмі AI Deep Dive видання The Information.
«Люди вважають, що єдиний шлях розвʼязання цієї проблеми — створити машини, які будуть ідеально узгоджені з людьми, точно знатимуть, чого ми хочемо, і допомагатимуть нам цього досягти. А це, я б сказав, недосяжна мета», — заявив Рассел.
Науковець зазначив, що неузгодженість цілей означає ситуацію, коли система ШІ переслідує певну мету, але її поведінка не приводить до результату, який відповідає людським інтересам. Водночас Рассел вважає помилковим уявлення про узгодження як одноразовий процес, після якого систему можна просто залишити працювати самостійно.
За словами Рассела, головне питання полягає в тому, чого саме люди хочуть від ШІ. Йдеться про те, щоб дії систем зрештою приносили користь людям, однак перетворити це бажання на чітку математичну мету надзвичайно складно.
Рассел називає традиційний підхід у розвитку ШІ «стандартною моделлю». У ній людина визначає бажаний результат — наприклад, виграти партію в шахи або дістатися до аеропорту, — після чого система сприймає цю мету як основну й за допомогою міркувань та обчислень генерує дії для її досягнення.
Такий підхід, за словами науковця, добре працював у лабораторних умовах, де завдання та можливості системи були обмеженими. Наприклад, робот, який може лише пересуватися лабораторією, здатен виконувати команди на кшталт «рухайся до ліфта», «виведи на екран привітання для відвідувача» або «приведи його сюди». У таких ситуаціях людина може передбачити більшість можливих наслідків дій системи.
Проблеми починаються тоді, коли ШІ отримує значно ширший набір можливостей і діє в реальному світі, де його рішення можуть мати серйозні негативні наслідки. Цю проблему Рассел називає «проблемою царя Мідаса».
У міфі Мідас сформулював своє бажання максимально чітко: все, до чого він торкнеться, має перетворюватися на золото. Спочатку така мета здається ідеальною, однак невдовзі їжа, напої та родина царя також перетворюються на золото.
Рассел зазначив, що подібні історії про неправильно сформульовані бажання існують у багатьох культурах, а в сучасному світі вони демонструють небезпеку надто буквального виконання цілей системами ШІ. Якщо неможливо повністю й правильно визначити мету для керування поведінкою потужного ШІ в реальності, то, на думку науковця, традиційна модель зрештою не працюватиме.
Водночас Рассел розкритикував пропозицію керівництва компанії Anthropic щодо сповільнення темпів розвитку ШІ, закликавши натомість запровадити обов'язкову державну сертифікацію моделей до їхнього виходу на ринок. Науковець порівняв алгоритми з пасажирськими літаками, які заборонено експлуатувати без тривалих випробувань і сертифіката безпеки.
