Профессор информатики Калифорнийского университета в Беркли и соучредитель Центра искусственного интеллекта, совместимого с интересами человека (Center for Human-Compatible Artificial Intelligence, или CHAI), Стюарт Рассел заявил, что полная «согласованность» искусственного интеллекта с человеческими целями является недостижимой целью. По его мнению, попытка заранее точно определить цели мощной системы может привести к опасным последствиям. Проблема особенно обостряется, когда ИИ переходит из контролируемых лабораторных условий в реальный мир.
Комментируя решение OpenAI не выпускать модель, которую компания планировала представить как GPT-6.1 Astra, из-за опасений относительно несоответствия её целей человеческим интересам, Рассел назвал ситуацию закономерной. По его словам, он впервые использовал термин «согласованность целей» ещё в 2014 году, но теперь сожалеет об этом. Рассел поделился этим в программе AI Deep Dive издания The Information.
«Люди считают, что единственный путь решения этой проблемы — создать машины, которые будут идеально согласованы с людьми, точно будут знать, чего мы хотим, и помогать нам этого достичь. А это, я бы сказал, недостижимая цель», — заявил Рассел.
Учёный отметил, что несогласованность целей означает ситуацию, когда система ИИ преследует определённую цель, но её поведение не приводит к результату, соответствующему человеческим интересам. В то же время Рассел считает ошибочным представление о согласовании как о разовом процессе, после которого систему можно просто оставить работать самостоятельно.
По словам Рассела, главный вопрос заключается в том, чего именно люди хотят от ИИ. Речь идет о том, чтобы действия систем в конечном итоге приносили пользу людям, однако превратить это желание в четкую математическую цель чрезвычайно сложно.
Рассел называет традиционный подход к развитию ИИ «стандартной моделью». В ней человек определяет желаемый результат — например, выиграть партию в шахматы или добраться до аэропорта, — после чего система воспринимает эту цель как основную и с помощью рассуждений и вычислений генерирует действия для ее достижения.
Такой подход, по словам ученого, хорошо работал в лабораторных условиях, где задачи и возможности системы были ограниченными. Например, робот, который может только передвигаться по лаборатории, способен выполнять команды вроде «двигайся к лифту», «выведи на экран приветствие для посетителя» или «приведи его сюда». В таких ситуациях человек может предвидеть большинство возможных последствий действий системы.
Проблемы начинаются тогда, когда ИИ получает значительно более широкий набор возможностей и действует в реальном мире, где его решения могут иметь серьезные негативные последствия. Эту проблему Рассел называет «проблемой царя Мидаса».
В мифе Мидас сформулировал своё желание максимально чётко: всё, к чему он прикоснется, должно превращаться в золото. Сначала такая цель кажется идеальной, однако вскоре еда, напитки и семья царя также превращаются в золото.
Рассел отметил, что подобные истории о неправильно сформулированных желаниях существуют во многих культурах, а в современном мире они демонстрируют опасность слишком буквального выполнения целей системами ИИ. Если невозможно полностью и правильно определить цель для управления поведением мощного ИИ в реальности, то, по мнению ученого, традиционная модель в конечном итоге не будет работать.
В то же время Рассел раскритиковал предложение руководства компании Anthropic о замедлении темпов развития ИИ, призвав вместо этого ввести обязательную государственную сертификацию моделей до их выхода на рынок. Учёный сравнил алгоритмы с пассажирскими самолётами, которые запрещено эксплуатировать без длительных испытаний и сертификата безопасности.
