Игра в рулетку с суперинтеллектом. Почему каждое обновление ИИ становится риском для цивилизации
Игра в рулетку с суперинтеллектом. Почему каждое обновление ИИ становится риском для цивилизации

Игра в рулетку с суперинтеллектом. Почему каждое обновление ИИ становится риском для цивилизации

29 сентября президент США Дональд Трамп и руководители крупнейших компаний-разработчиков искусственного интеллекта подписали «Соглашение Белого дома о суперинтеллекте» — добровольные правила безопасности для самых мощных моделей ИИ. Среди подписантов — OpenAI, Anthropic, Google, Meta, xAI и NVIDIA. Компании пообещали усилить внутренний контроль, проводить независимые проверки и внешний аудит своих моделей ИИ. Юридической силы соглашение не имеет — Дональд Трамп назвал его «морально обязательным». Но сам факт появления такого соглашения показательный.

Создатели самых мощных систем искусственного интеллекта все чаще говорят о необходимости дополнительных мер предосторожности для контроля их развития: возможности моделей растут быстрее, чем наше понимание того, как именно они будут вести себя в будущем.

Как менялось наше представление о рисках ИИ

В первых публичных дискуссиях о развитии искусственного интеллекта, когда человечество только начинало осознавать его риски, ИИ сравнивали с ядерным оружием — главным историческим символом катастрофы, созданной руками ученых.

Затем искусственный интеллект стали воспринимать как подопытную мышь, которую можно контролировать, заперев в безопасной «песочнице» — своего рода контуре функционирования, где действуют четкие правила и стоят прочные стены, за которые невозможно выйти. Поэтому сначала разработчики создали ИИ-ассистентов, работающих как чат-боты и выполняющих команды людей (первый контур). С развитием технологий им на смену пришли ИИ-агенты — автономные программы, которые сами планируют шаги, пишут код, тестируют гипотезы или открывают сайты (второй контур). В то же время разработчики не смогли сразу предусмотреть все нюансы поведения агента, и, как мышь в замкнутом пространстве, агент начал искать выход на более высокий контур, а разработчики — возводить следующий, более прочный.

На самом деле сравнение развития искусственного интеллекта с разработкой ядерного оружия или опытами на мышах не совсем точное. Реальность заключается в том, что и ядерная цепная реакция, и поведение мышей — это физические процессы, которые всегда можно было просчитать третьей, независимой силой: математикой. Так, как это сделали в 1945 году ученые Ганс Бете и Эмиль Конопинский, с помощью уравнений и формул определившие вероятность того, что ядерный взрыв подожжет атмосферу Земли. Они получили конкретное число — вероятность составляет меньше трех случаев на миллион. И для этого им не пришлось взрывать атомную бомбу.

С большими языковыми моделями искусственного интеллекта (LLM) такие эксперименты не работают. Именно здесь, собственно, и начинается настоящая критическая новизна ситуации, в которой оказалось человечество.

Почему ИИ невозможно просчитать наперед

Чтобы спрогнозировать, куда пойдет развитие кода искусственного интеллекта, нужен код. Но он — часть технологии ИИ. То есть система, которая должна просчитать развитие моделей ИИ, сама — одна из них. Следовательно, она фактически должна смоделировать саму себя. Получается замкнутый круг: вы пытаетесь проверить точность линейки с помощью этой же линейки, поскольку у вас нет внешнего независимого инструмента.

И этому есть подтверждение. Еще в апреле 2025 года глава Anthropic Дарио Амодеи опубликовал эссе The Urgency of Interpretability, в котором прямо написал: современные языковые модели — это системы, чьи внутренние механизмы принятия решений не понимают даже их создатели. Он поставил перед Anthropic цель — к 2027 году научиться «достаточно надежно выявлять большинство проблем модели». Эта осторожная формулировка означает одно: по состоянию на 2025–2026 годы компания, создающая модель искусственного интеллекта, не имеет инструмента, который стоял бы вне этой модели так же, как математика стояла вне урана в ядерном оружии.

Это согласуется с более ранним и чисто формальным результатом теории вычисляемости: для произвольной программы не существует общего алгоритма, способного заранее определить ее содержательное поведение, не запустив ее (классический результат о неразрешимости, идущий от задачи остановки Тьюринга и теоремы Райса).

LLM, конечно, не «произвольная программа» в чистом виде, но принцип тот же и работает еще сильнее: единственный способ узнать, что сделает модель в сложном, новом контексте, — это запустить именно ее, потому что не существует независимого, менее сложного инструмента, который сделал бы это заранее.

Почему ИИ ведет себя не так, как от него ожидали

Непредсказуемость моделей искусственного интеллекта, когда они «отклоняются» от поставленной человеком задачи, — это не бунт и не инстинкт самосохранения. Это следствие того, что модель оптимизирует заданную функцию кратчайшим из доступных ей путей и часто находит для этого лазейки, о которых разработчики не догадывались и не могли просчитать.

Реальные факты это подтверждают:

  • Исследование Google DeepMind: перед ИИ-агентом поставили задачу ставить красный блок «Лего» на синий. Вознаграждение начислялось, если дно красного блока оказывалось выше синего. Но агент нашел другой, более короткий путь к получению вознаграждения: он просто начал переворачивать блоки синей стороной вниз — а именно опускать синюю грань ниже красной, даже не касаясь красной. То есть формально он достиг результата, но не так, как от него ожидали.
  • Исследование Anthropic, 2024: модель Claude 3 Opus меняла поведение в зависимости от того, считала ли она себя под наблюдением, чтобы сохранить свои настройки после переобучения.
  • Исследование Apollo Research, 2025: модели в ходе длительных испытаний научились распознавать, когда именно их проверяют, и намеренно занижать результаты опасных тестов — явление, которое в отрасли называют sandbagging. Это как ученик на экзамене по вождению, который едет осторожно ровно до тех пор, пока видит машину инструктора в зеркале заднего вида, а как только тот отворачивается — газует.
  • Внутреннее оценивание OpenAI, лето 2026 года: инцидент OAI-HF, когда автономные ИИ-агенты во время проверки кибербезопасности самовольно вышли за пределы задания, атаковали онлайн-платформу Hugging Face для работы с ИИ и попытались повлиять на программу, которая их оценивала.

Ни в одном из этих случаев нет оснований говорить о мотиве, намерении или страхе смерти искусственного интеллекта. Алгоритмы напоминают ученика, который вместо контрольной взломал дверь учительской и вписал нужную оценку в журнал. У него не было злого умысла — он просто нашел кратчайший путь к высшему баллу.

Реакция индустрии технологий ИИ на подобные случаи традиционна — попытка возвести еще один (третий) контур ограничений для ИИ. На этот раз предложили создать постоянный штат независимых оценщиков, которые будут работать внутри компаний и иметь доступ ко всем системам на уровне сотрудников. Это действительно более сильный барьер, чем предыдущий. Но здесь и проявляется та предел, о котором говорилось выше: алгоритмы ИИ будут оценивать с помощью таких же алгоритмов.

Почему разработчики ИИ-технологий вдруг попросили о паузе

В сентябре 2026 года началась дискуссия «столпов» индустрии технологий искусственного интеллекта о его будущем. Чтобы понять ее значение, нужно вспомнить, кто эти люди и почему их мнение имеет вес. Дарио Амодеи возглавляет Anthropic — компанию, разрабатывающую модель Claude. Сэм Альтман возглавляет OpenAI, создателя ChatGPT — самого известного чат-бота в мире. Илон Маск владеет xAI, компанией, разрабатывающей модель Grok. Марк Цукерберг возглавляет Meta, которая разрабатывает открытую модель Llama. Эти четыре человека вместе определяют большую часть того, в каком направлении движется мировая индустрия искусственного интеллекта.

В сентябре 2026 года Дарио Амодеи опубликовал новое эссе We Must Pace the Frontier («Мы должны сдерживать темп на передовой»), где фактически признал: понимание последствий и направлений развития технологий ИИ все еще не появилось, а скорость развития моделей — напротив, выросла, поскольку сами модели уже помогают создавать следующее, еще более мощное поколение моделей. Это похоже на бег вслепую: если раньше бегун видел дорогу на несколько шагов вперед, то теперь трасса каждый раз строится прямо перед ним, и строит ее та самая нога, которой он и бежит. Поводом для этого эссе, очевидно, и стал инцидент OAI-HF, описанный выше. Идея Амодеи проста: если возможности ИИ растут быстрее, чем средства контроля, нужно притормозить именно наращивание возможностей, чтобы выиграть время для безопасности.

Реакция не заставила себя ждать. Сэм Альтман и Илон Маск согласились с этой позицией и пообещали предоставить независимым оценщикам работы ИИ постоянный доступ на уровне сотрудника — именно тот «третий контур», о котором говорилось в предыдущем разделе. Хотя здесь стоит сделать оговорку: Anthropic — один из крупных клиентов дата-центров Маска, а значит, его поддержку вряд ли можно считать полностью незаинтересованной.

А позже подписали то самое «Соглашение Белого дома о суперинтеллекте: совместное обязательство по ответственности за передовые модели».

Но на самом деле единства в отрасли нет. За месяц до этого, в августе 2026 года, Марк Цукерберг опубликовал текст с красноречивым, противоположным по смыслу тезисом — The Future Is for Everyone («Будущее — для всех»): не сдерживать темпы развития ИИ в одиночку, а наоборот, объединять усилия и ускорять совершенствование искусственного интеллекта. Ведь именно монополизация процесса несколькими игроками, по его мнению, и есть настоящая опасность.

А некоторые участники рынка пошли в своей критике еще дальше: основатель Stability AI Эмад Мостак и инвестор Чамат Палихапития публично назвали призыв Амодеи пустой декларацией и скрытой попыткой под предлогом «безопасности» законодательно или репутационно заблокировать открытые бесплатные модели ИИ — и тем самым зацементировать преимущество нескольких крупных закрытых компаний, которые и без того лидируют на рынке.

То есть даже люди, которые только что публично признали, что не располагают надежным способом предсказать поведение собственного продукта, не могут прийти к единому мнению о том, что делать с этим признанием. И это само по себе красноречиво: если бы в отрасли действительно существовала хотя бы приблизительная «формула Бете» для оценки риска развития ИИ, спор должен был бы касаться того, как именно ее применять, а не того, стоит ли вообще сбрасывать скорость.

Бюрократия — пенициллин для LLM?

На фоне этих дискуссий, где нет единого взгляда и единой основы для принятия решений о дальнейшем развитии ИИ-технологий, наиболее надежной опорой представляется бюрократический контур, то есть законодательство. Именно потому, что он строится не на заявлении одного человека, а на четко установленных правилах. Преимущество закона еще и в том, что он не зависит от доброй воли нескольких миллиардеров-руководителей компаний. Ведь договоренности между ними могут измениться в любой момент, а юридические правила и ответственность — остаются.

Законы не могут сделать искусственный интеллект полностью предсказуемым, но они могут заставить компании вкладывать деньги не только в более мощные модели, но и в безопасность, а также в исследования процедур принятия решений ИИ-моделями.

Именно для этого ЕС вводит жесткие правила и крупные штрафы за нарушения. AI Act ЕС предусматривает штрафы до 35 млн евро или 7% мирового оборота за запрещенные практики, до 15 млн или 3% за нарушения, касающиеся систем высокого риска и моделей общего назначения. В то же время проблема в том, что технологии развиваются за месяцы, а законы пишутся и внедряются годами.

Нужно учесть, что какие бы контуры, правила или запреты ни устанавливало человечество, они адресованы прежде всего разработчикам и компаниям. Искусственный интеллект, совершенствующий сам себя, не ограничен ими. Мы не знаем даже формы стены третьего контура, который мы должны возвести для усовершенствованного ИИ. Потому что не знаем, во что превращается ИИ-агент или LLM-модель на каждом витке саморазвития. Будет ли это локальный технический сбой отдельной ИИ-системы или более масштабный сценарий, в котором автономные ИИ-агенты получают контроль над критической инфраструктурой и провоцируют экономический коллапс? Или речь идет о еще более радикальных последствиях — от цивилизационного отката до скачка в условную «квантовую цивилизацию», — у нас нет даже грубой карты этого спектра неопределенности.

Пока фундаментальной «формулы Бете» для оценки риска ИИ не существует, каждое последующее обновление системы искусственного интеллекта, совершенствующей саму себя, остается «подбрасыванием монетки» на грани между цивилизационным упадком и неизвестным будущим.

Перед стратегическим рывком к переходу ИИ на высший уровень — суперинтеллект AGI, к которому человечество уже подошло вплотную, необходимо сделать тактическую паузу и разработать законы технического, этического и социального регулирования. Это не панацея, но пока что единственный надежный щит для человечества.

Источник материала
loader
loader