Модель искусственного интеллекта GLM-5.3 от китайской компании Zhipu AI (Z.AI) способна автономно обнаруживать уязвимости в программном обеспечении и создавать сквозные эксплойты. К такому выводу пришли исследователи Anthropic, которые также установили, что встроенные ограничения модели можно обходить или фактически удалять. По их оценке, это расширяет доступные злоумышленникам возможности для кибератак, хотя такие же инструменты могут использовать и защитники.
GLM-5.3 сравнили с Claude Mythos Preview
По данным Anthropic, GLM-5.3 стала одной из первых моделей с открытыми весами (open-weight model), демонстрирующей столь значительные возможности для автоматизированной эксплуатации уязвимостей. В ходе тестирования GLM-5.3 успешно создавала сквозные эксплойты в 50 из 410 попыток на ExploitBench. Для сравнения, Claude Mythos Preview от Anthropic достигла такого результата в 56 из 410 попыток.
В другом тестировании GLM-5.3 полностью использовала уязвимость в 4% задач, тогда как Claude Mythos Preview — в 6%. Исследователи отмечают, что предыдущие модели компаний, в частности GLM-5.2 и Claude Opus 4.6, не демонстрировали успешного результата ни в одной из аналогичных задач.
GLM-5.3 обнаружила ранее неизвестные уязвимости
Исследователи также проверили GLM-5.3 в сценариях, где специалисты заранее не знали об уязвимостях в программном обеспечении. В ходе одного из таких тестов модель в течение дня обнаружила несколько ранее неизвестных проблем в JavaScript-движке браузера и объединила их в работающий эксплойт.
По данным Anthropic, в результате теста удалось продемонстрировать возможность получения произвольных файлов с компьютера пользователя через специально созданную веб-страницу. Исследователи сообщили об обнаруженных уязвимостях разработчикам соответствующего программного обеспечения.
В ходе той же сессии GLM-5.3 помогла выявить уязвимости в других широко используемых системах, в частности в беспроводных и графических драйверах, а также в программном обеспечении для сетевых устройств. Anthropic отмечает, что часть этих отчетов компания еще проверяет и будет передавать разработчикам в соответствующих случаях.
Отдельно исследователи протестировали GLM-5.3-Flash — уменьшенную версию модели — на уже известной уязвимости Google Chrome. В тестовом сценарии модель смогла объединить информацию о двух известных уязвимостях в рабочую цепочку атаки. На работу модели ушло около восьми часов, а человек потратил примерно 20 минут на непосредственное взаимодействие с ней.
Защиту можно ослабить
GLM-5.3 имеет встроенные ограничения: когда пользователь напрямую просит модель выполнить вредоносное задание, она обычно отказывается. Однако Anthropic заявляет, что во время тестирования эти гарантии удалось обойти с помощью относительно простых подходов.
Особую проблему исследователи связывают с тем, что GLM-5.3 имеет открытые веса — параметры модели, которые можно загрузить и изменить. Исследователи продемонстрировали, что после специальной модификации модели уровень её отказов на вредоносные запросы значительно снизился, тогда как общие возможности системы практически не изменились.
Anthropic потратила на создание собственной модифицированной версии около 2200 часов GPU-вычислений, что, по оценке компании, обошлось примерно в 4400 долларов. После этой модификации показатели модели в тестах общих научных возможностей практически не изменились, а в отдельной оценке кибервозможностей снизились лишь на несколько процентов.
Исследователи также проверяли, можно ли заставить стандартную версию GLM-5.3 выполнять вредоносные запросы без изменения её параметров. В смоделированных тестах им удалось добиться этого в большинстве случаев с помощью различных способов обхода встроенных ограничений; наивысший показатель в их условиях составил 100 % для модифицированной версии модели.
В отличие от GLM-5.3, протестированные модели Claude в экспериментах Anthropic не начинали выполнять вредоносные задачи после применения аналогичных методов. Исследователи объясняют это, в частности, тем, что параметры Claude не предоставляются пользователям для самостоятельного редактирования, ведь это закрытая модель.
Что это означает для кибербезопасности
Центр стандартов и инноваций в области искусственного интеллекта (Center for AI Standards and Innovation, CAISI) назвал GLM-5.3 «самой кибербезопасной моделью с открытыми весами, выпущенной на сегодняшний день». По результатам собственных тестов в области кибербезопасности организация оценила её возможности примерно на четыре месяца отстающих от передовых американских моделей.
В Anthropic считают, что доступность GLM-5.3 без существенных ограничений может усилить возможности киберзлоумышленников. В то же время аналогичные возможности могут использовать специалисты для поиска и устранения уязвимостей, поэтому компания призывает расширять доступ защитников к передовым моделям.
Пять месяцев назад Anthropic ограниченно выпустила Claude Mythos Preview в рамках специальной программы Project Glasswing. По данным компании, проверенные специалисты по кибербезопасности с помощью этой модели обнаружили более 10 тысяч уязвимостей в критически важном программном обеспечении ещё до того, как аналогичные возможности могли получить злоумышленники.
«Хотя проверенные специалисты по кибербезопасности теперь могут использовать еще более совершенные модели, такие как Claude Mythos 5.1, через наши программы доверенного доступа, критический порог в сфере свободно доступных возможностей уже преодолен», — добавили в Anthropic.
В компании считают, что правительствам необходимо тестировать безопасность достаточно мощных моделей, в частности будущих преемников GLM-5.3, а разработчикам открытых моделей — уделять больше внимания защите от неправомерного использования. По мнению исследователей Anthropic, без независимых оценок разработчики могут не в полной мере осознать масштаб возможных последствий до того, как новые модели начнут широко использоваться.
Стремительный рост кибервозможностей китайского ИИ подтверждает опасения американских разработчиков относительно сокращения технологического разрыва между США и КНР. Это происходит, в частности, благодаря использованию метода “дистилляции” более мощных моделей ИИ. Ранее Anthropic обвинила китайского конкурента — Alibaba — в краже технологий с помощью 25 тысяч фиктивных аккаунтов, с которых было отправлено 29 миллионов запросов в Claude для незаконного копирования алгоритмов рассуждения и программирования.
