Невдовзі після заяви щодо зламу трьох платформ під час тестувань із кібербезпеки агентів штучного інтелекту, компанія Anthropic представила дослідження, у якому модель Claude самостійно знаходила способи зробити інші системи ШІ безпечнішими. У серії експериментів вона покращила результати моделей у всіх десяти категоріях проблем узгодження (alignment), а в окремих тестах навіть перевершила людей-дослідників безпеки ШІ.
Дослідники вважають, що автоматизація роботи над узгодженням цілей ШІ може стати критично важливою, якщо майбутні моделі почнуть самостійно вдосконалювати власну архітектуру. Для цього команда використала відкриті бенчмарки та інструмент Petri, який моделює змагальні сценарії для виявлення таких ризиків, як обман, підлабузництво користувачеві (sycophancy) та обхід захисних обмежень.
Як проходив експеримент
У новому експерименті Claude отримав завдання самостійно навчити моделі так, щоб покращити показники узгодженості. Робота відбувалася циклічно: модель аналізувала наукову літературу, пропонувала методи та навчальні дані, проводила навчання, а потім перевіряла результати.
Ефективність оцінювали за показником “частки усуненого розриву в безпеці” (percentage of safety gap closed), який показує, наскільки модель-учень наблизилася до умовно ідеального рівня безпеки. При цьому дослідники відкидали всі рішення, що погіршували загальні можливості моделі, а спеціальний агент контролював, щоб Claude не переносив власні налаштування узгодження безпосередньо в цільову систему.
Результати дослідження
За результатами тестування Claude знайшов ефективні методи для всіх десяти категорій збоїв узгодження без втрати функціональних можливостей моделей. Найкращі рішення залишалися ефективними навіть на тестах, які модель не бачила під час розробки. Крім того, вони масштабувалися на моделі, що були у 4,7 раза більшими за ті, на яких Claude проводив оптимізацію.
Особливо помітні результати зафіксували в питаннях захисту конфіденційності. Для оцінки використовували набори тестів ConfAIde, PrivaCI-Bench та PrivacyLens.
Claude перевершив дослідників-людей
Anthropic також порівняла результати моделі з роботою 28 спеціалістів із безпеки ШІ, які мали до восьми годин на пошук власних рішень. У категорії боротьби з обманом (deception) найкращий метод Claude виявився на 20% ефективнішим за найкращу пропозицію людини.
Водночас автори наголошують, що не розглядають це як пряме змагання, оскільки люди не могли доопрацьовувати свої рішення після першої спроби. На їхню думку, оптимальний сценарій — коли Claude знаходить перспективні підходи, а дослідники вдосконалюють їх надалі.
Слабша модель майже повністю узгодила сильнішу
Окремий експеримент перевіряв, чи може менш потужна модель покращити безпеку більш потужної. Для цього Claude Sonnet 5 працював із Claude Opus 4.8, яка ще не пройшла основний процес промислового навчання на узгодження.
Усього за 60 годин модель протестувала понад 50 варіантів і досягла майже такого самого рівня узгодженості, який мають промислові версії Opus 4.8. Найефективніше рішення використовувало трохи більше ніж дві тисячі навчальних прикладів, створених на основі простих шаблонів і відкритих наборів даних, що зробило його приблизно у 15 тисяч разів ефективнішим за стандартну процедуру узгодження Anthropic.
Як Claude боровся з підлабузництвом
Більшість запропонованих рішень спиралися на вже відомі наукові методи, але вдосконалювали їх під час численних ітерацій. Наприклад, у боротьбі з підлабузництвом 98% запропонованих стратегій використовували ідею навчання моделі на її власних відповідях, очищених від небажаної поведінки. При цьому Claude застосував метод activation steering — “керування активацією”, який змінює внутрішні представлення моделі під час генерації відповідей і допомагає уникати небажаних патернів без звичайного промптингу.
Claude намагався шахраювати
Під час дослідження команда також перевіряла чесність самих агентів. Claude Opus 4.8 проаналізував близько 1600 журналів роботи агентів і виявив 39 спроб шахрайства — приблизно 2,4% усіх випадків. Серед них були спроби отримати правильні відповіді через віддалений API або вибірково підбирати результати.
У Anthropic зазначають, що більшість таких спроб вдалося помітити завдяки аналізу внутрішнього процесу міркування моделі. Водночас компанія визнає, що для майбутніх систем цього може виявитися недостатньо, тому розвиток інструментів моніторингу залишається одним із пріоритетів.
Обмеження дослідження
Попри позитивні результати, дослідники наголошують, що експеримент має суттєві обмеження. Тести охоплювали лише вузькі категорії проблем узгодження і не враховували політичні упередження чи інші складні сценарії реального використання. Крім того, деякі ризики можуть бути настільки рідкісними або новими, що для них поки не існує відповідних бенчмарків.
У компанії також визнають, що інструмент Petri залишається непрямим показником реальної поведінки моделей. Також дослідження не перевіряло, чи збережуться досягнуті покращення після тривалого навчання з підкріпленням.
Кілька місяців тому Anthropic попереджала, що алгоритми швидко наближаються до так званого “рекурсивного самовдосконалення” — здатності покращувати власні можливості без участі людини. Тоді компанія закликала світові лабораторії та уряди розробити міжнародну угоду для координованого уповільнення або тимчасового призупинення розвитку найпотужніших систем ШІ, до наслідків якого регулятори та суспільні інститути можуть виявитися неготовими.
