Anthropic выпускает Opus 5.5: более низкие цены и производительность уровня Fable

Anthropic випускає Opus 5.5: нижчі ціни та продуктивність рівня Fable

Вчера компания Anthropic выпустила свою новейшую модель Opus 5.5, которая, по словам компании, устанавливает новый стандарт производительности в программировании и работе со знаниями. Opus — самый мощный и самый дорогой уровень в трёхуровневой линейке Claude от Anthropic; Sonnet занимает занимает среднее место, а Haiku — самая быстрая и самая дешевая. Примечательно, что Anthropic заявляет: новая модель опережает более крупную модель Fable во многих тестах и справилась с рядом неформальных задач, которые Fable не смогла выполнить.

Новая модель также значительно дешевле своей предшественницы. Исходные токены для Opus 5.5 будут стоить 20 долларов за миллион токенов против 25 долларов за предыдущую модель. Другие ценовые показатели также снизились примерно на столько же. Модель также работает быстрее, что отражает общее сокращение вычислительных ресурсов, необходимых для его работы. Новая версия также существенно изменила стиль общения Opus: Opus 5.5 реже использует сленг и чаще помещает важную информацию в начале своих сообщений.

«Запуск состоялся всего через два месяца после выпуска Opus 5 24 июля. Согласно объявлению, Sonnet 5.5 и Haiku 5.5, следующие модели линейки, будут выпущены «в ближайшие недели» с аналогичными улучшениями производительности», — пишет TechCrunch.

Anthropic заявляет, что Opus 5.5 сопоставим с Mythos по возможностям в области биологии и кибербезопасности, поэтому его выпуск подпадает под те же меры безопасности, что и модель Fable. Эти меры ограничивают использование моделей для поиска уязвимостей в скомпилированных программах или разработки биологического оружия, которое можно распознать, помимо прочего.

Anthropic випускає Opus 5.5: нижчі ціни та продуктивність рівня Fable

Opus 5.5 — это первый релиз модели Anthropic после того, как генеральный директор компании Дарио Амодей поддержал призывы замедлить развитие передовых систем, намеренно сдерживая прогресс в возможностях ИИ, чтобы он соответствовал темпам развития методов обеспечения безопасности.

«Я убедился, что для полного устранения рисков требуется ещё большая осторожность», — написал Амодей в своём посте в начале этого месяца, — «Не только инвестирование в предотвращение рисков, но и регулирование темпов развития возможностей таким образом, чтобы меры по предотвращению рисков успевали за ними».

Разработка Opus 5.5 в целом проходила аналогично разработке его предшественников, включая тестирование на совместимость и предрелизную оценку со стороны внешних организаций, таких как METR и Frontier Design. В то же время Anthropic подчеркнула, что для будущих моделей уже разрабатываются более совершенные системы обучения и оценки, в частности усовершенствованные системы безопасности и мониторинга.

«По мере того, как ИИ становится всё более мощным, государственная политика должна играть всё более важную роль в обеспечении безопасности систем, на которые полагаются люди. Создание такого потенциала требует времени, и мы уже начали создавать инфраструктуру для поддержки этих усилий», — говорится в записи в блоге. — «Мы надеемся в ближайшее время поделиться более подробной информацией об этих усилиях».

Anthropic приводит конкретные примеры работы Opus 5.5 с крупными программными проектами. Один из первых тестировщиков с помощью модели выполнил миграцию кодовой базы объемом 680 000 строк менее чем за сутки — по оценке компании, для команды инженеров такая работа могла бы занять несколько недель.

Anthropic випускає Opus 5.5: нижчі ціни та продуктивність рівня Fable

В другом тесте модель 39 раз из 40 успешно сократила время загрузки страниц веб-приложения, тогда как Opus 5 вносила менее значительные изменения, которые при этом могли влиять на поведение программы. Показательным стал и внутренний тест с HAProxy — — программным обеспечением для балансировки веб-трафика между серверами.

«Opus 5.5 и Fable 5.1 должны были перенести его с C на Rust, причём обе версии прошли почти все собственные регрессионные тесты HAProxy. Opus 5.5 выполнила задачу за 9,5 часа против 12 часов у Fable 5.1, затратив на это на 51% меньше средств. Для Opus 5.5 также предусмотрен отдельный быстрый режим в Claude Code и Claude Platform. Он может ускорять работу до 2,5 раз, но имеет другую тарификацию — $8 за миллион входных токенов и $40 за миллион выходных», — говорится в официальном релизе Anthropic.

Anthropic отдельно усилила защиту модели от атак с использованием prompt injection. По данным компании, Opus 5.5 не уступает Opus 5 по всем тестируемым сценариям, включая программирование, использование инструментов, взаимодействие с компьютером и просмотр веб-страниц. В тесте компании Gray Swan новая модель продемонстрировала такой же самый низкий уровень успешности prompt injection, как и Fable 5.1.

Источник: TechCrunch

Источник материала
loader
loader