Компанія SpaceXAI (раніше xAI) представила Grok 4.6 — нову версію своєї флагманської моделі штучного інтелекту. Розробники зосередилися на довготривалій роботі ШІ-агентів, програмуванні та створенні інтерактивних і візуальних проєктів. Модель Grok 4.6 зрівнялась з GPT-5.6 Sol, яку компанія OpenAI представила минулого місяця, йдеться в офіційному блозі SpaceXAI.
Створення Grok 4.6
Grok 4.6 створили на основі Grok 4.5, але модель пройшла довший додатковий етап навчання. SpaceXAI використовувала дані для розвитку міркування, технічних навичок та програмної інженерії, а також покращила оптимізатор і навчальний процес.
Після цього розробники використали Grok 4.5 для генерації навчальних траєкторій, які модель проходила у сферах STEM, програмування та роботи зі знаннями. Grok 4.6 також навчали виконувати агентські завдання, зокрема у веброзробці, оптимізації коду та автоматизованому проєктуванні.
Оновлення Grok
Одним із головних напрямів оновлення стала здатність моделі працювати над складними завданнями протягом тривалого часу. Grok 4.6 може:
- досліджувати незнайому тему;
- структурувати програму;
- реалізовувати основні функції програми;
- перевіряти власну роботу;
- вносити зміни після кількох раундів зворотного зв'язку.
SpaceXAI також відзначає покращення у створенні візуальних та інтерактивних проєктів. За словами розробників, модель може за один прохід сформувати структуру програми та її візуальний стиль, після чого користувач може доопрацьовувати результат.
У компанії заявляють, що разом із розширенням можливостей моделі посилила й систему безпеки. SpaceXAI провела масштабніше, ніж раніше, тестування до запуску, а також після розгортання та із залученням сторонніх оцінювачів.
Результати тестувань
За показником AA Intelligence Grok 4.6 отримав 61 бал, стільки ж, скільки GPT-5.6 Sol у наведених SpaceXAI порівняннях. У Claude Fable 5 компанії Anthropic цей показник становить 62 бали. Для порівняння, попередня версія Grok 4.5 мала 56 балів.
У низці інших тестів Grok 4.6 також продемонстрував покращення порівняно з попередньою версією. Зокрема, у GDPVal-AA v2 він отримав 1753 бали проти 1526 у Grok 4.5, у CursorBench v3.2 — 69,9% проти 66,7%, а в DeepSWE v1.1 — 65,9% проти 54%.
У частині тестів нова модель поступилася конкурентам. Наприклад, у CursorBench Fable 5 отримав 70,5%, у DeepSWE GPT-5.6 Sol — 73%, а у FrontierCode Fable 5 — 63,6% проти 61,3% у Grok 4.6.
Grok 4.6 уже доступний у Cursor та Grok Build, а також через API й партнерські платформи, серед яких OpenRouter, Vercel та Cloudflare. Ціна починається від $2 за мільйон вхідних токенів і $6 за мільйон вихідних, швидкий режим коштує вдвічі дорожче.
Нагадаємо, що засновник SpaceXAI Ілон Маск під час судових слухань проти OpenAI визнав, що його компанія “частково” застосовувала методи дистиляції на моделях конкурента для навчання чат-бота Grok. Практика дистиляції — використання відповідей потужніших ШІ-систем для тренування нових моделей — залишається одним із найгостріших предметів суперечок щодо інтелектуальної власності та конкуренції серед провідних розробників штучного інтелекту.
