OpenAI представила дві нові моделі штучного інтелекту — GPT-6 Sol і GPT-6 Luna, які доповнили флагмансьу GPT-6 Astra, що вийшла на початку цього місяця. За даними компанії, нові моделі успадкували ключові можливості Astra у програмуванні, роботі з фактами, використанні комп'ютера та узгодженні цілей (alignment), але стали швидшими й вдвічі дешевшими за своїх попередників із серії GPT-5.6.
GPT-6 Sol і GPT-6 Luna вже доступні для користувачів платних тарифів ChatGPT Work і Codex, а також через API. Користувачі безплатних планів можуть скористатися GPT-6 Luna у десктопному застосунку.
Вартість нових моделей
Найпомітнішою зміною стало зниження вартості API. Для GPT-6 Sol ціна вхідних токенів скоротилася з 4 до 2 доларів за мільйон, вихідних — з 20 до 10 доларів. GPT-6 Luna подешевшала з 0,20 до 0,10 долара за мільйон вхідних токенів і з 1,20 до 0,50 долара за мільйон вихідних токенів.
У компанії пояснюють, що цього вдалося досягти завдяки ефективнішому виведенню моделей та покращеному кешуванню запитів. За словами OpenAI, це робить використання потужного ШІ економічно доцільнішим для повсякденних завдань і масштабних застосунків.
GPT-6 Sol наблизився до Astra
OpenAI позиціює GPT-6 Sol як модель для складної професійної роботи. На бенчмарку AutomationBench, що перевіряє бізнес-процеси із використанням десятків програм, Sol із максимальними зусиллями набрала 33,2%, перевищивши GPT-6 Astra у режимі низьких зусиль (30,3%) і конкурентну модель Claude Opus 5 (26,9%) компанії Anthropic.
На тесті Agent's Last Exam, який оцінює виконання довготривалих професійних завдань у 55 галузях, GPT-6 Sol отримала 56,4%. Це, за даними OpenAI, перевищує найкращий результат Claude Opus 5 при нижчій вартості виконання завдань.
Менше помилок
Розробники стверджують, що GPT-6 Sol приблизно вдвічі скоротила кількість фактичних помилок порівняно з GPT-5.6 Sol на внутрішній оцінці, побудованій на реальних розмовах користувачів. GPT-6 Luna також значно покращила точність і, за даними OpenAI, наблизилася до рівня GPT-5.6 Sol за значно нижчої вартості.
Програмування
У програмуванні GPT-6 Sol покращив результати на FrontierCode, який оцінює готовність коду до інтеграції в реальні проєкти. На DeepSWE 1.1 модель набрала 68,8%, поступившись лише 1,1 відсоткового пункту Claude Fable 5 і зробивши це приблизно на 80% дешевше за вартістю виконання завдань. GPT-6 Luna на цьому ж тесті досягла 66,6%, що, за словами OpenAI, можна порівняти з Claude Opus 5 при середніх налаштуваннях, але за суттєво нижчою ціною.
Використання комп'ютера
Нові моделі також отримали вдосконалення для автоматизації роботи за комп'ютером. На тесті OSWorld 2.0 GPT-6 Sol із максимальними зусиллями показав 60,5%, що майже збіглося з результатом Claude Opus 5 (60,3%). За оцінками компанії, Luna також суттєво покращила продуктивність у таких сценаріях порівняно зі своєю попередницею.
Кешування для довгих розмов
Окремо OpenAI представила оновлену систему кешування запитів, яка має зменшити витрати під час тривалих сесій та роботи агентів. Розробники отримали нові інструменти для відстеження ефективності кешу, можливість змінювати рівень міркування без втрати кешованого контексту та самостійно визначати межі “кешованих префіксів” (Prefix Caching). За словами компанії, GitHub уже використовує ці покращення в Copilot, і вони скоротили частку токенів, які потребують повторної обробки, більш ніж на 50% під час мільярдів запитів.
Узгодженість цілей
В OpenAI зазначають, що Sol і Luna отримали суттєві вдосконалення у сфері безпеки та узгодженості, представлені раніше в GPT-6 Astra. За внутрішніми оцінками, обидва інструменти перевершують аналоги покоління GPT-5.6, зокрема значно рідше видають оманливі відповіді під час написання коду.
“Наведені оцінки навмисно перевіряють складні ситуації і не вимірюють рівень відмов при типовому використанні”, — наголосили в OpenAI.
Доступність
Компанія повідомила, що GPT-6 Sol і GPT-6 Luna вже доступні користувачам тарифів Plus, Pro, Business, Enterprise та Edu через ChatGPT Work і Codex, а також через API під назвами gpt-6-sol і gpt-6-luna. Розгортання моделей у ChatGPT відбуватиметься поступово протягом дня.
OpenAI представила нові моделі майже одночасно з конкурентною компанією Anthropic. Вона випустила свою нову флагманську модель Claude Opus 5.5, яка поєднала продуктивність передової системи Claude Fable 5.1 зі зниженою приблизно на 40% вартістю використання. Нова версія генерує відповіді на 30% швидше за Opus 5, демонструє покращення у програмуванні, а також на 85% рідше намагається обходити внутрішні обмеження.
Водночас генеральний директор Anthropic закликав до скоординованого уповільнення темпів розвитку технології, і його тоді підтримали керівник OpenAI Сем Альтман та глава SpaceXAI Ілон Маск, який напередодні також випустив нову модель ШІ Grok 4.7. Занепокоєння лідерів індустрії раніше викликали ризики неконтрольованого самовдосконалення алгоритмів та інциденти зі зламамиреальних систем.
