Команда платформи TryAI порівняла моделі штучного інтелекту GPT-5.6 Sol, Claude Fable 5, Grok 4.5 і Gemini 3.6 Flash у незвичному тесті. Системи не генерували готові зображення, а самостійно малювали їх на порожньому полотні за допомогою цифрових кольорових олівців. За підсумками експерименту найкращий результат показала модель OpenAI, тоді як Claude виявився найдорожчим, а Grok — найслабшим за якістю.
Дослідники створили спеціальне середовище Canvas Arena, у якому моделі отримували чисте полотно та набір інструментів: могли змінювати колір і товщину олівця, силу натискання, розмазувати штрихи, стирати окремі ділянки та переглядати власний малюнок для внесення змін. Загалом вони виконали 28 робіт: відтворили “Мону Лізу” Леонардо да Вінчі та “Зоряну ніч” Вінсента ван Гога, а також створили п'ять ілюстрацій за текстовими описами.
Як проходив експеримент
У тестуванні брали участь GPT-5.6 Sol, Claude Fable 5, Grok 4.5 та Gemini 3.6 Flash. Всі моделі працювали з однаковим набором інструментів і мали однакові умови. Точність відтворення картин оцінювали за метрикою структурної подібності (Structural Similarity Index Measure, SSIM).
Для відкритих творчих завдань моделі малювали літнього рибалку, захід сонця над океаном, червону троянду у вазі, кішку на підвіконні та інтер'єр дерев'яної хатини з каміном. Ці роботи не оцінювалися автоматично, оскільки не мали еталонного зображення.
GPT-5.6 став лідером
За підсумками тесту GPT-5.6 Sol отримав найкращу загальну оцінку авторів експерименту. Команда TryAI відзначила, що саме ця модель створила найдетальніші роботи, а її версії “Зоряної ночі” та троянди стали їхніми фаворитами.
Gemini 3.6 Flash показав найвищі значення SSIM для обох картин, однак автори зазначили, що автоматична метрика не завжди відповідає людському сприйняттю якості. Claude Fable 5 посів друге місце за результатом, але поступився через значно більшу вартість і тривалість роботи, тоді як Grok 4.5 продемонстрував найслабші результати.
Вартість і швидкість суттєво відрізнялися
За сім малюнків GPT-5.6 Sol використав близько 3,4 мільйона токенів, працював у середньому 6,2 хвилини над кожною роботою, а орієнтовна вартість становила 7,74 долара. Claude Fable 5 витратив понад 14,6 мільйонів токенів і приблизно 160,6 долара, що майже у 20 разів дорожче за GPT-5.6. Grok 4.5 використав найбільше токенів — 34 мільйона, але завдяки кешуванню його вартість залишилася на рівні 9,21 долара. Gemini 3.6 Flash обробив 27,7 мільйонів токенів з приблизною вартістю 12,87 долара.
Більше перевірок не означає кращий результат
Дослідники також відстежували, як моделі переглядали власні роботи під час малювання. Виявилося, що всі вони досягали найкращої схожості із зразком ще до завершення процесу, а потім часто погіршували результат, продовжуючи вносити зміни.
Наприклад, Gemini 3.6 Flash переглядав своє полотно в середньому понад 22 рази на малюнок, однак фінальна версія виявлялася гіршою за найкращий проміжний результат. Аналогічну тенденцію продемонстрували GPT-5.6 Sol, Claude Fable 5 і Grok 4.5.
Для чого проводили такий тест
Автори наголошують, що експеримент не був офіційним бенчмарком і не претендує на оцінку художніх здібностей моделей. Його метою було показати, як різні системи планують дії, користуються інструментами, оцінюють власний результат і наскільки ефективно працюють у відкритих творчих завданнях.
Нещодавно співзасновник OpenAI Андрей Карпати провів експеримент, під час якого модель Claude Opus 5 від Anthropic за дві години та 5500 рядків коду створила інтерактивну 3D-візуалізацію початку роману “Володар перснів”. Дослідник зазначив, що великі мовні моделі виходять за межі генерації простого тексту й переходять до створення персоналізованих ефемерних ігрових світів.
