Google представила Gemini 3.8 Live і Gemini 3.8 Live Extended Thinking
Google представила Gemini 3.8 Live і Gemini 3.8 Live Extended Thinking

Google представила Gemini 3.8 Live і Gemini 3.8 Live Extended Thinking

Нові системи орієнтовані на голосових агентів, складні сценарії та роботу з візуальним контекстом.

Google представила дві нові голосові моделі Gemini 3.8 Live і Gemini 3.8 Live Extended Thinking. Вони мають зробити спілкування з ШІ швидшим, природнішим і придатним для складних багатокрокових завдань. Моделі орієнтовані як на користувачів Gemini, Workspace і Search, так і на розробників корпоративних голосових агентів. Про це повідомила компанія Google.

Компанія називає Gemini 3.8 Live і Gemini 3.8 Live Extended Thinking своїми найрозвинутішими системами для живого діалогу. Основна мета оновлення — зробити взаємодію з ШІ більш інтуїтивною та інтелектуальною. Нові моделі отримали вдосконалене міркування майже в реальному часі та орієнтовані насамперед на голосові сценарії.

Gemini 3.8 Live створена з розрахунком на масштабування та економічну ефективність. Вона поєднує діалогові можливості, плавну розмову та роботу з візуальним контекстом. Gemini 3.8 Live Extended Thinking призначена для складніших сценаріїв. Модель отримала посилене багатокрокове міркування та вищий рівень інтелекту для завдань, які потребують глибшого аналізу.

Google позиціонує обидві системи як основу для надійних голосових агентів, готових до використання у виробничих середовищах. Вони також мають покращити голосову взаємодію з Gemini у застосунку компанії, Google Workspace та пошуку. 

Gemini 3.8 Live Extended Thinking посіла перше місце в рейтингу Artificial Analysis Speech to Speech Quality Index із результатом 82,6 бала. Модель також показала 68,6% у тесті τ-Voice на виконання агентних завдань і 35,1% у банківському тесті Sierra τ-Voice. У Big Bench Audio вона набрала 97,7%. Google підкреслює, що модель поєднує високі результати з конкурентною вартістю порівняно з іншими передовими системами.

Gemini 3.8 Live також отримала високі оцінки користувачів і посіла друге місце у Speech Agent Arena. Компанія окремо наголошує на її економічності та придатності для масштабного корпоративного використання.

У тесті EVA-Bench від ServiceNow обидві нові моделі просунулися на так звану межу Парето. Йдеться про баланс між точністю виконання складних завдань і якістю діалогу.

Gemini 3.8 Live обробляє візуальний контент майже в реальному часі. Це дозволяє системі враховувати зображення та інші візуальні дані під час розмови. Модель також автоматично розпізнає та перемикається між 97 підтримуваними мовами без переривання діалогу. Крім того, система може запускати інструменти та API у фоновому режимі. При цьому розмова з користувачем не припиняється. Модель може підтвердити отримання запиту та продовжити діалог, поки завдання виконується.

Gemini 3.8 Live Extended Thinking отримала ще одну важливу можливість — одночасно міркувати та говорити. Модель може виконувати складне завдання у фоновому режимі та паралельно підтримувати розмову. Google зазначає, що система використовує короткі природні фрази на кшталт "Дайте перевірю…", щоб одразу реагувати на запит. Вона також може в реальному часі пояснювати хід виконання багатокрокових завдань.

Компанія розраховує, що ці можливості зроблять роботу з Gemini в Google Workspace і Search більш спільною та природною, особливо у складних сценаріях. Для розробників нові моделі доступні через Gemini Live API. Його вже підтримують низка платформ для створення голосових інтерфейсів. Серед них Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel і Vision Agents. Вони беруть на себе інфраструктуру потокової передачі медіа в реальному часі та дозволяють розробникам зосередитися на самому інтерфейсі й сценаріях роботи.

Google також співпрацює з Salesforce, Genspark і Lumeris. У компанії зазначають, що партнери позитивно оцінюють затримку, плавність діалогу та можливості виклику інструментів у Gemini 3.8 Live і Gemini 3.8 Live Extended Thinking.

Джерело матеріала
loader
loader