Google показала Gemini 3.8 Live з живим аватаром та анонсувала Gemini 4

Google показала Gemini 3.8 Live з живим аватаром та анонсувала Gemini 4
Image: The Verge

Google представила Gemini 3.8 Live with Live Avatar — нову версію своєї мультимодальної ШІ-моделі, яка додає до голосової розмови відеоаватар в реальному часі. Компанія також розповіла про нові моделі синтезу мовлення Gemini 3.8 Flash TTS і Flash-Lite TTS, а керівник Google DeepMind підтвердив, що Gemini 4 вже перебуває на етапі підготовки до релізу.

Gemini 3.8 Live отримала візуальну присутність

Live Avatar поєднує можливості Gemini для живого діалогу з потоковою генерацією відео з низькою затримкою. Як пояснює Google, система може одночасно слухати й аналізувати візуальну інформацію, а потім відповідати голосом і відео за допомогою динамічного цифрового персонажа.

“Аватари підтримують синхронізацію рухів губ із мовленням, природну міміку та плавне чергування реплік. Google позиціонує технологію насамперед для корпоративного використання — від обслуговування клієнтів до інтерактивних інструкцій і віртуальних помічників. Live Avatar вже доступний у Gemini Enterprise”, — пише Google у блозі.

Окремо Google додала можливість асинхронного виконання інструментів. Поки Gemini виконує завдання у фоновому режимі, наприклад, перевіряє дані або працює із зовнішнім сервісом, аватар може продовжувати розмову з користувачем, не перериваючи діалог.

“Ще одна особливість — мультимовність. Live Avatar підтримує синхронізацію мовлення, міміки та рухів губ у 97 мовах і може переходити між ними під час однієї розмови. Для компаній також передбачене створення власних аватарів на основі референсного зображення, хоча ця функція поки доступна лише через корпоративний allowlisting”, — йдеться у блогах Google.

Google заявляє, що всі згенеровані аудіо- та відеоматеріали отримують невидимий водяний знак SynthID. Він має допомагати визначати контент, створений ШІ, і зменшувати ризик його помилкової атрибуції.

Gemini 3.8 навчилася створювати голоси

Напередодні Google представила Gemini 3.8 Flash TTS і Gemini 3.8 Flash-Lite TTS — дві моделі для генерації мовлення з детальним керуванням голосом та інтонацією.

“Перша орієнтована на створення унікальних голосів із текстового опису. Користувач може задати характер, акцент та інші властивості голосу природною мовою, а також керувати виконанням кожної репліки окремо — темпом, емоціями, паузами та манерою мовлення. Flash-Lite TTS розрахована на масштабні завдання, зокрема дубляж, створення аудіоконтенту та голосових агентів”, — повідомляє Google.

Google заявляє також про бібліотеку з понад 2000 готових голосів і підтримку більш ніж 100 мов та діалектів. Модель також може відтворити голос за 30-секундним аудіозразком, якщо користувач має на це право. Для такої функції передбачені перевірка згоди, SynthID і облікові дані C2PA. Нові TTS-моделі вже почали розгортати в Gemini API та Google AI Studio. Flash TTS також з’являється в Gemini Notebook, а Flash-Lite TTS — у Google Vids.

Google показала Gemini 3.8 Live з живим аватаром та анонсувала Gemini 4
Image: Google

Gemini 4 може вийти значно раніше кінця року

Паралельно Google готує наступну флагманську модель. Керівник Google DeepMind Корай Кавукчуоглу підтвердив виданню The Information, що Gemini 4 вже перейшла до етапу post-training — фінального доопрацювання базової моделі, яке включає перевірки безпеки, налаштування поведінки та захисних механізмів. Внутрішнє тестування Gemini 4 уже проводиться, зокрема для роботи Antigravity.

“Google хоче випустити ранню версію результатів post-training якнайшвидше, оскільки команда задоволена отриманими результатами. Ми сподіваємося на реліз значно раніше кінця 2026 року”, — заявив Кавукчуоглу, але конкретної дати компанія не назвала.

Таким чином, Google одночасно розширює Gemini у двох напрямках: робить взаємодію з ШІ більш схожою на спілкування з реальною людиною за допомогою Live Avatar і розвиває аудіогенерацію, поки наступне покоління Gemini 4 проходить фінальну підготовку до виходу.

Джерело: Google

Джерело матеріала
loader
loader