Google продемонстрировала Gemini 3.8 Live с живым аватаром и анонсировала Gemini 4

Google показала Gemini 3.8 Live з живим аватаром та анонсувала Gemini 4

Google представила Gemini 3.8 Live with Live Avatar — новую версию своей мультимодальной ИИ-модели, которая добавляет к голосовому разговору видеоаватар в режиме реального времени. Компания также рассказала о новых моделях синтеза речи Gemini 3.8 Flash TTS и Flash-Lite TTS, а руководитель Google DeepMind подтвердил, что Gemini 4 уже находится на этапе подготовки к выпуску.

Gemini 3.8 Live обрела визуальную составляющую

Live Avatar сочетает в себе возможности Gemini для живого диалога с потоковой генерацией видео с низкой задержкой. Как объясняет Google, система может одновременно слушать и анализировать визуальную информацию, а затем отвечать голосом и видео с помощью динамичного цифрового персонажа.

«Аватары обеспечивают синхронизацию движений губ с речью, естественную мимику и плавное чередование реплик. Google позиционирует эту технологию в первую очередь для корпоративного использования — от обслуживания клиентов до интерактивных инструкций и виртуальных помощников. Live Avatar уже доступен в Gemini Enterprise», — пишет Google в блоге.

Кроме того, Google добавила возможность асинхронного запуска инструментов. Пока Gemini выполняет задачи в фоновом режиме, например, проверяет данные или взаимодействует с внешним сервисом, аватар может продолжать разговор с пользователем, не прерывая диалог.

«Еще одна особенность — — многоязычность. Live Avatar поддерживает синхронизацию речи, мимики и движений губ на 97 языках и может переключаться между ними в ходе одного разговора. Для компаний также предусмотрена возможность создания собственных аватаров на основе эталонного изображения, хотя эта функция пока доступна только через корпоративный allowlisting», — говорится в блогах Google.

Google заявляет, что все сгенерированные аудио- и видеоматериалы снабжаются невидимым водяным знаком SynthID. Он призван помогать выявлять контент, созданный ИИ, и снижать риск его ошибочной атрибуции.

Gemini 3.8 научилась создавать голоса

Накануне Google представила Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS — две модели для генерации речи с точным управлением голосом и интонацией.

«Первая — предназначена для создания уникальных голосов на основе текстового описания. Пользователь может задать характер, акцент и другие свойства голоса на естественном языке, а также управлять произнесением каждой реплики отдельно — темпом, эмоциями, паузами и манерой речи. Flash-Lite TTS рассчитана на масштабные задачи, в частности дубляж, создание аудиоконтента и голосовых агентов», — сообщает Google.

Google также сообщает о наличии библиотеки, включающей более 2000 готовых голосов, и поддержке более 100 языков и диалектов. Модель также может воспроизвести голос по 30-секундному аудиообразцу, если у пользователя есть на это право. Для такой функции предусмотрена проверка согласия, SynthID и учетные данные C2PA. Новые модели TTS уже начали внедрять в Gemini API и Google AI Studio. Flash TTS также появляется в Gemini Notebook, а Flash-Lite TTS — — в Google Vids.

Google показала Gemini 3.8 Live з живим аватаром та анонсувала Gemini 4
Image: Google

Gemini 4 может выйти значительно раньше конца года

Параллельно с этим Google готовит следующую флагманскую модель. Руководитель Google DeepMind Корай Кавукчуоглу подтвердил изданию The Information, что Gemini 4 уже перешла до этапа post-training — финальной доработки базовой модели, включающей проверки безопасности, настройку поведения и защитных механизмов. Внутреннее тестирование Gemini 4 уже проводится, в частности, для работы Antigravity.

«Google хочет выпустить раннюю версию результатов пост-обучения как можно скорее, поскольку команда довольна полученными результатами. Мы надеемся на релиз значительно раньше конца 2026 года», — заявил Кавукчуоглу, но конкретной даты компания не назвала.

Таким образом, Google одновременно расширяет возможности Gemini в двух направлениях: делает взаимодействие с ИИ более похожей общение с реальным человеком с помощью Live Avatar и совершенствует технологию аудиогенерации, пока следующее поколение Gemini 4 проходит финальную подготовку к выпуску.

Источник: Google

Источник материала
loader
loader