Google представила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking
Google представила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking

Google представила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking

Новые системы ориентированы на голосовых агентов, сложные сценарии и работу с визуальным контекстом.

Google представила две новые голосовые модели — Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Они призваны сделать общение с ИИ более быстрым, естественным и подходящим для сложных многоэтапных задач. Модели ориентированы как на пользователей Gemini, Workspace и Search, так и на разработчиков корпоративных голосовых агентов. Об этом сообщила компания Google.

Компания называет Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking своими самыми продвинутыми системами для живого диалога. Основная цель обновления — сделать взаимодействие с ИИ более интуитивным и интеллектуальным. Новые модели получили усовершенствованную способность к рассуждению практически в режиме реального времени и ориентированы прежде всего на голосовые сценарии.

Gemini 3.8 Live создана с расчетом на масштабируемость и экономическую эффективность. Она сочетает в себе диалоговые возможности, плавную речь и работу с визуальным контекстом. Gemini 3.8 Live Extended Thinking предназначена для более сложных сценариев. Модель получила усовершенствованное многошаговое рассуждение и более высокий уровень интеллекта для задач, требующих более глубокого анализа.

Google позиционирует обе системы как основу для надёжных голосовых агентов, готовых к использованию в производственных средах. Они также должны улучшить голосовое взаимодействие с Gemini в приложении компании, Google Workspace и поиске.

Gemini 3.8 Live Extended Thinking заняла первое место в рейтинге Artificial Analysis Speech to Speech Quality Index с результатом 82,6 балла. Модель также показала 68,6% в тесте τ-Voice на выполнение агентских задач и 35,1% в банковском тесте Sierra τ-Voice. В тесте Big Bench Audio она набрала 97,7%. Google подчеркивает, что модель сочетает высокие результаты с конкурентоспособной стоимостью по сравнению с другими передовыми системами.

Gemini 3.8 Live также получила высокие оценки пользователей и заняла второе место в Speech Agent Arena. Компания отдельно отмечает её экономичность и пригодность для масштабного корпоративного использования.

В тесте EVA-Bench от ServiceNow обе новые модели достигли так называемого предела Парето. Речь идет о балансе между точностью выполнения сложных задач и качеством диалога.

Gemini 3.8 Live обрабатывает визуальный контент практически в реальном времени. Это позволяет системе учитывать изображения и другие визуальные данные во время разговора. Модель также автоматически распознает и переключается между 97 поддерживаемыми языками без прерывания диалога. Кроме того, система может запускать инструменты и API в фоновом режиме. При этом разговор с пользователем не прерывается. Модель может подтвердить получение запроса и продолжить диалог, пока задача выполняется.

Gemini 3.8 Live Extended Thinking получила ещё одну важную возможность — одновременно размышлять и говорить. Модель может выполнять сложные задачи в фоновом режиме и параллельно поддерживать разговор. Google отмечает, что система использует короткие естественные фразы вроде «Дайте проверю…», чтобы сразу реагировать на запрос. Она также может в реальном времени объяснять ход выполнения многошаговых задач.

Компания рассчитывает, что эти возможности сделают работу с Gemini в Google Workspace и Search более совместной и естественной, особенно в сложных сценариях. Для разработчиков новые модели доступны через Gemini Live API. Его уже поддерживает ряд платформ для создания голосовых интерфейсов. Среди них Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents. Они берут на себя инфраструктуру потоковой передачи медиа в реальном времени и позволяют разработчикам сосредоточиться на самом интерфейсе и сценариях работы.

Google также сотрудничает с Salesforce, Genspark и Lumeris. В компании отмечают, что партнеры положительно оценивают задержку, плавность диалога и возможности вызова инструментов в Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking.

Напомним, что Google ещё в июле расширила линейку Gemini моделями 3.6 Flash, 3.5 Flash Lite и 3.5 Flash Cyber. Главной новинкой стала Gemini 3.6 Flash, которая заменила 3.5 Flash и получила улучшенные возможности программирования. Gemini 3.5 Flash Lite компания назвала своей наиболее эффективной моделью для масштабирования агентных решений с минимальными затратами. Gemini 3.5 Flash Cyber стала первой крупной языковой моделью Google для кибербезопасности.

Кроме того, расширение экосистемы Gemini уже сопровождается резким ростом её аудитории. В августе Сундар Пичаи сообщил, что приложение превысило 1 млрд ежемесячных активных пользователей и стало 14-м продуктом Google с таким показателем. Эта статистика касается только отдельного приложения и не учитывает пользователей Gemini в Search, Workspace, Android и других сервисах.

Источник материала
loader
loader