Не верьте ушам: Google Gemini 3.5 Live Translate будет переводить на 70 языков без пауз
До недавнего времени синхронный перевод требовал сложного оборудования и участия специалистов, а машинные переводчики часто создавали неудобные паузы, ожидая завершения фразы. Однако Google объявила о разработке модели, способной непрерывно обрабатывать аудиопоток с минимальной задержкой всего в несколько секунд. Благодаря этой способности перевод генерируется синхронно с речью говорящего, сохраняя естественный темп и интонацию.
Gemini 3.5 Live Translate автоматически распознает более 70 языков, что делает возможными более 2000 языковых комбинаций. Эта технология разработана таким образом, чтобы сохранять оригинальную интонацию, темп речи и высоту голоса собеседника. Она также адаптирована для стабильной работы даже в noisy environments, что расширяет ее применение за пределы контролируемых студийных условий.
Запуск этой инновации происходит поэтапно, и уже в ближайшее время она начнет интегрироваться в ключевые продукты Google. Для пользователей Google Meet улучшенный голосовой перевод будет доступен в рамках закрытого предварительного просмотра для бизнес-клиентов Google Workspace уже в этом месяце, с более широким запуском, запланированным на конец года.
Обычные пользователи также скоро получат доступ к новой функции. Обновление приложения Google Translate для Android и iOS позволит получать синхронный перевод через наушники. Для владельцев Android-устройств даже предусмотрен режим прослушивания, который позволяет поднести телефон к уху и слышать перевод непосредственно через динамик.
В целях безопасности и для борьбы с дезинформацией весь аудиоконтент, созданный Gemini 3.5 Live Translate, маркируется цифровым водяным знаком SynthID. Этот незаметный для слушателя водяной знак позволяет определять контент, сгенерированный искусственным интеллектом, что является важным шагом в обеспечении правдивости информации.
Технология Gemini 3.5 Live Translate уже доступна для разработчиков через Gemini Live API и Google AI Studio. Внешние партнеры, такие как Agora, LiveKit, Vision Agents и азиатский сервис такси Grab, уже тестируют эту модель. В частности, Grab использует ее для многоязычного общения между водителями и пассажирами, обрабатывая более 10 миллионов голосовых звонков ежемесячно. Это демонстрирует значительный потенциал технологии для интеграции в различные сервисы мгновенного устного перевода.
Ранее Google уже демонстрировал прогресс в сфере искусственного интеллекта, запустив приложение Google AI Edge Eloquent для преобразования речи в текст, которое работает без подключения к интернету. Это приложение использует модели автоматического распознавания речи Gemma и доступно для загрузки на iOS. Разработчики также могут интегрировать технологию в многоязычные звонки, онлайн-уроки, трансляции и международные конференции, расширяя ее применение.
"3.5 Live Translate непрерывно генерирует речь, балансируя между необходимостью ждать контекст для улучшения качества и потребностью переводить немедленно, чтобы оставаться синхронизированной с говорящим", — отмечают в Google, подчеркивая сложность балансировки между скоростью и точностью.
"Этот незаметный водяной знак непосредственно вплетается в аудиовыход, обеспечивая возможность обнаружения контента, созданного ИИ, что помогает предотвращать дезинформацию", — добавляют в Google, говоря о важности защиты от фейковых аудиозаписей и дезинформации.
Запуск Gemini 3.5 Live Translate является важным шагом в преодолении языковых барьеров и сближении культур. Эта технология не только улучшает коммуникацию в реальном времени, но и открывает новые возможности для глобального сотрудничества, устраняя одно из самых больших препятствий в современном мире.

