Google представила Gemini 3.5 Transcribe: в скором времени она появится в Chrome

Google представила Gemini 3.5 Transcribe: незабаром він з’явиться у Chrome

Вчера Google представила Gemini 3.5 Transcribe как свою «самую точную модель преобразования речи в текст», которая уже используется в нескольких собственных продуктах компании. В отличие от обычных моделей распознавания речи, которым сложно работать с фоновым шумом, сложную терминологию и необходимость очистки речи от пауз и ошибок, Gemini 3.5 Transcribe напрямую преобразует необработанную аудиозапись в точный, отредактированный и структурированный текст.

Эта модель «разработана для того, чтобы фиксировать естественную манеру вашей речи, лучше понимать ваши намерения и распознавать вашу лексику». Gemini 3.5 Transcribe может обрабатывать самоисправления («встретимся во вторник — нет, в среду») и удалять из конечного результата «эээ», «эм» и другие слова-паразиты, а также автоматически форматировать текст и позволять редактировать его естественным голосом. Кроме того, вот что анонсирует Google:

  • Более точная транскрипция: По данным измерений Artificial Analysis, модель демонстрирует среднюю частоту ошибок в словах (WER) на уровне 4,0 % при потоковой обработке и 2,6 % при непотоковой обработке. Она демонстрирует высокую эффективность в реальных условиях с шумом, точно распознавая буквенно-цифровые данные, такие как почтовые индексы и номера заказов.
  • Собственный словарь: распознает специализированную терминологию и уникальные варианты написания, беспрепятственно адаптируя транскрипцию к предоставленному пользователем собственному словарю.
  • Поддержка языков по всему миру: автоматически распознает и транскрибирует более 85 языков, беспрепятственно работая с региональными акцентами и различными диалектами.
  • Идентификация нескольких говорящих: точно определяет, кому принадлежит каждая реплика в предварительно записанном аудио, добавляя временные метки для трёх говорящих. Поддержка более трёх говорящих пока находится в экспериментальной стадии.

Что касается производительности, Gemini 3.5 Transcribe, по словам Google, обеспечивает «значительный прорыв» в различных возможностях, демонстрирует улучшенный показатель частоты ошибок в словах и значительно меньшую задержку по сравнению с моделью транскрипции Chirp 3, представленной в 2025 году. По данным Artificial Analysis, время до получения окончательной транскрипции, например, сократилось на 70%.

Google представила Gemini 3.5 Transcribe: незабаром він з’явиться у Chrome
Изображение: Google

В тесте FLEURS, проведённом для ряда основных языков и локалей, модель демонстрирует точную многоязычную работу, превосходя Chirp 3, достигающий показателя WER на уровне 5,50 % в потоковом режиме и 5,04 % в непотоковом.

«Еще одна цель заключается в том, чтобы позволить пользователям «выполнять задачи с помощью голоса». Функция вызова функций позволяет Gemini 3.5 Transcribe «передавать сложные задачи, такие как генерация изображений и анализ файлов, другим моделям Gemini». Это можно увидеть в функции Speak to Window в приложении Gemini для macOS», — пишет 9to5Google.

Помимо приложения Gemini для macOS и Rambler в Gboard на Android, Gemini 3.5 Transcribe доступно в поле ввода подсказок с микрофоном в Google Antigravity. Следующим местом появления модели станет браузер Chrome, где она позволит «говорить для ввода текста в любом веб-поле, упрощая диктовку ответов, написание публикаций или более естественный и удобный ввод подсказок для Gemini в Chrome». Gemini 3.5 Transcribe доступна:

  • Для разработчиков: в режиме публичного предварительного просмотра через Gemini API в Google AI Studio и Google Antigravity.
  • Для предприятий: в режиме публичного предварительного просмотра через Gemini Enterprise Agent Platform, а в скором времени также появится в Gemini Enterprise for Customer Experience.

В приложении Gemini для macOS возможности модели не ограничатся преобразованием речи в текст. Голосовые команды могут использовать контекст того, что происходит на экране, а Gemini способна привлекать другие модели в фоновом режиме для выполнения более сложных операций. Google также раскрыла технические детали интеграции модели для разработчиков. Gemini 3.5 Transcribe работает через два отдельных API:

  • Первый предназначен для потоковой обработки в реальном времени и обеспечивает непрерывную двунаправленную передачу аудио с задержкой менее секунды.
  • Второй используется для уже записанного аудио — в частности, записей встреч, телефонных разговоров и журналов звонков — и поддерживает распознавание говорящих и временные метки для отдельных слов.

Отдельным преимуществом стала способность модели переключаться между языками прямо во время разговора. Gemini 3.5 Transcribe может автоматически определять язык и продолжать потоковую транскрипцию даже в тех случаях, когда пользователь переключается между языками. Это особенно важно для многоязычных диалогов, где в традиционных системах часто приходится отдельно задавать язык распознавания.

Источник: 9to5Google

Источник материала
loader
loader