Google нещодавно випустила Gemini 3.7 Flash — модель для програмування та автоматизації бізнес-завдань. Тепер компанія представила Gemini 3.5 Transcribe — нову модель для точного перетворення мовлення на текст у реальному часі та з записаного аудіо. Вона автоматично прибирає слова-паразити, враховує самовиправлення користувача та форматує результат. Про це повідомили у Google.
Google називає Gemini 3.5 Transcribe своєю найточнішою моделлю для розпізнавання мовлення. Вона створена насамперед для голосових інтерфейсів і має працювати краще за звичайні системи speech-to-text у шумному середовищі, зі складною термінологією та природними мовними паузами. Модель перетворює сирий аудіозапис одразу на очищений і структурований текст. Компанія вже використовує цю технологію у власних продуктах, зокрема в Gemini та Android.
Тепер аналогічні можливості стали доступні розробникам через Gemini API в Google AI Studio та Gemini Enterprise Agent Platform. Модель можна інтегрувати у голосових агентів, системи субтитрів у реальному часі та сервіси для аналізу дзвінків. Google пропонує два окремі режими. Перший працює з потоковим аудіо в реальному часі через Live API та модель gemini-3.5-transcribe-live, другий обробляє попередньо записані файли через Interactions API і модель gemini-3.5-transcribe.
У режимі реального часу Gemini 3.5 Transcribe підтримує безперервну двосторонню передачу даних із затримкою менш як секунду. Такий варіант орієнтований на інтерактивні голосові застосунки. Для записаного аудіо модель може створювати транскрипції зустрічей, телефонних розмов та інших матеріалів, визначати співрозмовників і додавати часові мітки на рівні окремих слів.
Однією з головних можливостей стала так звана "розумна транскрипція". Модель розуміє самовиправлення прямо під час мовлення. Наприклад, фразу "зустрінемося у вівторок — ні, у середу" вона може одразу перетворити на остаточний варіант без зайвого фрагмента. Також система прибирає "ем", "ее" та інші слова-паразити і сама форматує текст.
Gemini 3.5 Transcribe підтримує функціональні виклики до інших моделей Gemini. Завдяки цьому голосова команда може запускати складніші дії, наприклад аналіз файлу або генерацію зображення. Поки така можливість доступна, зокрема, в застосунку Gemini для macOS. Інші Gemini-моделі виконують окремі завдання, а Transcribe відповідає за розуміння голосового запиту.
За даними Artificial Analysis, середній показник Word Error Rate для Gemini 3.5 Transcribe становить 4% у потоковому режимі та 2,6% під час обробки записаного аудіо. Модель також демонструє високу точність у реальному шумному середовищі. Вона здатна правильно розпізнавати складні буквено-цифрові послідовності, зокрема поштові індекси, номери замовлень та подібні дані.
Окрема функція дозволяє передавати моделі спеціальний словник. Завдяки цьому система краще розпізнає професійний жаргон, терміни, незвичайні написання і власні назви. Gemini 3.5 Transcribe автоматично визначає понад 85 мов. Вона також враховує регіональні акценти та діалекти і може працювати з перемиканням між мовами під час однієї розмови. Для записаного аудіо доступне визначення кількох співрозмовників. Модель може точно розділяти мовлення до трьох людей і ставити часові мітки. Підтримка більшої кількості голосів поки має експериментальний статус.
Google заявляє, що Gemini 3.5 Transcribe стала значним кроком уперед порівняно з попередньою моделлю Chirp 3. Новинка отримала додаткові функції, нижчу частоту помилок і суттєво меншу затримку. За вимірюваннями Artificial Analysis, час до отримання остаточної транскрипції скоротився на 70%.
Gemini 3.5 Transcribe уже інтегрують у повсякденні продукти Google. На Android вона працює у новій функції Rambler клавіатури Gboard. Користувач може диктувати довільний текст, а система автоматично структурує його та прибирає зайві слова. Голосом також можна виправляти орфографічні помилки, редагувати текст і змінювати стиль написання.
У Google Antigravity модель, за дозволом користувача, може враховувати вміст екрана та історію чату. Це має допомагати точніше розпізнавати назви файлів, думки агентів та активні документи. Такий контекст зменшує кількість помилок у специфічних назвах і словах, які без додаткової інформації важко правильно розпізнати. У Google AI Studio Gemini 3.5 Transcribe доступна в режимі Build. Розробники можуть диктувати команди під час створення застосунків і таким чином писати код голосом. У компанії називають такий підхід одним із варіантів voice-based vibe coding.
У застосунку Gemini для macOS модель перетворює природне мовлення на очищений і форматований текст та одночасно використовує контекст екрана. Це дозволяє голосом запускати складніші сценарії. Наприклад, користувач може попросити підсумувати локальний файл, переробити текст із одного застосунку для іншого або згенерувати зображення прямо біля курсора.
Google також планує додати Gemini 3.5 Transcribe у Chrome. Користувачі зможуть диктувати текст у будь-якому полі на вебсторінці. Це має спростити написання відповідей, дописів та запитів до Gemini без ручного введення з клавіатури.
Нагадаємо, що розвиток голосових функцій Gemini відбувається на тлі стрімкого зростання аудиторії сервісу. Застосунок Gemini перевищив один мільярд щомісячних активних користувачів і став 14-м продуктом Google, який подолав цю позначку. За даними компанії, 63% користувачів безпосередньо спілкуються з асистентом за допомогою голосових функцій.
