Думає, слухає та говорить одночасно: ChatGPT отримав новий голосовий інтерфейс
OpenAI оновила голосовий режим ChatGPT на базі GPT-Live.
З появою розширеного голосового режиму ChatGPT у 2024 році чатбот став спілкуватись більш природно, давати швидші відповіді, а користувачі отримали змогу переривати його у будь-який момент. Однак в OpenAI швидко перейшли до новіших моделей обробки звуку в режимі реального часу, розроблених для досконаліших голосових помічників.
В травні компанія анонсувала GPT-Realtime-2 — найпросунутішу наразі модель обробки голосу. На відміну від попередніх голосових систем, переважно орієнтованих на швидкі розмови, GPT-Realtime-2 використовує логічні міркування на базі GPT-5 у форматі живого діалогу. Це дозволяє голосовим помічникам на базі цієї моделі обробляти складніші запити, надійніше відстежувати тривалі розмови та виконувати багатоетапні завдання, зберігаючи природний стиль спілкування.
Новий голосовий інтерфейс ChatGPT на базі GPT-Live дозволяє чатботу говорити, чути та слухати одночасно, а не робити все це послідовно, як традиційні голосові помічники. Модель здатна природним чином висловлювати невеликі підтвердження, на кшталт “Добре”, або короткі словесні репліки, якщо користувач робить паузу або сповільнює темп аби не переривати його. Чатбот також може мовчати, коли користувачу необхідний час подумати.
Користувачі можуть перервати чатбот у будь-який момент і модель миттєво адаптується. GPT-Live також може відповідати на запитання, які потребують пошуку інформації в інтернеті, глибшого аналізу або складних обчислень, оскільки у фоновому режимі використовується новітня модель підготовки відповіді. Наразі GPT-Live використовує GPT-5.5 у фоновому режимі.
OpenAI випускає дві версії GPT-Live — GPT-Live-1 та GPT-Live-1 mini — для користувачів ChatGPT у всьому світі. Користувачі ChatGPT Go, Plus та Pro отримають модель GPT-Live-1 для голосового керування, а користувачі Free — модель GPT-Live-1 mini. Ці моделі також будуть доступні в API для розробників та підприємств.
Джерело: Neowin

