Google научила Gemini “просматривать“ видео выборочно: анализ стал на 66% дешевле
Google научила Gemini “просматривать“ видео выборочно: анализ стал на 66% дешевле

Google научила Gemini “просматривать“ видео выборочно: анализ стал на 66% дешевле

Новая функция позволяет выборочно сканировать фрагменты, экономя до 88% токенов при работе с длинными видео.

Вскоре после запуска сервиса для создания и редактирования изображений Pics компания Google представила функцию агентного анализа видео для моделей Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Новая технология позволяет искусственному интеллекту просматривать только нужные фрагменты видео вместо анализа всего материала с фиксированной частотой кадров. По данным компании, это сокращает потребление токенов до 88%, снижает затраты на 66% и повышает точность анализа примерно на 7%.

Gemini самостоятельно решает, что просматривать

В отличие от традиционной обработки, когда модель считывает видео с заранее заданной частотой кадров (по умолчанию один кадр в секунду), агентный режим позволяет Gemini самостоятельно выбирать, какие части видео нужно просматривать более подробно.

Модель анализирует визуальные кадры, аудио и текстовые расшифровки, повторно сканируя нужные фрагменты с более высокой частотой кадров. Такой подход позволяет находить конкретные моменты с точностью до доли секунды, выявлять аномалии, подсчитывать объекты и отвечать на сложные вопросы по многочасовым записям.

Максимальная эффективность

Google отмечает, что преимущества особенно заметны при работе с длительными видео — от 10-минутных инструкций до 90-минутных лекций и многочасовых записей. В тестах LongVideoBench Gemini 3.7 Flash с агентным режимом продемонстрировала лучшее соотношение точности и стоимости среди тестируемых моделей, выйдя на так называемую границу Парето — оптимальный баланс между качеством результатов и затратами на вычисления.

Новые сценарии использования

Функция открывает новые возможности для разработчиков, работающих с большими видеоархивами. В частности, она поддерживает поиск монтажных склеек и мгновенных изменений состояния, поиск нужной информации в многочасовых записях, повторный анализ быстрых движений и более точное отслеживание повторяющихся действий и отдельных объектов.

Уже доступно через API

Агентный анализ видео уже работает через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. Функция поддерживает как загруженные видео, так и ролики с YouTube.

Для активации достаточно установить режим обработки agentic в настройках API. Дополнительная плата за новую возможность не взимается — она использует стандартные тарифы Gemini API.

Google также сообщила, что в ближайшее время технология станет доступна всем пользователям приложения Gemini. В последующие месяцы она начнет работать и в функции Ask YouTube, которая будет отвечать на вопросы с учётом не только субтитров, но и визуального содержания видео.

Недавно Google представила Gemini 3.5 Transcribe — специализированную модель для распознавания и структурирования речи в реальном времени и по аудиозаписям, которая стала преемницей системы Chirp 3. Технология поддерживает более 85 языков, работает с задержкой менее секунды и автоматически очищает текст от слов-паразитов, фиксируя самоисправления говорящего и разделяя голоса собеседников.

Источник материала