Вскоре после запуска сервиса для создания и редактирования изображений Pics компания Google представила функцию агентного анализа видео для моделей Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Новая технология позволяет искусственному интеллекту просматривать только нужные фрагменты видео вместо анализа всего материала с фиксированной частотой кадров. По данным компании, это сокращает потребление токенов до 88%, снижает затраты на 66% и повышает точность анализа примерно на 7%.
Gemini самостоятельно решает, что просматривать
В отличие от традиционной обработки, когда модель считывает видео с заранее заданной частотой кадров (по умолчанию один кадр в секунду), агентный режим позволяет Gemini самостоятельно выбирать, какие части видео нужно просматривать более подробно.
Модель анализирует визуальные кадры, аудио и текстовые расшифровки, повторно сканируя нужные фрагменты с более высокой частотой кадров. Такой подход позволяет находить конкретные моменты с точностью до доли секунды, выявлять аномалии, подсчитывать объекты и отвечать на сложные вопросы по многочасовым записям.
Максимальная эффективность
Google отмечает, что преимущества особенно заметны при работе с длительными видео — от 10-минутных инструкций до 90-минутных лекций и многочасовых записей. В тестах LongVideoBench Gemini 3.7 Flash с агентным режимом продемонстрировала лучшее соотношение точности и стоимости среди тестируемых моделей, выйдя на так называемую границу Парето — оптимальный баланс между качеством результатов и затратами на вычисления.
Новые сценарии использования
Функция открывает новые возможности для разработчиков, работающих с большими видеоархивами. В частности, она поддерживает поиск монтажных склеек и мгновенных изменений состояния, поиск нужной информации в многочасовых записях, повторный анализ быстрых движений и более точное отслеживание повторяющихся действий и отдельных объектов.
Уже доступно через API
Агентный анализ видео уже работает через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. Функция поддерживает как загруженные видео, так и ролики с YouTube.
Для активации достаточно установить режим обработки agentic в настройках API. Дополнительная плата за новую возможность не взимается — она использует стандартные тарифы Gemini API.
Google также сообщила, что в ближайшее время технология станет доступна всем пользователям приложения Gemini. В последующие месяцы она начнет работать и в функции Ask YouTube, которая будет отвечать на вопросы с учётом не только субтитров, но и визуального содержания видео.
Недавно Google представила Gemini 3.5 Transcribe — специализированную модель для распознавания и структурирования речи в реальном времени и по аудиозаписям, которая стала преемницей системы Chirp 3. Технология поддерживает более 85 языков, работает с задержкой менее секунды и автоматически очищает текст от слов-паразитов, фиксируя самоисправления говорящего и разделяя голоса собеседников.