Новости ИИЗнаков 7999Время чтения20 мин

Google добавляет агентную обработку видео в Gemini API, сокращая использование токенов до 88%

Gemini теперь может динамически анализировать длинные видео; Google сообщает о снижении числа токенов до 88%, затрат — до 66% и повышении точности до 7%.

Содержание · 11
  1. 1. Gemini больше не обязана обрабатывать каждое видео с фиксированной частотой
  2. 2. Разработчики могут выбирать режим для каждого видео
  3. 3. Заявления об эффективности зависят от видео и вопроса
  4. 4. Непосредственное влияние касается проектирования приложений для длинных видео
  5. Частые вопросы
  6. Что такое агентное понимание видео?
  7. Какие модели Gemini поддерживают эту функцию?
  8. Всегда ли это сокращает использование токенов на 88%?
  9. Дороже ли включать агентную обработку?
  10. Следует ли разработчикам использовать её для коротких видео?
  11. Источники

Google выпустила агентное понимание видео для Gemini API, заменив анализ видео с фиксированной частотой кадров процессом, управляемым запросом и способным выбирать, какие части записи нужно изучить. По данным Google, этот режим использует до 88% меньше токенов, снижает стоимость анализа до 66% и повышает точность до 7% в её бенчмарках видеоанализа.

Функция была запущена 1 сентября 2026 года для Gemini 3.7 Flash, Gemini 3.6 Flash и Gemini 3.5 Flash-Lite в API Interactions и GenerateContent. Она доступна для загруженных файлов и общедоступных видео YouTube через Google AI Studio и Gemini Enterprise Agent Platform.

Днём позже Google выпустила Gemini 3.8 Flash. По состоянию на 3 сентября в актуальной документации для разработчиков эта модель также указана как поддерживающая агентное понимание видео, хотя в первоначальном анонсе и примечании к выпуску от 1 сентября названы только три более ранние Flash-модели.

1. Gemini больше не обязана обрабатывать каждое видео с фиксированной частотой

Стандартный статический режим обработки видео в Gemini извлекает кадры с фиксированной частотой — один кадр в секунду — и за один проход помещает полученный видеоконтекст в модель. Разработчики могут настроить частоту выборки, но должны сделать это до того, как модель ответит на вопрос.

Для длинных записей это создаёт компромисс. Высокая частота выборки расходует больше контекста и входных токенов, тогда как низкая может пропустить кратковременные действия, границы монтажа, визуальные дефекты или другие события между отобранными кадрами. Разработчики могут создавать собственные конвейеры предобработки для поиска по расшифровкам, разделения видео на сегменты и повторной выборки перспективных интервалов, но эта работа выполняется за пределами модели.

Агентная обработка переносит эти решения во внутренний цикл инференса Gemini. В ответ на запрос модель может перемещаться по временной шкале, запрашивать выбранные кадры или аудио, изучать расшифровку и повторно анализировать релевантные интервалы с другой частотой кадров или разрешением. Она загружает доказательства, которые считает необходимыми, вместо того чтобы автоматически помещать в контекст фиксированное представление полного видео.

Это форма внутреннего использования инструментов, а не новая система генерации видео. Gemini по-прежнему отвечает на вопросы о предоставленных материалах; изменение касается того, как она собирает визуальные и аудиодоказательства перед формированием ответа.

Google называет целевыми сценариями поиск моментов с точностью до долей секунды, обнаружение аномалий, подсчёт повторяющихся действий, подсчёт объектов и поиск по многочасовым записям. Динамическая повторная выборка особенно актуальна, когда первоначальное сканирование выявляет короткий интервал с быстрым движением или едва заметным визуальным изменением.

2. Разработчики могут выбирать режим для каждого видео

В Interactions API разработчики включают функцию, устанавливая поле processing для входного видео в значение "agentic". Эквивалентная конфигурация GenerateContent использует настройку mediaProcessing или media_processing в зависимости от SDK.

Выбор делается для каждого видео, а не для всего запроса. Поэтому приложение, сравнивающее несколько записей, может использовать агентную обработку для длинной лекции, сохраняя статическую обработку для короткого эксперимента в том же запросе.

Это различие важно, поскольку Google не представляет агентный режим как универсально более быстрый. В документации рекомендуется статическая обработка для чувствительных к задержке роликов длительностью менее пяти минут и для задач, требующих последовательного покадрового покрытия всей записи. Агентная навигация может увеличить время до первого токена на коротких роликах, поскольку модель выполняет внутренние рассуждения и обращения к инструментам перед формированием ответа.

Interactions API показывает доказательства того, что такая навигация состоялась. Ответы могут содержать шаги processing_call и processing_result перед финальным выводом модели. Приложения могут использовать эти шаги для отображения хода выполнения, хотя им не нужно отправлять ответ на каждый внутренний вызов. Ответы GenerateContent аналогично сохраняют части вызовов и ответов инструмента MEDIA_PROCESSING для контекста многоходовых рассуждений.

Видеоконтекст также может сохраняться между ходами в состоянии взаимодействия. Это позволяет пользователю задавать уточняющие вопросы без того, чтобы приложение вручную воссоздавало предыдущий процесс анализа модели.

Существующие ограничения Gemini на видеоввод по-прежнему применяются. Согласно документации Google, модели Gemini 2.5 и более поздние версии могут получать до 10 видео в одном запросе. Входные видео YouTube должны быть общедоступными, а не приватными или доступными по ссылке, а пользователи бесплатного тарифа ограничены восемью часами загрузок видео YouTube в день.

3. Заявления об эффективности зависят от видео и вопроса

Ключевые показатели Google — это максимальные улучшения, а не фиксированные сокращения для каждого запроса. Компания сообщает о снижении потребления токенов до 88%, снижении стоимости анализа до 66% и повышении точности до 7% в своих стандартных бенчмарках видеоанализа.

Заявленные преимущества наиболее актуальны для длинных материалов, включая 10-минутные обучающие видео, 90-минутные лекции и записи продолжительностью в несколько часов. Для таких входных данных узконаправленный вопрос может требовать лишь фрагмента расшифровки и нескольких визуальных интервалов, а не представления полной записи с фиксированной частотой кадров.

Расход токенов зависит от сложности запроса и глубины динамической выборки. Детальный вопрос может заставить Gemini изучить больше сегментов или отобрать выбранные части с частотой выше одного кадра в секунду. Поэтому разработчики не могут предполагать, что каждый запрос достигнет заявленного сокращения на 88%.

Google не ввела отдельную плату за функцию агентного понимания видео. Для запросов применяются стандартные цены токенов Gemini API для соответствующей модели. Заявленное снижение стоимости обусловлено обработкой меньшего числа токенов, а не льготной ставкой для агентного видео.

Максимальное снижение стоимости на 66% также меньше максимального сокращения токенов на 88%. Эти показатели не следует объединять, как если бы они описывали одну гарантированную рабочую нагрузку: это максимумы в бенчмарках, а полный запрос может включать динамически загружаемые медиа, токены рассуждений и выходные токены, тарифицируемые согласно ценам выбранной модели.

Показатели Google остаются данными поставщика. В анонсе описываются результаты на бенчмарках видеоанализа и демонстрируется Gemini 3.7 Flash для понимания длинных видео, подсчёта быстрых действий и поиска «иголки в стоге сена», однако не устанавливается, что каждая производственная рабочая нагрузка улучшится на ту же величину. Командам, внедряющим этот режим, потребуются сопоставимые тесты с собственными видео, запросами, требованиями к задержке и критериями оценки.

4. Непосредственное влияние касается проектирования приложений для длинных видео

Изменение снижает потребность разработчиков создавать отдельные системы поиска по расшифровкам и выбора ключевых кадров перед отправкой длинного видео в Gemini. Приложение может передать запись и вопрос, позволить модели решить, какие доказательства извлечь, и изучить возвращённые шаги обработки, чтобы подтвердить использование агентной навигации.

Оно также меняет оценку затрат. Статическая обработка напрямую связывает размер входных данных с длительностью видео и выбранной конфигурацией выборки. Агентная обработка может сделать целевой запрос значительно дешевле, но расход токенов зависит от того, что модель решит загрузить. Производственным системам потребуется измерять использование по классам запросов, а не полагаться только на длину видео.

Согласно обновлённому руководству для разработчиков, текущая матрица поддержки включает Gemini 3.8 Flash, 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Статический режим остаётся режимом по умолчанию, поэтому существующие интеграции не меняют поведение обработки автоматически.

Выпуск API — первый этап развертывания. Google заявляет, что затем агентное понимание видео появится в моделях Flash и Flash-Lite в потребительском приложении Gemini. Компания также планирует использовать его для функции YouTube «Ask YouTube» в ближайшие месяцы, чтобы ответы точнее основывались на визуальном содержимом видео. Точных дат запуска для обеих потребительских интеграций Google не указала.

Частые вопросы

Что такое агентное понимание видео?

Это режим обработки Gemini, который динамически выбирает видеосегменты, кадры, аудио и фрагменты расшифровки на основе вопроса пользователя вместо обработки всей записи с фиксированной частотой кадров.

Какие модели Gemini поддерживают эту функцию?

В текущей документации Google указаны Gemini 3.8 Flash, Gemini 3.7 Flash, Gemini 3.6 Flash и Gemini 3.5 Flash-Lite. Первоначальный запуск 1 сентября охватывал последние три модели.

Всегда ли это сокращает использование токенов на 88%?

Нет. Google говорит «до» 88%. Фактический расход зависит от видео, сложности запроса и того, насколько широко модель повторно отбирает релевантные сегменты.

Дороже ли включать агентную обработку?

Отдельной платы за функцию нет. Применяются стандартные цены токенов Gemini API, хотя количество потреблённых токенов зависит от запроса.

Следует ли разработчикам использовать её для коротких видео?

Не обязательно. Google рекомендует статическую обработку для чувствительных к задержке роликов короче пяти минут и задач, требующих равномерного покадрового анализа всего видео.

Источники

Share

Поделиться статьёй