Google, Gemini API에 에이전틱 동영상 처리를 추가해 토큰 사용량을 최대 88% 절감
Gemini는 이제 긴 동영상을 동적으로 분석할 수 있으며, Google은 토큰을 최대 88% 적게 사용하고 비용을 66% 낮추며 정확도를 7% 높인다고 보고했다.
목차 · 11
Google은 Gemini API용 에이전틱 동영상 이해 기능을 출시했다. 이 기능은 고정 비율의 동영상 분석을 대체하며, 녹화본 가운데 어떤 부분을 살펴볼지 쿼리의 방향에 따라 선택할 수 있다. Google은 이 모드가 동영상 분석 벤치마크에서 토큰을 최대 88% 적게 사용하고, 분석 비용을 최대 66% 낮추며, 정확도를 최대 7% 높인다고 보고했다.
이 기능은 2026년 9월 1일 Interactions API와 GenerateContent API 모두에서 Gemini 3.7 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash-Lite용으로 출시됐다. Google AI Studio와 Gemini Enterprise Agent Platform을 통해 업로드 파일 및 공개 YouTube 동영상에서 사용할 수 있다.
Google은 하루 뒤 Gemini 3.8 Flash를 출시했다. 9월 3일 기준, 실시간 개발자 문서에는 원래 발표와 9월 1일 릴리스 노트가 앞선 세 Flash 모델만 언급했음에도 이 모델 역시 에이전틱 동영상 이해를 지원하는 것으로 나와 있다.
1. Gemini는 더 이상 모든 동영상을 고정 비율로 처리할 필요가 없다
Gemini의 기본 정적 동영상 처리 모드는 초당 1프레임의 고정 비율로 프레임을 추출하고, 생성된 동영상 컨텍스트를 한 번에 모델에 입력한다. 개발자는 샘플링 비율을 조정할 수 있지만, 모델이 질문에 답하기 전에 이를 선택해야 한다.
긴 녹화본에서는 이것이 트레이드오프를 만든다. 높은 샘플링 비율은 더 많은 컨텍스트와 입력 토큰을 소비하는 반면, 낮은 비율은 샘플링된 프레임 사이에 발생하는 짧은 동작, 편집 경계, 시각적 결함 또는 기타 이벤트를 놓칠 수 있다. 개발자는 트랜스크립트를 검색하고, 동영상을 구간으로 나누며, 유망한 구간을 다시 샘플링하는 자체 전처리 파이프라인을 구축할 수 있지만, 이 작업은 모델 외부에서 이뤄진다.
에이전틱 처리는 이러한 결정을 Gemini의 추론 루프 안으로 옮긴다. 모델은 프롬프트에 반응해 타임라인을 탐색하고, 선택한 프레임이나 오디오를 요청하며, 트랜스크립트를 확인하고, 다른 프레임 레이트나 해상도로 관련 구간을 다시 살펴볼 수 있다. 전체 동영상의 고정된 표현을 자동으로 컨텍스트에 넣는 대신, 필요하다고 판단한 증거를 불러온다.
이는 새로운 동영상 생성 시스템이 아니라 내부 도구 사용의 한 형태다. Gemini는 여전히 제공된 영상에 대한 질문에 답하며, 변경된 것은 답변을 생성하기 전에 시각 및 오디오 증거를 수집하는 방식이다.
Google은 1초 미만 시점 검색, 이상 탐지, 반복 동작 수 세기, 객체 수 세기, 수 시간에 걸친 녹화본 검색을 대상 애플리케이션으로 제시한다. 초기 스캔에서 빠른 움직임이나 미묘한 시각적 변화가 포함된 짧은 구간을 식별하는 경우, 동적 재샘플링이 특히 유용하다.
2. 개발자는 동영상별로 모드를 선택할 수 있다
Interactions API에서 개발자는 동영상 입력의 processing 필드를 "agentic"으로 설정해 기능을 활성화한다. 동등한 GenerateContent 구성은 SDK에 따라 mediaProcessing 또는 media_processing 설정을 사용한다.
선택은 요청별이 아니라 동영상별로 이뤄진다. 따라서 여러 녹화본을 비교하는 애플리케이션은 동일한 프롬프트에서 긴 강의에는 에이전틱 처리를 사용하고, 짧은 실험에는 정적 처리를 유지할 수 있다.
Google이 에이전틱 모드를 항상 더 빠른 것으로 제시하지 않기 때문에 이 구분은 중요하다. 문서에서는 5분 미만의 지연 시간에 민감한 클립과 전체 녹화본에서 일관된 프레임 수준 커버리지가 필요한 작업에는 정적 처리를 권장한다. 에이전틱 탐색은 모델이 응답을 생성하기 전에 내부 추론과 도구 왕복을 수행하므로, 짧은 클립에서 첫 토큰까지의 시간을 늘릴 수 있다.
Interactions API는 이 탐색이 발생했다는 증거를 제공한다. 응답에는 최종 모델 출력 전에 processing_call 및 processing_result 단계가 포함될 수 있다. 애플리케이션은 이 단계를 사용해 진행 추적을 표시할 수 있지만, 각 내부 호출에 대해 응답을 보낼 필요는 없다. GenerateContent 응답도 마찬가지로 다중 턴 추론 컨텍스트를 위해 MEDIA_PROCESSING 도구 호출 및 응답 부분을 보존한다.
상태 저장 상호작용에서는 동영상 컨텍스트를 턴 간에 유지할 수도 있다. 이를 통해 사용자는 애플리케이션이 모델의 이전 분석 과정을 수동으로 재구성하지 않아도 후속 질문을 할 수 있다.
기존 Gemini 동영상 입력 제한은 계속 적용된다. Google 문서에 따르면 Gemini 2.5 및 이후 모델은 한 요청에서 최대 10개의 동영상을 받을 수 있다. YouTube 입력은 비공개 또는 일부 공개가 아닌 공개 동영상이어야 하며, 무료 등급 사용자는 하루에 최대 8시간의 YouTube 동영상을 업로드할 수 있다.
3. 효율성 주장은 동영상과 질문에 따라 달라진다
Google의 헤드라인 측정치는 모든 요청에 적용되는 고정 절감치가 아니라 최대 개선치다. 회사는 표준 동영상 분석 벤치마크 전반에서 토큰 소비가 최대 88% 감소하고, 분석 비용이 최대 66% 감소하며, 정확도가 최대 7% 향상된다고 보고했다.
주장된 이점은 10분짜리 교육 동영상, 90분 강의, 수 시간 동안 지속되는 녹화본을 포함한 장시간 자료에서 가장 관련성이 높다. 이러한 입력에서는 좁게 설정된 질문이 전체 녹화본의 고정 비율 표현 대신 트랜스크립트 구간과 몇 개의 시각적 구간만 필요로 할 수 있다.
토큰 소비량은 쿼리 복잡도와 동적 샘플링의 깊이에 따라 달라진다. 상세한 질문은 Gemini가 더 많은 구간을 확인하거나 선택된 부분을 초당 1프레임보다 높은 비율로 샘플링하게 할 수 있다. 따라서 개발자는 모든 요청이 광고된 88% 절감에 도달할 것이라고 가정할 수 없다.
Google은 에이전틱 동영상 이해에 별도 기능 요금을 추가하지 않았다. 요청에는 해당 모델의 표준 Gemini API 토큰 가격이 적용된다. 보고된 비용 절감은 할인된 에이전틱 동영상 요금이 아니라 더 적은 토큰 처리에서 비롯된다.
66%의 최대 비용 절감도 88%의 최대 토큰 절감보다 작다. 이 수치를 하나의 보장된 워크로드를 설명하는 것처럼 결합해서는 안 된다. 이는 벤치마크 최대치이며, 완전한 요청에는 선택한 모델의 가격 정책에 따라 과금되는 동적으로 불러온 미디어, 추론, 출력 토큰이 포함될 수 있다.
Google의 수치는 여전히 공급업체 보고에 기반한다. 발표는 동영상 분석 벤치마크 전반의 결과를 설명하고 긴 동영상 이해, 빠른 동작 수 세기, 건초 더미 속 바늘 찾기 검색에서 Gemini 3.7 Flash를 시연하지만, 모든 프로덕션 워크로드가 같은 수준으로 개선된다는 점을 입증하지는 않는다. 이 모드를 도입하는 팀은 자체 동영상, 프롬프트, 지연 시간 요구 사항, 평가 기준을 사용한 대응 테스트가 필요하다.
4. 즉각적인 영향은 장시간 동영상 애플리케이션 설계에 있다
이 변경으로 개발자가 긴 동영상을 Gemini에 보내기 전에 별도의 트랜스크립트 검색 및 키프레임 선택 시스템을 구축할 필요가 줄어든다. 애플리케이션은 녹화본과 질문을 제공하고, 모델이 어떤 증거를 검색할지 결정하도록 하며, 반환된 처리 단계를 확인해 에이전틱 탐색이 사용됐는지 검증할 수 있다.
비용 추정 방식도 바뀐다. 정적 처리는 입력 크기를 동영상 길이와 선택한 샘플링 구성에 더 직접적으로 연결한다. 에이전틱 처리는 표적 쿼리의 비용을 크게 낮출 수 있지만, 토큰 사용량은 모델이 무엇을 불러오기로 결정하는지에 따라 달라진다. 프로덕션 시스템은 동영상 길이에만 의존하지 않고 쿼리 클래스별 사용량을 측정해야 한다.
업데이트된 개발자 가이드에 따르면 현재 지원 매트릭스에는 Gemini 3.8 Flash, 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite가 포함된다. 정적 모드는 기본값으로 유지되므로 기존 통합이 자동으로 처리 동작을 전환하지는 않는다.
API 출시는 첫 번째 배포 단계다. Google은 에이전틱 동영상 이해가 이후 소비자용 Gemini 앱의 Flash 및 Flash-Lite 모델에도 제공될 것이라고 밝혔다. 회사는 또한 향후 몇 달 내 YouTube의 “Ask YouTube” 기능에 이를 사용할 계획이며, 답변은 동영상의 시각적 콘텐츠에 더 밀접하게 근거하게 된다. Google은 두 소비자 통합 모두에 대해 정확한 출시 일정을 제공하지 않았다.
자주 묻는 질문
에이전틱 동영상 이해란 무엇인가?
전체 녹화본을 고정 프레임 레이트로 처리하는 대신, 사용자의 질문에 따라 동영상 구간, 프레임, 오디오, 트랜스크립트 구간을 동적으로 선택하는 Gemini 처리 모드다.
어떤 Gemini 모델이 이를 지원하는가?
Google의 현재 문서에는 Gemini 3.8 Flash, Gemini 3.7 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash-Lite가 나와 있다. 원래 9월 1일 출시는 뒤의 세 모델을 대상으로 했다.
항상 토큰 사용량을 88% 줄이는가?
아니다. Google은 “최대” 88%라고 말한다. 실제 소비량은 동영상, 쿼리 복잡도, 모델이 관련 구간을 얼마나 광범위하게 재샘플링하는지에 따라 달라진다.
에이전틱 처리를 활성화하는 데 비용이 더 드는가?
별도 기능 요금은 없다. 표준 Gemini API 토큰 가격이 적용되지만, 소비되는 토큰 수는 요청마다 달라진다.
개발자는 짧은 동영상에 이를 사용해야 하는가?
반드시 그렇지는 않다. Google은 5분 미만의 지연 시간에 민감한 클립과 전체 동영상의 균일한 프레임 수준 분석이 필요한 작업에는 정적 처리를 권장한다.
참고 자료
Share