Google, 40초 장면 확장 및 4K 업스케일링 지원 Gemini Omni 1.1 Flash 출시
Gemini Omni 1.1 Flash는 더 긴 장면 확장, 키프레임 제어, 더 빠른 360p 초안, 동영상 레퍼런스 및 4K 업스케일링을 추가한다.
Google이 멀티모달 동영상 생성 및 편집 모델의 프로덕션 준비 완료 업데이트인 Gemini Omni 1.1 Flash를 출시했다. 핵심 업그레이드는 장면 확장이다. 이 모델은 연속 장면을 생성할 때 앞선 영상의 최대 10초를 분석할 수 있으며, 이는 Google의 이전 모델이 지원하던 1초보다 길다.
개발자는 동영상을 10초 단위로 확장해 누적 길이 40초까지 만들 수 있다. Google은 더 큰 레퍼런스 창이 연속 확장 전반에서 캐릭터, 움직임, 조명, 오디오 및 서사적 맥락을 유지하는 데 모델이 도움을 준다고 설명한다. 이는 단일 생성 숏보다 긴 시퀀스를 제작하는 데 따르는 실무적 장벽 중 하나를 해결한다.
안정 API 모델 식별자는 gemini-omni-1.1-flash다. 이 모델은 텍스트, 이미지, 동영상을 입력으로 받아 오디오가 포함된 동영상을 생성한다. Google의 모델 목록은 출력 길이를 3초에서 10초, 해상도를 360p, 720p, 1080p 또는 4K, 프레임 레이트를 초당 24프레임으로 명시한다.
1. 장면 확장, 이제 10초의 컨텍스트 활용
장면 확장은 기존 클립의 끝에 새 영상을 생성한다. Gemini Omni 1.1 Flash는 API 상호작용에서 이전에 생성된 동영상이나 Google Files API를 통해 제공된 업로드 동영상을 확장할 수 있다.
모델이 생성한 동영상의 경우 개발자는 previous_interaction_id를 통해 이전 상호작용의 식별자를 전달할 수 있다. 이렇게 하면 결과 동영상을 다시 업로드하지 않고도 이전 생성의 상태를 보존할 수 있다. 이어서 개발자는 장면 다음 부분의 카메라 움직임, 대사, 음악 또는 사건에 관한 지시를 포함해 자연어로 연속 장면을 요청할 수 있다.
업로드한 클립도 프롬프트로 확장할 수 있지만, API 문서는 더 엄격한 조건을 설정한다. 업로드 입력은 10초를 초과할 수 없으며, 모델은 영상 끝에만 푸티지를 추가할 수 있다. 새 도입부를 앞에 붙이거나 클립 중간에 확장을 삽입할 수는 없다.
대사 관련 규칙도 워크플로에 따라 달라진다. Gemini Omni 1.1 Flash는 멀티턴 상호작용을 통해 자체적으로 이전에 생성한 출력을 확장할 때 추가 음성 대사를 생성할 수 있다. 현재는 누군가 이미 말하고 있는 업로드 동영상을 확장하면서 대사를 더 추가할 수 없지만, 무음 연속 장면은 여전히 가능하다.
유럽경제지역, 스위스 및 영국에서는 API를 통한 업로드 동영상의 편집 또는 확장을 사용할 수 없다. 모델이 생성한 동영상의 확장은 지원되는 지역에서 계속 사용할 수 있다.
이러한 제한이 중요한 이유는 Google이 언급한 40초가 한 번에 40초를 생성한다는 뜻이 아니라, 여러 단계에 걸친 누적 확장을 뜻하기 때문이다. 각 연속 장면은 여전히 더 짧은 세그먼트로 생성되며, 이전 영상은 다음 세그먼트의 컨텍스트로 사용된다.
2. 키프레임과 레퍼런스로 더 직접적인 연출 제어 제공
Gemini Omni 1.1 Flash는 첫 프레임과 마지막 프레임 보간을 추가한다. 개발자는 숏의 시작과 끝을 나타내는 두 이미지를 제공한 뒤 원하는 전환을 설명할 수 있다. 모델은 그 사이의 움직임을 하나의 연속된 동영상으로 생성한다.
이 메커니즘은 텍스트 프롬프트만 사용하는 것보다 제작자에게 더 많은 제어권을 제공한다. 양 끝점은 구도와 피사체 배치를 제한할 수 있고, 프롬프트는 그 사이에서 카메라나 장면이 어떻게 움직여야 하는지를 지정한다. Google은 카메라 오빗, 줌 전환, 휩 팬 및 루핑 클립을 의도된 활용 사례로 제시한다.
이 모델은 짧은 동영상 레퍼런스도 입력으로 받는다. Google은 레퍼런스가 새 장면에 최대 3초의 움직임, 시각적 컨텍스트 또는 캐릭터 정보를 제공할 수 있다고 설명한다. API 문서는 동영상 레퍼런스의 오디오는 무시된다고 명시하므로, 이 기능은 오디오 전송 시스템이 아니라 시각 및 움직임 레퍼런스로 이해해야 한다.
이러한 제어 기능은 기존 Gemini Omni 접근 방식을 대체하는 것이 아니라 확장한다. 첫 Omni Flash 릴리스는 이미 대화형 편집을 지원했다. 각 자연어 수정은 사용자가 바꾸지 말라고 한 장면 요소를 보존하려 하면서 이전 출력을 기반으로 구축될 수 있었다. 버전 1.1은 숏 경계, 연속 장면 및 레퍼런스 기반 움직임을 위한 더 명시적인 제약을 추가한다.
상태 유지형 편집은 여전히 상호작용 저장에 의존한다. 개발자가 저장을 비활성화하면 결과 동영상은 이후 previous_interaction_id를 통해 편집할 수 없다. 대용량 출력도 별도 처리가 필요하다. Google은 4 MB를 초과하는 동영상 파일의 경우 전체 파일을 인라인으로 반환하는 대신 URI 전송을 권장한다.
3. 초안에서 최종 납품까지의 해상도 워크플로
Google은 360p 생성을 초안 작성 모드로 포지셔닝하고 있다. 회사는 비교 시스템 처리량을 기준으로 360p 프리뷰를 표준 720p 출력보다 최대 60% 더 빠르게, 비용은 3분의 1로 생성할 수 있다고 설명한다.
이 성능 설명은 구체적으로 360p와 720p 생성을 비교한 것이다. 모든 Omni 1.1 요청이 이전 모델보다 60% 더 빠르게 완료된다는 일반적 주장은 아니다.
이 저해상도 옵션은 최종 클립을 선택하기 전에 여러 프롬프트, 카메라 또는 구도 변형을 테스트하는 워크플로를 위해 설계됐다. 애플리케이션은 저렴한 프리뷰를 생성해 비교한 뒤 선택한 결과에만 고해상도 처리를 적용할 수 있다.
기본 API 해상도는 720p다. 개발자는 1080p 또는 4K 출력을 요청할 수 있지만, Google 문서는 두 형식을 모두 업스케일된 출력으로 명시한다. 따라서 이 모델은 네이티브 4K 프레임을 직접 생성하는 것으로 문서화되어 있지 않으며, 업스케일된 최종 납품 버전을 생성한다.
이 구분은 미세한 디테일을 평가하는 프로덕션 팀에 중요하다. 4K 파일은 더 높은 해상도의 납품물을 제공하지만, 그 라벨만으로 원래 네이티브 4K 해상도로 생성되거나 촬영된 푸티지와 같은 수준의 디테일 보존을 입증하지는 않는다.
4. 미리보기에서 안정 API로의 전환과 제공 범위
Google은 2026년 8월 27일 gemini-omni-1.1-flash를 모델의 안정적이고 일반적으로 제공되는 버전으로 출시했다. 이전 gemini-omni-flash-preview 식별자는 미리보기 버전으로 계속 목록에 남아 있으며, Google의 지원 종료 페이지는 안정 모델의 종료 일정이 아직 발표되지 않았다고 설명한다.
개발자는 Google AI Studio의 Gemini API를 통해 Omni 1.1에 액세스할 수 있다. 엔터프라이즈 고객은 Gemini Enterprise Agent Platform을 통해 이를 기반으로 개발할 수 있다. 이 출시 상태는 유지 관리되는 제품에 미리보기 식별자를 통합하는 것을 주저했던 기업에 중요하다. 안정 모델 이름이 이제 명확한 프로덕션 대상을 제공하기 때문이다. 다만 Google은 지원 종료 날짜를 공개하지 않았다.
Gemini Omni 1.1 Flash는 Google AI Plus, Pro 및 Ultra 구독자를 대상으로 Google Flow에서도 전 세계적으로 제공된다. 장면 확장은 Gemini 앱에서 이 세 가지 등급의 구독자에게 제공된다. Google의 발표는 모든 새 API 제어 기능이 각 소비자 인터페이스에서 동일하게 노출된다고 말하지는 않는다.
기존 통합은 Google 자체 도구를 넘어 모델의 도달 범위를 넓힌다. Google은 Gemini Omni Flash가 Adobe Firefly에 통합되었으며, Figma Weave와 Runway가 이 모델을 사용하는 크리에이티브 플랫폼에 포함된다고 설명한다. 이러한 통합은 독립적인 성능 평가가 아니라 회사가 보고한 사례다.
5. 실무적 이점과 문서화된 한계
크리에이티브 도구 개발자에게 이 릴리스는 저해상도 아이데이션, 끝점 제어 숏 생성, 대화형 수정, 장면 연속 및 고해상도 납품이라는 기존 동영상 워크플로의 여러 단계를 하나의 모델로 제공한다. 따라서 API는 사용자가 새 프롬프트로 모든 숏을 다시 시작하는 대신 이전 생성 결과에서 분기할 수 있는 반복형 인터페이스를 지원할 수 있다.
10초 확장 컨텍스트는 눈에 띄는 불연속을 줄일 수 있지만 이를 완전히 없애지는 못한다. Google의 모델 카드는 편집 전반의 완전한 일관성, 복잡한 움직임이 있는 장면 및 완벽하게 정확한 텍스트가 여전히 어렵다고 명시한다. 따라서 연속성 개선 주장은 모든 시퀀스에서 매끄러운 결과를 약속하는 것이 아니라, 이전 1초 컨텍스트 창과 비교한 상대적 개선으로 받아들여야 한다.
API는 음성 편집이나 업로드된 오디오 레퍼런스도 지원하지 않는다. 특정 식별 가능한 인물이 포함된 이미지의 편집을 제한하며, 유럽경제지역, 스위스 및 영국에서는 미성년자가 포함된 이미지에 추가 제한이 적용된다.
Gemini 앱, Google Flow 또는 YouTube 안에서 제작되거나 편집된 콘텐츠에 대해 Google은 눈에 보이지 않는 SynthID 워터마크와 C2PA Content Credentials를 적용한다고 설명한다. Google의 공개 설명은 이들 제품을 구체적으로 명시하므로, Gemini API를 통해 직접 반환되는 모든 동영상이 동일한 출처 처리 방식을 적용받는다는 확인으로 해석해서는 안 된다.
자주 묻는 질문
API 모델 이름은 무엇인가요?
안정 모델 식별자는 gemini-omni-1.1-flash다. Google은 gemini-omni-flash-preview도 미리보기 버전으로 목록에 올려 두고 있다.
Gemini Omni 1.1 Flash는 한 번의 요청으로 40초 동영상을 생성할 수 있나요?
Google은 10초 단위 확장을 통해 누적 길이 40초까지 지원한다고 설명한다. 표준 출력 클립의 길이는 여전히 3초에서 10초 사이다.
모델이 네이티브 4K 동영상을 생성하나요?
Google의 API 문서는 1080p와 4K를 업스케일된 출력으로 설명한다. 기본 생성 해상도는 720p다.
업로드한 모든 동영상을 확장할 수 있나요?
아니다. 업로드 동영상은 10초 이하이어야 하며, 확장은 클립 끝으로 제한되고, 지역 및 대사 관련 제한이 적용된다.
Gemini Omni 1.1 Flash는 어디에서 사용할 수 있나요?
Google AI Studio의 Gemini API와 Gemini Enterprise Agent Platform을 통해 사용할 수 있다. Google AI Plus, Pro 및 Ultra 구독자는 Google Flow에서도 액세스할 수 있으며, Gemini 앱에서는 장면 확장이 제공된다.
참고 자료
Share