Google Ra Mắt Gemini Omni 1.1 Flash Với Tính Năng Mở Rộng Cảnh 40 Giây và Nâng Cấp Độ Phân Giải 4K
Gemini Omni 1.1 Flash bổ sung khả năng mở rộng cảnh dài hơn, kiểm soát khung hình chính, bản nháp 360p nhanh hơn, tham chiếu video và nâng cấp độ phân giải 4K.
Google đã phát hành Gemini Omni 1.1 Flash, bản cập nhật sẵn sàng cho môi trường sản xuất cho mô hình tạo và chỉnh sửa video đa phương thức của hãng. Nâng cấp trọng tâm là mở rộng cảnh: mô hình có thể phân tích tối đa 10 giây cảnh quay trước đó khi tạo phần tiếp nối, so với một giây ở các mô hình trước đây của Google.
Nhà phát triển có thể mở rộng video theo các đoạn 10 giây, đạt tổng thời lượng 40 giây. Google cho biết cửa sổ tham chiếu lớn hơn giúp mô hình duy trì nhân vật, chuyển động, ánh sáng, âm thanh và ngữ cảnh tường thuật qua các lần mở rộng liên tiếp, giải quyết một trong những rào cản thực tiễn đối với việc tạo các chuỗi dài hơn một cảnh quay được sinh đơn lẻ.
Mô hình API ổn định được định danh là gemini-omni-1.1-flash. Mô hình nhận văn bản, hình ảnh và video, đồng thời tạo video có âm thanh. Danh sách mô hình của Google nêu rõ thời lượng đầu ra từ ba đến 10 giây, độ phân giải 360p, 720p, 1080p hoặc 4K và tốc độ khung hình 24 khung hình mỗi giây.
1. Tính Năng Mở Rộng Cảnh Nay Sử Dụng Mười Giây Ngữ Cảnh
Mở rộng cảnh tạo cảnh quay mới ở cuối một đoạn clip hiện có. Gemini Omni 1.1 Flash có thể mở rộng cả video đã được tạo trước đó trong một lượt tương tác API lẫn video được tải lên thông qua Files API của Google.
Đối với video do mô hình tạo, nhà phát triển có thể truyền định danh của lượt tương tác trước đó qua previous_interaction_id. Điều này duy trì trạng thái của lần tạo trước mà không yêu cầu tải lại video kết quả. Sau đó, nhà phát triển có thể yêu cầu phần tiếp nối bằng ngôn ngữ tự nhiên, bao gồm chỉ dẫn về chuyển động máy quay, lời thoại, âm nhạc hoặc các sự kiện ở phần tiếp theo của cảnh.
Các clip được tải lên cũng có thể được mở rộng bằng một câu lệnh, nhưng tài liệu API áp dụng các điều kiện chặt chẽ hơn. Đầu vào được tải lên không được dài quá 10 giây và mô hình chỉ có thể nối thêm cảnh quay ở cuối. Mô hình không thể thêm phần mở đầu mới ở phía trước hoặc chèn phần mở rộng vào giữa clip.
Các quy tắc về lời thoại cũng phụ thuộc vào quy trình. Gemini Omni 1.1 Flash có thể tạo thêm lời thoại được nói khi mở rộng đầu ra trước đó của chính nó thông qua tương tác nhiều lượt. Hiện tại, mô hình không thể mở rộng video tải lên đã có người đang nói và thêm lời thoại, mặc dù vẫn có thể tạo phần tiếp nối không có lời thoại.
Việc chỉnh sửa hoặc mở rộng video tải lên không khả dụng thông qua API tại Khu vực Kinh tế Châu Âu, Thụy Sĩ và Vương quốc Anh. Việc mở rộng các video do mô hình tạo vẫn được hỗ trợ tại các khu vực khả dụng.
Những hạn chế này quan trọng vì con số 40 giây của Google mô tả việc mở rộng tích lũy qua nhiều bước, thay vì một lần tạo duy nhất dài 40 giây. Mỗi phần tiếp nối vẫn được tạo thành một đoạn ngắn hơn, với cảnh quay trước đó làm ngữ cảnh cho đoạn kế tiếp.
2. Khung Hình Chính và Tham Chiếu Mang Lại Quyền Kiểm Soát Đạo Diễn Trực Tiếp Hơn
Gemini Omni 1.1 Flash bổ sung khả năng nội suy giữa khung hình đầu và cuối. Nhà phát triển có thể cung cấp hai hình ảnh biểu thị phần đầu và phần cuối của một cảnh quay, sau đó mô tả chuyển tiếp mong muốn. Mô hình tạo chuyển động ở giữa thành một video liên tục.
Cơ chế này cho người sáng tạo nhiều quyền kiểm soát hơn chỉ với câu lệnh văn bản. Các điểm đầu cuối có thể giới hạn bố cục và vị trí chủ thể, trong khi câu lệnh xác định cách máy quay hoặc cảnh nên chuyển động giữa chúng. Google đưa ra các chuyển động xoay quanh chủ thể của máy quay, chuyển tiếp thu phóng, lia máy nhanh và clip lặp lại làm các trường hợp sử dụng dự kiến.
Mô hình cũng nhận các video tham chiếu ngắn. Google cho biết một video tham chiếu có thể đóng góp tối đa ba giây thông tin về chuyển động, ngữ cảnh hình ảnh hoặc nhân vật cho một cảnh mới. Tài liệu API lưu ý rằng âm thanh trong video tham chiếu bị bỏ qua, vì vậy tính năng này nên được hiểu là một hệ thống tham chiếu hình ảnh và chuyển động, thay vì một hệ thống chuyển âm thanh.
Các cơ chế kiểm soát này mở rộng phương pháp Gemini Omni ban đầu thay vì thay thế nó. Bản phát hành Omni Flash đầu tiên đã hỗ trợ chỉnh sửa hội thoại: mỗi lần sửa đổi bằng ngôn ngữ tự nhiên có thể xây dựng trên đầu ra trước đó trong khi cố gắng giữ nguyên những phần của cảnh mà người dùng không yêu cầu thay đổi. Phiên bản 1.1 bổ sung các ràng buộc rõ ràng hơn đối với ranh giới cảnh quay, phần tiếp nối và chuyển động dựa trên tham chiếu.
Chỉnh sửa có trạng thái vẫn phụ thuộc vào việc lưu trữ lượt tương tác. Nếu nhà phát triển tắt lưu trữ, video kết quả không thể được chỉnh sửa sau đó thông qua previous_interaction_id. Các đầu ra lớn cũng cần được xử lý khác: Google khuyến nghị phân phối qua URI cho các tệp video trên 4 MB thay vì trả về toàn bộ tệp nội tuyến.
3. Quy Trình Độ Phân Giải Từ Bản Nháp Đến Bàn Giao
Google đang định vị việc tạo 360p như một chế độ tạo bản nháp. Công ty cho biết các bản xem trước 360p có thể được tạo nhanh hơn tới 60% so với đầu ra 720p tiêu chuẩn, dựa trên thông lượng hệ thống so sánh, và với một phần ba chi phí.
Tuyên bố về hiệu năng này cụ thể là so sánh giữa việc tạo 360p và 720p. Đây không phải tuyên bố chung rằng mọi yêu cầu Omni 1.1 sẽ hoàn thành nhanh hơn 60% so với mô hình trước.
Tùy chọn độ phân giải thấp hơn này được thiết kế cho các quy trình thử nghiệm nhiều biến thể về câu lệnh, máy quay hoặc bố cục trước khi chọn clip cuối cùng. Ứng dụng có thể tạo các bản xem trước ít tốn kém, so sánh chúng và dành việc xử lý độ phân giải cao hơn cho kết quả được chọn.
Độ phân giải API mặc định là 720p. Nhà phát triển có thể yêu cầu đầu ra 1080p hoặc 4K, nhưng tài liệu của Google xác định cả hai định dạng là đầu ra được nâng cấp độ phân giải. Do đó, mô hình không được mô tả là tạo trực tiếp các khung hình 4K gốc; mô hình tạo một phiên bản bàn giao đã được nâng cấp độ phân giải.
Sự khác biệt này liên quan đến các nhóm sản xuất đánh giá chi tiết tinh tế. Một tệp 4K cung cấp sản phẩm bàn giao có độ phân giải cao hơn, nhưng riêng nhãn này không cho thấy khả năng giữ lại chi tiết tương đương cảnh quay được tạo hoặc ghi hình ban đầu ở độ phân giải 4K gốc.
4. Khả Dụng và Sự Chuyển Dịch Từ Bản Xem Trước Sang API Ổn Định
Google đã phát hành gemini-omni-1.1-flash dưới dạng phiên bản ổn định, khả dụng rộng rãi của mô hình vào ngày 27 tháng 8 năm 2026. Định danh gemini-omni-flash-preview trước đó vẫn được liệt kê là phiên bản xem trước, trong khi trang ngừng hỗ trợ của Google cho biết chưa có ngày ngừng hoạt động nào được công bố cho mô hình ổn định.
Nhà phát triển có thể truy cập Omni 1.1 qua Gemini API trong Google AI Studio. Khách hàng doanh nghiệp có thể xây dựng với mô hình này thông qua Gemini Enterprise Agent Platform. Trạng thái phát hành này có ý nghĩa với các công ty từng ngần ngại tích hợp một định danh xem trước vào các sản phẩm được duy trì: tên mô hình ổn định hiện cung cấp một mục tiêu sản xuất xác định, mặc dù Google chưa công bố ngày ngừng hỗ trợ.
Gemini Omni 1.1 Flash cũng được cung cấp trên toàn cầu trong Google Flow cho người đăng ký Google AI Plus, Pro và Ultra. Tính năng mở rộng cảnh khả dụng cho người đăng ký ở cả ba gói này trong ứng dụng Gemini. Thông báo của Google không nói rằng mọi cơ chế kiểm soát API mới đều được cung cấp giống hệt nhau trong từng giao diện người dùng.
Các tích hợp hiện có mở rộng phạm vi tiếp cận của mô hình ra ngoài các công cụ riêng của Google. Google cho biết Gemini Omni Flash đã được tích hợp vào Adobe Firefly, trong khi Figma Weave và Runway nằm trong số các nền tảng sáng tạo đang sử dụng mô hình. Những tích hợp này là các ví dụ do công ty báo cáo, không phải các đánh giá hiệu năng độc lập.
5. Lợi Ích Thực Tiễn và Các Giới Hạn Được Tài Liệu Hóa
Đối với nhà phát triển công cụ sáng tạo, bản phát hành này cung cấp nhiều giai đoạn của một quy trình video thông thường qua một mô hình: lên ý tưởng ở độ phân giải thấp, tạo cảnh quay có kiểm soát điểm đầu cuối, chỉnh sửa hội thoại, tiếp nối cảnh và bàn giao độ phân giải cao. Vì vậy, API có thể hỗ trợ các giao diện lặp, trong đó người dùng phân nhánh từ các lần tạo trước thay vì khởi động lại từng cảnh quay bằng một câu lệnh mới.
Ngữ cảnh mở rộng 10 giây có thể giảm các điểm đứt đoạn dễ nhận thấy, nhưng không đảm bảo loại bỏ chúng hoàn toàn. Thẻ mô hình của Google nêu rằng tính nhất quán hoàn toàn giữa các lần chỉnh sửa, các cảnh có chuyển động phức tạp và văn bản chính xác tuyệt đối vẫn là những thách thức. Do đó, các tuyên bố về tính liên tục được cải thiện nên được xem là tương đối so với cửa sổ ngữ cảnh một giây trước đây, chứ không phải lời hứa về kết quả liền mạch trong mọi chuỗi.
API cũng không hỗ trợ chỉnh sửa giọng nói hoặc tham chiếu âm thanh được tải lên. API hạn chế chỉnh sửa hình ảnh chứa một số người có thể nhận diện, và các giới hạn bổ sung áp dụng cho hình ảnh có trẻ vị thành niên tại EEA, Thụy Sĩ và Vương quốc Anh.
Đối với nội dung được tạo hoặc chỉnh sửa trong ứng dụng Gemini, Google Flow hoặc YouTube, Google cho biết hãng áp dụng hình mờ SynthID không thể nhận biết và C2PA Content Credentials. Tuyên bố đã công bố của Google nêu cụ thể các sản phẩm đó và không nên được hiểu là xác nhận mọi video trả về trực tiếp qua Gemini API đều nhận được cùng cơ chế truy xuất nguồn gốc.
Câu hỏi thường gặp
Tên mô hình API là gì?
Định danh mô hình ổn định là gemini-omni-1.1-flash. Google cũng liệt kê gemini-omni-flash-preview là phiên bản xem trước.
Gemini Omni 1.1 Flash có thể tạo video 40 giây trong một yêu cầu không?
Google mô tả việc mở rộng theo các đoạn 10 giây, đạt tổng thời lượng 40 giây. Các clip đầu ra tiêu chuẩn vẫn có thời lượng từ ba đến 10 giây.
Mô hình có tạo video 4K gốc không?
Tài liệu API của Google mô tả 1080p và 4K là các đầu ra được nâng cấp độ phân giải. Độ phân giải tạo mặc định là 720p.
Mô hình có thể mở rộng mọi video được tải lên không?
Không. Video tải lên phải dài 10 giây hoặc ngắn hơn, việc mở rộng chỉ giới hạn ở cuối clip, đồng thời áp dụng các hạn chế về khu vực và lời thoại.
Gemini Omni 1.1 Flash khả dụng ở đâu?
Mô hình khả dụng qua Gemini API trong Google AI Studio và Gemini Enterprise Agent Platform. Người đăng ký Google AI Plus, Pro và Ultra cũng có thể truy cập qua Google Flow, với tính năng mở rộng cảnh được cung cấp trong ứng dụng Gemini.
Tham khảo nguồn
- Thông báo ban đầu của Google AI trên X
- Google: Gemini Omni 1.1 Flash cho phép bạn xây dựng với nhiều quyền kiểm soát hơn
- Google AI dành cho Nhà phát triển: Thông số mô hình Gemini Omni Flash
- Google AI dành cho Nhà phát triển: Tạo và chỉnh sửa video với Gemini Omni Flash
- Google AI dành cho Nhà phát triển: Ghi chú phát hành Gemini API
- Google DeepMind: Thẻ mô hình Gemini Omni Flash
Share