Google ra mắt Gemini 3.8 Flash cho lập trình dài hạn và tác tử
Gemini 3.8 Flash bổ sung năng lực lập trình và suy luận tác tử mạnh hơn, cửa sổ ngữ cảnh 1M token, mức nỗ lực có thể điều chỉnh và giá API giới thiệu.
Mục lục · 13
- 1. Google phát hành bản cập nhật Flash thứ ba trong sáu tuần
- 2. Các vòng lặp suy luận dài hơn là thay đổi sản phẩm trọng tâm
- 3. Google báo cáo mức cải thiện lớn nhất trong các đánh giá về lập trình và tác tử
- 4. Việc di chuyển đòi hỏi nhiều hơn thay đổi tên mẫu
- 5. Giá ban đầu không đổi nhưng tăng gấp đôi vào tháng 1
- 6. Thẻ mẫu duy trì các hạn chế quan trọng
- Câu hỏi thường gặp
- Gemini 3.8 Flash được phát hành khi nào?
- Mã mẫu API của Gemini 3.8 Flash là gì?
- Gemini 3.8 Flash có hỗ trợ hình ảnh, âm thanh và video không?
- Gemini 3.8 Flash có giá bao nhiêu?
- Gemini 3.8 Flash Cyber có khả dụng rộng rãi không?
- Tham khảo nguồn
1. Google phát hành bản cập nhật Flash thứ ba trong sáu tuần
Google đã phát hành Gemini 3.8 Flash vào ngày 2 tháng 9, định vị mẫu này là hệ thống thuộc dòng Flash mạnh nhất của hãng cho kỹ nghệ phần mềm, tác tử tự hành và công việc chuyên môn nhiều bước. Mã nhận diện API ổn định là gemini-3.8-flash, và mẫu được ra mắt ở trạng thái khả dụng rộng rãi thay vì bản xem trước.
Bản phát hành này nối tiếp Gemini 3.7 Flash, được giới thiệu ngày 13 tháng 8, và Gemini 3.6 Flash, phát hành ngày 21 tháng 7. Điều đó khiến Gemini 3.8 Flash trở thành bản phát hành Flash thứ ba của Google trong sáu tuần. Google cho biết mẫu mới vẫn giữ tốc độ và mức giá giới thiệu của 3.7 Flash, đồng thời cải thiện khả năng duy trì suy luận và sử dụng công cụ trong các tác vụ dài hơn.
Gemini 3.8 Flash nhận đầu vào là văn bản, hình ảnh, âm thanh, video và tài liệu PDF. Cửa sổ ngữ cảnh của mẫu là 1,048,576 token đầu vào, với đầu ra tối đa 65,536 token. Đầu ra vẫn chỉ là văn bản: mẫu có thể phân tích tài liệu đa phương thức nhưng không tạo hình ảnh hoặc âm thanh.
Mẫu hỗ trợ gọi hàm, tìm kiếm tệp, thực thi mã, đầu ra có cấu trúc, ngữ cảnh URL, neo dữ liệu từ Google Search và Maps, cùng lưu đệm ngữ cảnh. Khả năng sử dụng máy tính được hỗ trợ ở bản xem trước. Live API, tạo hình ảnh và tạo âm thanh không được hỗ trợ.
Google đã công bố một mẫu thứ hai, Gemini 3.8 Flash Cyber, cùng với bản phát hành đa dụng. Theo công ty, hai mẫu dùng chung năng lực nền tảng, nhưng phiên bản Cyber có các năng lực an ninh mạng ít hạn chế hơn và chỉ dành cho các chính phủ đã được thẩm định, đơn vị vận hành hạ tầng trọng yếu, bên bảo trì phần mềm và các bên phòng thủ đáng tin cậy khác thông qua Fairwind Program của Google DeepMind.
2. Các vòng lặp suy luận dài hơn là thay đổi sản phẩm trọng tâm
Thay đổi mang tính định nghĩa so với Gemini 3.7 Flash không phải là cửa sổ ngữ cảnh lớn hơn hay một phương thức đầu ra mới. Các giới hạn cốt lõi đó vẫn không đổi. Thay vào đó, Google cho biết 3.8 Flash sẵn sàng thực hiện thêm các bước suy luận, phục hồi sau trở ngại và gọi công cụ lặp lại khi một tác vụ không thể hoàn thành đáng tin cậy chỉ trong một lượt.
Hành vi này hướng đến những công việc như điều hướng một cơ sở mã lớn, chẩn đoán lỗi, chỉnh sửa nhiều tệp, kiểm thử kết quả và sửa đổi triển khai. Google đã trình diễn mẫu trong Antigravity khi xây dựng một trò chơi 3D, chơi trò chơi đó để xác định lỗi và áp dụng thay đổi mã trong một vòng lặp tác tử liên tục. Các phần trình diễn khác gồm một ứng dụng Google Maps theo phong cách DOS, một công cụ trực quan hóa địa hình có dữ liệu hỗ trợ và một công cụ tháo rời phần cứng Three.js.
Những phần trình diễn đó là ví dụ được kiểm soát, không phải thử nghiệm sản phẩm độc lập. Giá trị liên quan của chúng nằm ở quy trình làm việc: Gemini 3.8 Flash được thiết kế để luân phiên giữa suy luận, gọi công cụ, thực thi, quan sát và sửa đổi thay vì chỉ trả về một mẫu mã.
Sự kỹ lưỡng bổ sung này có chi phí có thể đo lường được. Google cảnh báo rõ rằng 3.8 Flash có thể tiêu thụ nhiều token hơn 3.7 Flash, đặc biệt ở các thiết lập suy luận cao hơn. Nhà phát triển có thể chọn LOW, MEDIUM hoặc HIGH thông qua tham số thinking_level; MEDIUM là mặc định. Mẫu không chấp nhận mức MINIMAL, và việc yêu cầu mức này tạo ra lỗi xác thực.
Đối với các ứng dụng nhạy cảm với độ trễ hoặc có lưu lượng lớn, Google khuyến nghị hạ mức nỗ lực hoặc tiếp tục dùng Gemini 3.7 Flash. Do đó, lựa chọn thực tế phụ thuộc vào khối lượng công việc: 3.8 Flash mang lại độ bền bỉ cao hơn cho các tác vụ khó, nhưng 3.7 Flash vẫn được hỗ trợ cho những triển khai mà mức tiêu thụ token có thể dự đoán quan trọng hơn tỷ lệ hoàn thành tác vụ tối đa.
3. Google báo cáo mức cải thiện lớn nhất trong các đánh giá về lập trình và tác tử
Các đánh giá do Google công bố cho thấy sự cải thiện trên một số bài kiểm tra hướng đến lập trình và công cụ, dù các kết quả này vẫn do nhà cung cấp báo cáo và hiệu năng benchmark không xác lập độ tin cậy trong một môi trường sản xuất cụ thể.
Trên Terminal-bench 2.1, Gemini 3.8 Flash đạt 90.8%, so với 81.6% của Gemini 3.7 Flash. Điểm SWE-Atlas của mẫu tăng từ 48.0% lên 51.9%, trong khi SWE-Bench Pro tăng từ 60.4% lên 61.6%. Trên tập con ngân hàng của τ³-bench, bài kiểm tra các tác tử xử lý tương tác nhiều bước, điểm được báo cáo tăng từ 30.9% lên 38.1%.
Mẫu cũng đạt 61.4% trên Vals Finance Agent v2, cao hơn Gemini 3.7 Flash ở mức 59.0% trong so sánh của Google. Trên Harvey’s Legal Agent Benchmark, các điểm tương ứng là 10.0% và 8.8%.
Đối với HLE-Verified, một benchmark suy luận đa ngành ở cấp độ chuyên gia, Google báo cáo 54.9% cho Gemini 3.8 Flash và 53.6% cho 3.7 Flash. So sánh được công bố xếp 3.8 Flash nhỉnh hơn GPT-5.6 Sol ở mức 54.5% và Claude Opus 5 ở mức 54.4%. Những chênh lệch nhỏ như vậy không nên được xem là bằng chứng rằng một mẫu sẽ liên tục vượt trội mẫu khác trên các khối lượng công việc không liên quan.
Google cũng cho biết Gemini 3.8 Flash dẫn đầu đánh giá kỹ nghệ phần mềm dài hạn DeepSWE v1.1 trong khi vận hành với chi phí thấp hơn các mẫu lớn hơn. Bài đánh giá bản phát hành của Ars Technica mô tả mức cải thiện là khiêm tốn ở nhiều bài kiểm tra tổng quát nhưng lớn hơn trong các đánh giá lập trình. Bài viết cũng lưu ý rằng, dù cải thiện so với 3.7 Flash trên OSWorld 2.0, mẫu mới vẫn kém xa Claude Opus trong benchmark sử dụng máy tính đó.
Mô hình kết quả pha trộn này quan trọng đối với các quyết định triển khai. Lý do mạnh nhất được công bố để nâng cấp liên quan đến công việc trên terminal, tác tử lập trình và thực thi tác vụ kéo dài — chứ không phải mức nhảy vọt đồng đều trên mọi bài kiểm tra suy luận hoặc điều khiển máy tính.
4. Việc di chuyển đòi hỏi nhiều hơn thay đổi tên mẫu
Nhà phát triển chuyển từ Gemini 3.7 Flash hoặc 3.6 Flash phải thay đổi mã nhận diện mẫu thành gemini-3.8-flash. Hướng dẫn di chuyển dành cho doanh nghiệp của Google cũng chỉ dẫn người dùng thay cấu hình thinking_budget dựa trên số nguyên cũ bằng enum thinking_level.
Một số cơ chế điều khiển sinh dữ liệu cũ không khả dụng. Google cho biết temperature, top_p và top_k bị backend bỏ qua, trong khi frequency_penalty, presence_penalty và candidate_count tạo ra lỗi API. Các ứng dụng phụ thuộc vào những trường này cần thay đổi cấu hình thay vì chỉ thay tên mẫu.
Việc gọi hàm được xác thực nghiêm ngặt hơn. Một lượt phản hồi hàm phải khớp mã nhận diện, tên và số lần thực thi của lệnh gọi hàm ngay trước đó. Tài sản đa phương thức phải được đặt bên trong payload phản hồi, lịch sử trò chuyện không thể kết thúc bằng một lượt có vai trò mẫu và các phản hồi mẫu được điền sẵn không được hỗ trợ.
Các ràng buộc này có thể làm lộ lỗi tích hợp mà các triển khai cũ từng chấp nhận. Các nhóm đánh giá việc nâng cấp nên kiểm thử toàn bộ dấu vết tác tử — bao gồm thử lại, phản hồi công cụ, đầu ra có cấu trúc và tái dựng lịch sử hội thoại — thay vì so sánh các prompt riêng lẻ.
Mốc cắt kiến thức được tài liệu hóa của mẫu là tháng 3 năm 2026, dù Google cảnh báo rằng phạm vi bao phủ trong một số lĩnh vực có thể vẫn tương tự mốc cắt tháng 1 năm 2025 gắn với họ Gemini 3 rộng hơn. Neo dữ liệu từ tìm kiếm hoặc một lớp truy xuất khác vẫn cần thiết cho thông tin hiện tại hoặc thay đổi nhanh.
5. Giá ban đầu không đổi nhưng tăng gấp đôi vào tháng 1
Đến hết ngày 31 tháng 12 năm 2026, mức sử dụng Gemini API tiêu chuẩn có giá $0.75 cho mỗi triệu token đầu vào và $3.75 cho mỗi triệu token đầu ra, bao gồm token suy luận. Đây là các mức giá giới thiệu giống như đã niêm yết cho Gemini 3.7 Flash.
Các mức giá tăng gấp đôi vào ngày 1 tháng 1 năm 2027, lên $1.50 cho mỗi triệu token đầu vào và $7.50 cho mỗi triệu token đầu ra. Phí lưu đệm ngữ cảnh cũng tăng từ $0.075 lên $0.15 cho mỗi triệu token, trong khi phí lưu trữ bộ nhớ đệm tăng từ $0.50 lên $1 cho mỗi triệu token mỗi giờ.
Suy luận Batch và Flex có giá $0.375 cho mỗi triệu token đầu vào và $1.875 cho mỗi triệu token đầu ra trong giai đoạn giới thiệu. Cả hai tăng lần lượt lên $0.75 và $3.75 vào tháng 1. Suy luận Priority có giá cao hơn, ở mức $1.35 cho mỗi triệu token đầu vào và $6.75 cho mỗi triệu token đầu ra đến hết tháng 12.
Giá đầu ra bao gồm các token suy luận nội bộ, khiến việc chọn mức nỗ lực trở thành một phần của mô hình chi phí. Một tác vụ gọi thêm bước suy luận có thể tốn nhiều hơn ngay cả khi phản hồi cuối cùng hiển thị cho người dùng ngắn. Vì vậy, các đánh giá trong môi trường sản xuất nên ghi nhận tổng token được tính phí, tỷ lệ hoàn thành, độ trễ và số lần gọi công cụ thay vì chỉ so sánh giá niêm yết.
Nhà phát triển có thể truy cập Gemini 3.8 Flash qua Google AI Studio, Gemini API, Android Studio, Stitch và Antigravity. Doanh nghiệp có thể sử dụng mẫu này qua Gemini Enterprise Agent Platform. Người dùng cần đăng ký Google AI Pro hoặc Ultra để truy cập mẫu trong ứng dụng Gemini, AI Mode trong Google Search và Gemini trong Google Sheets.
6. Thẻ mẫu duy trì các hạn chế quan trọng
Thẻ mẫu của Google cho biết Gemini 3.8 Flash có thể tạo ảo giác, đôi khi phản hồi chậm, hết thời gian chờ hoặc tiêu thụ nhiều token hơn dự kiến ở các mức nỗ lực cao hơn. Khả năng hỗ trợ đầu vào đa phương thức và công cụ tác tử của mẫu không loại bỏ nhu cầu xác thực mã được tạo ra, phân tích tài chính, công việc pháp lý hoặc các hành động được thực hiện thông qua hệ thống bên ngoài.
Công ty báo cáo hiệu năng an toàn nội dung tổng quát tương đương hoặc cải thiện so với Gemini 3.7 Flash, dù kiểm thử tự động phát hiện sự suy giảm nhẹ trong một số đánh giá an toàn không phải tiếng Anh. Google cho biết việc rà soát thủ công xác định các trường hợp suy giảm được gắn cờ chủ yếu là dương tính giả hoặc các trường hợp không nghiêm trọng.
Theo Frontier Safety Framework của Google DeepMind, công ty kết luận rằng Gemini 3.8 Flash không bổ sung các năng lực đáng kể so với 3.7 Flash trong các lĩnh vực rủi ro cao được theo dõi bởi khung này và khó có khả năng vượt qua Tracked hoặc Critical Capability Level. Mẫu không hạn chế vẫn giữ các biện pháp bảo vệ đối với tấn công mạng và hành vi lạm dụng hóa học, sinh học, phóng xạ và hạt nhân; biến thể Cyber có năng lực cao hơn được phân phối riêng theo cơ chế truy cập hạn chế.
Câu hỏi thường gặp
Gemini 3.8 Flash được phát hành khi nào?
Google đã phát hành mẫu ổn định vào ngày 2 tháng 9 năm 2026, ba tuần sau Gemini 3.7 Flash.
Mã mẫu API của Gemini 3.8 Flash là gì?
Mã nhận diện API ổn định là gemini-3.8-flash.
Gemini 3.8 Flash có hỗ trợ hình ảnh, âm thanh và video không?
Mẫu nhận văn bản, hình ảnh, âm thanh, video và PDF làm đầu vào nhưng chỉ tạo đầu ra văn bản.
Gemini 3.8 Flash có giá bao nhiêu?
Giá API tiêu chuẩn là $0.75 cho mỗi triệu token đầu vào và $3.75 cho mỗi triệu token đầu ra đến hết ngày 31 tháng 12 năm 2026. Các mức giá tăng lên $1.50 và $7.50 vào ngày 1 tháng 1 năm 2027.
Gemini 3.8 Flash Cyber có khả dụng rộng rãi không?
Không. Google giới hạn biến thể Cyber cho các bên phòng thủ được phê duyệt thông qua Fairwind Program. Mẫu Gemini 3.8 Flash đa dụng có khả dụng rộng rãi.
Tham khảo nguồn
- Thông báo Google AI gốc trên X
- Google: Giới thiệu Gemini 3.8 Flash và 3.8 Flash Cyber
- Google DeepMind: Gemini 3.8 Flash
- Google DeepMind: Thẻ mẫu Gemini 3.8 Flash
- Google AI for Developers: Thông số kỹ thuật Gemini 3.8 Flash
- Google AI for Developers: Giá Gemini API
- Google Cloud: Hướng dẫn dành cho nhà phát triển về Gemini 3.8 Flash
- Ars Technica: Google phát hành Gemini 3.8 Flash
Share