Google ra mắt Gemini 3.5 Transcribe với tính năng đọc chính tả thông minh và hai API chuyển giọng nói thành văn bản
Gemini 3.5 Transcribe bổ sung đọc chính tả thông minh, hơn 85 ngôn ngữ, phát trực tiếp, nhãn người nói, dấu thời gian và quyền truy cập API trả phí.
Google giới thiệu Gemini 3.5 Transcribe vào ngày 26 tháng 8 năm 2026, như một mô hình chuyển giọng nói thành văn bản chuyên dụng cho giao diện giọng nói trực tiếp và âm thanh đã ghi. Bản xem trước công khai hỗ trợ hơn 85 ngôn ngữ và bổ sung chế độ “thông minh” tùy chọn, giúp loại bỏ từ đệm, xử lý các chỉnh sửa khi nói và định dạng lời nói phi cấu trúc thành văn bản dễ đọc.
Mô hình được cung cấp cho nhà phát triển qua hai endpoint Gemini API riêng biệt. gemini-3.5-transcribe-live xử lý âm thanh theo thời gian thực qua Live API, trong khi gemini-3.5-transcribe xử lý các bản ghi được tải lên qua Interactions API. Google cũng đã triển khai công nghệ chép lời nền tảng trên một số sản phẩm tiêu dùng được chọn, gồm Rambler trong Gboard và ứng dụng Gemini cho macOS.
Sự phân biệt giữa chép lời và hành vi trợ lý rộng hơn là quan trọng. Bản thân Gemini 3.5 Transcribe tạo ra văn bản; tài liệu tham chiếu mô hình của Google liệt kê function calling, tìm kiếm tệp, tạo ảnh, thực thi mã và suy luận là không được hỗ trợ. Khi ứng dụng macOS dùng một lệnh đọc chính tả để tóm tắt tệp hoặc tạo ảnh, các mô hình Gemini khác và công cụ ở cấp sản phẩm sẽ thực hiện công việc đó sau khi giọng nói đã được chép thành văn bản.
1. Hai mô hình phục vụ các quy trình âm thanh khác nhau
Mô hình trực tiếp kết nối qua một phiên WebSocket hai chiều và phát ra văn bản tăng dần khi âm thanh vẫn đang được gửi đến. Google mô tả độ trễ là dưới một giây, khiến endpoint này phù hợp cho phụ đề, giao diện đọc chính tả và ứng dụng giọng nói cần hiển thị văn bản trước khi người nói kết thúc một đoạn dài.
Các phiên trực tiếp chấp nhận âm thanh PCM 16-bit thô; hướng dẫn triển khai của Google quy định âm thanh đơn kênh ở 16 kHz và khuyến nghị các đoạn âm thanh khoảng 100 mili giây. Một phiên chép lời trực tiếp liên tục bị giới hạn ở 10 phút. Những ứng dụng cần hội thoại dài hơn phải tự quản lý việc chuyển đổi phiên trong hạ tầng của mình.
Mô hình không phát trực tuyến chấp nhận tệp âm thanh ghi sẵn và có thể xử lý tối đa một giờ trong mỗi yêu cầu. Giới hạn này giảm còn 30 phút khi bật dấu thời gian ở cấp từ hoặc phân tách người nói. Không như endpoint trực tiếp, mô hình này có thể gắn độ lệch thời gian bắt đầu và kết thúc cho từng từ, đồng thời nhận diện người nói trong bản ghi.
Thông báo ra mắt của Google mô tả khả năng gán người nói cho tối đa ba người. Tài liệu tham chiếu API cho thấy hỗ trợ tới tám người, nhưng ghi nhãn việc gán người nói từ ba người trở lên là thử nghiệm. Vì vậy, các nhà phát triển xử lý những cuộc họp lớn hơn nên xem con số tám người là trần kỹ thuật, không phải cam kết về chất lượng gán nhãn ổn định.
Cả hai endpoint đều tự động nhận diện các ngôn ngữ được hỗ trợ và có thể đổi ngôn ngữ trong một phiên hoặc câu mà không yêu cầu nhà phát triển cấu hình trước một ngôn ngữ duy nhất. Nếu đã biết ngôn ngữ, ứng dụng có thể cung cấp mã BCP-47 để hướng nhận dạng về ngôn ngữ đó.
Từ vựng tùy chỉnh mang lại một hình thức điều hướng thứ hai. Nhà phát triển có thể cung cấp tối đa 1.000 thuật ngữ cho tên riêng, từ viết tắt, biểu thức kỹ thuật hoặc các cụm từ ít gặp khác. Google cho biết kết quả thường tốt nhất với danh sách không quá 100 thuật ngữ, cho thấy từ vựng có mục tiêu phù hợp hơn các từ điển quá rộng.
2. Chép lời thông minh thay đổi đầu ra, không chỉ cách trình bày
Gemini 3.5 Transcribe có hai chế độ đầu ra. Chế độ mặc định VERBATIM giữ lại từ đệm, sự lặp lại, khởi đầu ngập ngừng và các tự chỉnh sửa khi nói. Ngược lại, chế độ SMART cố gắng tạo ra văn bản mà người nói muốn truyền đạt.
Ở chế độ thông minh, mô hình có thể loại bỏ các biểu thức như “um” và “uh”, xóa hiện tượng nói lắp, đồng thời áp dụng dấu câu và viết hoa đầu câu. Nó cũng xử lý các chỉnh sửa nội tuyến: một người ban đầu nói Thứ Ba rồi sửa ngày thành Thứ Tư sẽ nhận được bản chép lời chỉ chứa Thứ Tư.
Hệ thống định dạng có thể chuyển một chuỗi lời nói thành đoạn văn, danh sách dấu đầu dòng hoặc danh sách đánh số. Hệ thống cũng áp dụng chuẩn hóa văn bản ngược, biến các đại lượng được nói thành dạng viết gọn — ví dụ, chuyển “twenty six million dollars” thành “$26M.”
Hành vi này khiến chế độ thông minh hữu ích cho tin nhắn, ghi chú, prompt và bản nháp đầu tiên. Tuy nhiên, nó không tương đương với bản ghi nguyên văn. Vì mô hình chủ động xóa và viết lại một số phần của phát ngôn, các tổ chức tạo bản chép lời pháp lý, dữ liệu nghiên cứu, trích dẫn hoặc hồ sơ tuân thủ nên dùng đầu ra nguyên văn và đối chiếu kết quả với âm thanh gốc.
Google cũng áp đặt sự tách biệt kỹ thuật giữa đầu ra đã làm sạch và các chú thích chi tiết. Không thể kết hợp chép lời thông minh với dấu thời gian ở cấp từ hoặc phân tách người nói trong API âm thanh đã ghi. Các tính năng đó yêu cầu chế độ nguyên văn. Chép lời trực tiếp hỗ trợ định dạng thông minh nhưng không cung cấp dấu thời gian ở cấp từ hay phân tách người nói; thay vào đó, nó phát dấu thời gian ở cấp phát ngôn.
3. Kiểm thử độc lập xếp mô hình này vào nhóm hệ thống được lưu trữ chính xác nhất
Google gọi Gemini 3.5 Transcribe là mô hình chuyển giọng nói thành văn bản chính xác nhất của mình từ trước đến nay và định vị nó là phiên bản kế nhiệm Chirp 3. Trên benchmark đa ngôn ngữ FLEURS, Google báo cáo tỷ lệ lỗi từ là 5.50% cho chép lời trực tuyến và 5.04% cho xử lý không phát trực tuyến trên một nhóm ngôn ngữ và khu vực hàng đầu được chọn.
Tỷ lệ lỗi từ đo số lần thay thế, xóa và chèn so với bản chép lời tham chiếu; điểm thấp hơn cho thấy ít lỗi hơn. Các con số này chỉ áp dụng cho benchmark và không nên được hiểu là tỷ lệ lỗi phổ quát cho mọi giọng nói, micro hoặc môi trường âm học.
Google cũng cho biết Artificial Analysis đo được tỷ lệ lỗi trung bình 4.0% cho sử dụng trực tuyến và 2.6% cho sử dụng không phát trực tuyến. Google cũng báo cáo thời gian cần để tạo bản chép lời cuối cùng giảm 70% so với Chirp 3.
Bảng xếp hạng công khai về xử lý không phát trực tuyến của Artificial Analysis xác nhận kết quả 2.6%. Tại thời điểm xuất bản, bảng này xếp Gemini 3.5 Transcribe thứ năm về độ chính xác trong số các hệ thống được liệt kê, sau các mô hình có kết quả từ 1.7% đến 2.4%. Bài kiểm tra kết hợp khoảng tám giờ âm thanh từ các bộ dữ liệu hội thoại, nghị viện và báo cáo thu nhập doanh nghiệp, thay vì dựa vào một kho ngữ âm sạch duy nhất.
Bảng độc lập này cũng báo cáo hệ số tốc độ xử lý xấp xỉ 82.5, nghĩa là dịch vụ xử lý khoảng 82.5 giây âm thanh mỗi giây trong các điều kiện của benchmark đó. Artificial Analysis ước tính chi phí là $5 mỗi 1,000 phút, tương ứng với mức giá API không phát trực tuyến hỗn hợp xấp xỉ mà Google công bố.
Các phép đo này hỗ trợ tuyên bố của Google rằng mô hình có khả năng cạnh tranh, nhưng không chứng minh đây luôn là dịch vụ chính xác nhất hiện có. Đánh giá trong môi trường sản xuất vẫn cần các bản ghi mang tính đại diện, đặc biệt khi chuyển đổi mã ngôn ngữ, từ vựng chuyên ngành, người nói chồng lấn hoặc kênh nhiễu quyết định liệu bản chép lời có sử dụng được hay không.
4. Giá khởi điểm khoảng nửa xu cho mỗi phút âm thanh đã ghi
Bảng giá Gemini Developer API trả phí của Google niêm yết đầu vào âm thanh không phát trực tuyến ở mức $2 mỗi triệu token, ước tính là $0.003 mỗi phút. Đầu ra văn bản có giá $12 mỗi triệu token, ước tính thêm $0.002 mỗi phút. Vì vậy, Google đưa ra ước tính hỗn hợp khoảng $0.005 cho mỗi phút âm thanh đã ghi.
Chép lời trực tiếp có giá cao hơn. Đầu vào âm thanh có giá $3.50 mỗi triệu token, tương đương khoảng $0.005 mỗi phút, trong khi văn bản được tạo ra có giá $21 mỗi triệu token, ước tính $0.004 mỗi phút. Google tính mức giá kết hợp hiệu dụng khoảng $0.009 cho mỗi phút trực tiếp.
Cả hai biến thể đều có tầng API miễn phí. Bảng giá của Google cũng nêu rằng nội dung ở tầng miễn phí có thể được dùng để cải thiện sản phẩm của hãng, trong khi nội dung ở tầng trả phí không được dùng cho mục đích đó theo các điều khoản được liệt kê. Các nhóm xử lý bản ghi mật nên đánh giá tầng dịch vụ áp dụng, khả năng cung cấp theo khu vực và điều khoản quản trị dữ liệu trước khi triển khai.
Cả hai mô hình chép lời đều không hỗ trợ suy luận batch, flex hoặc priority. Grounding bằng Google Search cũng không khả dụng. Đây là dịch vụ âm thanh thành văn bản chuyên dụng, không phải mô hình Gemini tổng quát được bổ sung chép lời như một khả năng có thể prompt.
5. Google đang nhúng tính năng chép lời vào giao diện đọc chính tả và tác tử
Đối với người dùng, Gemini 3.5 Transcribe hiện có bằng tiếng Anh thông qua ứng dụng Gemini trên macOS và qua Rambler trên Android tại một số quốc gia và ngôn ngữ được chọn. Rambler có thể làm sạch văn bản đọc chính tả, sửa lỗi chính tả, thực hiện chỉnh sửa và thay đổi phong cách viết bằng chỉ dẫn giọng nói.
Trong Google Antigravity, tính năng chép lời có thể sử dụng ngữ cảnh màn hình được cho phép và lịch sử trò chuyện để cải thiện cách xử lý tên tệp, tài liệu đang hoạt động và đầu ra của tác tử. Google AI Studio cũng cung cấp mô hình này trong chế độ Build để nhà phát triển có thể đọc chính tả khi tạo ứng dụng.
Ứng dụng Gemini trên macOS kết hợp chép lời với ngữ cảnh màn hình và các mô hình Gemini khác. Các yêu cầu bằng lời nói có thể kích hoạt quy trình liên quan đến tóm tắt tệp cục bộ, tái sử dụng văn bản giữa các ứng dụng, tìm kiếm hoặc tạo ảnh. Những thao tác này là tính năng tích hợp: mô hình chép lời chuyên dụng chuyển giọng nói thành văn bản, trong khi ứng dụng xung quanh định tuyến lệnh tạo ra.
Google cho biết hỗ trợ nói để nhập cho các trường web bất kỳ sẽ đến với Chrome, nhưng chưa thuộc bản phát hành hiện có. Quyền truy cập doanh nghiệp đang ở giai đoạn xem trước công khai thông qua Gemini Enterprise Agent Platform, với hỗ trợ cho Gemini Enterprise for Customer Experience được lên kế hoạch riêng.
Vì vậy, đợt ra mắt này thay đổi nhiều hơn độ chính xác nhận dạng. Google hiện cung cấp một lớp chép lời cho đọc chính tả tiêu dùng, môi trường phát triển, xử lý âm thanh doanh nghiệp và giao diện giọng nói thời gian thực. Nhà phát triển có thể chọn đầu ra đã làm sạch hoặc nguyên văn, nhưng cũng phải lựa chọn giữa độ trễ thấp của endpoint trực tiếp và nhãn người nói cùng thời gian ở cấp từ của endpoint âm thanh đã ghi.
Câu hỏi thường gặp
Gemini 3.5 Transcribe đã được cung cấp rộng rãi chưa?
Chưa. Google liệt kê các dịch vụ dành cho nhà phát triển và doanh nghiệp là bản xem trước công khai.
Mô hình hỗ trợ bao nhiêu ngôn ngữ?
Mô hình tự động nhận diện và chép lời hơn 85 ngôn ngữ, bao gồm cả việc chuyển đổi ngôn ngữ trong một phát ngôn hoặc phiên.
Mô hình trực tiếp có thể nhận diện người nói không?
Không. Phân tách người nói và dấu thời gian ở cấp từ chỉ khả dụng cho âm thanh đã ghi ở chế độ nguyên văn.
Chép lời thông minh có giữ nguyên chính xác lời của người nói không?
Không. Nó có thể loại bỏ từ đệm, xử lý chỉnh sửa, tái cấu trúc văn bản và thay đổi định dạng. Hãy dùng chế độ nguyên văn khi cách diễn đạt chính xác là quan trọng.
API có giá bao nhiêu?
Google ước tính khoảng $0.005 mỗi phút cho chép lời không phát trực tuyến và $0.009 mỗi phút cho chép lời trực tiếp ở tầng trả phí.
Tham khảo nguồn
- Thông báo gốc của Google AI trên X
- Google: Chép lời thông minh với Gemini 3.5 Transcribe
- Tài liệu tham chiếu mô hình Gemini 3.5 Transcribe
- Hướng dẫn chép lời âm thanh của Gemini API
- Hướng dẫn chép lời Gemini Live API
- Bảng giá Gemini Developer API
- Trang chép lời âm thanh Gemini của Google DeepMind
- Bảng xếp hạng chuyển giọng nói thành văn bản không phát trực tuyến của Artificial Analysis
Share