Grok 4.6 Nhắm đến các tác tử hoạt động dài hạn với ít lượt gọi công cụ hơn và giá API cố định
Grok 4.6 của SpaceXAI cải thiện các benchmark tác tử đường dài, giữ mức giá $2/$6 và cung cấp ngữ cảnh API 500.000 token.
SpaceXAI đã phát hành Grok 4.6 vào ngày 12 tháng 8, định vị mô hình này cho các tác tử hoạt động dài hạn có thể nghiên cứu chủ đề, làm việc trên nhiều codebase, sử dụng công cụ và tinh chỉnh công việc qua nhiều bước. Bản phát hành cải thiện đáng kể so với Grok 4.5 trên một số đánh giá tác tử, đồng thời duy trì mức giá API niêm yết là $2 cho mỗi triệu token đầu vào và $6 cho mỗi triệu token đầu ra.
Kết quả khác biệt nhất đến từ benchmark AA-Briefcase của Artificial Analysis dành cho công việc tri thức đường dài. Grok 4.6 hoàn thành các tác vụ trong khoảng 53 lượt và tiêu thụ khoảng 500 triệu token đầu vào trong toàn bộ quá trình đánh giá, so với khoảng 103 lượt và hai tỷ token đầu vào của Claude Opus 5 ở mức nỗ lực tối đa. So sánh này củng cố một tuyên bố hiệu quả cụ thể: trên benchmark này, Grok cần khoảng một nửa số lượt và một phần tư số token đầu vào.
Phát hiện này hẹp hơn mô tả ban đầu trên mạng xã hội rằng Grok 4.6 sử dụng một nửa số lượt của “other leading models.” Artificial Analysis đã công bố so sánh chi tiết với Claude Opus 5 Max, không phải với mọi mô hình biên cạnh tranh. Tuy vậy, điều này vẫn có ý nghĩa vì các vòng lặp tác tử dài liên tục gửi lại hoặc tích lũy ngữ cảnh, khiến số bước trở thành một thành phần trực tiếp của độ trễ và chi phí.
1. Grok 4.6 Mở rộng dòng huấn luyện Grok 4.5
SpaceXAI mô tả Grok 4.6 là sự tiếp nối của Grok 4.5, thay vì một kiến trúc mới được công bố. Công ty chưa công bố số lượng tham số, mức tính toán huấn luyện hoặc đặc tả kiến trúc chi tiết cho bản phát hành này.
Mô hình đã trải qua một đợt huấn luyện bổ sung dài hơn so với Grok 4.5. SpaceXAI cho biết giai đoạn này sử dụng dữ liệu do mô hình tạo ra đã được tuyển chọn cho suy luận và các khái niệm kỹ thuật nâng cao, dữ liệu kỹ thuật chất lượng cao, cùng một optimizer và quy trình huấn luyện được cải tiến.
Sau đó, Grok 4.5 được dùng để tái tạo các quỹ đạo fine-tuning có giám sát trên nhiều mức nỗ lực suy luận, harness tác tử và các lĩnh vực gồm STEM, kỹ thuật phần mềm và công việc tri thức. Các kiểm tra dựa trên mô hình đã lọc những quỹ đạo có vấn đề trước khi checkpoint thu được chuyển sang reinforcement learning.
Các môi trường reinforcement learning bao phủ lập trình và công việc tri thức nói chung, cùng những tác vụ chuyên biệt hơn liên quan đến tối ưu hóa kernel, phát triển web và thiết kế hỗ trợ bằng máy tính. SpaceXAI cho biết các quỹ đạo thử nghiệm dài hơn cũng tạo ra nhiều trường hợp mô hình tự kiểm thử và xác minh công việc của mình trước khi tiếp tục.
Dữ liệu Cursor thuộc dòng mô hình này, nhưng các thông tin được công bố đòi hỏi cách diễn đạt cẩn trọng. Cursor cho biết Grok 4.5 được huấn luyện chung với SpaceXAI dưới dạng mô hình mixture-of-experts, sử dụng hàng nghìn tỷ token dữ liệu Cursor. Dữ liệu đó ghi lại cả các tương tác với codebase lẫn trao đổi giữa nhà phát triển, tác tử và công cụ phần mềm.
Thông báo về Grok 4.6 cho biết mô hình mới xây dựng trên Grok 4.5 và nhận thêm dữ liệu kỹ thuật, nhưng không định lượng lượng dữ liệu Cursor mới được bổ sung riêng cho phiên bản 4.6. Mô tả Grok 4.6 là hưởng lợi từ nền tảng được huấn luyện với Cursor là có cơ sở; tuyên bố về một khối lượng dữ liệu Cursor mới được công bố cho đợt huấn luyện bổ sung 4.6 thì không.
2. Benchmark tác tử cho thấy mức tăng lớn, nhưng không phải chiến thắng toàn diện
Grok 4.6 đạt 61 điểm trên phiên bản 4.1.1 của Artificial Analysis Intelligence Index, cao hơn Grok 4.5 năm điểm và bằng GPT-5.6 Sol Max trong so sánh ra mắt của SpaceXAI. Fable 5 Max đạt 62 điểm. Chỉ số này kết hợp chín đánh giá về công việc tác tử, tác vụ terminal, khoa học, kiến thức tổng quát và suy luận.
Các cải thiện rõ ràng nhất của bản phát hành xuất hiện trong các bài kiểm tra hướng đến tác tử:
| Đánh giá | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| GDPVal-AA v2 | 1,753 | 1,526 | 1,728 | 1,741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54.0% | 73.0% | 70.0% |
| FrontierCode v1.1 Extended | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26.0% | 15.7% | 34.6% | 34.1% |
| AA-Briefcase | 1,577 | 1,313 | 1,502 | 1,574 |
GDPVal-AA v2 đánh giá các tác vụ chuyên môn có giá trị kinh tế. Artificial Analysis độc lập báo cáo rằng kết quả của Grok 4.6 chỉ đứng sau Claude Opus 5 và không thể phân biệt có ý nghĩa thống kê với Fable 5 và Qwen3.8 Max vì các khoảng tin cậy của chúng chồng lấp.
AA-Briefcase tạo ra kết quả chất lượng tương tự nhưng có hồ sơ hiệu quả khác thường hơn. Grok 4.6 đạt Elo 1,577, nhỉnh hơn một chút so với mức 1,574 của Fable 5 Max và cao hơn đáng kể so với 1,502 của GPT-5.6 Sol Max trong bảng của SpaceXAI. Artificial Analysis mô tả đầu ra của Grok là cạnh tranh ổn định trên các tiêu chí tuân thủ rubric, trình bày và chất lượng phân tích.
Các kết quả này không xác lập Grok 4.6 là mô hình mạnh nhất cho mọi khối lượng công việc tác tử. GPT-5.6 Sol Max dẫn trước 7.1 điểm phần trăm trên DeepSWE v1.1 và 8.6 điểm trên Terminal-Bench v3.0. Fable 5 Max cũng tiếp tục dẫn trước trên CursorBench, FrontierCode, APEX-Agents, Terminal-Bench và APEX-SWE trong bảng ra mắt.
Điều kiện benchmark khác nhau theo harness và mức thiết lập suy luận, và SpaceXAI lưu ý rằng các số liệu cạnh tranh được chọn từ system card do nhà cung cấp công bố hoặc bảng xếp hạng công khai. Vì vậy, bảng này là bằng chứng về hiệu năng cạnh tranh trên nhiều môi trường, không phải một tuyên bố được kiểm soát rằng một mô hình thống trị mọi hệ thống tác tử.
3. Số lượt ít hơn thay đổi cách tính chi phí
Artificial Analysis đo được chi phí trung bình $0.84 cho mỗi tác vụ khi đánh giá Grok 4.6 trên Intelligence Index của họ. Tổ chức này đặt mô hình trên biên hiệu năng-chi phí đối với từng đánh giá tác tử có trong chỉ số đó.
Lợi thế kinh tế đến từ hai yếu tố riêng biệt. Grok 4.6 có giá token công bố thấp hơn một số mô hình biên lân cận, và các lượt chạy AA-Briefcase của nó tích lũy ít ngữ cảnh hơn vì dùng ít lượt hơn. Một tác tử chạy dài có thể gửi lại cho mô hình chỉ dẫn, lịch sử hội thoại, tài liệu truy xuất và kết quả công cụ sau mỗi hành động. Do đó, giảm số chu kỳ có thể làm giảm mức tiêu thụ token đầu vào ngay cả khi câu trả lời cuối cùng tương tự.
Điều này không có nghĩa mọi ứng dụng Grok 4.6 sẽ có giá $0.84 hoặc sử dụng ít hơn một nửa số lượt. Những số liệu đó mô tả cấu hình đánh giá của Artificial Analysis. Chi phí thực tế phụ thuộc vào mức nỗ lực suy luận, thiết kế công cụ, prompt caching, sự tăng trưởng ngữ cảnh, số lần thử lại và việc tác tử có hoàn thành tác vụ thành công hay không.
Tốc độ thô là một hạn chế khác. Artificial Analysis đo được khoảng 62 token đầu ra mỗi giây và thời gian đến token đầu tiên là 44.82 giây thông qua API của SpaceXAI; cả hai đều chậm hơn các trung vị so sánh hiển thị trên trang mô hình của họ. Hiệu quả theo lượt có thể giảm thời lượng của toàn bộ quy trình mà không làm từng phản hồi riêng lẻ nhanh hơn.
4. Triển khai API và Cursor có các giới hạn khác nhau
API SpaceXAI gốc sử dụng mã định danh mô hình grok-4.6. API này nhận văn bản và hình ảnh, trả về văn bản, đồng thời hỗ trợ các mức nỗ lực suy luận low, medium, high và xhigh, với high là mặc định. Các công cụ được ghi nhận gồm function calling, tìm kiếm web và X, cùng thực thi mã.
SpaceXAI ghi nhận cửa sổ ngữ cảnh 500,000 token, mốc kiến thức ngày 1 tháng 2 năm 2026 và không nêu giới hạn đầu ra văn bản. Dưới 200,000 token prompt, giá API là $2 cho mỗi triệu token đầu vào, $0.50 cho mỗi triệu token đầu vào được cache và $6 cho mỗi triệu token đầu ra. Các mức giá này tăng gấp đôi lên $4, $1 và $12 khi prompt vượt quá 200,000 token.
Công ty khuyến nghị gán một khóa prompt-cache ổn định cho cuộc hội thoại để các yêu cầu kế tiếp đến cùng máy chủ và có thể tái sử dụng ngữ cảnh đã cache. Công ty cũng khuyến nghị nén ngữ cảnh cho các vòng lặp tác tử dài. Cả hai cơ chế đều quan trọng vì dung lượng ngữ cảnh được quảng cáo không loại bỏ chi phí xử lý lặp lại một lịch sử ngày càng dài.
Triển khai của Cursor cung cấp cửa sổ ngữ cảnh được ghi nhận nhỏ hơn, 256,000 token. Nó cho Grok 4.6 quyền truy cập vào các công cụ tìm kiếm tệp, truy cập web, đọc và chỉnh sửa tệp, terminal, trình duyệt, tạo ảnh và truy xuất rules của Cursor. Mức giá on-demand tiêu chuẩn khớp với tier API thấp hơn, trong khi tùy chọn Fast của Cursor có giá $4 cho mỗi triệu token đầu vào, $1 cho mỗi triệu token đầu vào được cache và $12 cho mỗi triệu token đầu ra.
Khi ra mắt, Grok 4.6 có mặt thông qua Cursor, Grok Build, SpaceXAI API, OpenRouter, Vercel và Cloudflare. Cursor và Grok Build cung cấp gấp đôi mức sử dụng đi kèm trong tuần đầu tiên, nhưng đó là chương trình khuyến mãi ra mắt có thời hạn, không phải điều khoản giá vĩnh viễn.
Câu hỏi thường gặp
Grok 4.6 được phát hành khi nào?
SpaceXAI đã phát hành Grok 4.6 vào ngày 12 tháng 8 năm 2026.
Grok 4.6 có luôn sử dụng ít hơn một nửa số lượt tác tử không?
Không. So sánh khoảng 53 so với 103 lượt chỉ đến từ đánh giá AA-Briefcase của Artificial Analysis đối chiếu với Claude Opus 5 Max.
Grok 4.6 có được huấn luyện trên dữ liệu Cursor không?
Nền tảng Grok 4.5 của nó đã được huấn luyện với hàng nghìn tỷ token dữ liệu Cursor. SpaceXAI chưa công bố lượng dữ liệu Cursor bổ sung, nếu có, được dùng riêng trong đợt huấn luyện bổ sung Grok 4.6.
API Grok 4.6 có giá bao nhiêu?
Dưới 200,000 token prompt, mức giá được ghi nhận là $2 cho mỗi triệu token đầu vào, $0.50 cho mỗi triệu token đầu vào được cache và $6 cho mỗi triệu token đầu ra. Các mức giá tăng gấp đôi trên ngưỡng đó.
Grok 4.6 có cùng cửa sổ ngữ cảnh trong Cursor và API không?
Không. SpaceXAI ghi nhận 500,000 token cho API của mình, trong khi Cursor ghi nhận cửa sổ ngữ cảnh 256,000 token cho triển khai của họ.
Tham khảo nguồn
Share