Grok 4.6 以更少工具回合數和固定 API 定價瞄準長時間運行代理
SpaceXAI 的 Grok 4.6 改善長時程代理基準測試表現,維持 $2/$6 定價,並提供 500,000-token API 上下文。
SpaceXAI 於 8 月 12 日發布 Grok 4.6,將此模型定位為適用於長時間運行的代理,可研究主題、跨程式碼庫操作、使用工具,並透過多個步驟完善工作成果。此版本在多項代理評估中較 Grok 4.5 有顯著改善,同時維持每百萬輸入 token $2、每百萬輸出 token $6 的主要 API 定價。
最具特色的結果來自 Artificial Analysis 的長時程知識工作 AA-Briefcase 基準測試。Grok 4.6 在評估中約以 53 個回合完成任務,合共消耗約 500 million input tokens;相比之下,Claude Opus 5 在最高努力程度下約需 103 個回合及 two billion input tokens。此比較支持一項具體的效率主張:在此基準測試中,Grok 所需回合數約少一半,輸入 token 數約少四分之三。
這項發現的範圍較原先社交媒體所述的 Grok 4.6 使用「other leading models」一半回合數為窄。Artificial Analysis 公布的是與 Claude Opus 5 Max 的詳細比較,而非與每個競爭前沿模型的比較。不過,這仍具重要意義,因為長代理迴圈會反覆重新傳送或累積上下文,令步驟數成為延遲和成本的直接組成部分。
一、Grok 4.6 延續 Grok 4.5 的訓練路線
SpaceXAI 將 Grok 4.6 描述為 Grok 4.5 的延續,而非一個新披露的架構。公司尚未公布此版本的參數量、訓練運算量數字或詳細架構規格。
此模型接受了比 Grok 4.5 更長的補充訓練。SpaceXAI 表示,這個階段使用了經整理、由模型生成的推理及進階技術概念材料、高質素工程數據,以及改良的優化器和訓練配方。
其後,Grok 4.5 用於在多個推理努力程度設定、代理框架及包括 STEM、軟件工程和知識工作的領域中,重新生成監督式微調軌跡。基於模型的檢查會先篩除有問題的軌跡,然後所得檢查點才進入強化學習。
強化學習環境涵蓋一般編程和知識工作,亦包括涉及核心最佳化、網頁開發和電腦輔助設計的更專門任務。SpaceXAI 表示,較長的測試軌跡亦帶來更多模型在繼續前自行測試和驗證工作成果的例子。
Cursor 數據屬於這個模型譜系,但現有披露需要審慎措辭。Cursor 表示,Grok 4.5 與 SpaceXAI 共同訓練,作為混合專家模型使用了數以萬億計的 Cursor 數據 token。該些材料記錄了程式碼庫互動,以及開發人員、代理和軟件工具之間的交流。
Grok 4.6 公告指出,新模型建基於 Grok 4.5,並獲得額外工程數據,但沒有量化專門為 4.6 版本新增了多少 Cursor 數據。稱 Grok 4.6 受惠於以 Cursor 數據訓練的基礎是有依據的;聲稱 4.6 補充訓練新披露了某個 Cursor 數據量則沒有依據。
二、代理基準測試顯示大幅進步,但並非全面領先
Grok 4.6 在 Artificial Analysis Intelligence Index 4.1.1 版本中獲得 61 分,較 Grok 4.5 高五分,並在 SpaceXAI 的發布比較中與 GPT-5.6 Sol Max 同分。Fable 5 Max 獲得 62 分。該指數結合九項評估,涵蓋代理工作、終端任務、科學、一般知識及推理。
此版本最明顯的改善出現在以代理為導向的測試中:
| 評估 | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| GDPVal-AA v2 | 1,753 | 1,526 | 1,728 | 1,741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54.0% | 73.0% | 70.0% |
| FrontierCode v1.1 Extended | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26.0% | 15.7% | 34.6% | 34.1% |
| AA-Briefcase | 1,577 | 1,313 | 1,502 | 1,574 |
GDPVal-AA v2 評估具經濟價值的專業任務。Artificial Analysis 獨立報告,Grok 4.6 的結果僅落後於 Claude Opus 5,並因其置信區間重疊,與 Fable 5 和 Qwen3.8 Max 在統計上無法區分。
AA-Briefcase 帶來相近的品質結果,但效率特徵較為罕見。Grok 4.6 達到 1,577 的 Elo 評分,略高於 SpaceXAI 表格中 Fable 5 Max 的 1,574,亦明顯高於 GPT-5.6 Sol Max 的 1,502。Artificial Analysis 將 Grok 的輸出描述為在評分準則遵循、呈現方式及分析品質方面一貫具競爭力。
這些結果並不證明 Grok 4.6 在每種代理工作負載上都是最強模型。GPT-5.6 Sol Max 在 DeepSWE v1.1 領先它 7.1 個百分點,並在 Terminal-Bench v3.0 領先 8.6 個百分點。Fable 5 Max 亦在發布表格中的 CursorBench、FrontierCode、APEX-Agents、Terminal-Bench 和 APEX-SWE 維持領先。
基準測試條件會因代理框架和推理設定而異,SpaceXAI 指出競爭模型數字取自供應商公布的系統卡或公開排行榜。因此,該表格是多個環境中具競爭力表現的證據,而非受控地宣告某一模型主導所有代理系統。
三、較低回合數改變成本計算
Artificial Analysis 在其 Intelligence Index 中評估 Grok 4.6 時,測得每項任務平均成本為 $0.84。它將該模型列為指數中每項代理評估的成本效能前沿。
經濟優勢來自兩個獨立因素。Grok 4.6 的公布 token 定價低於多個相近的前沿模型,而其 AA-Briefcase 運行因使用較少回合而累積較少上下文。長時間運行的代理可能會在每次操作後,把指示、對話歷史、檢索文件和工具結果傳回模型。因此,即使最終答案相近,減少循環次數亦可降低輸入 token 消耗。
這不代表每個 Grok 4.6 應用程式都會花費 $0.84 或使用一半回合數。這些數字描述的是 Artificial Analysis 的評估配置。實際成本取決於推理努力程度、工具設計、提示快取、上下文增長、重試,以及代理是否成功完成任務。
原始速度是另一項限制。Artificial Analysis 經 SpaceXAI API 測得約每秒 62 個輸出 token,以及 44.82 秒的首個 token 時間,兩者均慢於其模型頁面所示的比較中位數。回合效率可縮短整個工作流程的時長,但不會令每次個別回應變快。
四、API 和 Cursor 部署的限制不同
原生 SpaceXAI API 使用模型識別碼 grok-4.6。它接受文字和圖片、輸出文字,並支援 low、medium、high 和 xhigh 推理努力程度,預設為 high。其文件列出的工具包括函數呼叫、網絡和 X 搜尋,以及程式碼執行。
SpaceXAI 文件列出 500,000-token 上下文視窗、2026 年 2 月 1 日知識截止日期,以及沒有列明的文字輸出上限。在 200,000 個提示 token 以下,API 定價為每百萬輸入 token $2、每百萬快取輸入 token $0.50,以及每百萬輸出 token $6。提示超過 200,000 個 token 後,這些費率會加倍為 $4、$1 和 $12。
公司建議為對話指定穩定的提示快取鍵,讓後續請求到達同一伺服器並重用快取上下文。它亦建議為長代理迴圈進行上下文壓縮。兩種機制都很重要,因為所宣傳的上下文容量並不會消除反覆處理不斷增長歷史的成本。
Cursor 的部署提供較小的已記錄上下文視窗,為 256,000 個 token。它讓 Grok 4.6 存取 Cursor 的檔案搜尋、網絡存取、檔案讀取和編輯、終端機、瀏覽器、圖像生成及規則檢索工具。標準按需費率與較低 API 級別相同,而 Cursor 的 Fast 選項定價為每百萬輸入 token $4、每百萬快取輸入 token $1,以及每百萬輸出 token $12。
發布時,Grok 4.6 可透過 Cursor、Grok Build、SpaceXAI API、OpenRouter、Vercel 和 Cloudflare 使用。Cursor 和 Grok Build 在首星期提供雙倍已包括用量,但那是限時發布優惠,而非永久定價條款。
常見問題
Grok 4.6 於何時發布?
SpaceXAI 於 2026 年 8 月 12 日發布 Grok 4.6。
Grok 4.6 是否總會使用一半代理回合數?
否。約 53 對 103 回合的比較,專門來自 Artificial Analysis 的 AA-Briefcase 評估,對手為 Claude Opus 5 Max。
Grok 4.6 是否以 Cursor 數據訓練?
其 Grok 4.5 基礎使用了數以萬億計的 Cursor 數據 token 訓練。SpaceXAI 尚未披露在 Grok 4.6 補充訓練中,是否使用了額外 Cursor 數據,以及使用了多少。
Grok 4.6 API 的費用是多少?
在 200,000 個提示 token 以下,文件列出的費率為每百萬輸入 token $2、每百萬快取輸入 token $0.50,以及每百萬輸出 token $6。超過該門檻後,費率會加倍。
Grok 4.6 在 Cursor 和 API 中有相同的上下文視窗嗎?
否。SpaceXAI 為其 API 列出 500,000 個 token,而 Cursor 為其部署列出 256,000-token 上下文視窗。
參考來源
Share