Grok 4.6 以更少的工具轮次和固定 API 定价瞄准长时运行智能体
SpaceXAI 的 Grok 4.6 改进了长时程智能体基准表现,维持 $2/$6 定价,并提供 500,000-token 的 API 上下文。
SpaceXAI 于 8 月 12 日发布 Grok 4.6,将该模型定位为面向长时运行智能体:可研究主题、跨代码库操作、使用工具,并在多个步骤中持续完善工作。该版本在多项智能体评测中相较 Grok 4.5 有显著提升,同时维持每百万输入 token $2、每百万输出 token $6 的标价 API 价格。
最具特色的结果来自 Artificial Analysis 针对长时程知识工作的 AA-Briefcase 基准测试。Grok 4.6 在整个评测中以约 53 轮完成任务,消耗约 5 亿输入 token;相比之下,Claude Opus 5 在最高推理强度下约需 103 轮和 20 亿输入 token。这一比较支持一项明确的效率主张:在该基准上,Grok 所需轮次约为一半,输入 token 约为四分之一。
这一发现比最初社交媒体中称 Grok 4.6 使用“其他领先模型”一半轮次的说法更为具体。Artificial Analysis 发布的是与 Claude Opus 5 Max 的详细比较,而非与所有竞争性前沿模型的比较。不过,这一点仍然意义重大,因为长智能体循环会反复重发或累积上下文,使步骤数量直接影响延迟和成本。
一、Grok 4.6 延续 Grok 4.5 的训练路线
SpaceXAI 将 Grok 4.6 描述为 Grok 4.5 的延续,而非新披露的架构。该公司尚未公布此次发布的参数量、训练计算量或详细架构规格。
该模型接受了比 Grok 4.5 更长的补充训练。SpaceXAI 表示,这一阶段使用了经过筛选的模型生成材料,用于推理和高级技术概念;还使用了高质量工程数据,以及改进的优化器和训练方案。
随后,使用 Grok 4.5 在多种推理强度设置、智能体框架和领域中重新生成监督微调轨迹,涵盖 STEM、软件工程和知识工作。基于模型的检查会先筛除存在问题的轨迹,之后生成的检查点再进入强化学习阶段。
强化学习环境涵盖通用编程和知识工作,也包括内核优化、Web 开发和计算机辅助设计等更专业的任务。SpaceXAI 表示,更长的测试轨迹还带来了更多模型在继续之前测试和验证自身工作的实例。
Cursor 数据属于这一模型谱系,但现有披露需要谨慎表述。Cursor 表示,Grok 4.5 与 SpaceXAI 联合训练,是一个使用数万亿 token Cursor 数据的混合专家模型。这些材料记录了代码库交互,以及开发者、智能体和软件工具之间的交流。
Grok 4.6 的公告称,新模型建立在 Grok 4.5 之上,并获得了额外工程数据,但未量化专门为 4.6 版本新增了多少 Cursor 数据。称 Grok 4.6 受益于经过 Cursor 数据训练的基础是有依据的;但声称 4.6 补充训练新披露了某一规模的 Cursor 数据,则没有依据。
二、智能体基准显示大幅提升,但并非全面领先
在 Artificial Analysis Intelligence Index 4.1.1 版本中,Grok 4.6 得分为 61,比 Grok 4.5 高 5 分,并在 SpaceXAI 的发布比较中与 GPT-5.6 Sol Max 持平。Fable 5 Max 得分为 62。该指数结合了九项评测,覆盖智能体工作、终端任务、科学、通识知识和推理。
此次发布最明显的提升出现在面向智能体的测试中:
| 评测 | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| GDPVal-AA v2 | 1,753 | 1,526 | 1,728 | 1,741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54.0% | 73.0% | 70.0% |
| FrontierCode v1.1 Extended | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26.0% | 15.7% | 34.6% | 34.1% |
| AA-Briefcase | 1,577 | 1,313 | 1,502 | 1,574 |
GDPVal-AA v2 评估具有经济价值的专业任务。Artificial Analysis 独立报告称,Grok 4.6 的结果仅次于 Claude Opus 5;由于其置信区间重叠,与 Fable 5 和 Qwen3.8 Max 在统计上无法区分。
AA-Briefcase 产生了相似的质量结果,但效率表现更为特殊。Grok 4.6 的 Elo 评分达到 1,577,略高于 SpaceXAI 表格中 Fable 5 Max 的 1,574,也显著高于 GPT-5.6 Sol Max 的 1,502。Artificial Analysis 将 Grok 的输出描述为在评分标准遵循度、呈现效果和分析质量方面始终具有竞争力。
这些结果并不能证明 Grok 4.6 在每一种智能体工作负载上都是最强模型。GPT-5.6 Sol Max 在 DeepSWE v1.1 上领先它 7.1 个百分点,在 Terminal-Bench v3.0 上领先 8.6 个百分点。发布表格中的 Fable 5 Max 也仍在 CursorBench、FrontierCode、APEX-Agents、Terminal-Bench 和 APEX-SWE 上领先。
不同框架和推理设置下的基准条件有所不同,SpaceXAI 指出,竞品数据选自供应商发布的系统卡或公开排行榜。因此,该表格证明的是模型在多个环境中的竞争性表现,而不是在受控条件下宣称某一模型主导所有智能体系统。
三、更少的轮次改变成本计算方式
Artificial Analysis 在其 Intelligence Index 上评测 Grok 4.6 时,测得每项任务的平均成本为 $0.84。该机构将该模型置于该指数所含每项智能体评测的成本性能前沿。
经济优势来自两个独立因素。Grok 4.6 的公开 token 价格低于若干相近的前沿模型;同时,其 AA-Briefcase 运行因使用更少轮次而累积了更少上下文。长时运行智能体可能在每次操作后将指令、对话历史、检索文档和工具结果重新发送给模型。因此,即使最终答案相似,减少循环次数也可以降低输入 token 消耗。
这并不意味着每个 Grok 4.6 应用都会花费 $0.84,或使用一半轮次。这些数据描述的是 Artificial Analysis 的评测配置。实际成本取决于推理强度、工具设计、提示缓存、上下文增长、重试次数,以及智能体是否成功完成任务。
原始速度是另一项限制。Artificial Analysis 通过 SpaceXAI API 测得约 62 个输出 token/秒,以及 44.82 秒的首 token 时间,两者都慢于其模型页面列出的比较中位数。轮次效率可以缩短整个工作流的持续时间,但不意味着每一次单独响应都会更快。
四、API 和 Cursor 部署具有不同限制
原生 SpaceXAI API 使用模型标识符 grok-4.6。它接受文本和图像,返回文本,并支持 low、medium、high 和 xhigh 推理强度,默认值为 high。其文档列出的工具包括函数调用、Web 和 X 搜索以及代码执行。
SpaceXAI 文档说明其上下文窗口为 500,000-token,知识截止日期为 2026 年 2 月 1 日,并未说明文本输出限制。提示词低于 200,000 token 时,API 定价为每百万输入 token $2、每百万缓存输入 token $0.50、每百万输出 token $6。一旦提示词超过 200,000 token,这些费率将翻倍至 $4、$1 和 $12。
该公司建议为对话分配稳定的提示缓存键,以便后续请求到达同一服务器并复用缓存上下文。它还建议为长智能体循环进行上下文压缩。这两种机制都很重要,因为宣传的上下文容量并不能消除反复处理不断增长历史记录的成本。
Cursor 的部署提供了较小的、文档说明为 256,000-token 的上下文窗口。它让 Grok 4.6 可访问 Cursor 的文件搜索、Web 访问、文件读取和编辑、终端、浏览器、图像生成和规则检索工具。标准按需费率与较低 API 档位一致,而 Cursor 的 Fast 选项收费为每百万输入 token $4、每百万缓存输入 token $1、每百万输出 token $12。
发布时,Grok 4.6 可通过 Cursor、Grok Build、SpaceXAI API、OpenRouter、Vercel 和 Cloudflare 使用。Cursor 和 Grok Build 在第一周提供双倍包含用量,但那是限时发布促销,而非永久定价条款。
常见问题
Grok 4.6 是何时发布的?
SpaceXAI 于 2026 年 8 月 12 日发布了 Grok 4.6。
Grok 4.6 是否总是使用一半的智能体轮次?
不是。约 53 轮对 103 轮的比较,专门来自 Artificial Analysis 的 AA-Briefcase 评测中与 Claude Opus 5 Max 的对比。
Grok 4.6 是否使用 Cursor 数据训练?
其 Grok 4.5 基础模型使用数万亿 token 的 Cursor 数据训练。SpaceXAI 尚未披露在 Grok 4.6 补充训练中,具体使用了多少额外 Cursor 数据(如有)。
Grok 4.6 API 的费用是多少?
提示词低于 200,000 token 时,文档费率为每百万输入 token $2、每百万缓存输入 token $0.50、每百万输出 token $6。超过该阈值后,费率翻倍。
Grok 4.6 在 Cursor 和 API 中是否拥有相同的上下文窗口?
不是。SpaceXAI 为其 API 标注 500,000 token,而 Cursor 为其部署标注文档化的 256,000-token 上下文窗口。
参考来源
Share