AI News字数 3092阅读时长8 分钟

Anthropic 推出 Claude Fable 5.1,降低智能体成本并发布受限的 Mythos 版本

Claude Fable 5.1 提升智能体性能,将缓存读取成本降低 75%,并更新安全防护措施;Mythos 5.1 仍为受限访问。

文章目录 · 12
  1. 一、Fable 5.1 面向长周期智能体工作
  2. 二、Anthropic 报告广泛的基准测试提升
  3. 三、Fable 和 Mythos 共享智能,但访问权限不同
  4. 四、安全防护措施如今产生更少误报
  5. 五、缓存定价和企业数据控制改变部署经济性
  6. 常见问题
  7. Claude Fable 5.1 是否已通用可用?
  8. Claude Mythos 5.1 是不同的模型吗?
  9. 通过 API 使用 Fable 5.1 的费用是多少?
  10. 上下文和输出限制是多少?
  11. Fable 5.1 可以执行渗透测试吗?
  12. 参考来源

Anthropic 于 9 月 1 日发布 Claude Fable 5.1,将其定位为目前能力最强、面向长期运行的编程、研究和知识工作智能体的通用可用模型。该公司同时推出 Claude Mythos 5.1:这是同一底层模型的仅限受邀版本,为获批准的网络安全和生命科学机构提供更宽松的安全防护措施。

Fable 5.1 延续上一代的基础 API 定价:每百万输入 token $10,每百万输出 token $50。影响更大的定价变化是缓存读取成本下降 75%,从每百万 token $1 降至 $0.25。Anthropic 估计,这将使典型 Fable 工作负载的总成本降低约 25%,高度智能体化的工作负载最高可降低 45%。

此次发布还修订了原始 Fable 5 所采用的安全防护措施;这些措施曾使部分正当的生物学和安全任务难以完成。Fable 5.1 现在可以识别源代码中的漏洞,但渗透测试、漏洞利用生成、二进制漏洞扫描以及高级生命科学研究仍受到限制,或会被路由至能力较低的模型。

一、Fable 5.1 面向长周期智能体工作

Fable 5.1 接替了 Fable 5;Anthropic 于 2026 年 6 月 9 日推出后者,用于可异步运行数日的复杂任务。新模型延续这一侧重点,同时提升了在编程、计算机操作、科学研究、业务工作流程和跨学科推理方面的表现。

API 模型标识符为 claude-fable-5-1。它接受文本和图像输入并生成文本,拥有一百万 token 的上下文窗口,最大输出为 128,000 token。自适应思考始终启用,文档标注的可靠知识和训练数据截止时间均为 2026 年 6 月。

Anthropic 将 Fable 5.1 描述为适用于高要求推理和长周期智能体的选择,而非所有应用的默认选项。其模型选择指南建议,大多数工作负载先从更便宜的 Claude Opus 5 开始;若在更高 Opus 工作量级别下的评估仍不足,再转向 Fable 5.1。

该模型可通过 Claude 的 Pro、Max、Team 和 Enterprise 计划使用。开发者可通过 Claude API、Amazon Bedrock、AWS 上的 Claude Platform、Google Cloud 和 Microsoft Foundry 访问。Anthropic 还提供仅限美国的推理服务,输入和输出价格均为标准价格的 1.1 倍。

Fable 5.1 在 Claude Code 中默认使用高工作量,在 Claude Cowork 和 Claude.ai 中则默认使用中等工作量。Anthropic 表示,较低工作量设置可在更低成本下接近或超过 Fable 5 的性能,为开发者提供另一项控制延迟和 token 消耗的手段。

二、Anthropic 报告广泛的基准测试提升

Anthropic 公布的评估显示,在其发布对比中的每项基准测试上,Fable 5.1 均优于 Fable 5。这些结果由供应商报告,其中若干测试采用了近期修订的测试,或 Anthropic 自身的评估配置。

在衡量终端环境中智能体科学工作能力的 Terminal-Bench-Science 0.1 上,Fable 5.1 得分为 52.6%,而 Fable 5 为 24.7%,Opus 5 为 29.0%,GPT-5.6 Sol 为 22.4%。Anthropic 报告称,每个模型的标准误差在 3.5 至 4.5 个百分点之间。

Fable 5.1 在用于智能体编程的 Terminal-Bench 4.0 上得分为 55.8%。Mythos 5.1 在同一测试中达到 60.9%,而 Fable 5 为 42.0%,Opus 5 为 52.3%,GPT-5.6 Sol 为 37.3%。由于 Fable 和 Mythos 使用相同的底层模型,Anthropic 将两者结果间的差距归因于 Fable 安全防护措施介入的任务。

在 CursorBench 3.2.0 上,Fable 5.1 得分为 73.4%,领先于得分 70.5% 的 Fable 5、70.0% 的 Opus 5 和 67.2% 的 GPT-5.6 Sol。其 AutomationBench 得分从 Fable 5 的 17.1% 升至 31.4%。启用工具后,该模型在 Humanity’s Last Exam 上也达到 65.0%,相比之下 Fable 5 为 63.8%,Opus 5 为 63.6%。

Anthropic 在启用其生产环境安全防护措施的情况下评估 Fable 5.1。当这些措施介入时,它对某些 OSWorld 任务给予零分;而另一些被标记的网络安全和生物学任务则由备用 Opus 模型完成。因此,该公司提醒,公布的结果反映的是底层模型及其已部署路由系统的共同表现。

三、Fable 和 Mythos 共享智能,但访问权限不同

Claude Mythos 5.1 并不是比 Fable 5.1 更强大的基础模型。Anthropic 表示,两者在模型层面完全相同;区别在于,Mythos 会为经过审核的机构采用更宽松的安全防护措施,而这些机构的专业工作原本会触发 Fable 的限制。

Mythos 5.1 拥有相同的一百万 token 上下文窗口、128,000 token 最大输出、自适应思考,以及每百万输入 $10、每百万输出 $50 的定价。其 API 标识符为 claude-mythos-5-1,但仅限受邀访问,目前仅面向部分美国机构。

生命科学访问正通过与美国政府共同开发的生命科学验证计划组织开展。Anthropic 已吸纳首批机构,并表示计划扩大招募范围。该计划为获批准的研发工作放宽生物学限制,同时保留模型的其他安全防护措施。

网络安全验证计划目前允许符合条件的防御方使用某些网络安全限制较少的 Opus 和 Sonnet 级模型。Anthropic 表示,近期将增加 Mythos 级访问权限。该公司的代码库扫描产品 Claude Security 已在 Mythos 5.1 上运行。

这种双层部署让 Anthropic 能够广泛分发模型的通用编程和推理能力,同时将限制最少的网络和生物能力置于机构验证之后。这也意味着,Mythos 的基准测试结果不能自动视为普通 Fable 用户可获得的结果。

四、安全防护措施如今产生更少误报

Fable 5 为生物学和网络安全引入了异常严格的分类器。当请求触发这些分类器时,Claude 可能会切换至 Opus 模型,而不是由 Fable 完成任务。Anthropic 承认,原始实现拦截了许多无害的医疗、教育和防御性安全请求。

与随 Fable 5 发布的分类器相比,更新后的生物学安全防护措施对无害基础生物学和医疗提示的介入频率降低约 85%。因此,日常健康问题、临床辅助和生物学教育应会遇到更少的模型替换。涉及病毒学、毒理学或分子设计等领域的研究,除非用户符合 Mythos 访问资格,否则仍可能被路由至 Opus。

在网络安全方面,预计 Claude Code 用户每个会话经历的安全防护措施介入次数将减少约 60%。Fable 5.1 可以检查源代码以识别漏洞,但仍会重定向渗透测试、漏洞利用开发和基于二进制文件的漏洞扫描。

Axios 独立报道称,这些介入已成为实际的客户问题,一些开发者因正当工作被中断而寻求降低对 Claude 的依赖。因此,这些变化影响的不只是拒绝率:更少的意外回退应使编程智能体的行为和成本估算更可预测。

Anthropic 还增加了反蒸馏限制。新的 API 账户无法再编辑 Claude 的早期上下文,同时保留模型此前的思考记录。现有账户最初可获豁免,但 Anthropic 表示,该限制将在未来模型发布时适用于所有用户,可能要求改写对话历史的集成进行调整。

五、缓存定价和企业数据控制改变部署经济性

标准输入和输出费率没有下降,但缓存读取对于反复复用长指令、代码库上下文、工具结果或累积任务历史的智能体尤其重要。将该价格降至每百万 token $0.25,会使缓存上下文占据大部分 token 消耗的长会话获得不成比例的收益。

Anthropic 根据 2026 年 8 月四周的实际使用情况,计算出其典型工作负载节省 25% 和高度智能体化工作负载节省 45% 的估算。实际节省将取决于应用复用缓存上下文的频率;以新输入或生成输出为主的工作负载,降幅会较小。

数据保留仍是另一项部署约束。Fable 和 Mythos 默认要求保留 30 天数据,用于安全监控。Anthropic 表示,该监控旨在检测分布于多个会话或账户中的滥用模式,而不是在未经许可的情况下利用企业数据训练模型。

新的 Enterprise Frontier Safeguards 系统旨在使该监控与零数据保留要求兼容。在 EFS 下,活动数据可以保留在由客户控制的云基础设施中,使用客户的加密密钥、访问策略和审计日志。自动化监控可以标记可疑模式,而人工审核默认由客户而非 Anthropic 进行。

EFS 与超过 100 家机构共同设计,计划于 2026 年秋季开始分阶段推出。在该系统可用之前,符合条件的客户可在零数据保留条款下使用 Fable 5 和 Fable 5.1。Anthropic 不会对 EFS 单独收费,但客户仍需承担云存储和数据传输费用。

Fable 5.1 和 Mythos 5.1 还引入了不可见文本水印,以遵守欧盟针对 2026 年 8 月 2 日后发布模型的透明度规则。Anthropic 表示,该水印通过改变 token 选择的随机性实现,不会添加隐藏字符、额外 token 或用户识别数据。检测功能最初将通过面向符合条件机构的私有预览 API 提供。

常见问题

Claude Fable 5.1 是否已通用可用?

是。它可通过付费 Claude 计划、Claude API 和受支持的云平台使用。API 模型标识符为 claude-fable-5-1

Claude Mythos 5.1 是不同的模型吗?

不是。Anthropic 表示,Fable 5.1 和 Mythos 5.1 使用相同的底层模型。Mythos 采用更宽松的安全防护措施,并仅限经过审核的机构使用。

通过 API 使用 Fable 5.1 的费用是多少?

标准定价为每百万输入 token $10、每百万输出 token $50。缓存读取费用为每百万 token $0.25。

上下文和输出限制是多少?

Fable 5.1 支持一百万 token 的上下文窗口,每次请求最多输出 128,000 token。

Fable 5.1 可以执行渗透测试吗?

其安全防护措施仍会重定向渗透测试、漏洞利用生成和基于二进制文件的漏洞扫描。它可以为防御目的识别源代码中的漏洞。

参考来源

Share

分享这篇文章