Google 推出 Gemini 3.8 Flash,面向长时程编程与智能体
Gemini 3.8 Flash 增强了编程与智能体推理能力,提供 100 万 token 上下文窗口、可调节的推理强度以及初始 API 定价。
文章目录 · 13
一、Google 在六周内推出第三次 Flash 更新
Google 于 9 月 2 日发布 Gemini 3.8 Flash,将该模型定位为其 Flash 级别系统中能力最强的一款,面向软件工程、自主智能体和多步骤专业工作。稳定版 API 标识符为 gemini-3.8-flash,该模型以正式可用状态发布,而非预览版。
此次发布紧随 8 月 13 日推出的 Gemini 3.7 Flash,以及 7 月 21 日发布的 Gemini 3.6 Flash。这使 Gemini 3.8 Flash 成为 Google 在六周内发布的第三款 Flash 模型。Google 表示,新模型保留了 3.7 Flash 的速度和初始价格,同时提升了其在更长任务中持续进行推理和工具使用的能力。
Gemini 3.8 Flash 接受文本、图像、音频、视频和 PDF 文档。其上下文窗口为 1,048,576 个输入 token,最大输出为 65,536 个 token。输出仍仅限文本:该模型可以分析多模态材料,但不会生成图像或音频。
该模型支持函数调用、文件搜索、代码执行、结构化输出、URL 上下文、Google 搜索和地图 grounding,以及上下文缓存。计算机使用功能以预览版形式支持。Live API、图像生成和音频生成不受支持。
Google 在发布通用模型的同时还宣布了第二款模型 Gemini 3.8 Flash Cyber。该公司称,两款模型共享相同的底层智能,但 Cyber 版本拥有更宽松的网络安全能力,并且仅通过 Google DeepMind 的 Fairwind Program 向经过审核的政府、关键基础设施运营方、软件维护者及其他受信任的防御者开放。
二、更长的推理循环是核心产品变化
相较 Gemini 3.7 Flash,决定性的变化并不是更大的上下文窗口或新的输出模态。这些核心限制保持不变。相反,Google 表示,当任务无法可靠地一次完成时,3.8 Flash 更愿意执行额外的推理步骤、从障碍中恢复,并重复调用工具。
这种行为旨在服务于诸如浏览大型代码库、诊断故障、编辑多个文件、测试结果和修订实现等工作。Google 演示了该模型在 Antigravity 中构建一款 3D 游戏、通过游玩识别错误,并在持续运行的智能体循环中应用代码改动。其他演示包括一款 DOS 风格的 Google 地图应用、一个由数据驱动的地形可视化工具,以及一款 Three.js 硬件拆解工具。
这些演示属于受控示例,而非独立产品测试。其意义在于工作流:Gemini 3.8 Flash 被设计为在推理、工具调用、执行、观察和修订之间交替,而不是仅返回一个代码示例。
额外的周密性带来了可衡量的成本。Google 明确警告,3.8 Flash 可能比 3.7 Flash 消耗更多 token,尤其是在较高推理设置下。开发者可通过 thinking_level 参数选择 LOW、MEDIUM 或 HIGH;默认值为 MEDIUM。该模型不接受 MINIMAL 级别,请求该级别会产生验证错误。
对于对延迟敏感或高吞吐量的应用,Google 建议降低推理强度,或继续使用 Gemini 3.7 Flash。因此,实际选择取决于工作负载:3.8 Flash 为困难任务提供更强的持续执行能力,但对于可预测的 token 消耗比最大任务完成能力更重要的部署,3.7 Flash 仍受支持。
三、Google 报告称其在编程和智能体评测中取得最大提升
Google 公布的评测显示,该模型在多项编程和工具导向测试中有所提升,不过这些结果仍为厂商自行报告,基准测试表现也不能证明其在特定生产环境中的可靠性。
在 Terminal-bench 2.1 上,Gemini 3.8 Flash 得分为 90.8%,而 Gemini 3.7 Flash 为 81.6%。其 SWE-Atlas 得分从 48.0% 提升至 51.9%,SWE-Bench Pro 则从 60.4% 升至 61.6%。在测试智能体处理多步骤交互的 τ³-bench 银行业子集上,报告得分从 30.9% 升至 38.1%。
在 Google 的对比中,该模型在 Vals Finance Agent v2 上也达到 61.4%,领先于 Gemini 3.7 Flash 的 59.0%。在 Harvey 的 Legal Agent Benchmark 上,两者得分分别为 10.0% 和 8.8%。
对于专家级跨学科推理基准 HLE-Verified,Google 报告 Gemini 3.8 Flash 的得分为 54.9%,3.7 Flash 为 53.6%。公布的对比将 3.8 Flash 略微置于 GPT-5.6 Sol 的 54.5% 和 Claude Opus 5 的 54.4% 之上。如此规模的微小差异不应被视为某一模型将在不相关的工作负载中持续优于另一模型的证据。
Google 还表示,Gemini 3.8 Flash 在 DeepSWE v1.1 长时程软件工程评测中领先,同时成本低于更大的模型。Ars Technica 对此次发布的评测认为,该模型在许多通用测试中的提升有限,但在编程评测中的提升更大。该评测还指出,尽管新模型在 OSWorld 2.0 上较 3.7 Flash 有所改进,但在这项计算机使用基准上仍明显落后于 Claude Opus。
这种混合表现对部署决策至关重要。已发布的最有力升级依据涉及终端工作、编程智能体和延长的任务执行,而不是所有推理或计算机控制测试都出现一致性的跃升。
四、迁移不只是更改模型名称
从 Gemini 3.7 Flash 或 3.6 Flash 迁移的开发者必须将模型标识符改为 gemini-3.8-flash。Google 的企业迁移指南还要求用户将较早的基于整数的 thinking_budget 配置替换为 thinking_level 枚举。
多项旧版生成控制项不可用。Google 表示,后端会忽略 temperature、top_p 和 top_k,而 frequency_penalty、presence_penalty 和 candidate_count 会产生 API 错误。依赖这些字段的应用需要调整配置,而不只是替换模型名称。
函数调用的验证更加严格。函数响应轮次必须与此前函数调用的标识符、名称和执行次数相匹配。多模态资产必须置于响应载荷内,聊天历史不能以 model 角色轮次结束,并且不支持预填充的模型响应。
这些限制可能暴露旧版部署曾容忍的集成错误。评估升级的团队应测试完整的智能体轨迹——包括重试、工具响应、结构化输出和会话历史重建——而不是比较孤立的提示词。
该模型记录的知识截止日期为 2026 年 3 月,不过 Google 提醒,某些领域的覆盖范围可能仍接近更广泛 Gemini 3 系列所对应的 2025 年 1 月截止日期。对于当前或快速变化的信息,搜索 grounding 或其他检索层仍然必不可少。
五、定价初期不变,但将在 1 月翻倍
截至 2026 年 12 月 31 日,标准 Gemini API 使用费用为每百万输入 token 0.75 美元,以及每百万输出 token 3.75 美元,其中包括思考 token。这些价格与 Gemini 3.7 Flash 列出的相同初始费率一致。
费率将在 2027 年 1 月 1 日翻倍,变为每百万输入 token 1.50 美元和每百万输出 token 7.50 美元。上下文缓存费用也将从每百万 token 0.075 美元升至 0.15 美元,而缓存存储费用将从每百万 token 每小时 0.50 美元升至 1 美元。
在初始期间,Batch 和 Flex 推理的费用为每百万输入 token 0.375 美元,以及每百万输出 token 1.875 美元。两者将在 1 月分别增至 0.75 美元和 3.75 美元。Priority 推理定价更高,截至 12 月为每百万输入 token 1.35 美元,以及每百万输出 token 6.75 美元。
输出价格包括内部思考 token,因此推理强度选择是成本模型的一部分。即使最终可见响应很短,调用更多推理步骤的任务也可能花费更多。生产环境评估因此应记录计费 token 总数、完成率、延迟和工具调用次数,而不是只比较标价。
开发者可通过 Google AI Studio、Gemini API、Android Studio、Stitch 和 Antigravity 使用 Gemini 3.8 Flash。企业可通过 Gemini Enterprise Agent Platform 使用该模型。消费者需要订阅 Google AI Pro 或 Ultra,才能在 Gemini 应用、Google 搜索中的 AI Mode 以及 Google Sheets 中的 Gemini 里访问它。
六、模型卡保留了重要限制
Google 的模型卡指出,Gemini 3.8 Flash 可能产生幻觉,偶尔响应缓慢、超时,或在较高推理强度下消耗超出预期的 token。其多模态输入支持和智能体工具并不能消除对生成代码、财务分析、法律工作或通过外部系统执行的操作进行验证的必要性。
该公司报告称,相较 Gemini 3.7 Flash,其通用内容安全表现相近或有所改善,不过自动化测试发现,在一些非英语安全评测中出现了轻微退步。Google 表示,人工审查判定被标记的失分主要是误报或不严重的情况。
根据 Google DeepMind 的 Frontier Safety Framework,该公司得出结论:Gemini 3.8 Flash 在该框架追踪的高风险领域中,并未相较 3.7 Flash 增加实质性能力,且不太可能达到 Tracked 或 Critical Capability Level。未受限模型保留了针对网络攻击以及化学、生物、放射性和核滥用的安全措施;能力更强的 Cyber 变体则在受限访问条件下单独分发。
常见问题
Gemini 3.8 Flash 于何时发布?
Google 于 2026 年 9 月 2 日发布稳定版模型,时间在 Gemini 3.7 Flash 发布三周后。
Gemini 3.8 Flash 的 API 模型 ID 是什么?
稳定版 API 标识符为 gemini-3.8-flash。
Gemini 3.8 Flash 支持图像、音频和视频吗?
它接受文本、图像、音频、视频和 PDF 作为输入,但只生成文本。
Gemini 3.8 Flash 的价格是多少?
截至 2026 年 12 月 31 日,标准 API 定价为每百万输入 token 0.75 美元和每百万输出 token 3.75 美元。费率将在 2027 年 1 月 1 日升至 1.50 美元和 7.50 美元。
Gemini 3.8 Flash Cyber 是否普遍可用?
否。Google 仅通过 Fairwind Program 向获批防御者提供 Cyber 变体。通用的 Gemini 3.8 Flash 模型已正式普遍可用。
参考来源
Share