AI News字數 2861閱讀時長8 分鐘

Google 推出 Gemini 3.8 Flash,支援長時程程式編寫及代理

Gemini 3.8 Flash 加強程式編寫及代理式推理能力,提供 100 萬個 token 的上下文視窗、可調整的運算投入程度,以及入門 API 定價。

文章目錄 · 13
  1. 一、Google 在六星期內推出第三次 Flash 更新
  2. 二、較長的推理迴圈是核心產品改變
  3. 三、Google 報告其在程式編寫及代理評估中的最大增幅
  4. 四、遷移不只是更改模型名稱
  5. 五、定價初期維持不變,但一月起加倍
  6. 六、模型卡保留重要限制
  7. 常見問題
  8. Gemini 3.8 Flash 何時推出?
  9. Gemini 3.8 Flash 的 API 模型 ID 是甚麼?
  10. Gemini 3.8 Flash 支援圖像、音訊及影片嗎?
  11. Gemini 3.8 Flash 的費用是多少?
  12. Gemini 3.8 Flash Cyber 是否正式全面推出?
  13. 參考來源

一、Google 在六星期內推出第三次 Flash 更新

Google 於 9 月 2 日推出 Gemini 3.8 Flash,將其定位為旗下最強大的 Flash 級系統,適用於軟件工程、自主代理及多步驟專業工作。穩定 API 識別碼為 gemini-3.8-flash,而該模型以正式全面推出而非預覽版形式發布。

這次發布緊隨 8 月 13 日推出的 Gemini 3.7 Flash,以及 7 月 21 日發布的 Gemini 3.6 Flash。這令 Gemini 3.8 Flash 成為 Google 在六星期內推出的第三個 Flash 版本。Google 表示,新模型保留 3.7 Flash 的速度及入門價格,同時提升其在較長任務中持續推理及使用工具的能力。

Gemini 3.8 Flash 接受文字、圖像、音訊、影片及 PDF 文件。其上下文視窗為 1,048,576 個輸入 token,最高輸出為 65,536 個 token。輸出仍僅限文字:模型可分析多模態素材,但不會生成圖像或音訊。

該模型支援函數呼叫、檔案搜尋、程式碼執行、結構化輸出、URL 上下文、Google 搜尋及地圖 grounding,以及上下文快取。電腦操作功能以預覽形式支援。Live API、圖像生成及音訊生成則不受支援。

Google 與通用版本一併公布第二個模型 Gemini 3.8 Flash Cyber。據公司表示,兩個模型共享相同的底層智能,但 Cyber 版本具備較寬鬆的網絡安全能力,並僅透過 Google DeepMind 的 Fairwind Program 向經審核的政府、關鍵基礎設施營運者、軟件維護者及其他可信賴防禦者提供。

二、較長的推理迴圈是核心產品改變

相較 Gemini 3.7 Flash,最具決定性的改變並非更大的上下文視窗或新的輸出模態。這些核心限制維持不變。相反,Google 表示,當任務無法在一次處理中可靠完成時,3.8 Flash 更願意執行額外推理步驟、從障礙中恢復,並重複呼叫工具。

這種行為旨在支援瀏覽大型程式碼庫、診斷故障、編輯多個檔案、測試結果及修訂實作等工作。Google 示範模型在 Antigravity 中建立一個 3D 遊戲、透過遊玩辨識錯誤,並在持續進行的代理迴圈內套用程式碼變更。其他示範包括 DOS 風格的 Google Maps 應用程式、由資料支援的地形視覺化工具,以及 Three.js 硬件拆解工具。

這些示範屬於受控範例,而非獨立產品測試。其相關性在於工作流程:Gemini 3.8 Flash 的設計是交替進行推理、工具呼叫、執行、觀察及修訂,而非只回傳一個程式碼範例。

增加的審慎程度帶來可量化的成本。Google 明確警告,3.8 Flash 的 token 消耗可能高於 3.7 Flash,尤其在較高推理設定下。開發者可透過 thinking_level 參數選擇 LOWMEDIUMHIGH;預設為 MEDIUM。模型不接受 MINIMAL 級別,提出該要求會產生驗證錯誤。

對於對延遲敏感或高流量應用程式,Google 建議降低投入程度,或繼續使用 Gemini 3.7 Flash。因此,實際選擇取決於工作負載:3.8 Flash 為困難任務提供更強的持續性,但對於可預測 token 消耗比最高任務完成率更重要的部署,3.7 Flash 仍獲支援。

三、Google 報告其在程式編寫及代理評估中的最大增幅

Google 公布的評估顯示,模型在多項程式編寫及工具導向測試中有所改善,儘管結果仍由供應商自行報告,而基準測試表現並不能證明其在特定生產環境中的可靠性。

在 Terminal-bench 2.1 中,Gemini 3.8 Flash 得分為 90.8%,相比 Gemini 3.7 Flash 的 81.6%。其 SWE-Atlas 得分由 48.0% 升至 51.9%,而 SWE-Bench Pro 則由 60.4% 升至 61.6%。在測試代理處理多步驟互動的 τ³-bench 銀行子集上,報告得分由 30.9% 升至 38.1%。

在 Google 的比較中,該模型在 Vals Finance Agent v2 亦達到 61.4%,高於 Gemini 3.7 Flash 的 59.0%。在 Harvey 的 Legal Agent Benchmark 中,兩者得分分別為 10.0% 及 8.8%。

對於專家級跨學科推理基準 HLE-Verified,Google 報告 Gemini 3.8 Flash 得分為 54.9%,3.7 Flash 為 53.6%。已公布的比較顯示,3.8 Flash 略高於得分 54.5% 的 GPT-5.6 Sol 及得分 54.4% 的 Claude Opus 5。如此幅度的細小差異,不應視為某一模型會在無關的工作負載中持續勝過另一模型的證明。

Google 亦表示,Gemini 3.8 Flash 在 DeepSWE v1.1 長時程軟件工程評估中領先,同時成本低於較大型模型。Ars Technica 對這次發布的評論指出,模型在許多一般測試上的提升屬於溫和,但在程式編寫評估中的增幅較大。該評論亦指出,雖然新模型在 OSWorld 2.0 上較 3.7 Flash 有所改善,但在該電腦操作基準上仍遠遠落後於 Claude Opus。

這種參差的模式對部署決策十分重要。已公布的最強升級理由在於終端機工作、程式編寫代理及延長任務執行,而非在每一項推理或電腦控制測試中均有一致躍升。

四、遷移不只是更改模型名稱

由 Gemini 3.7 Flash 或 3.6 Flash 遷移的開發者,必須將模型識別碼改為 gemini-3.8-flash。Google 的企業遷移指南亦指示用戶,將較舊、以整數為基礎的 thinking_budget 設定改為 thinking_level enum。

多項舊有生成控制項不可使用。Google 表示,temperaturetop_ptop_k 會被後端忽略,而 frequency_penaltypresence_penaltycandidate_count 會產生 API 錯誤。依賴這些欄位的應用程式需要更改設定,而非只替換模型名稱。

函數呼叫的驗證更為嚴格。函數回應回合必須符合前一個函數呼叫的識別碼、名稱及執行次數。多模態資產必須置於回應負載內,聊天記錄不可在模型角色回合結束,而預先填入的模型回應亦不受支援。

這些限制可能會暴露較舊部署所容許的整合錯誤。評估升級的團隊應測試完整的代理追蹤紀錄,包括重試、工具回應、結構化輸出及對話記錄重建,而非只比較獨立提示。

該模型記錄的知識截止日期為 2026 年 3 月,但 Google 提醒,部分領域的覆蓋範圍仍可能接近與較廣泛 Gemini 3 系列相關的 2025 年 1 月截止日期。對於目前或快速變化的資訊,搜尋 grounding 或另一個檢索層仍然必要。

五、定價初期維持不變,但一月起加倍

截至 2026 年 12 月 31 日,標準 Gemini API 使用費為每百萬個輸入 token $0.75,以及每百萬個輸出 token $3.75,當中包括 thinking token。這與 Gemini 3.7 Flash 列出的相同入門費率一致。

費率將於 2027 年 1 月 1 日加倍,分別升至每百萬個輸入 token $1.50 及每百萬個輸出 token $7.50。上下文快取收費同樣由每百萬個 token $0.075 升至 $0.15,而快取儲存費則由每百萬個 token 每小時 $0.50 升至 $1。

在入門期內,Batch 及 Flex 推理的費用為每百萬個輸入 token $0.375,以及每百萬個輸出 token $1.875。兩者均會在一月分別升至 $0.75 及 $3.75。Priority 推理定價較高,截至 12 月為每百萬個輸入 token $1.35,以及每百萬個輸出 token $6.75。

輸出價格包括內部 thinking token,令投入程度的選擇成為成本模型的一部分。即使最終可見回應很短,呼叫更多推理步驟的任務仍可能成本更高。因此,生產環境評估應記錄總計費 token、完成率、延遲及工具呼叫次數,而非只比較列價。

開發者可透過 Google AI Studio、Gemini API、Android Studio、Stitch 及 Antigravity 存取 Gemini 3.8 Flash。企業可透過 Gemini Enterprise Agent Platform 使用該模型。消費者則需要 Google AI Pro 或 Ultra 訂閱,才能在 Gemini 應用程式、Google 搜尋的 AI Mode 及 Google Sheets 中的 Gemini 使用它。

六、模型卡保留重要限制

Google 的模型卡指出,Gemini 3.8 Flash 可能出現幻覺,偶爾回應緩慢、逾時,或在較高投入程度下消耗比預期更多的 token。其多模態輸入支援及代理工具,並未免除驗證生成程式碼、財務分析、法律工作,或透過外部系統採取行動的需要。

公司報告,相對 Gemini 3.7 Flash,整體內容安全表現相若或有所改善,儘管自動化測試在部分非英語安全評估中發現輕微倒退。Google 表示,人工審核認定被標示的失分主要屬誤報或非嚴重個案。

根據 Google DeepMind 的 Frontier Safety Framework,公司結論為,Gemini 3.8 Flash 在該框架追蹤的高風險領域中,沒有較 3.7 Flash 增加實質能力,且不大可能跨越 Tracked 或 Critical Capability Level。未受限制的模型保留針對網絡攻擊,以及化學、生物、放射性及核濫用的防護措施;能力較高的 Cyber 版本則在受限制存取下另行分發。

常見問題

Gemini 3.8 Flash 何時推出?

Google 於 2026 年 9 月 2 日推出穩定模型,距離 Gemini 3.7 Flash 推出三星期。

Gemini 3.8 Flash 的 API 模型 ID 是甚麼?

穩定 API 識別碼為 gemini-3.8-flash

Gemini 3.8 Flash 支援圖像、音訊及影片嗎?

它接受文字、圖像、音訊、影片及 PDF 作為輸入,但只會產生文字。

Gemini 3.8 Flash 的費用是多少?

截至 2026 年 12 月 31 日,標準 API 定價為每百萬個輸入 token $0.75,以及每百萬個輸出 token $3.75。費率將於 2027 年 1 月 1 日升至 $1.50 及 $7.50。

Gemini 3.8 Flash Cyber 是否正式全面推出?

否。Google 透過 Fairwind Program 將 Cyber 版本限制於獲批准的防禦者。通用 Gemini 3.8 Flash 模型則已正式全面推出。

參考來源

Share

分享這篇文章