Google 推出 Gemini 4 Argon,在多項 AI 基準測試領先並強調網路安全
重點
Google 推出 Gemini 4 Argon,這是其最新的 frontier 模型,在 DeepSWE v1.1 取得 77.9% 的成績,並在 18 項內部基準測試中領先 12 項。該模型對間接提示注入攻擊表現出強大的抗性,在 Gray Swan 的測試中攻擊成功率為 0.7%。Argon 將先透過 Fairwind 計畫提供予經過審核的防禦團隊,在更廣泛的 API 與訂閱者可用之前不具內建的網路防護限制。 Argon 在網路安全上的突出表現是此版本的主要差異化要素。
情緒分析
- 整體情緒為審慎樂觀:公告強調顯著的技術進展,特別是在網路安全與程式編寫能力方面,同時也承認基準測試與分階段推出的注意事項。語調在對模型能力的熱忱與對安全與比較性聲明的謹慎之間取得平衡。
文章正文
Google 發表 Gemini 4 Argon,作為其最新的 frontier 模型,被定位為公司在從程式編寫與辦公工作到網路防禦等任務上最強大的產品。在內部評估中,Argon 在 DeepSWE v1.1 上取得 77.9%,該基準測試評估 AI 完成複雜且具真實世界情境的軟體工程任務的能力。該分數在報導的比較中超越了幾個來自競爭對手的近期模型,並標誌著相較早期 Gemini 發行版本的顯著提升。
除了程式編寫性能外,Argon 擴展的回應容量也值得注意:該模型單一回覆最多可產生 100 萬個標記(tokens),這比先前的 64,000 標記限制大幅提升。這使得長篇連續輸出成為可能,適用於廣泛文件撰寫、長篇生成或多階段技術協助。
基準數據應謹慎解讀。Google 報告了自家的 DeepSWE 成績,並展示了一張表格顯示 Argon 在多數測試中領先,但在其他幾項測試仍落後。比較結合了跨程式編寫、科學與控制任務的各類評估,且部分競爭者的分數取自公開排行榜與公司報告,而非單一統一的測試環境。
網路安全是 Argon 的一項重點能力。間接提示注入——即惡意指令隱藏在代理程式所閱讀的內容中——對於會存取使用者電子郵件、文件或其他資料的助理構成嚴重風險。在 Gray Swan 的間接提示注入基準測試中,Argon 在多次嘗試中的攻擊成功率為 0.7%,這是一個低(較好)數值,優於在相同基準測試上測試的幾個近期模型。對提示注入攻擊的這種抗性是 Google 在說明 Argon 防禦效用時的一項核心主張。
Google 起初透過 Fairwind 計畫將 Argon 提供給經過審核的網路防禦者,這是一項受控存取的倡議,包含政府、關鍵基礎設施營運者與安全夥伴。在此階段,Argon 被部署時不具通常的內建拒絕機制——通常稱為網路防護限制——以便讓安全團隊模擬攻擊者行為並在更廣泛可用前找出漏洞。其理由是防禦者能從一個能像攻擊者思考的模型中獲益,發現並修補缺陷,但 Google 強調會以分階段推出來限制風險。
此做法遵循產業先例:其他實驗室也以類似方式將早期聚焦於網路的發行限制於受信任夥伴,使協調式的漏洞發現與修補成為可能。Google 也報告在例如 Wiz 滲透測試基準等測試中的內部基準提升,Argon 在這些測試中解決了比先前受限模型更多的利用挑戰。公司引用與夥伴共同發現的真實世界發現,包括 Argon 協助識別的一個醫療軟體關鍵漏洞。
儘管技術上有進展,此次發行仍發生在公司面臨更廣泛挑戰與市場審視之際。今夏早些時候,Google 延遲了部分計畫中的模型更新,並面臨與產品策略相關的股東壓力。Argon 的定價與存取細節已公布:入門 API 價格訂為每百萬輸入標記 2 美元及每百萬輸出標記 10 美元,並表示之後標準費率會較高,但未說明何時轉為標準定價。
Google 提到其正參與與政府利害關係者協調的自願性預發布存取程序。分階段分發以及與安全公司合作的做法反映了雙重目標:在加速關鍵部門的防禦能力同時,管理釋出高度能力模型可能被濫用的風險。 公司強調謹慎、分階段的存取對於在能力與安全之間取得平衡至關重要。
總結來說,Gemini 4 Argon 代表了 Google 在技術上的重要進步,尤其是在網路防禦與長篇生成領域。該模型強勁的基準成績與目標性發行策略旨在為防禦者提供先進工具,同時讓更廣泛的社群與監管機構觀察這類能力如何被管理與部署。
關鍵見解表格
| 面向 | 說明 |
|---|---|
| DeepSWE v1.1 的表現 | Argon 得分 77.9%,在所呈現的比較中領先,並較早期 Gemini 模型有所提升。 |
| 對提示注入的抗性 | Argon 在 Gray Swan 的間接提示注入基準測試上記錄到 0.7% 的成功率,顯示出強抗性。 |
| 存取策略 | 初期透過 Fairwind 提供給經過審核的防禦者,且不設網路防護限制,之後再分階段開放 API 與訂閱者存取。 |
| 輸出容量 | 單次回覆支援高達 100 萬個標記,能產生比先前限制長得多的連續輸出。 |
| 定價 | 宣布的入門 API 價格為每百萬輸入標記 2 美元與每百萬輸出標記 10 美元,之後將有較高的標準費率。 |
最後編輯時間:2026/10/1
