Meta 推出 Muse Code(測試版):一個具備崩潰安全性的 大規模程式碼代理
重點
Meta 已釋出 Muse Code(測試版),這是一個基於終端機的程式碼代理,由 Muse Spark 1.2 程式碼模型驅動,可透過 Meta Model API 與 curl 安裝腳本取得。該代理協調持續運行的子代理,將每個事件記錄到本地的精確重放事件儲存,並能在崩潰後繼續執行而不遺失進度。根據 Meta 的基準圖表,Muse Spark 1.2 在所示的程式碼測試中落後於 Anthropic 的 Opus 5,但通常超越 OpenAI 的 Codex 與 Google 的 Antigravity。 最引人注目的特性是可重啟的安全執行環境:長時間運行的工作可以精確地從中斷處恢復,對於延伸的工程工作流程而言,這比原始速度更重要。
情緒分析
- 整體情緒呈混合偏微正面。此版本以實用的工程功能為特色,而非在基準測試上全面壓倒對手。下方的進度條反映出謹慎正面的語調,強調有用的創新,但也承認在某些測試中存在更強勁的競爭者。
文章內容
Meta 推出 Muse Code(測試版),這是一個基於 Muse Spark 1.2 模型的終端機式程式碼代理,並透過 Meta Model API 與簡單的 curl 安裝方式發佈。該產品針對大型程式庫的軟體工程工作:規劃變更、撰寫程式碼、驗證結果,並協調多個持久子代理來解決複雜問題,減少人為介入。Meta 將此發佈定位為漸進但有意義的前進,並表示更大型的模型正在開發中。
Muse Code 的一項關鍵運作細節是其事件記錄策略。該代理將每次模型呼叫、工具調用、核准與編輯記錄到本地事件日誌,作為單一事實來源。基於此設計,執行環境為「可精確重放」且可重啟安全:若程序發生崩潰,可以精確地從中斷處繼續。對於可能持續數小時或數天的長時間任務而言,這種韌性可能比原始推理速度更重要,且是相較於許多競爭代理的一個區別性能力。
Muse Code 隨附內建技能與命令,以支援迭代與需核准的工作流程。例如,"/plan" 命令可將任務轉為需核准的計畫;"/grill" 對計畫進行壓力測試,直到其證明足夠健全;而 "/goal" 則驅動以完成目標。Meta 報告稱 Muse Spark 1.2 與 Muse Code 共同訓練,使底層大型語言模型與代理的協調邏輯能夠協同運作。
在基準測試上,Muse Spark 1.2 呈現出複雜的情況。這是相較於前一代更專注於程式碼的更新,Meta 表示已增加程式碼任務的計算量並擴展訓練環境,以提升程式碼生成、偵錯與端到端工作流程的能力。在 Meta 報告的結果中,搭配 Muse Code 的 Muse Spark 1.2 在 Terminal‑Bench 2.1 上得分低於 Anthropic 的 Opus 5(82.9% 對 86.7%),但在相同圖表中領先於其他多個系統,例如 Codex 與 Grok Build。針對代理導向的基準如 DeepSWE 1.1,差距較小:Muse 與競爭者較為接近,但在報告數字中仍落後於 Opus 5。
在更長序列與多次工具呼叫下的效能是另一個重要面向。Meta 的加速圖表顯示 Opus 5 在多次工具呼叫上相較基線取得最大提升,而 Muse Spark 1.2 則處於中間位置。Meta 強調 Muse Code 的行為會隨著工具呼叫累積而改善——這正是長期視野的程式編寫者(會隨時間細化解法)所需要的特性。
一些最具說服力的示範是長期與多模態的案例。Meta 展示 Muse Code 在 Nvidia Hopper 硬體上經過超過 1,000 次工具呼叫的長時間執行,逐步優化 GPU 核心,顯示該代理能在長時間作業中改善輸出。還有多模態的範例:使用者提供一個家居飛越影片(mp4),Muse Code 解析影片並產生具視覺豐富的網站,包含預訂功能。這類示範反映出 Meta 在 Muse 家族上的多模態野心。
儘管具備這些優勢,Meta 仍進入一個競爭激烈的市場。其他公司已推出具有代理特性的程式碼工具與平行代理協調;一些既有替代方案已提供可比或更廣泛的功能。Meta 的差異化並非在所有基準上壓倒性領先,而是其崩潰安全的執行環境與子代理架構。這樣的設計可能對執行長時間、自主工作負載的團隊具吸引力,但同時也提高了關於具長期自主性且頻繁存取工具的強大代理所帶來的常見顧慮。
總之,Muse Code(測試版)是一個務實的發佈,強調長時間開發者工作流程的穩健性與多模態能力。它並未在每項基準上取代現有領導者,但引入的特性——尤其是可精確重放的事件日誌與持久子代理——可能會改變團隊處理延伸代理化工程任務的方式。該代理現已可透過 Meta 提供的簡單安裝指令進行測試。
實務要點: Muse Code 的可重啟安全執行環境與協調子代理使其特別適合於持續時程較長且為多模態的工程工作,當連貫性與可重現性比單一任務速度更有價值時尤為重要。
重要見解表
| 面向 | 描述 |
|---|---|
| 主要產品 | Muse Code(測試版):基於 Muse Spark 1.2 的終端機程式碼代理,面向大規模工程任務。 |
| 獨特特性 | 本地精確重放的事件日誌,使執行可重啟且對崩潰具韌性,並支援持久子代理。 |
| 基準表現 | 在部分程式碼基準上落後於 Anthropic Opus 5,但在 Meta 報告的圖表中優於其他多個模型。 |
| 最佳使用情境 | 長時間優化、多模態由影片生成網站、大型程式庫的工程工作流程。 |
| 可用性 | 現已可透過 Meta Model API 與 curl 安裝腳本進行測試。 |