Devin Voice 讓你用講的派工,Cognition 自研 SWE-2 同日上線

Cognition 在 9 月 10 日同日發表自研模型 SWE-2 與語音通話介面 Devin Voice:語音層採 OpenAI GPT-Live,工程層從 Kimi K33 後訓練,FrontierCode 成績貼近前沿模型而成本低 64%,Pro、Max、Teams 訂閱戶免費使用 SWE-2 到 10 月 10 日。

用 AI 摘要這篇文章:

台北時間 9 月 11 日凌晨,Devin 開發商 Cognition 在同一個美國工作天裡丟出兩則消息:先發表自研編程模型 SWE-2,隔幾個小時再宣布語音通話介面 Devin Voice。兩件事擺在一起看才有意思:負責聽你說話的語音層,用的是 OpenAI 的 GPT-Live;負責寫程式的工程層,換上 Cognition 自己從 Kimi K33 後訓練出來的新模型。官方介紹 Devin Voice 的說法很直白,標語寫著「You say it, Devin ships it」,你用講的,Devin 負責把東西做出來。

對已經付費的台灣用戶,最實際的一條藏在官方帳號的後續推文裡:SWE-2 即日起在 Devin Desktop 與 CLI 上線,而且接下來一個月,對所有 Pro、Max 與 Teams 訂閱者免費。換句話說,訂閱戶拿到一段零額外成本的試用期,可以趁這段時間用自己手上的任務,摸清這顆新引擎的斤兩。

時間點也值得記一筆。這是 Cognition 兩天前宣布逾 20 億美元 Series E 融資、估值 480 億美元之後的第一波產品動作,同一週 AI 模型圈還有 DeepSeek V4.1-Flash 的發表,競爭節奏明顯在加快。

一天兩發:先換引擎,再裝電話

把 9 月 10 日的時間軸攤開,Cognition 的發布順序是這樣:台北時間 9 月 10 日晚上 11 點 21 分,官方 X 帳號開始連發 SWE-2 的介紹推文,用「與近期前沿模型同分、成本低最多 70%」來定調;官方部落格的公告文章帶著美西時間上午 10 點的發布時間戳,給出更精確的對照數字;到了台北時間 9 月 11 日凌晨 4 點 12 分,再補上 Devin Voice 的宣布推文,附一支 51 秒的官方示範影片。兩個官方說法並不衝突,70% 是推文對整組基準的概括,部落格的 64% 則明確指向與 Fable 5.1 在 FrontierCode 1.1 Main 上的逐一對照,引用時以後者為準比較不會失真。

Cognition 官方部落格公告頁截圖,標題 Introducing SWE-2,內文說明 SWE-2 在 FrontierCode 1.1 Main 拿到 50.0%,與 Fable 5.1 差距在 1 分內而且成本低 64%Pin
Cognition 官方公告定位 SWE-2 為最接近前沿的自研模型,主打成本與效能同時推進(圖片來源:Cognition 部落格)

Cognition 這幾天的動作不止於此:9 月 10 日同一天,官方部落格也宣布 Rust 開源框架 Dioxus 的開發團隊加入 Cognition,承諾繼續支援 Dioxus、Blitz、Taffy 與 Subsecond 等專案,並把團隊的專長帶進 Devin 的虛擬機器、電腦操作與測試這幾個底層環節。模型、介面、團隊、資金四線並進,這家公司此刻的節奏不難想像。

公告與生效時間這次是同步的。SWE-2 即日起在 Devin Desktop 與 Devin CLI 生效,Devin Web 與 Devin Fusion 則列為陸續推出;Devin Voice 隨當天的產品更新進到介面裡,官方文件已經上線操作說明。對使用者的淨效果是:桌面版和命令列用戶當天就能碰到新模型,網頁版用戶還要再等。Devin Desktop 的血統來自 Cognition 併購的 Windsurf,官方文件裡兩個名字仍然互通,安裝時認圖示即可。

SWE-2:站在 Kimi K33 肩膀上的自研模型

Cognition 對 SWE-2 的定位是「最接近前沿的自研模型」。關鍵數字都在官方公告裡:在自家的 FrontierCode 1.1 Main 基準上,SWE-2 拿到 50.0%,與 Anthropic Fable 5.1 的 50.9% 差距不到 1 分,官方並稱成本低 64%;在 DeepSWE 1.1 上拿到 73.0%,只輸給 GPT-6 Astra 的 74.1%;Terminal-Bench 2.1 的 92.8% 是官方表列模型中的最高分。

基準(官方數字)SWE-2SWE-1.7Kimi K3Grok 4.6Fable 5.1GPT-5.6 SolGPT-6 Astra
FrontierCode 1.1 Main50.0%42.0%44.2%48.0%50.9%47.5%53.3%
DeepSWE 1.173.0%37.7%68.5%67.5%67.4%72.7%74.1%
Terminal-Bench 2.192.8%81.5%88.3%88.4%91.4%88.8%89.9%
Terminal-Bench 427.3%7.6%21.5%20.3%55.8%37.3%57.9%
資料來源:Cognition 官方公告「Introducing SWE-2」,2026 年 9 月 10 日發布,各模型取官方表列最佳成績。

模型血統上,SWE-2 是從 Moonshot 的 Kimi K33 後訓練而來,基底是 2.8 兆參數、已經做過大量代理式程式開發強化學習的模型。Cognition 稱自家的後訓練配方在許多基準上再拿下 5 到 6 分,把 K3 原本整條成本與效能曲線往上推。這是 Cognition 首度把強化學習拉到數兆參數的規模,做法上有一個值得記的技術選擇:單一次 RL 訓練同時涵蓋所有推理努力等級,靠的是按基礎模型成本效能曲線的斜率去設定線性成本懲罰。

成本這條線,官方附錄還給了一個有點反直覺的對照:Fable 5.1 的最高努力等級 Max 在 FrontierCode 1.1 Main 拿 50.3%,每個任務要價 12.83 美元,分數反而低於自家 Medium 等級的 50.9% 與 3.28 美元。花更多錢不代表更高分,這正是 Cognition 把「成本寫進訓練目標」當賣點的背景:與其讓使用者自己猜該選哪個等級,他們直接在訓練時就按各等級的合理成本畫好界線。

SWE-2 也是 Cognition 第一個支援努力等級切換的模型,分成 medium、high、max 三段。官方對三段的行為描述是:medium 更快出手,適合簡單到中等的任務;high 與 max 在複雜任務上多規劃、多探索,用更完整的驗證流程管理不確定性。內部測試裡官方還點了兩個行為變化:SWE-2 更會寫能從頭到尾檢查實作的測試;被質疑時傾向重新推導結論,而不是把原本的說法再講一遍。後者對天天跟代理來回溝通的工程師來說,應該很有感。

公告尾段還附了一段可信度評測:在一套用英文、簡體中文、繁體中文三種語言提問、衡量回答是否被特定官方立場帶著走的測試裡,SWE-2 整體通過率 98.0%,繁體中文提問的通過率 99.1%。對繁中環境的開發者來說,這至少是官方有拿出數字的一個面向。

SWE-1.7 的過度探索,官方自己給了交代

上一代 SWE-1.7 今年 7 月上線時,用戶最常抱怨的是它在簡單任務上繞太多路。這一點 Cognition 在公告裡自己承認:SWE-1.7 靠徹底探索整個程式庫換取效能,收到了用戶對過度探索與過度思考的回饋。SWE-2 給出的交代很具體,官方在 FrontierCode 1.1 Main 上的量測數字是:

  • 平均回合數從 SWE-1.7 的 127 降到 SWE-2 medium 的 53,high 等級 80,max 等級 98。
  • 開始動手改程式碼之前的中位步數,從 48 步縮到 18 步。
  • SWE-2 medium 分數高於 SWE-1.7,同時回合數少 58%,平均成本低 81%。

官方對這組數字的解讀是「聚焦探索」:模型變聰明之後,能判斷任務真正需要看程式庫的哪些部分,於是可以更早開始實作。對使用者的直接感受會是帳單和等待時間,同一個任務跑下來,中間那些反覆讀檔案、反覆檢查的繞路變少了。若你暑假用過 SWE-1.7 並且被它的「謹慎」磨過耐性,這組前後對照就是這次更新跟你最有關係的部分。

誠實的那一面:Terminal-Bench 4 還差一大截

同一張官方成績表也留了一個明顯的弱點。在難度更高的 Terminal-Bench 4 上,SWE-2 只拿到 27.3%,Fable 5.1 是 55.8%,GPT-6 Astra 是 57.9%,差距直接拉到一倍上下。官方文字裡「與 GPT-6 Astra 差幾分之內」的說法,那是對 FrontierCode 與 DeepSWE 而言;換到複雜終端環境的長任務,SWE-2 與前沿模型之間還有一段實實在在的距離。省下來的成本,買不到這一塊能力。

這正是免費一個月值得認真用的原因。你的日常工作落在光譜的哪一端,只有拿自己的任務去跑才會知道。終端操作比重高的團隊,建議把評估期拉長一點再決定要不要把預設模型換過去;以程式庫內修改為主的場景,照官方數字看 SWE-2 的投報比相當有利。

Devin Voice:這次是通話,不是錄音留言

Devin 並非頭一次碰語音。2025 年 1 月的 Devin 1.2 更新就加入過語音訊息,但那本質上是錄音留言,你說完、它晚點聽。Devin Voice 換成了即時通話。官方文件對它的用途寫得相當清楚:把想法講清楚、當場壓力測試一個做法、把工作交辦出去,三件事都在講電話的過程裡完成。

操作上,入口在 Devin 首頁 Agent 模式訊息框旁邊的通話按鈕,也可以在既有的工作階段裡直接發起;按下後授權麥克風,如果你本來有打一半的文字,會在通話開始時一起送出。通話中的控制設計得相當完整:可以把麥克風靜音,未在打字時按住空白鍵就能說話;可以只把 Devin 的聲音關掉而不影響自己的收音;可以隨時掛斷。通話進行中你仍然可以照常操作 Devin 的介面,整段對話會存進工作階段歷史,事後能回頭翻。官方文件還特別提醒兩件事:可以放心中途插話,不管任務跑到一半還是句子講到一半;想要不同的說話速度或溝通風格,直接開口要求就行。

Devin 官方文件語音模式頁面截圖,標題 Devin voice mode,說明可用語音討論想法、壓力測試做法並交辦工作,右側目錄列出 Start a call、During a call 與 TipsPin
Devin Voice 的官方文件隨當天更新上線,記錄通話入口與通話中的控制方式(圖片來源:Devin 官方文件)

語音層背後的 GPT-Live,是 OpenAI 在 7 月先於 ChatGPT 上線、主打全雙工的語音模型,架構細節與 API 版的計費方式我們先前在 GPT-Live-1 開放 API 一文整理過。全雙工的意思是它可以邊聽邊說,每秒做好幾次判斷,決定自己該開口、繼續聽、停頓、插話還是呼叫工具;遇到需要深度推理的問題,它把工作委派給背後的前沿模型,等答案回來的這段時間,對話照常進行不中斷。對 Devin 這種一跑就是幾十分鐘的代理任務來說,「等待不冷場」正好是語音介面能不能用的關鍵。OpenAI 對 GPT-Live 的語言支援有一條官方提醒:部分語言可能出現非母語口音或流暢度落差。繁體中文在 Devin Voice 裡的實際表現,官方沒有給保證,這一點留給實測。

把兩邊的官方文件擺在一起,Cognition 這波更新的結構就看得更清楚:聽與說的即時互動層外包給 OpenAI,工程推理層自己養。兩份文件都沒有把這層分工寫成一句話,這是對照後的解讀。對使用者來說,這種分工的好處是升級速度快,語音層跟著 GPT-Live 的世代走;代價是體驗上限綁在別人家的模型上,Cognition 能自己掌控的,是後面那顆寫程式的腦。

誰現在能用,要花多少錢

截至 9 月 11 日,devin.ai 定價頁的方案是這個架構:免費方案 0 元,提供輕量額度與有限的模型選擇,文件裡另載明免費方案含 Devin Review 與 DeepWiki 的存取,定價頁另標明免費方案享有不限次數的 Tab 自動補全;Pro 每月 20 美元,主打前沿模型額度與雲端代理 Devin Cloud 的存取,超過額度的部分可以按 API 價格隨用隨付;Max 每月 200 美元,頁面上標示 NEW,內容是明顯更高的額度,官方文件說明它取消每日上限、只保留每週額度;Teams 每月 80 美元起外加每個完整開發席位每月 40 美元;企業版另談,以 ACU 單位計價。

值得留意的是定價頁的更新速度:9 月 11 日晚間檢視,Pro 方案條款已經寫成「免費使用 SWE-2 與主流開源模型」,並明載在 Devin Desktop 與 CLI 的免費期到 2026 年 10 月 10 日止;比較表也列出免費方案可以用慢速版的 SWE-2。對照官方推文只說「接下來一個月」,現在有了明確日期,想把免費期用好用的訂閱戶,排程就照 10 月 10 日抓。

按族群分流的實際建議:已訂閱 Pro、Max 或 Teams 的用戶,更新 Devin Desktop 或 CLI,趁免費期用自己的任務測 SWE-2,終端操作比重高的多留心 Terminal-Bench 4 的落差,別急著改預設模型;主力用 Devin Web 的用戶,等陸續推出的通知就好;免費方案用戶,比較表標明可用慢速版的 SWE-2,想試新模型不必先升級;還沒在用 Devin 的開發者,這波對你的意義比較偏向市場訊號,自研模型把前沿效能的門票價格又往下壓了一階;要在眾多 AI 編程助手之間做選擇的人,可以先對照我們整理過的 39 款 AI coding 助手對比表,把候選名單縮小之後再觀望。

官方還沒說清楚的兩件事

語言支援沒有答案:Devin Voice 的官方文件沒有列出支援語言,GPT-Live 的通用提醒只能當參考,繁中通話的口音與流暢度要實測才知道。計費方式也交代有限:自助方案以內含額度加隨用點數計費,但 voice mode 的文件頁對通話本身怎麼計量隻字未提,長時間通話會不會吃掉額度、還是完全不計,都是未知數。

這篇的方案與促銷細節有保存期限:免費期 10 月 10 日截止前後,定價頁與 Devin Voice 的計費說明都可能再更新,屆時以官方頁面當下內容為準。想在免費期內完成評估的讀者,現在開始測,時間是夠的。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1237

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...