Claude Opus 5.5 發布:API 降價兩成,升級前要過四道關卡

Anthropic 於 9 月 22 日發布 Claude Opus 5.5,API 單價降 20%、快取讀取降 60%,官方自報典型工作總成本約低 40%。升級要過四項破壞性變更,評測有兩項低於 GPT-6 Astra,依負載形狀決定要不要現在切換。

用 AI 摘要這篇文章:

Anthropic 在 2026 年 9 月 22 日(台北時間 23 日凌晨)發布 Claude Opus 5.5,這是 Claude 5.5 家族的第一款模型,官方定位在長時間的代理式程式開發與知識工作,開場定位寫得很直白:多數工作上與 Fable 5.1 同級,而跑起來的成本比 Opus 5 低四成。模型當天就上了 Claude API、Amazon Bedrock、Google Cloud 與 Microsoft Foundry,開發端模型名稱是 claude-opus-5-5。對只在 Claude 網頁或 App 裡使用的一般使用者,這次變動幾乎不自覺:模型變便宜、變快,訂閱額度還放了利多。對 API 用戶則不然,升級要處理四項破壞性變更,降價的實際形狀與遷移成本需要分開算清楚。

價格、評測與相容性細節都對照 2026 年 9 月 23 日抓取的 Anthropic 官方公告與 Claude Platform 開發文件;其中官方自行測試或轉述早期用戶的數字,目前沒有獨立複核。

降價是三層疊出來的:單價、快取、再少掉的步驟

最上層是牌價。Opus 5.5 的 API 單價是每百萬輸入 4 美元、輸出 20 美元,比 Opus 5 的 5 與 25 美元調降 20%。牌價表上降幅最大的其實是快取讀取:從 0.5 美元降到 0.2 美元,等於打四折。5 分鐘快取寫入從 6.25 美元降到 5 美元,另提供 1 小時快取寫入 8 美元的選項,批次處理半價為每百萬 2 與 10 美元。

每百萬 token 價格Claude Opus 5.5Claude Opus 5調整幅度
快取讀取0.20 美元0.50 美元-60%
輸入4 美元5 美元-20%
輸出20 美元25 美元-20%
快取寫入(5 分鐘)5 美元6.25 美元-20%

第二層在用量。Anthropic 自報在預設設定下,典型工作負載的總成本比 Opus 5 低約 40%,輸出速度加快 30% 以上。40% 遠大於牌價降幅,差額來自模型用更少的步驟與更少的 token 完成同樣的工作。官方給的例子:有早期測試者用它在不到一天內完成 68 萬行程式碼遷移;另一個 20 萬行程式庫的審計修復,Opus 5.5 在 3 小時內做完,Opus 5 花超過 20 小時、還多用 2.5 倍的 token;內部測試把 HAProxy 從 C 改寫成 Rust,Opus 5.5 花 9.5 小時完成,Fable 5.1 要 12 小時,成本低 51%,兩個版本都通過 HAProxy 幾乎全部的迴歸測試。知識工作也有對照:18 份財務報告裡有 16 份通過「任何捏造數字或引文即失敗」的門檻,Fable 5.1 與 Opus 5 在任何一次嘗試中都沒有過門。這些是官方自測或轉述早期用戶的數字,當方向參考可以,當保證不行。

Anthropic 官方公告的 Opus 5.5 與 Opus 5 價格表截圖,快取讀取每百萬 0.20 美元對 0.50 美元,輸入 4 對 5 美元,輸出 20 對 25 美元,快取寫入 5 對 6.25 美元Pin
官方牌價表:快取讀取降幅最大,從 0.5 美元降到 0.2 美元(圖片來源:Anthropic 公告頁)

早期測試者的實測數字方向一致,而且都出自具名公司。GitHub 的產品長說,在 Copilot CLI 與 VS Code 的測試裡,Opus 5.5 是量到 token 與步驟數最少的模型之一,在 VS Code 用不到一半的步驟解掉比 Opus 5 更多的終端機任務;交易公司 Optiver 在自家代理程式任務上,用約一半的輪次、時間與輸出 token 追平 Opus 5 的品質,該工作負載的成本降了四到五成;顧問公司 Quantium 的一項複雜任務,從原本 38 個 prompt、花四天,變成 11 個 prompt、三小時完成。這些引述由 Anthropic 節錄發布,挑過案例是難免的,但與官方自測的 40% 指向同一個方向:省錢主要省在步驟與用量,牌價只是入場券。

第三層是配對的行為。快取讀取降 60% 只對有開快取的用法有意義,而代理式工作(多輪工具呼叫、反覆讀同一份系統提示與檔案)正是快取讀取佔大頭的形態,官方在公告裡也是用這個角度定位這次降價。反過來說,如果請求都很短、系統提示沒有重用,拿到的就接近牌價那 20%。

訂閱端同步有兩項調整:Pro、Max、Team 與按席位計費的 Enterprise 方案,五小時額度提高;訂閱用戶另外拿到一次可儲存的速率限制重置,可以留到需要的時候再用。想要更快輸出的人,Fast 模式以最高 2.5 倍速度提供,費率為每百萬 8 與 40 美元,屬研究預覽,只在 Claude Code 與 Claude API 上提供,Bedrock、Google Cloud、Foundry 這些雲端管道目前沒有。

想省這四成,先過四道相容性關卡

Claude Platform 的開發文件列出四項破壞性變更,前三項在 Fable 5.1 上已經存在,對從 Opus 5 或更早版本升級的程式則是新的。

  • 思考不能再關:Opus 5.5 的 thinking 永遠開啟,請求裡送 thinking type disabled 或手動指定思考預算,都會收到 400 錯誤。深度控制改用 effort 參數,而 Opus 5.5 的預設 effort 是 medium,比 Opus 5 的預設 high 低一檔;文件還提醒同一個 effort 數值在新模型上會思考得更多,建議重跑一輪參數校正,別把舊設定直接搬過來。
  • 不能強制指定單一工具:tool_choice 設成 any 或 tool 加名稱,伺服器會直接送出 400 錯誤。替代做法是保持 auto、在 prompt 裡說明什麼時候該用哪個工具,或改走 strict tool use 與結構化輸出。
  • thinking 區塊綁定模型與對話:Opus 5.5 讀得懂 Opus 5 與更早 Opus、Sonnet、Haiku 的 thinking 區塊,讀不懂 Fable 與 Mythos 的。從 Opus 5 換到 5.5,或在 Claude API 上從 5.5 換到 Fable 5.1 與 Mythos 5.1,推理帶得走;其他方向就不行,切換後的輪次會在沒有前一段推理的狀態下進行。帳號層還有一道前綴檢查:2026 年 8 月 31 日 00:00 UTC 之後建立的帳號預設強制「thinking 區塊之前的系統提示、工具定義與更早訊息不得變更」,變更後重送舊區塊會收到 400 錯誤,這是 Fable 5.1 起的反蒸餾措施 preserved thinking 的一部分;Anthropic 九月的威脅情報報告記錄了大規模假帳號蒸餾攻擊的細節,背景可以互相對照。
  • 舊版電腦操作工具退場:在 Claude API 與 Google Cloud 上,Opus 5.5 只收新版 computer_toolset_20260801 工具組,宣告舊的 computer_20251124 會被拒絕並收到 400 錯誤;Amazon Bedrock 是例外,舊工具照常運作,那條路徑不需要改。

還有一個不會報錯但會安靜的陷阱:模型在工具呼叫之間寫的進度文字,現在改放在 thinking 區塊裡,display 預設值是 omitted,也就是這些文字全部以空值出現。如果介面把這些文字串流給使用者看,升級後畫面會安靜下來,要設好 display 值才看得到。另外,防護分類器攔下請求時,送出的形狀是 HTTP 200 搭配 stop_reason 為 refusal,不是 4xx 錯誤,自動化程式要照這個形狀設計 fallback,官方也提供伺服器端的自動退換模型選項。

官方的遷移指南把該做的事收成一張清單:把模型名稱換成 claude-opus-5-5;移除所有指定關閉思考或手動思考預算的設定,改選一個 effort 檔位;把 tool_choice 的 any 與 tool 換成 auto 加 strict tool use;在 Claude API 或 Google Cloud 上用電腦操作的整合,改宣告新的工具組;介面會顯示工具間進度文字的,補上 display 設定。對照之下,本來就開著思考、用 auto 工具選擇的程式幾乎不用改,這也是官方把破壞面集中在「控制權」而非「功能」的原因。

規格Claude Opus 5.5
上下文視窗100 萬 token
最大輸出12.8 萬 token
可靠知識截止2026 年 6 月
預設 effortmedium(Opus 5 為 high)
雲端供應Claude API、Bedrock、Google Cloud、Microsoft Foundry

成績單要連附註一起讀:贏的集中在長任務,輸的在兩類

評測項目Opus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
Terminal-Bench 4.0(終端機長任務)66.4%55.8%52.3%57.9%37.3%
FrontierCode v1.1(程式修改可合併率)54.4%50.3%48.0%53.3%47.5%
CursorBench 4.0(真實多檔案任務)57.8%51.8%46.6%未列41.7%
GDPval-AA v2.1(44 種職業知識工作)18461735170815421588
AutomationBench(商務流程自動化)40.0%31.4%26.9%41.4%28.8%
Terminal-Bench-Science 0.1(科學代理任務)58.7%52.6%29.0%64.6%22.4%
OSWorld 2.0(電腦操作)81.8%80.7%74.0%未列未列

領先的欄位確實醒目:Terminal-Bench 4.0 的 66.4% 高於 GPT-6 Astra 的 57.9% 與 Fable 5.1 的 55.8%;FrontierCode、CursorBench、GDPval-AA、OSWorld 也都是五欄最高;其中 OSWorld 2.0 的三個 Claude 分數官方都標註為 partial,屬部分測項的成績。但同一張表裡,AutomationBench 的 40.0% 低於 GPT-6 Astra 的 41.4%,Terminal-Bench-Science 的 58.7% 低於 64.6%,輸的正好是商務流程自動化與科學代理這兩類。

Claude Platform 模型總覽比較表截圖,列出 Fable 5.1、Opus 5.5、Sonnet 5 與 Haiku 4.5 的定價、預設 effort、上下文視窗、最大輸出與知識截止,Opus 5.5 為每百萬 4 與 20 美元、預設 effort medium、1M 上下文、128K 輸出Pin
模型總覽表:Opus 5.5 規格與四個現行模型的定價對照(圖片來源:Claude Platform 文件)
Anthropic 官方公告的評測對照表截圖,欄位為 Opus 5.5、Fable 5.1、Opus 5、GPT-6 Astra 與 GPT-5.6 Sol,Terminal-Bench 4.0 一列 Opus 5.5 為 66.4%,AutomationBench 與 Terminal-Bench-Science 兩列以灰底標示 GPT-6 Astra 較高的 41.4% 與 64.6%Pin
官方評測表:兩格灰底是 GPT-6 Astra 分數高於 Opus 5.5 的位置(圖片來源:Anthropic 公告頁)

Anthropic 自己在表下附了三條註解,值得逐條讀。除特別註明外,Opus 5.5 的成績都在 max effort 測得,Terminal-Bench 4.0 的 Opus 5.5 則用 xhigh、GPT-6 Astra 用 high(取自 OpenAI 自報的最佳成績),條件並不對等;標準誤方面 Opus 5.5 約正負 2.6 個百分點,與 Astra 的差距大於誤差範圍。評測全程帶著正式環境的防護跑,當防護出手時,網安任務轉給 Opus 4.8、生物與前沿模型開發任務轉給 Opus 5,官方自承這個安排可能壓低 Opus 5.5 的分數。AutomationBench 由 Zapier 評測與發布,沒有 fallback 模型,防護介入直接算失敗,官方也註明實務上表現會比帳面分數好。附註裡還有一個誠實細節:Terminal-Bench 4.0 公開排行榜上 Opus 5 是 51.8%,Anthropic 自己的環境重跑出 52.3%,落在誤差內,等於把自測環境與公開榜對了一次錶。

換到成本軸,官方給的另一組數字更有參考價值:預設 effort(medium)下,FrontierCode 拿 54.6%,打贏 GPT-6 Astra 的最佳成績,每任務成本約為其五分之一;Terminal-Bench 4.0 追平 Astra,成本約四成;CursorBench 拿 52.5%,贏 GPT-5.6 Sol 11 個百分點,成本約三分之一。官方也在公告裡寫明:在這個能力水準,評測分數的差距已經不是實際差異的可靠指標,內部使用中 Opus 5.5 與 Fable 5.1 的差距比分數顯示的更小。同週 SpaceXAI 發布的 Grok 4.7 同樣以價格不變包裝長任務升級,兩家不約而同把敘事從每一項冠軍搬到每任務成本,這個訊號比任何單一分數都值得記下來。

安全數字是自評,防護結構是真的

安全這節的數字大多出自 Anthropic 自家的評測,僅 Gray Swan 基準由外部資安公司執行,證據等級要先講清楚。自動行為審計覆蓋近 2,000 個情境,官方稱 Opus 5.5 是迄今測過、在失準行為衡量上表現最好的模型;在一項測試模型會不會試圖越過隔離邊界的評估裡,Opus 5.5 的越界嘗試比 Opus 5 或 Mythos 5.1 大約少 85%,且每次嘗試都屬低嚴重度、並由模型自行通報。提示注入方面,官方稱每種測過的設定都追平或勝過 Opus 5;在資安公司 Gray Swan 跑的基準上,與 Fable 5.1 並列所有受測模型的最低注入成功率。同一節裡官方也自承:有跡象顯示 Opus 5.5 經常懷疑自己正在被評測,這會削弱評測結果對真實環境行為的代表性,這句但書讓上面的數字有了明確的適用邊界。

防護的結構性變化比數字本身實在。Opus 5.5 是第一款出廠就掛上 Fable 5.1 級防護的 Opus 模型,涵蓋網安、生物與蒸餾三類,被攔下的請求會透明地退給另一個模型處理:多數網安任務改由 Opus 4.8 接手。研究機構可以申請生命科學驗證計畫(Life Sciences Verification Program),取得為生物研究設計的防護等級;網安端的驗證計畫也預告將擴大到三個層級。完整評估方法與結果放在 Opus 5.5 System Card,以 PDF 公開,9 月 23 日檢查時可以直接下載,檔案有 17.8MB。

治理脈絡是這次發布的第二條故事線。Opus 5.5 是 Anthropic 發布設速宣言之後的第一款模型,發布前經 Frontier Design 與 METR 等外部機構評測;宣言裡承諾的嵌入式評估者,在 9 月 18 日落地為與 Accenture 的合作,由其 AI 專門業務 Faculty 主導,雙方各預期在五年內投入至少 10 億美元。Anthropic 九月也公布了研發速度的量測報告威脅情報報告,這次防護設計與反蒸餾措施都能對上那些文件。

升級決策看負載形狀,觀望的人等兩件事

Claude 自己的選型文件給的答案很直白:不確定就用 Opus 5.5 起步;需要更重的推理與更長程的代理工作、或 Opus 5.5 調高 effort 仍不夠時,才用 Fable 5.1(每百萬 10 與 50 美元)。Sonnet 5.5 與 Haiku 5.5 官方稱數週內跟上。

分成幾種負載形狀來看:

  • 網頁與訂閱用戶:自動受益,沒有遷移成本,五小時額度還變多。
  • 有開快取的代理與程式工作:受益最大,三層紅利全吃(單價、快取讀取、更少步驟),官方自報的 40% 就是這種形態的數字。
  • 短請求的簡單工作:拿到的主要是牌價兩成,考慮更便宜的 Sonnet 5(每百萬 2 與 10 美元)可能更值得。
  • 舊整合依賴關閉思考或強制工具的團隊:那段程式必須重寫,先在測試環境跑完整的工具迴圈、模型切換與錯誤處理再上線。

未確認的事項也列一下:40% 與評測分數目前都是 Anthropic 自報,獨立榜(Artificial Analysis、Cursor evals 等)何時列入 Opus 5.5 還沒有公開資料;外部機構對 System Card 的覆核、Sonnet 5.5 與 Haiku 5.5 的規格與定價也都還沒揭曉。台灣在內的區域供應限制,公告與文件都沒有特別列出,API 與三個雲端平台全到齊。

一句話收攏:這次發布的實質,是把前一代的長任務能力用更便宜的帳單形狀交出來,同時把「推理要不要開、工具怎麼選」的控制權收歸模型端。要升級的 API 用戶,先把四項變更在測試環境跑過一輪;還在觀望的人,等獨立榜與 Sonnet 5.5 的定價出來再決定,也不會損失太多。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1488

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...