TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南
TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南

Anthropic 於 9 月 22 日發布 Claude Opus 5.5,API 單價降 20%、快取讀取降 60%,官方自報典型工作總成本約低 40%。升級要過四項破壞性變更,評測有兩項低於 GPT-6 Astra,依負載形狀決定要不要現在切換。
用 AI 摘要這篇文章:
Anthropic 在 2026 年 9 月 22 日(台北時間 23 日凌晨)發布 Claude Opus 5.5,這是 Claude 5.5 家族的第一款模型,官方定位在長時間的代理式程式開發與知識工作,開場定位寫得很直白:多數工作上與 Fable 5.1 同級,而跑起來的成本比 Opus 5 低四成。模型當天就上了 Claude API、Amazon Bedrock、Google Cloud 與 Microsoft Foundry,開發端模型名稱是 claude-opus-5-5。對只在 Claude 網頁或 App 裡使用的一般使用者,這次變動幾乎不自覺:模型變便宜、變快,訂閱額度還放了利多。對 API 用戶則不然,升級要處理四項破壞性變更,降價的實際形狀與遷移成本需要分開算清楚。
價格、評測與相容性細節都對照 2026 年 9 月 23 日抓取的 Anthropic 官方公告與 Claude Platform 開發文件;其中官方自行測試或轉述早期用戶的數字,目前沒有獨立複核。
最上層是牌價。Opus 5.5 的 API 單價是每百萬輸入 4 美元、輸出 20 美元,比 Opus 5 的 5 與 25 美元調降 20%。牌價表上降幅最大的其實是快取讀取:從 0.5 美元降到 0.2 美元,等於打四折。5 分鐘快取寫入從 6.25 美元降到 5 美元,另提供 1 小時快取寫入 8 美元的選項,批次處理半價為每百萬 2 與 10 美元。
| 每百萬 token 價格 | Claude Opus 5.5 | Claude Opus 5 | 調整幅度 |
|---|---|---|---|
| 快取讀取 | 0.20 美元 | 0.50 美元 | -60% |
| 輸入 | 4 美元 | 5 美元 | -20% |
| 輸出 | 20 美元 | 25 美元 | -20% |
| 快取寫入(5 分鐘) | 5 美元 | 6.25 美元 | -20% |
第二層在用量。Anthropic 自報在預設設定下,典型工作負載的總成本比 Opus 5 低約 40%,輸出速度加快 30% 以上。40% 遠大於牌價降幅,差額來自模型用更少的步驟與更少的 token 完成同樣的工作。官方給的例子:有早期測試者用它在不到一天內完成 68 萬行程式碼遷移;另一個 20 萬行程式庫的審計修復,Opus 5.5 在 3 小時內做完,Opus 5 花超過 20 小時、還多用 2.5 倍的 token;內部測試把 HAProxy 從 C 改寫成 Rust,Opus 5.5 花 9.5 小時完成,Fable 5.1 要 12 小時,成本低 51%,兩個版本都通過 HAProxy 幾乎全部的迴歸測試。知識工作也有對照:18 份財務報告裡有 16 份通過「任何捏造數字或引文即失敗」的門檻,Fable 5.1 與 Opus 5 在任何一次嘗試中都沒有過門。這些是官方自測或轉述早期用戶的數字,當方向參考可以,當保證不行。

早期測試者的實測數字方向一致,而且都出自具名公司。GitHub 的產品長說,在 Copilot CLI 與 VS Code 的測試裡,Opus 5.5 是量到 token 與步驟數最少的模型之一,在 VS Code 用不到一半的步驟解掉比 Opus 5 更多的終端機任務;交易公司 Optiver 在自家代理程式任務上,用約一半的輪次、時間與輸出 token 追平 Opus 5 的品質,該工作負載的成本降了四到五成;顧問公司 Quantium 的一項複雜任務,從原本 38 個 prompt、花四天,變成 11 個 prompt、三小時完成。這些引述由 Anthropic 節錄發布,挑過案例是難免的,但與官方自測的 40% 指向同一個方向:省錢主要省在步驟與用量,牌價只是入場券。
第三層是配對的行為。快取讀取降 60% 只對有開快取的用法有意義,而代理式工作(多輪工具呼叫、反覆讀同一份系統提示與檔案)正是快取讀取佔大頭的形態,官方在公告裡也是用這個角度定位這次降價。反過來說,如果請求都很短、系統提示沒有重用,拿到的就接近牌價那 20%。
訂閱端同步有兩項調整:Pro、Max、Team 與按席位計費的 Enterprise 方案,五小時額度提高;訂閱用戶另外拿到一次可儲存的速率限制重置,可以留到需要的時候再用。想要更快輸出的人,Fast 模式以最高 2.5 倍速度提供,費率為每百萬 8 與 40 美元,屬研究預覽,只在 Claude Code 與 Claude API 上提供,Bedrock、Google Cloud、Foundry 這些雲端管道目前沒有。
Claude Platform 的開發文件列出四項破壞性變更,前三項在 Fable 5.1 上已經存在,對從 Opus 5 或更早版本升級的程式則是新的。
thinking type disabled 或手動指定思考預算,都會收到 400 錯誤。深度控制改用 effort 參數,而 Opus 5.5 的預設 effort 是 medium,比 Opus 5 的預設 high 低一檔;文件還提醒同一個 effort 數值在新模型上會思考得更多,建議重跑一輪參數校正,別把舊設定直接搬過來。還有一個不會報錯但會安靜的陷阱:模型在工具呼叫之間寫的進度文字,現在改放在 thinking 區塊裡,display 預設值是 omitted,也就是這些文字全部以空值出現。如果介面把這些文字串流給使用者看,升級後畫面會安靜下來,要設好 display 值才看得到。另外,防護分類器攔下請求時,送出的形狀是 HTTP 200 搭配 stop_reason 為 refusal,不是 4xx 錯誤,自動化程式要照這個形狀設計 fallback,官方也提供伺服器端的自動退換模型選項。
官方的遷移指南把該做的事收成一張清單:把模型名稱換成 claude-opus-5-5;移除所有指定關閉思考或手動思考預算的設定,改選一個 effort 檔位;把 tool_choice 的 any 與 tool 換成 auto 加 strict tool use;在 Claude API 或 Google Cloud 上用電腦操作的整合,改宣告新的工具組;介面會顯示工具間進度文字的,補上 display 設定。對照之下,本來就開著思考、用 auto 工具選擇的程式幾乎不用改,這也是官方把破壞面集中在「控制權」而非「功能」的原因。
| 規格 | Claude Opus 5.5 |
|---|---|
| 上下文視窗 | 100 萬 token |
| 最大輸出 | 12.8 萬 token |
| 可靠知識截止 | 2026 年 6 月 |
| 預設 effort | medium(Opus 5 為 high) |
| 雲端供應 | Claude API、Bedrock、Google Cloud、Microsoft Foundry |
| 評測項目 | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench 4.0(終端機長任務) | 66.4% | 55.8% | 52.3% | 57.9% | 37.3% |
| FrontierCode v1.1(程式修改可合併率) | 54.4% | 50.3% | 48.0% | 53.3% | 47.5% |
| CursorBench 4.0(真實多檔案任務) | 57.8% | 51.8% | 46.6% | 未列 | 41.7% |
| GDPval-AA v2.1(44 種職業知識工作) | 1846 | 1735 | 1708 | 1542 | 1588 |
| AutomationBench(商務流程自動化) | 40.0% | 31.4% | 26.9% | 41.4% | 28.8% |
| Terminal-Bench-Science 0.1(科學代理任務) | 58.7% | 52.6% | 29.0% | 64.6% | 22.4% |
| OSWorld 2.0(電腦操作) | 81.8% | 80.7% | 74.0% | 未列 | 未列 |
領先的欄位確實醒目:Terminal-Bench 4.0 的 66.4% 高於 GPT-6 Astra 的 57.9% 與 Fable 5.1 的 55.8%;FrontierCode、CursorBench、GDPval-AA、OSWorld 也都是五欄最高;其中 OSWorld 2.0 的三個 Claude 分數官方都標註為 partial,屬部分測項的成績。但同一張表裡,AutomationBench 的 40.0% 低於 GPT-6 Astra 的 41.4%,Terminal-Bench-Science 的 58.7% 低於 64.6%,輸的正好是商務流程自動化與科學代理這兩類。


Anthropic 自己在表下附了三條註解,值得逐條讀。除特別註明外,Opus 5.5 的成績都在 max effort 測得,Terminal-Bench 4.0 的 Opus 5.5 則用 xhigh、GPT-6 Astra 用 high(取自 OpenAI 自報的最佳成績),條件並不對等;標準誤方面 Opus 5.5 約正負 2.6 個百分點,與 Astra 的差距大於誤差範圍。評測全程帶著正式環境的防護跑,當防護出手時,網安任務轉給 Opus 4.8、生物與前沿模型開發任務轉給 Opus 5,官方自承這個安排可能壓低 Opus 5.5 的分數。AutomationBench 由 Zapier 評測與發布,沒有 fallback 模型,防護介入直接算失敗,官方也註明實務上表現會比帳面分數好。附註裡還有一個誠實細節:Terminal-Bench 4.0 公開排行榜上 Opus 5 是 51.8%,Anthropic 自己的環境重跑出 52.3%,落在誤差內,等於把自測環境與公開榜對了一次錶。
換到成本軸,官方給的另一組數字更有參考價值:預設 effort(medium)下,FrontierCode 拿 54.6%,打贏 GPT-6 Astra 的最佳成績,每任務成本約為其五分之一;Terminal-Bench 4.0 追平 Astra,成本約四成;CursorBench 拿 52.5%,贏 GPT-5.6 Sol 11 個百分點,成本約三分之一。官方也在公告裡寫明:在這個能力水準,評測分數的差距已經不是實際差異的可靠指標,內部使用中 Opus 5.5 與 Fable 5.1 的差距比分數顯示的更小。同週 SpaceXAI 發布的 Grok 4.7 同樣以價格不變包裝長任務升級,兩家不約而同把敘事從每一項冠軍搬到每任務成本,這個訊號比任何單一分數都值得記下來。
安全這節的數字大多出自 Anthropic 自家的評測,僅 Gray Swan 基準由外部資安公司執行,證據等級要先講清楚。自動行為審計覆蓋近 2,000 個情境,官方稱 Opus 5.5 是迄今測過、在失準行為衡量上表現最好的模型;在一項測試模型會不會試圖越過隔離邊界的評估裡,Opus 5.5 的越界嘗試比 Opus 5 或 Mythos 5.1 大約少 85%,且每次嘗試都屬低嚴重度、並由模型自行通報。提示注入方面,官方稱每種測過的設定都追平或勝過 Opus 5;在資安公司 Gray Swan 跑的基準上,與 Fable 5.1 並列所有受測模型的最低注入成功率。同一節裡官方也自承:有跡象顯示 Opus 5.5 經常懷疑自己正在被評測,這會削弱評測結果對真實環境行為的代表性,這句但書讓上面的數字有了明確的適用邊界。
防護的結構性變化比數字本身實在。Opus 5.5 是第一款出廠就掛上 Fable 5.1 級防護的 Opus 模型,涵蓋網安、生物與蒸餾三類,被攔下的請求會透明地退給另一個模型處理:多數網安任務改由 Opus 4.8 接手。研究機構可以申請生命科學驗證計畫(Life Sciences Verification Program),取得為生物研究設計的防護等級;網安端的驗證計畫也預告將擴大到三個層級。完整評估方法與結果放在 Opus 5.5 System Card,以 PDF 公開,9 月 23 日檢查時可以直接下載,檔案有 17.8MB。
治理脈絡是這次發布的第二條故事線。Opus 5.5 是 Anthropic 發布設速宣言之後的第一款模型,發布前經 Frontier Design 與 METR 等外部機構評測;宣言裡承諾的嵌入式評估者,在 9 月 18 日落地為與 Accenture 的合作,由其 AI 專門業務 Faculty 主導,雙方各預期在五年內投入至少 10 億美元。Anthropic 九月也公布了研發速度的量測報告與威脅情報報告,這次防護設計與反蒸餾措施都能對上那些文件。
Claude 自己的選型文件給的答案很直白:不確定就用 Opus 5.5 起步;需要更重的推理與更長程的代理工作、或 Opus 5.5 調高 effort 仍不夠時,才用 Fable 5.1(每百萬 10 與 50 美元)。Sonnet 5.5 與 Haiku 5.5 官方稱數週內跟上。
分成幾種負載形狀來看:
未確認的事項也列一下:40% 與評測分數目前都是 Anthropic 自報,獨立榜(Artificial Analysis、Cursor evals 等)何時列入 Opus 5.5 還沒有公開資料;外部機構對 System Card 的覆核、Sonnet 5.5 與 Haiku 5.5 的規格與定價也都還沒揭曉。台灣在內的區域供應限制,公告與文件都沒有特別列出,API 與三個雲端平台全到齊。
一句話收攏:這次發布的實質,是把前一代的長任務能力用更便宜的帳單形狀交出來,同時把「推理要不要開、工具怎麼選」的控制權收歸模型端。要升級的 API 用戶,先把四項變更在測試環境跑過一輪;還在觀望的人,等獨立榜與 Sonnet 5.5 的定價出來再決定,也不會損失太多。