TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南
TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南

OpenAI 把支撐 Codex 的代理執行框架開放成 Agents API 公開測試版:一次 API 呼叫建立可壓縮情境、可派子代理的長時間代理,執行環境可選 OpenAI 代管沙盒、自帶基礎設施或九家夥伴,框架本身不另收費。
用 AI 摘要這篇文章:
9 月 10 日,OpenAI 在官方部落格宣布 Agents API 進入公開測試(public beta),對所有開發者開放。這次的主角不是新模型,而是一套地基:支撐 Codex 與 ChatGPT for Work 走到數百萬使用者規模的代理執行框架(harness)與維運基礎設施,現在包成一支 API,開發者不必自己拼裝,就能在上面蓋自己的代理應用。公告把動機寫得很直白:有用的代理需要會管理情境、會有效率使用工具、會協調子代理的框架,也需要能讓代理連續工作好幾天的環境;這兩件事過去都落在開發者自己身上,如今 OpenAI 把它們接過去管。
計費結構先講結論:使用 Agents API 本身沒有額外費用,帳單只按代理實際用掉的模型 token 與工具用量計算。不過「代管」兩個字的成本會出現在其他報表上,後面單獨拆開談。
同一天 OpenAI 的產品序列相當熱鬧:GPT-Live-1 語音模型開放進 API、金融業版 ChatGPT 發表,ChatGPT Work 的資料代理也掛在同日的公告序列上。把 Agents API 放進這個序列看,方向相當一致:把產品端驗證過的能力,一批一批變成開發者與企業可以直接下單的品項。
harness 白話講,就是模型外圍那一圈工程:session 管理、情境壓縮、工具調度、子代理協調、中斷之後的恢復。官方文件把代管範圍列成清單:在沙盒裡執行指令與程式碼、套用 skills 與指示、透過工具或 MCP 連接外部資料、代理工作途中導引方向、把先前的工作摘要進情境、把任務拆給子代理平行處理、session 中斷後從原處續跑。讀這份清單最有感的方式,是把它對照自家團隊過去一年的待辦:每一行幾乎都對得上某個自己寫過的模組。
用法上,開發者用一次 API 呼叫指定任務、模型、工具與執行環境,就能建立一個官方稱為 production-ready 的代理。公告的示範情境是維運場景:叫代理調查某個服務過去半小時 5xx 錯誤率升高,把部署、錯誤、依賴關係三個面向分派給子代理平行分析,再把調查結果與建議存進指定目錄。範例程式碼裡模型填的是 gpt-6-astra(前一天剛發表、主打工作場景的新模型),工具掛一支用 MCP 連接的觀測服務,子代理並行上限設 3,另外還帶了 vault_ids 與 capability_directories 兩個欄位:前者對應文件裡的 Vaults 功能,用來保管 MCP 連線的憑證,代理能使用需要登入的工具,但全程拿不到金鑰本體;後者指向沙盒裡的 skills 目錄。任務描述裡則明確要求把證據與建議寫進指定工作目錄。SDK 有 JavaScript、Python、Go、Java、Ruby 五種語言,呼叫都放在 beta 命名空間下,入口是 client.beta.agents.sessions.create。
公告另點出框架近期的三項強化。情境管理排在前面:session 接近情境上限時自動壓縮較早的內容,保留代理後續需要的資訊,工作流可以橫跨多個情境視窗,不必自己寫壓縮邏輯。工具的效率層是第二塊:工具搜尋(tool search)按需載入相關的工具定義,降低 token 消耗又保住模型快取;程式化工具呼叫(programmatic tool calling)讓代理平行呼叫、串接操作,直接在程式碼裡過濾彙整,只把相關結果帶回情境。多代理是第三塊:任務拆成獨立子任務交給子代理平行跑,每個子代理有自己的情境,主代理負責協調與彙整。這三項對應的正是長任務的兩個成本黑洞:情境塞爆與工具清單膨脹。
這次設計裡最關鍵的分界在這裡:harness 由 OpenAI 代管並持續維運,但代理的執行環境是開發者的選擇題,共有三條路。
最省事的是 OpenAI 代管沙盒。公告明說這套沙盒沿用支撐 Codex 與 ChatGPT 的同一套沙盒基礎設施,OpenAI 負責建置與維運,沙盒裡可以裝自己的檔案、套件、skills 與外掛,費用按容器費率計算。
想把運算留在自己手上的,走 self-hosted 路線:筆電、容器或遠端沙盒都行。架構上是分工的:OpenAI 跑代理框架,你的環境裡執行一支 codex exec-server,負責跑指令、讀寫檔案、使用本地 MCP 服務。連線設計只有出站方向:exec-server 主動用 WebSocket 連回 OpenAI 的環境服務,斷線會自己重接,環境不必開任何連入連接埠。金鑰也做了分權:給環境的 executor key 權限只有「連接環境」這一件事,連其他 API 動作都無法授權,應用程式主金鑰留在環境外面。對算力與資料要落地在自己機房的團隊,這條路把信任邊界畫得相當具體。
夾在中間的是九家沙盒服務商的一級整合:Modal、Cloudflare、Daytona、DigitalOcean、E2B、Blaxel、Runloop、Oracle(OCI)與 Vercel,官方文件裡每家都附了專屬的設定指南。可選的條件包括完全代管或部署在自己的 VPC 內、各家不同的檔案與密鑰儲存機制,以及不同的 CPU、GPU 與記憶體配置。環境的起動、重連與關閉,文件也提供兩種管理方式:由應用程式自己控制,或交給 webhook 事件處理,讓長時間代理的維運不必一直盯著連線狀態。

三條路合起來看,鎖定效應畫在哪裡很明白:框架這一層交給 OpenAI,行為會隨模型版本演進;但運算環境不必跟著搬,隨時可以換到自家機房或任一家夥伴。Long Lake 的 CTO Rasmus Wissmann 在公告頁的引句把這個分工講得最白:「Agents API 供應 harness;環境、情境與使用者體驗留在我們手裡。」
官方文件對計費只寫了三條,但三條都要讀:模型用量按所選模型的 API 費率計;OpenAI 內建工具按各自標準費率計;代管沙盒按標準容器費率計。換句話說,框架本身確實免費,但一個長時間跑在代管沙盒裡的代理,帳單會同時出現模型費、工具費與容器費三個科目。

容器費率這一軌要看得仔細。定價頁的容器段列出 1GB 每 20 分鐘 0.03 美元到 64GB 1.92 美元的價目(符合條件的 session 按分鐘計、每次至少 5 分鐘),但該段標示的對象是 Hosted Shell 與 Code Interpreter;Agents API 代管沙盒在文件裡只說「標準容器費率」,沒有另列專屬價目表。要精算成本的團隊,動工前值得先向官方確認對應費率,這也是公開測試期文件還沒寫滿的部分。
成本結構值得想清楚再設計:跑數小時到數天的代理,容器費隨時間線性累積,模型費隨 token 累積,而框架的情境壓縮與工具搜尋,壓的正是後者。長任務要省錢,架構上就得讓代理少把無關內容搬進情境,這件事現在變成框架層的責任,也是這類代管服務真正的賣點。
公告有一節標題直接點名開源基礎(Build on an open-source foundation):Agents API 背後跑的,是開源的 Codex harness,開發者可以直接檢視協調模型呼叫、工具與情境的核心邏輯,官方的說法是可以 inspect and learn。對應的公開專案是 GitHub 上的 openai/codex,Apache-2.0 授權,截至 9 月 11 日超過 12 萬顆星,專案從 2025 年 4 月就存在,最近一次提交就在 9 月 11 日。OpenAI 這次等於明文把「API 背後那套框架」指到這個 repo,對照各家把代理框架當黑盒賣的做法,這是明顯的差異。

分寸也順便講清楚:開源的是 harness 程式碼,API 代管服務本身的維運仍在 OpenAI 手裡;self-hosted 路線裡安裝的 @openai/codex 套件,就出自同一個專案家族。想理解代理在框架裡怎麼被調度的人,現在有一份可以直接讀的原始碼;官方同步在自家的 Vimeo 帳號放了介紹影片。之前我們整理過 Codex 技能外掛跨平台分發的案例,同一套技能生態在 Agents API 的沙盒裡同樣可以掛載。
公告頁刊載了八家公司的引句,這些數字全部屬於廠商自述等級,沒有第三方覆核,引用時要留意出處性質。有數字的幾段最有參考價值。
Ciridae 技術長 Jack Weissenberger 寫道,團隊的評測分數從 0.71 升到 0.85,子代理的觀測與協調在舊架構裡相當麻煩,換到新 API 後「延遲改善了 4 倍」,子代理流程是開箱即用的大提升。原文用語是 4x latency reduction,換算下來延遲約為原本的四分之一。
SafetyKit 的 Bhavyansh Sabharwal 則給了營運面的數字:把案件審查工作流遷移到 Agents API 之後,每案成本降低 60%,延遲變低、token 效率明顯變好,效能維持原水準。金融服務場景的 Hypha 由主任工程師 Serhii Shchoholiev 出面:把代理框架與沙盒分開之後,失敗的代理回應減少 86%。這段剛好呼應上面的分界設計,harness 與環境解耦本身就是可靠度工程的一部分。
規模感可以看物流平台 Nash.ai,共同創辦人 Aziz Alghunaim 寫他們部署數千個長時間執行的代理、管理全球物流網路上數億趟配送,Agents API 提供的是耐久的 session 與協調層,工具與執行環境由 Nash 自己接上。另外 WithCoverage 的工程總監 Cole Striler 給了一個好比喻:以前寫提示詞鏈、自己管理工具呼叫,現在可以直接在程式碼裡用代理,「就像 Codex 在你筆電上工作的方式」。
官方明說公開測試期間會根據回饋快速迭代、朝正式版(GA)推進,但沒有給時間表;框架行為會隨每次模型發布以版本化方式演進,穩定介面的承諾,公開測試期間還沒有給。文件與公告的範例清一色使用 gpt-6-astra,其他模型的支援範圍尚未列出完整清單,選型前建議以官方文件現況為準。
社群反應集中在供應商鎖定的張力上。Hacker News 上的主討論串截至 9 月 11 日累積 262 分、140 多則留言,有人直接問 OpenAI 靠這個怎麼賺錢,結論恐怕就是生態鎖定;也有人認為,把沙盒環境的安全更新、容器擴展交給 OpenAI 換來省下的維運,本來就是合理的交易。功能面上也有人點出缺口:希望應用程式能在事件發生時觸發一輪代理工作、又讓使用者透過 Codex 介面監看進度,這種混搭目前的 API 還做不到。這兩面的拉扯,就是採用決策本身。
官方入口有三個:文件總覽講架構與四個核心概念(代理、環境、session、事件與項目);快速入門用代管沙盒跑一個建目錄樹腳本的小例子,是最短路徑,另一個範例則用子代理比對各版 release notes 再彙整成一份答案;定價頁看三軌費率。文件還附了五個完整範例應用可以當起點:事件響應代理會調查告警、在請求許可後才執行恢復動作;資料分析代理只用唯讀 SQL 回答倉儲問題,把唯讀當成代理碰資料時的預設邊界;另外還有連接職場工具的 Slack 機器人、重現回報問題的 GitHub issue 調查員,以及用政策技能與專家代理審查文件的審查器。
情境上大致三分流:全新專案直接從代管沙盒起步最快;已經有自建框架的團隊,挑一個非核心工作流做對照跑(同任務、同評測,量成本與延遲的差異),再決定要不要遷移;對資料落地有硬性要求的團隊,先讀 self-hosted 的連線與金鑰設計再評估。把關鍵業務流程押上去之前,記得先回查 GA 狀態與費率頁的最新內容。
整體看,Agents API 把「讓代理長時間活著」這件事,從每個團隊的各自發明,變成 OpenAI 目錄裡可以下單的代管品項。框架這層交出去之後,開發者能做出差異的地方,就剩下工具、知識與工作流程,而這恰好也是公告裡 OpenAI 自己畫出的分工線。