TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南
TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南

OpenAI 在 2026 年 9 月 22 日推出 GPT-6 Sol 與 GPT-6 Luna,API 牌價分別是旗艦 Astra 的五分之一與百分之一,較 GPT-5.6 促銷價再降一半。三款模型怎麼分工、官方評測數字怎麼讀、快取怎麼影響帳單,以及現在哪些帳號用得到,一次整理。
用 AI 摘要這篇文章:
2026 年 9 月 22 日,OpenAI 在官方 X 帳號發文,把 GPT-6 Sol 與 GPT-6 Luna 送進 GPT-6 系列。兩款新模型以和 9 月初發表的旗艦 Astra 相似的訓練方法打造,把多數專業工作用得到的能力,搬進便宜許多的價位帶:API 標準牌價每百萬 token 計,Sol 輸入 2 美元、輸出 10 美元,Luna 輸入 0.10 美元、輸出 0.50 美元,對照旗艦 Astra 的 10 與 50 美元。
對自費呼叫 API 的開發者與重度付費使用者來說,這次發布真正的份量不在「降價」兩個字,而在預設選項變了:Sol 的單價落在 Astra 的五分之一,OpenAI 同步公布的評測數字,讓「日常主力不必動用旗艦」有了可核對的依據;Luna 則把堪用的寫程式與代理能力壓到 Astra 的百分之一價位。文內價格與引述以 OpenAI 官方公告、API 價目表與模型規格頁為準。
時間軸很短。9 月初,OpenAI 發表 GPT-6 Astra,官方定位是系列中能力最高的旗艦;不到三週後的 9 月 22 日,官方 X 帳號貼文寫下「Please welcome GPT-6 Sol and GPT-6 Luna to the GPT-6 universe」,同日公告正式上線。發布前一週,API 字串洩痕與模型別名其實已被社群摸到線頭,站上先前把這些跡象整理過一次,這次是官方本人現身。
三款模型的分工,公告與模型頁寫得很直白:Astra 持續是各方面表現最好的模型,留給最難、最重要的工作;Sol 面向專業工作,特色是更高的用量限額與更低成本;Luna 是聚焦、大量任務裡效率最高的選項。規格面上,Sol 與 Luna 的上下文視窗都是 1,050,000 token,最大輸出 128,000 token,都支援推理 token;知識截止日 Sol 為 2026 年 4 月 20 日,Luna 為 2026 年 5 月 18 日。

依公告的可用性說明,GPT-6 Sol 與 Luna 即日起進入 ChatGPT Work 與 Codex,對象是 Plus、Pro、Business、Enterprise 與 Edu 用戶;Free 與 Go 帳號可以在桌面版應用程式使用 Luna。API 端的模型名稱就是 gpt-6-sol 與 gpt-6-luna,直接指定即可。
兩個範圍限制先記住。其一,這兩款模型尚未進入一般 ChatGPT 對話,官方沒有給時間表;它們在 ChatGPT Work 與 Codex 內也是發布當天分批開放,帳號一時看不到選項屬於正常情況,官方的建議是稍後再試;其二,API 按 token 計費與 ChatGPT 訂閱額度是兩套制度,Work 與 Codex 走的是訂閱方案的用量限額,API 牌價的降幅不能直接推算成訂閱費會變便宜。只把 ChatGPT 當一般對話工具、不碰 Work 與 Codex 的用戶,這次發布暫時沒有直接變化。
官方公告把這次調價描述為相較 GPT-5.6 促銷價再降 50%:GPT-5.6 Sol 促銷價每百萬 token 輸入 4 美元、輸出 20 美元,GPT-6 Sol 降為 2 與 10 美元;GPT-5.6 Luna 從 0.20 與 1.20 美元,降為 0.10 與 0.50 美元。要注意基準點:對照的是上一代促銷中的價格,不是最早發表時的原價。價目表明文寫著 GPT-5.6 Sol 的促銷至少延續到 2026 年 11 月 21 日,也就是說舊款目前仍掛促銷價,GPT-6 是在促銷價之上再對半。
逐項看的話,Luna 的輸出單價從 1.20 降到 0.50 美元,實際降幅約 58%,比官方統一口徑的「50%」更大。發布當下的價目表上,三款模型的標準處理牌價如下,短上下文與超過 272K 後的長上下文費率並列:
| 模型 | 輸入 | 快取讀取 | 輸出 | 長上下文輸入 | 長上下文輸出 |
|---|---|---|---|---|---|
| GPT-6 Astra | US$10.00 | US$1.00 | US$50.00 | US$20.00 | US$75.00 |
| GPT-6 Sol | US$2.00 | US$0.20 | US$10.00 | US$4.00 | US$15.00 |
| GPT-6 Luna | US$0.10 | US$0.01 | US$0.50 | US$0.20 | US$0.75 |
表列金額為每百萬 token 的標準處理牌價。單次請求輸入超過 272,000 token 時,整筆請求改用長上下文費率,輸入與快取價變兩倍、輸出價變 1.5 倍;這對長對話代理是實際會踩到的結構,後面快取一節會再回到這裡。批次(Batch)與彈性(Flex)處理都是標準價的五折,例如 Sol 降到輸入 1 美元、輸出 5 美元;要求低延遲的 Fast mode 則翻倍到輸入 4 美元、輸出 20 美元。另外,EU 資料駐留目前僅標準處理支援,區域處理端點要加價 10%,快取寫入則以輸入價的 1.25 倍計。

用一個具體例子感受價差:假設一次任務用掉 100 萬輸入、20 萬輸出 token,每筆請求輸入都壓在 272,000 token 門檻以下、全走標準處理,Sol 帳單約 4 美元,Astra 約 20 美元,Luna 約 0.20 美元。同一件事的三種價格,這就是分層呼叫值得算的原因。實際帳單還會被快取命中率、長上下文門檻與重試次數拉動,單價只是起點。
長對話代理還要注意兩者的互動:一旦單筆請求超過 272,000 token,輸入與快取都改按兩倍計費,快取帶來的節省會被稀釋;會把上下文推到門檻附近的流程,先試算再上。
OpenAI 這次給的評測數字相當多,最值得停下來看的是 AutomationBench。這套評測由 Zapier 維護,讓 AI 代理用 47 個工具跑跨銷售、行銷、營運、客服、財務與人資的商務流程,量的是「完成一件真實流程」的分數與成本。官方公布的四行對照如下:
| 模型(推理強度) | 分數 | 每件任務成本 |
|---|---|---|
| GPT-6 Sol(xhigh) | 33.2% | US$0.27 |
| GPT-6 Astra(low) | 30.3% | Sol 的 3.9 倍 |
| Claude Fable 5.1 含 Opus 5 fallback(max) | 31.4% | Sol 的 8.9 倍以上 |
| Claude Opus 5(max) | 26.9% | Sol 的 11.1 倍 |
白話讀法:Sol 以 xhigh 強度拿到 33.2%,每件 0.27 美元;Claude Opus 5 用到最強的 max 強度是 26.9%,每件成本約為 Sol 的 11.1 倍,換算下來 Sol 只花對手的 9%。官方下的註腳很老實:Fable 5.1 那行約有 40% 的任務發生退回 Opus 5 處理的情形,而退回的成本沒有計入,等於該行成本被低估。換句話說,Sol 在這套商務流程評測同時贏過對手旗艦與自家旗艦的低強度設定,這是「日常主力可以換」論述的核心數字。
但書有兩個。這是 OpenAI 自己挑選、自己跑的評測,公告註明評測在研究環境或 API 進行,對手分數取自公開報告,條件未必完全對齊;把它當候選名單的參考可以,當通用排行榜不行。而且同一段落官方也公布,Luna 以高強度跑同一套評測,比 GPT-5.6 Luna 進步 5.4 個百分點,每件成本降低 58%,便宜款在商務流程上也在前進。同段官方另補一句,Sol 的成績超過 Claude Fable 5.1,成本遠低於它。另一項專業複雜流程評測 Agents’ Last Exam,Sol 以 max 強度拿到 56.4%,官方稱高於 Claude Opus 5 在該評測的最高分,每件成本低 60%。
兩個不影響分數但影響體驗的更新也跟著來。溝通風格上,Astra 那套比較清晰的表達方式被帶進 Sol 與 Luna,官方預告在技術與寫程式的對話裡會更明顯:行話更少、贅詞更少、回答整體略短但不失內容。對齊面上,官方稱兩款在對齊評測都較 GPT-5.6 同位版本進步,包括比較少對自己的寫程式成果做出誤導宣稱;這類評測同樣刻意挑戰困難情境,不代表日常出錯率,但書與事實性評測相同。
寫程式是最能看出這次「下放」幅度的地方。DeepSWE v1.1 用真實程式庫裡的複雜工程任務測代理,GPT-6 Sol 以 max 強度拿到 68.8%,距離 Claude Fable 5 在該評測的最高分 69.9%(xhigh 強度)只剩 1.1 個百分點,每件成本低約 80%。更有意思的是 Luna:max 強度拿到 66.6%,官方描述為與 Opus 5、Fable 5 的 medium 強度相當,而每件成本比 Opus 5 低 93%、比 Fable 5 低 96%。Luna 已非只能做摘要分類的便宜貨,是可以排進正式分層的工程模型。
其餘幾項各有位置。FrontierCode 測的是產出的變更是否達到可合進真實程式庫的標準,官方說 Sol 較 GPT-5.6 Sol 明顯進步,能以低得多的成本匹配 Fable 5.1 的 xhigh 水準,但沒有給出分數。OSWorld 2.0 離線版測電腦操作,Sol 以 xhigh 拿 60.5%,與 Opus 5 medium 的 60.3% 相當,成本低約 80%;Luna 的 max 強度勝過 GPT-5.6 Sol 的 medium,成本僅十分之一。電腦操作這塊官方仍明說 Astra 是最好的模型,Sol 與 Luna 的意義是把「可用門檻」往下搬。
事實性方面,官方稱在內部評測中,GPT-6 Sol 犯的錯約為 GPT-5.6 Sol 的一半,接近 Astra 的水準;Luna 在較高強度下能匹配 GPT-5.6 Sol,成本約百分之一。這個數字的來源要讀清楚:評測樣本來自使用者曾回報前代模型出錯的去識別化對話,難度天生偏高,官方也明言這些對話不代表一般使用情境。把「錯誤減半」直接外推成日常問答出錯率減半,超出資料能支持的範圍。
OpenAI 順帶公布了一個內部數字當背景:按 API 牌價折算,內部研究員的中位數每日 token 用量超過 600 美元,前 10% 超過 7,000 美元。寫程式代理的任務越長越重,成本效率就從加分項變成生存項,這是這波降價的脈絡。
單價砍半之外,公告用了一整節談快取,因為代理與長對話的帳單大頭往往在重複讀取的上下文。GPT-6 的快取預設命中率提高,快取讀取價是輸入價的十分之一(上表三款都是),省 90%。配套也補齊:平台新的快取儀表板與診斷工具讓開發者看見「哪些該快取的沒快取到」;調整推理強度、開關工具不再打破先前的快取;還能自訂快取斷點,指定哪些前綴要留下來重用。
規模化的效果有外部佐證:GitHub 表示,過去幾個月這些改進讓他們對 OpenAI 模型的數十億次請求中,需要重新處理的 prompt token 佔比降了一半以上,Copilot 的回應因此變快。對自架代理管線的團隊,這提醒很實際:換模型之前,先看自己的快取命中率,有時帳單的槓桿在這裡而不在單價。至於把 272,000 token 的長上下文門檻、快取與分層呼叫放進同一條管線怎麼算帳,先前談錢包份額那篇的直算方法可以直接套用。
把官方數字放回「自己的任務」上,我的判斷是這樣排的:日常開發與跨工具的專業工作,預設從旗艦換到 Sol,它有官方評測與五分之一價位支撐「先試它」的正當性;大量、重複、有辦法自動驗收的工作(分類、清理、格式轉換、簡單代理步驟)下放 Luna,用 Batch 再砍半;Astra 留給錯誤代價高、任務難拆解、或實測顯示 Sol 經常要重做的難題。
兩個例外要自己驗。若你的任務裡 Sol 的重做率高,重做的成本很快就吃掉價差,此時升級 Astra 反而省錢;若工作有正確答案可對照(例如既有測試套件覆蓋的批次處理),Luna 加 Batch 的組合幾乎沒有對手。這是從官方數字推導的採用順序建議,不是效能排行,最終仍要用自己任務的成功率、重試次數與人工修正時間來定。讓 Astra 表現穩定的提示詞寫法,官方指南的整理可以搭配看。
幾件事官方沒給答案。GPT-6 Sol 與 Luna 何時進入一般 ChatGPT 對話,公告只說尚未提供,沒有時間表;FrontierCode 與 OSWorld 的完整分數表未隨公告公佈,現有的比較停留在文字描述;自家模型的評測數字全部是研究環境或 API 口徑,與生產環境的表現可能不同。另外,GPT-5.6 Sol 促銷至少到 2026 年 11 月 21 日,到期後舊款牌價怎麼調、新舊價差是否再變,值得在那之前回頭看一次價目表。
文內價格與規格,對應 2026 年 9 月 22 日至 23 日的 OpenAI 官方價目表與模型頁;OpenAI 調價與模型推陳的速度都不慢,閱讀時若已過一段時間,以官方價目表的當下數字為準。想追蹤後續的讀者,盯三件事就夠:一般 Chat 何時接入、11 月 21 日促銷到期後的牌價、以及 OpenAI 開發者日(站上先前整理為 9 月 29 日)有沒有接續宣布。