DeepSeek V4.1-Flash 發表:代理任務多項最佳,旗艦同步退役

DeepSeek 發表 V4.1-Flash:552B 骨幹 MoE、每 token KV 快取 890 bytes,代理型評測拿下官方表多項最佳;9 月 14 日中午起 deepseek-v4-pro 請求自動改由新模型服務並以 Flash 價計費,離峰輸出單價降至每百萬 token 0.60 美元。

用 AI 摘要這篇文章:

台北時間 9 月 10 日下午 2 點 10 分,DeepSeek 在官方 X 帳號貼出六篇系列文的第一篇,宣布 DeepSeek-V4.1-Flash 上線。更早四個小時,同日上午 10 點 17 分,模型權重已經悄悄放上 HuggingFace。發布鏈的另一端是一枚定時炸彈:官方定價頁寫明,9 月 14 日中午 12 點起,所有打給旗艦模型 deepseek-v4-pro 的請求都會改由 V4.1-Flash 接手,並以 Flash 的價格計費。

先講對讀者最實際的結論。如果你是 API 用戶,這則新聞的內容是「四天後你打電話過去,接電話的人換了,帳單同時變便宜」:離峰時段的輸出單價從每百萬 token 1.98 美元降到 0.60 美元,不用改任何程式碼。如果你關心的是模型戰局,官方成績單要分開讀:代理型任務多項拿下官方比較表中的最佳成績,但極限推理與部分專業資安攻防項目仍然是 Claude Opus 5 與 GPT-5.6 Sol 領先,這不是一次全面超越。

發布在一天之內走完:權重上架、官方宣布、價格生效

這次發布沒有發表會,時間軸全留在公開紀錄裡。HuggingFace 儲存庫的建立時間是 9 月 10 日上午 10 點 17 分(台北時間),權重以 MIT 授權公開,safetensors 檔案總量約 484.6 GB。下午 2 點 10 分,官方 X 帳號開始連發系列文,第一篇的措辭是:這是新架構家族中尺寸最小的模型,原生整合視覺理解,「為了更高的能力上限、更快的推理速度、更高的系統吞吐量,以及未來擴展到更大規模模型而設計。」

「尺寸最小」對應的規格是:552B 骨幹參數的混合專家模型(MoE),上下文長度一百萬 token,處理輸入時每 token 只激活 8B 參數,生成輸出時激活 16B。對照前代,V4-Flash 是 284B 骨幹、13B 激活;被點名退役的 V4-Pro 是 1.6T 骨幹、49B 激活。帳面旗艦比新模型大三倍,這是接下來整齣戲的張力來源。

官方把 V4.1-Flash 定位成新架構家族的開端而非終點。系列文與 model card 都寫明這套架構是為了往上長出更大模型而設計,被路由用戶等的 V4.1 Pro 雖然沒有時程表,方向已經寫在家族敘事裡。另一個規格面的新鮮事是視覺:V4.1-Flash 原生吃圖片輸入,定價頁規格表上 v4-pro 的 Vision 欄位寫的是不支援,這次切換等於把多模態能力順手帶進原本的 Pro 帳單。model card 列出的多模態分數包含 MMMU-Pro 56.5、文件問答 DocVQA 95.6、圖中物體指認 RefCOCO 平均 86.0;預訓練語料本身就是 45T token 的圖文混合,視覺不是後加的轉接器,是從預訓練第一天就跟文字一起練的。

讓旗艦退場的理由,官方寫在定價頁的註解裡,原文是:「經過大量測試,V4.1 Flash 已在效能、成本、速度與總時間上全面超越 V4 Pro,因此我們計畫以有序的方式讓 V4 Pro 退役。自 2026 年 9 月 14 日北京時間 12:00 起,直到未來 V4.1 Pro 推出為止,所有發往 deepseek-v4-pro 的請求都將路由到 V4.1 Flash,並按 V4.1 Flash 的價格計費。」這是官方自己的宣稱,獨立第三方的重測目前還沒有出現。

誰會被影響,誰完全不用理會

受影響最直接的是程式裡寫死 model=”deepseek-v4-pro” 的 API 用戶。9 月 14 日中午起,這些請求自動換成 V4.1-Flash 服務、Flash 價格計費,呼叫端完全不用改。用更舊名稱的人其實已經被換過了:定價頁註明 deepseek-v4-flash 與 deepseek-v4-flash-vision-exp 兩個舊名「模型已除役但仍可呼叫」,現在就由 V4.1-Flash 接管。想鎖住 V4-Pro 行為的人沒有選項,官方沒有提供任何保留舊模型的別名。

自架族群拿到的是完整的權重與 MIT 授權,但門檻不低。484.6 GB 的權重量體先勸退大多數人;官方這次沒有附 Jinja 格式的 chat template,prompt 編碼要改用儲存庫裡的 encoding 參考實作,或官方另發的 deepseek-recipe 工具包(Rust 函式庫附 Python 綁定)。儲存庫裡附的是「可讀的參考實作」而非正式推論引擎,官方自己這麼寫。

反向交代不受影響的人:只用 DeepSeek App 或網頁版聊天的一般用戶,介面裡不會看到任何切換開關,體驗變化由官方慢慢推;使用其他家模型的開發者,這波定價與路由調整完全碰不到你。真正需要盯著行事曆的,只有把 v4-pro 放進生產環境的 API 呼叫方。

帳單前後差異:離峰輸出降約七成,輸入快取命中降最多

官方定價頁的現行價格(每百萬 token 計)整理如下,左欄是被路由前的 v4-pro 價,右欄是 9 月 14 日起同一個請求實際負擔的 Flash 價:

DeepSeek 官方 API 定價頁的 Models & Pricing 表格,列出 deepseek-flash 與 deepseek-v4-pro 兩個模型的輸入輸出價格、快取命中價、上下文長度與並發上限Pin
官方定價頁:deepseek-flash 輸出離峰每百萬 token 0.60 美元,v4-pro 為 1.98 美元(圖片來源:DeepSeek API Docs)
計費項目(每 1M token)deepseek-v4-prodeepseek-flash
輸出,離峰$1.98$0.60
輸出,尖峰$3.96$1.20
輸入(快取未命中),離峰$0.66$0.15
輸入(快取命中),離峰$0.022$0.003

換算成降幅:離峰輸出從 1.98 美元到 0.60 美元,降 69.7%;輸入未命中降 77%;快取命中的輸入從 0.022 到 0.003 美元,降幅約 86%,是所有項目裡最凶的一格。反過來讀也成立:重度依賴系統提示與工具定義的 agent 工作流,把固定前綴放進快取更划算,命中與未命中的價差從舊模型的 30 倍拉大到 50 倍。這些百分比與倍數是我用官方兩欄價格相除算出來的,官方新聞稿沒有提供降幅數字。另外,並發上限從 Pro 的 500 放寬到 2500。

尖峰與離峰的定義值得抄下來:週一至週五 UTC 01:00 到 04:00、06:00 到 10:00 是尖峰,換算台北時間就是上班日的上午 9 點到 12 點、下午 2 點到 6 點,其餘時段與整個週末都是離峰半價。換句話說,台灣開發者的白天正是計費最貴的時段,把批次工作排進晚上,輸出成本直接對半。

成績單要分開讀:代理任務多項最佳,極限推理仍落後

官方 model card 的比較表把 V4.1-Flash 對上 Claude Opus 5.0、GPT-5.6 Sol、Kimi K3、GLM-5.3,加上自家 V4-Pro 與 V4-Flash,全部用內部評測框架、最高推理力度跑分。贏面集中在代理型任務:軟體工程修復 DeepSWE v1.1 拿 74.2,比 Opus 5.0 的 74.0 高 0.2 分;資安攻防 CyberGym 拿 88.1,拉開對手 3.6 分;自動化工作流 AutomationBench 拿 54.8;終端指令 Terminal-Bench 2.1 拿 90.6;Agent’s Last Exam 拿 31.8;競賽程式 Codeforces 評分 3471。對自家前代的拉開幅度更大,V4-Pro 在這幾項分別是 62.7、83.3、43.2、87.9、25.7、3348。

DeepSeek-V4.1-Flash HuggingFace model card 的前沿模型比較表,欄位包含 Opus-5.0、GPT-5.6 Sol、K3、GLM-5.3、DS-V4-Pro、DS-V4-Flash 與 DS-V4.1-Flash,列出推理與代理型基準分數Pin
官方 model card 比較表:代理型任務多項拿下最佳,Terminal-Bench 3.0 與 HLE 仍由對手領先(圖片來源:HuggingFace DeepSeek-AI)

但同一張表裡輸掉的項目也很清楚。Terminal-Bench 3.0 拿 30.0,Opus 5.0 是 43.3,GPT-5.6 Sol 是 34.4;更新的 Terminal-Bench 4.0 拿 31.2,Opus 5.0 是 51.8;號稱人類最後考試的 HLE 拿 36.8,Opus 5.0 是 56.3;GPQA Diamond 90.9,輸給 GPT-5.6 Sol 的 94.1;資安類的 SEC-Bench Pro 與 ExploitGym 也都由 GPT-5.6 Sol 領先。允許呼叫工具的 HLE with tools 反而以 63.9 微幅高於 Opus 的 63.6,不過這個差距同樣落在官方定義的同級範圍內。把 DeepSWE 那 0.2 分的差距講成「擊敗 Claude」,是把同級差距讀成了超車,官方在 model card 另處的表註寫明 0.3 分以內視為同等級。

所以這張成績單的正確讀法是:需要反覆呼叫工具、讀大量程式碼、多步驟執行的工作負載,新模型用遠低於對手的價格拿到第一排位置;需要極限推理深度或專業資安能力的任務,西方旗艦仍然明顯在前。另外別忘了整張表都是 DeepSeek 自家的評測框架產出,等第三方復測出來之前,分數該當參考訊號而非定論。

890 bytes 的 KV 快取,是這次降價的底氣

模型讀長文時要替每個 token 保留一份鍵值快取(KV cache),可以想成模型邊讀邊抄的筆記,抄越多份、伺服器記憶體吃越兇。V4.1-Flash 把這本筆記壓到每 token 890 bytes,約是前代 V4-Flash 的四分之一、2023 年初代 V1 的四百三十七分之一;換算一下,塞滿一百萬 token 的上下文,這份快取的佔用約 0.89 GB。手段是把三件事疊起來:注意力層之間共享快取與索引、把主要鍵值改用 FP4 低精度儲存、再加上讓滑動視窗內的筆記可以重播重建,官方文件稱後者讓持久化足跡再壓到前代的八分之一。

另一個省錢設計是不對稱激活:讀輸入用 8B 的小隊,寫輸出換 16B 的正規軍,輸入密集的 agent 工作流(一次塞整個程式碼庫進去那種)正好踩在省最多的那一側。這些架構名詞不需要記,CED、CSA2、Engram 是 DeepSeek 的內部分類法;對使用者有意義的只有結果:同樣一百萬 token 的上下文,服務端記憶體成本大幅下降,而這正是官方敢讓 1.6T 旗艦退役、把輸出價砍到 0.60 美元的成本基礎。

現在要做什麼:多數人不用動,生產環境先跑測試

多數人什麼都不必做。9 月 14 日中午起路由與計費自動切換,帳單只會降不會漲,這是官方單方面的讓利結構。擔心的是行為特性:v4-pro 換成新模型後,輸出風格、工具呼叫習慣、極端案例的表現都會變,建議在 14 日之前用 deepseek-flash 端點跑一遍自己的測試集,測項涵蓋工具呼叫正確率、長上下文檢索與輸出格式穩定性這三類最容易因換模型而漂移的項目,因為切換之後沒有退回前代的路;想先快速比對兩個模型的回應速度與穩定性,可以借助開源的 LLM API Test 從瀏覽器直接實測。已經在長期監控 token 消耗的團隊,可以沿用既有的 DeepSeek API 用量監控工具對照切換前後的消耗結構;在終端環境裡操作模型的開發者,官方這次同步把 DeepSeek Harness 開發者預覽上架,桌面端也有現成的外殼工具可用。

切換前值得認識兩個新參數。官方把 thinking 模式設為預設開啟,模型會先推理再回答,不需要推論的批次工作可以明確關掉省時間;推理力度 reasoning_effort 在 model card 上是 1 到 100 的連續整數,不再是固定幾段檔位,成本敏感的任務可以壓低力度換速度。另外 API 同時提供 OpenAI 相容與 Anthropic 相容兩種端點,後者代表走 Anthropic 協定的客戶端,把 base URL 指到 api.deepseek.com/anthropic、模型名填 deepseek-flash 就能接上,這是端點規格的直接推論,個別工具的實際相容性仍以自己跑過為準。對拿西方旗艦當主力、想找便宜備援的台灣開發者,這條路最短。

批次型工作排程進台北時間晚上與週末,直接吃離峰半價,這在任何切換之前就成立。考慮自架的人,把 484.6 GB 權重、自製 prompt 編碼、參考級推論實作三件事加起來再評估;對多數團隊,API 加離峰排程是務實得多的起點。

還沒確定的事:V4.1 Pro 時程與第三方復測

三件事留在未定狀態。V4.1 Pro 的推出時程官方隻字未提,註解只寫「直到 V4.1 Pro 推出為止」,被路由的用戶等的是一個沒有日期的承諾。資本市場動態方面,路透社 9 月 9 日獨家報導並經科創板日報跟進:DeepSeek 已委託中信證券籌備上海科創板上市,中信已進場盡調,此前 4 月開啟的首輪融資於 6 月交割、募資逾人民幣 500 億元、投後估值超過 3,500 億元;兩則報導都來自知情人士,記者致電 DeepSeek 未獲官方回應,在公司證實之前,這條線只能當傳聞看。同批報導給了市場座標:智譜今年 1 月 8 日已在港股掛牌,報導稱其市值一度站上兆元港幣後回落,中國一線模型公司正把上市當成下一個集體戰場,DeepSeek 是這條隊伍裡最受矚目的排隊者。最後,所有基準分數的第三方復測、以及 9 月 14 日切換後的實際輸出表現,都還需要時間沉澱。

時效聲明:本文價格、路由與基準數字以 9 月 10 日晚間的官方頁面為準;9 月 14 日中午路由生效前後,建議再核一次官方定價頁,V4.1 Pro 或後續模型發布時,本文的除役與價格段落即告過時。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1209

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...