LongCat-Flash-Chat 開源大模型權重免費可商用,採用前先看清門檻

LongCat-Flash-Chat 是美團 2025 年開源的 560B MoE 大模型,權重以 MIT 釋出可免費商用,但模型已凍結一年、官方 API 也改賣 LongCat-2.0。本文拆解自架硬體門檻、官方評測解讀、2.0 定價與同級開源 MoE 替代,幫你判斷今天還要不要採用。

用 AI 摘要這篇文章:

2025 年 8 月底,美團的 LongCat 團隊把一個 5,600 億參數的開源大模型放上 GitHub 與 Hugging Face,名字叫 LongCat-Flash-Chat。當時它以代理任務(讓模型自己呼叫工具、分步驟完成工作)的成績引起不少討論。一年過去,還會搜到它的讀者,心裡通常有三個問題:這個模型現在還拿得到嗎?自己架要付出什麼?如果只是想用 LongCat,是不是已經有別的路?

三個問題的短答:拿得到,權重免費、MIT 授權、可商用,但模型本身已經將近一年沒有更新;自己架的門檻是資料中心等級,官方部署指南開出的最低規格是一整個節點裝 8 張 H20 顯卡;而官方的付費 API 平台上,按用量計費的模型清單裡已經沒有它,只剩 2026 年 6 月發表的 LongCat-2.0。

換句話說,LongCat-Flash-Chat 今天的位置是:一個權重仍然開放、但已經被自家新旗艦接棒的起點作品。這篇導覽以官方文件、模型卡與 API 平台的現況為準,把三個問題各自展開,最後收斂成採用前的判斷軸。文中的評測分數都來自官方自行發布的資料,性質上是官方說法,先講清楚。

還拿得到嗎:權重免費、MIT 可商用,但凍結在 2025 年 9 月

先確認最基本的事:模型還在,而且合法免費。Hugging Face 上的 meituan-longcat/LongCat-Flash-Chat 近 30 天下載量超過 4 萬次、累積 537 個喜歡,GitHub 儲存庫有 1,364 顆星。授權條款寫得明確:模型權重與程式碼都以 MIT 釋出,可以免費使用、修改、商用與再散布,唯獨不授予美團的商標與專利權。對想拿去做產品的人,這是相當寬鬆的條件。

LongCat-Flash-Chat 官方 GitHub 儲存庫的模型介紹頁面,開頭說明 560B MoE 架構與動態激活參數Pin
LongCat-Flash-Chat 官方 GitHub 儲存庫的模型介紹開頭(擷取時間 2026 年 8 月)

但「拿得到」與「還活著」是兩回事。模型卡的最後更動停在 2025 年 9 月 24 日,之後將近一年,權重沒有再更新過。GitHub 儲存庫表面上仍在維護,看進 2026 年的變更紀錄,內容幾乎全是微信群 QR 圖的替換,沒有模型或程式碼層面的實質推進。對一個模型專案來說,這種狀態就是凍結,不是活躍。

凍結的原因,看家族時間線就明白:LongCat-Flash-Chat 之後,團隊在同一條產線上持續推出新成員,資源自然往新模型移動。

社群面倒是沒有收攤跡象:README 上仍留著 Discord 社群、X 帳號與 [email protected] 聯絡信箱,2026 年 7 月還有開發者在儲存庫的 issue 裡詢問 API 免費額度的申請。對採用者的意義是:出了問題找得到人、找得到社群,但不要期待這個版本本身再收到功能更新,安全修補與能力改進都會落在後續世代。

時間成員定位
2025 年 8 月底LongCat-Flash-Chat560B 對話基礎模型,非思考型,主打代理任務
2025 年 9 月LongCat-Flash-Thinking思考推理變體
2025 年 10 月LongCat-Flash-Omni多模態變體,附技術報告
2026 年 1 月LongCat-Flash-Lite、Thinking-260168.5B 輕量版與新思考版
2026 年 3 月LongCat-Flash-ProverLean4 形式化數學證明專用
2026 年 6 月底LongCat-2.01.6 兆參數新旗艦,1M 長情境,權重同樣 MIT 上架
LongCat 開源家族一年內的演進(資料範圍:GitHub 與 Hugging Face 的 meituan-longcat 帳號,2026 年 8 月查核)

這裡有個容易被誤傳的點值得說清楚:美團並沒有走「開源打響名號、然後收回去賣閉源服務」的劇本。2026 年 6 月底發表的 LongCat-2.0 是 1.6 兆參數的 MoE 模型、支援 100 萬 token 情境長度,官方介紹寫明它在中國自研加速器叢集上完成訓練,而它的權重同樣以 MIT 授權放上了 Hugging Face。開源這條路沒有斷,只是旗艦換了人,被留在原地的是 Flash-Chat 這一代。

560B 只動用 27B,省的卻不是你的部署成本

LongCat-Flash 最常被引用的賣點是「又大又省」,這句話需要拆開看。大,是指總參數量 5,600 億;省,是指它用混合專家架構(MoE)運作。可以把 MoE 想成一間有很多位專家的顧問公司,模型每次處理一個 token,只會把相關的幾位專家叫起來工作,其他人休息。官方數字是:每個 token 動態激活 186 億到 313 億參數,平均約 270 億,約佔總量的二十分之一。

架構上還有兩個有名字的設計。零計算專家機制讓不重要的 token 走近乎不計算的捷徑,把運算預算留給重要 token;專家偏置則由一個 PID 控制器動態調節,把每個 token 的平均激活量穩在 270 億附近,避免負載忽高忽低。通訊端採用捷徑連接式的 ScMoE 設計,擴大計算與通訊的重疊視窗,官方據此宣稱推論速度可超過每秒 100 個 token。這個速度數字是官方說法,本文沒有親自架起來驗證,先按官方宣稱看待。

關鍵在於理解「省」省在哪裡。MoE 省的是推論時每個 token 的計算量,但 5,600 億參數的權重一個都不能少,全部要裝進顯示記憶體。對雲端業者來說,每 token 成本降低是真的;對想自己架的人來說,硬體帳單一點都沒有變小,這正是下一節的主題。

另外有個接 API 時會遇到的細節:它的對話格式是自訂的,使用者訊息要用 [Round 0] USER:…ASSISTANT: 這樣的前綴組合,回合結束記號是 </longcat_s>,工具呼叫則包在 <longcat_tool_call> 標籤裡。用 SGLang 或 vLLM 部署時框架會處理,但如果你打算自己串底層,這些格式細節就會實際碰到。

自架門檻:官方部署指南寫得誠實,數字就攤在那裡

官方部署指南第一段就把話說死了:因為模型有 5,600 億參數,FP8 量化版本至少需要一個節點(範例是 8 張 H20-141G),BF16 全精度版本至少需要兩個節點(範例是 16 張 H800-80G)。翻成白話:最低消費是一台裝了 8 張 141GB 記憶體顯卡的機器,這種等級的硬體不存在於個人工作室,租用一整節點的行情大約每小時數十美元起跳。

不熟悉量化的讀者,FP8 可以這樣理解:模型權重原本以 16 位元精度的 BF16 格式存放,FP8 把每個數字壓到 8 位元,檔案直接減半,換來的是輕微的品質折損,這已經是部署大型模型的標準省法。就算吃了這個減半紅利,5,600 億參數仍然裝不進任何單張消費級顯卡,這就是數字的殘酷之處。

版本最低需求約當記憶體總量
FP8 權重(meituan-longcat/LongCat-Flash-Chat-FP8)一節點,8 張 H20-141G約 1.1TB
BF16 全精度權重兩節點,16 張 H800-80G約 1.3TB
官方部署指南開出的最低硬體需求(H20 與 H800 皆為 8 卡伺服器常見配置)

好消息是工程整合已經上游化:SGLang 與 vLLM 兩大推論框架都收了 LongCat 的支援程式碼,官方也提供多 token 預測(MTP)的投機解碼設定來壓延遲。官方文件給的單節點啟動命令一行就能核對:python3 -m sglang.launch_server --model meituan-longcat/LongCat-Flash-Chat-FP8 --trust-remote-code --attention-backend flashinfer --enable-ep-moe --tp 8。還有一個小提醒:Hugging Face 上的模型標了 custom_code,用 transformers 直接載入需要開啟信任遠端程式碼的選項,資安上自己衡量。

官方評測怎麼讀:代理任務真的強,長文圖遊走是明顯弱項

README 裡有一張與 DeepSeek V3.1、Qwen3 MoE-2507、Kimi-K2、GPT-4.1、Claude 4 Sonnet、Gemini 2.5 Flash 的對照表。先講讀法:這是官方自行發布的評測,對手多半以非思考模式受測(官方有註記),分數僅供選型參考。帶著這個前提,表裡的形狀其實蠻有資訊量的。

基準LongCat-Flash表內最佳對手
τ²-Bench 電信情境(客服代理模擬)73.68Kimi-K2 67.50
VitaBench(代理綜合)24.30Claude 4 Sonnet 23.00
GraphWalks-128k(長文圖遊走)51.05GPT-4.1 85.02
MMLU(通識)89.71Claude 4 Sonnet 91.75
LiveCodeBench(程式)48.02DeepSeek V3.1 56.40
官方評測表節選:代理類基準拿下表內最高分,長情境圖形任務卻明顯落後(資料來源:LongCat-Flash-Chat README,官方自行發布)

形狀很清楚:代理任務是它的主戰場,τ²-Bench 電信情境的 73.68 是該基準全排最高,VitaBench 也以些微差距領先;但 GraphWalks-128k 只有 51.05,落後 GPT-4.1 的 85.02、Qwen3 的 80.72 一大截,說明 128k 長情境裡做多跳推理時的可靠度是它的弱項。通識與程式項目落在中段,不算頂尖。安全欄位裡的隱私保護項拿到 93.98,落後所有對手(對手落在 96.39 到 100 之間),官方表內的相對弱項,反而值得參考。

對應到使用決策:如果你的應用是工具呼叫密集的代理流程(訂單查詢、多步驟工作流程),它的官方成績確實有吸引力;如果是超長文件的結構化推理,這個版本不該是首選。

不自己架的話:官方 API 現在只賣 LongCat-2.0

很多人聽過的「百萬 token 人民幣 5 元」說法,需要放到今天的平台現況裡重新對帳。LongCat 的 API 平台文件寫得直接:按用量計費目前支援的模型只有 LongCat-2.0 一個。官方變更紀錄把話說得更白:2026 年 5 月 29 日起,平台退役了 LongCat-Flash-Chat、Flash-Lite 等 6 個舊模型的 API 服務,把資源集中給 2.0。也就是說,你已經無法向美團購買 LongCat-Flash-Chat 的推論服務,想走官方 API,走的就是 2.0。

LongCat-2.0 API 官方定價表,輸入每百萬 token 人民幣 5 元,輸出人民幣 20 元,限時價 2 元與 8 元Pin
LongCat API 平台目前的按量計費定價,唯一支援的模型是 LongCat-2.0(擷取時間 2026 年 8 月)
計費項牌價(每百萬 token)限時價
輸入(未快取)人民幣 5 元(美元 0.75 元)人民幣 2 元
輸入(快取命中)人民幣 0.10 元人民幣 0.04 元
輸出人民幣 20 元(美元 2.95 元)人民幣 8 元
LongCat-2.0 API 定價(官方定價頁,查核時間 2026 年 8 月;限時價與牌價隨時可能調整)

對帳的時候把輸入與輸出分開看才不失真:5 元只是輸入牌價,輸出是 20 元,兩者差 4 倍,真實成本要用輸入輸出加權平均來估,官方也標明平台與帳單數字才是最終依據。規格面上 2.0 已經是不同世代:100 萬 token 情境長度、單次回應最長 12.8 萬 token,API 端點在 api.longcat.chat,同時支援 OpenAI 與 Anthropic 兩種訊息格式,後者代表可以直接掛進 Claude Code、Cline、OpenCode、Kilo Code 這類 coding 工具,官方文件為每一種都寫了接法。想比較這類工具的人,可以先看 39 款 AI coding 助手對比表再決定要把 2.0 接到哪裡。

採用前也把營運主體看清楚:平台由北京酷訊互動科技(美團體系公司)營運,站點持中國 ICP 備案,服務條款與隱私政策頁都存在。對一般開發者是中性的背景資訊;但若你的應用涉及個資或敏感資料,資料落地與適用法律的評估就該在採用前做完,這是所有跨境 API 服務都會遇到的課題,LongCat 並不例外。

同級開源 MoE 怎麼挑:家族內外都有更實用的選擇

如果你其實沒有非 Flash-Chat 不可的理由,只是想找一個可自架的開源 MoE,那麼對照組就在官方自己的比較表裡:DeepSeek V3.1 是 671B 總參數、37B 激活;Qwen3 MoE-2507 是 235B 總參數、22B 激活;Kimi-K2 是 1043B 總參數、32B 激活。其中 Qwen3 的 235B 體積,對有 2 到 4 張高階顯卡的團隊是最現實的量級,它的量化版本在社群裡的支援也最廣。想知道多家模型擺在一起誰適合你的任務,可以參考 多家 LLM 同場會診的開源面板的作法,把候選模型放進同一批題目再淘汰。

真想要 LongCat 家族的味道,家族內就有更實際的選擇:2026 年 1 月上架的 LongCat-Flash-Lite。它是 685 億總參數、平均激活約 30 億的輕量 MoE,靠 YaRN 方法把情境長度拉到 256k,同樣 MIT 授權。官方模型卡寫明用 transformers 載入至少需要 2 張 80GB 記憶體的顯卡(H100 或 A100 等級),這是租一台雙卡機器就摸得到的門檻,與 Flash-Chat 的一整節點是兩個世界。它也是家族裡少數帶著新架構實驗的版本:把超過 300 億參數放進 N-gram(N 元連字)嵌入表,用嵌入擴充取代部分專家擴充,官方說這在特定規模區間是更有效率的縮放路線。

另外兩種常見的部署形態也值得記住。想自己架一個完整的 AI 服務層、模型用 BYOK 方式接,可以看 GeekAI 自架 AI 助手平台的架構拆解;想看開源產品怎麼挑底層模型,SQLBot 開源問數系統就是一個把模型選擇攤開來討論的實例。模型從來不是孤立決策,它掛在什麼工程形態裡,往往比評測分數更影響體感。

授權、活躍度與採用判斷:三條路只挑一條走

把前面所有線索收攏。授權面:MIT 含權重、可商用、免費,法律風險低,這一關乾淨。活躍度面:模型凍結在 2025 年 9 月,儲存庫 2026 年只剩維護性變更,官方 API 也不再把推論服務賣給它,三件事放在一起,合理的推論是官方資源已經整體移轉到 2.0 與新家族成員上,Flash-Chat 得到的是封存級的對待,不是持續支援。

所以今天的採用判斷其實是三選一。手上有整節點算力、任務形態剛好命中代理強項、且能接受模型不再更新的人,抓 FP8 權重自架仍然成立,MIT 授權保證它不會消失。想要 LongCat 最新能力、不想碰硬體的人,走 2.0 的 API,按輸入輸出分開計價抓成本,再把資料落地評估做完。而大多數只是想找開源 MoE 的人,Qwen3 這個量級的活躍模型,或是家族內的 Flash-Lite,都會是更經濟實惠的起點。

反過來說,兩種人現在不必碰它:想找「會持續更新的開源旗艦」的人,它給不了;以及把長文件多跳推理當核心負載的人,官方評測裡的 GraphWalks 落差已經把話說明白。開源模型的好處是選擇權永遠在你手上,一年後回看,LongCat-Flash-Chat 留下的價值是把代理任務這個方向的門推開了,至於今天要不要走進去,按自己的算力與任務形態決定就好。技術報告有興趣的話,團隊在 arXiv 編號 2509.01322 有完整文件可以查。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1007

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...