Awesome Open Source AI 開源 AI 清單,用腳註標出真開源的尺寸

Awesome Open Source AI 是一份以 CC0 釋出的 GitHub 開源 AI 資源清單,用 OSI 定義當篩子,並用腳註把 Qwen 2.5 等家族的開源範圍標到單一尺寸;本文逐一核對 HuggingFace 授權現況,並攤開它凍結在 2025 年 1 月的維護事實。

用 AI 摘要這篇文章:

「開源」兩個字在 AI 模型圈正在快速貶值。模型卡上寫著 open source、新聞稿裡喊著 open source,但下載之後才發現授權條款禁商用、限研究用途,或者根本只開放了權重、訓練資料與程式碼都看不到。這時候一份名為 Awesome Open Source AI 的 GitHub 清單提供了很不一樣的東西:它把「開源」的判斷顆粒度,一路標到模型的單一尺寸。

這份清單由署名 suncloudsmoon 的開發者維護(GitHub 帳號的自述欄只有一句 I love cycling),2024 年 12 月 22 日開張,以 CC0-1.0 釋出,截至 2026 年 9 月約 306 顆星。它收錄推理引擎、語言模型、嵌入模型與工具,篩選標準寫得很明白:盡可能符合開放原始碼促進會(OSI)的開源定義。整份清單最有價值的東西藏在四條不起眼的腳註裡,這篇會把它們拆開看;同時也要先把話講在前面:這是一份凍結在 2025 年 1 月的快照,它的判斷法歷久,它的清單內容不新。

GitHub 上 suncloudsmoon/awesome-open-source-ai 儲存庫頁面,顯示 306 顆星與 CC0-1.0 授權標示Pin
Awesome Open Source AI 的 GitHub 儲存庫首頁:約 306 顆星、CC0-1.0 授權、README 開頭標明以 OSI 開源定義為篩選標準。

同一個家族,開源的只有幾個尺寸

先看這份清單最精華的設計。在語言模型區,Qwen 2.5、Qwen 2.5 Coder、Qwen2.5 VL、InternVL 2.5 四個條目各自掛著編號腳註,內容是:

  • Qwen 2.5:3B 與 72B 兩個尺寸不開源
  • Qwen 2.5 Coder:3B 尺寸不開源
  • Qwen2.5 VL:只有 7B 開源
  • InternVL 2.5:只有 1B 與 38B 開源

這四行字背後是一個很容易被忽略的事實:模型家族的名字不等於授權保證。Qwen 2.5 不是一個開源模型,它是一座貨架,架上每個尺寸的授權條款可以不一樣。HuggingFace 上這個家族各尺寸的授權標籤現況是:7B-Instruct 掛 apache-2.0,3B、72B 與 Coder 的 3B 掛的是 Qwen 自訂條款,其中 3B 兩款限研究用途,72B 允許商用但設有月活躍用戶門檻,沒有一份是 OSI 認可的開源授權,與腳註的說法對得上。換句話說,一個想在商用產品裡用 Qwen 2.5 的人,選 7B 拿到的是標準開源授權,選 3B 就掉進限研究用途的條款裡;兩個決定只差一個型號數字。

README 頁尾的四條授權腳註,逐條標明 InternVL 2.5 與 Qwen 2.5 系列哪些尺寸不是開源Pin
清單 README 的四條腳註:逐條標出 Qwen 2.5、Qwen2.5 VL、InternVL 2.5 家族裡哪些尺寸不在開源範圍。

腳註也會過期,這裡就有一個現成的例子。清單說 InternVL 2.5 只有 1B 與 38B 開源,但 HuggingFace 上現在的授權標籤是:1B、2B、4B、8B、26B、38B 六個尺寸全是 MIT,只有 78B 掛自訂授權。腳註寫下的當下也許是對的,但授權狀態會變,連這麼謹慎的清單都會落後。所以比背下任何清單更值得帶走的是方法:到 HuggingFace 模型頁右側看授權標籤,而且要看你要下載的那一個尺寸的頁面,不是家族首頁。掛 apache-2.0 或 MIT 的是開源軟體;掛 other、自訂條款名稱的,條款裡常藏著用途限制。

這也是為什麼清單開頭那句「盡可能符合 OSI 定義」值得注意。OSI 定義延續自由軟體運動的四項自由精神、列成十項條件,把「能不能商用、能不能改、能不能再發布」一次講清楚;拿它當篩子,等於把判斷標準從各家的行銷說詞,移到一份中性的公共定義上。對照之下,2025 年初聲量最大的 Llama 家族並不在這份名單上,Meta 的自訂授權條款不在 OSI 核可之列;名單收的 DeepSeek-R1 是 MIT(在 GitHub 上超過 9 萬顆星)、IBM Granite 是 Apache 系授權、AllenAI 的 OLMo 2 更是連訓練流程都開出來的全開源模型。作者沒有明說排除過誰,但收錄方向與 OSI 篩子一致這件事,從名單上一眼就看得出來。

開源成色可以分成三層看

把腳註的邏輯延伸出去,模型的開源成色其實可以分三層讀。

最扎實的一層,是連訓練過程都開出來的模型。名單裡的代表是 AllenAI 的 OLMo 2:資料、程式碼、訓練腳本與權重全部公開,外部研究者可以重現、改作、驗證。清單給它的描述是全流程開源,這是作者的評語,但 OLMo 系列的開放程度在圈內有共識,位於這個等級的模型至今仍是少數。

中間的一層,是家族裡的特定尺寸開源。Qwen 2.5 的 7B 掛 apache-2.0,DeepSeek-R1 以 MIT 釋出程式碼與權重,授權條款本身是標準開源授權,下載、商用、修改的權利都拿得到;但訓練資料不見得完整公開,模型的可重現性打了折扣。對多數應用場景來說,這一層已經夠安全,關鍵只在於選對尺寸。

最外圈是自訂授權。Qwen 2.5 的 3B 與 72B、InternVL2.5 的 78B,在 HuggingFace 上掛的都是自訂條款而非公認的開源授權。這類條款多半限制商業用途或附加其他義務,能不能用、怎麼用,要逐條讀條款原文,不能靠開源兩個字帶過。

這個分層與 OSI 定義的關係很直接:OSI 核可的授權條款(MIT、Apache-2.0、GPL 系)自帶完整的自由度保證,條款本身就是保證書;自訂條款則每一份都得單獨檢驗。Awesome Open Source AI 把篩子放在 OSI 定義上,等於預設排除最外圈,再用條目腳註處理中間層的尺寸陷阱,這套組合就是它與一般「開源模型大集合」最不一樣的地方。

換代規則寫在貢獻指引裡,然後從未兌現

這份清單的貢獻指引(CONTRIBUTING.md)只訂了三條規則:資源要符合 OSI 開源定義、條目要按字母排序,以及最有意思的一條:新版資源上市時,舊版必須被替換掉,作者自己舉的例子就是「Qwen 3 出了,Qwen 2.5 就要被換掉」。

這條規則現在讀起來有點傷感。Qwen3 確實上市了,HuggingFace 上的建檔時間是 2025 年 4 月底,而且掛的是 apache-2.0;但這份清單的語言模型區至今仍是 Qwen 2.5 一族。整個倉庫的提交紀錄停在 2025 年 1 月 27 日,總共 15 個提交、全部出自同一人之手,從開張到停筆只有 36 天。這是一場一個人的衝刺,衝完就停了。

停更的實際影響要分區看。模型區傷得最重:2025 年 1 月之後上市的模型一個都不在名單上,對想找最新模型的人,這份清單幫不上忙。引擎區傷得輕:llama.cpp、Ollama 這些專案自己還在活躍維護,清單只是個入口,入口舊一點無所謂。工具區居中:Open WebUI 仍在高速迭代,但名單上另外兩個工具條目其實是同一位 Kaggle 帳號的筆記本,這點後面再談。

順帶一提這類專案在 GitHub 上的文體背景。以 Awesome 命名、掛徽章、字母排序的清單在 GitHub 上自成一種傳統,標準劇本是單人開張、累積星星、靠外部拉取請求眾包維護,做出貢獻指引正是那個文體的配備。這份清單的前半場照著劇本走,後半場沒有等到社群接手:它的換代規則與排序規則都還寫在檔案裡,只是從 2025 年 1 月底起,沒有人再執行它們。同文體裡維持數萬顆星、每天都有提交進場的大清單確實存在,差距不在規則設計,在人有沒有一直都在。

拉取請求列表則是另一個現場。2026 年陸續有人上門提議收錄新資源,到 9 月為止掛著 8 個未結的拉取請求,全部零討論;被關掉的請求也沒有任何一筆對應的收錄動作進到倉庫,因為 2025 年 1 月底之後提交紀錄再沒有動過。提案的人等不到答覆,這份清單對它自己的貢獻規則來說,已經處於無人執法的狀態。

21 個條目實際的長相

把整份清單攤開清點,實際收錄 21 個條目:推理引擎 4 個、語言模型 10 個、嵌入模型 2 個、語音合成 1 個、工具 4 個。目錄上雖然列了七個分類,圖像模型、語音轉文字、影片模型三區都還是 Coming soon 的佔位文字。每個條目的格式統一:名稱、連結、一句話理由;貢獻規則要求按字母排序,實際各區執行得不算嚴謹。

幾個條目的一句話理由本身就有判斷含量。llama.cpp 被描述為「精簡的推理引擎,提供比 Ollama 更多的輸出控制選項」;Ollama 是「好上手,附 OpenAI 相容的 API 伺服器」;koboldcpp 則被稱為 LLM 推理引擎的瑞士刀。這三條合起來其實就是本地跑模型的選型骨架:要控制細節選 llama.cpp,要省事選 Ollama,要一次滿足多種 API 端點選 koboldcpp。清單把 OpenedAI Speech 這個語音合成伺服器也放在引擎區,分類上有一點混,但無傷大雅。

實際的起手式,多數人會從 Ollama 開始:裝好之後一行 pull 指令就能把模型拉下來跑,模型庫頁面會標示每個模型的參數量與授權,對照清單腳註的習慣,先確認自己要的尺寸掛的是哪種授權再下載,流程相當單純。願意碰參數的人再往 llama.cpp 走,量化、執行緒、取樣策略都開放出來調;koboldcpp 把多種 API 端點包在一起,接舊前端特別方便。這三個引擎到 2026 年都還在活躍維護,是整份清單裡凍結傷害最小的區塊。

條目描述裡也有誠實的刺。Phi-4 的描述先誇它在中型模型的各項基準測試表現頂尖,括號裡緊接著補一句「Phi 系列在基準測試之外通常表現不如預期」;Qwen 2.5 的描述提醒它在數學等任務拿高分的同時,特定主題可能遭遇內容審查;OLMo 2 被標注為全流程開源;SmolLM2 則被老實說成「適合把玩與做摘要,不太適合拿去微調」。語言模型區還有一個 Qwen 2.5-1M,主打百萬 token 的上下文長度,清單舉的例子是 Podcast 生成這類長上下文任務。嵌入模型區只有兩個條目:BGE-EN-ICL 的賣點是 MTEB 排行榜上的成績,all-MiniLM-L6-v2 的賣點是小到能在低階消費級硬體上跑。語音區目前只有 Kokoro 一個 82M 參數的 TTS 模型,以它的體積而言評價不俗。以上都是清單作者自己的評語,但敢在一句話理由裡寫下基準測試之外的保留意見,這種口吻在行銷導向的清單裡很少見。

連結品質倒是經得起考驗。到 2026 年 9 月,名單上所有對外連結仍連得上、沒有死鏈,連 2024 年的 Kaggle 筆記本都還活著。凍結的清單不等於失效的清單,這點對它的可用性有很大的補償。

工具區洩漏了單人策展的指紋

工具區的 4 個條目裡藏著這份清單最明顯的策展偏誤訊號。其一,TextCraft 是維護者自己的專案:一個把 AI 工具整合進 Microsoft Word 的 C# 增益集,MIT 授權、161 顆星,最後更新停在 2024 年 12 月,比清單本身還早凍結。自己維護清單、把自己的作品放進工具區,不算什麼大過,但讀者應該知道這層關係。其二,另外兩個條目是同一位 Kaggle 帳號(thomasanderson1962)的筆記本,一個微調腳本、一個用視覺模型從 PDF 生成合成資料集;Kaggle 筆記本能不能算開源資源、授權歸誰,標準明顯比模型區寬鬆。四分之一的工具區繫於作者自己的作品,另外一半繫於單一第三方帳號,這個分佈本身就說明了單人清單的上限:規則是 OSI,執行是手感。

把這些放在一起看,這份清單的信任模型其實很清楚。它不是一個組織維運的目錄,是一個人 36 天衝刺的快照;它的價值不在於持續更新,而在於示範了一種把授權顆粒度標到尺寸的作法,以及一批經過篩子過濾、到今天連結還全部活著的 2025 年初經典模型。

拿它當起點的三種情境,與兩種不該

適合把這份清單當起點的人,大概有三種情境。想學「怎麼判斷一個模型是不是真的開源」的人,那四條腳註加上 HuggingFace 授權標籤的對照,是最現成的教材。想部署 2025 年初那批經典模型的人,DeepSeek-R1、OLMo 2、Phi-4、Granite 3.1 都在那個時間區間的定格裡,搭配仍在活躍維護的 llama.cpp 與 Ollama,起手成本低;對中文場景來說,Qwen 家族一直是中文能力的熱門選擇,這也讓「家族裡挑哪個尺寸」的授權問題,對中文開發者格外實際。要在本地把模型跑起來做實際工作的人,可以接著看 Local Deep Research 這類以本地模型為引擎的研究工具,或 MTranServer 這種自架離線翻譯伺服器的實例,兩者都示範了開源模型落地之後能做什麼。

不適合的情境同樣明確。要找 2026 年最新模型的人,直接去 Ollama 的模型庫或 HuggingFace 排行榜,那裡的東西比這份清單新一年半以上;Qwen 家族這一年多的演進,可以參考 Qwen 的開放權重策略一文裡的脈絡。要把清單當長期維護目錄引用的人,也要想清楚它已經 20 個月沒有執行過自己的收錄規則;同為 GitHub 上的策展清單,Awesome MCP Servers 那種持續有提交進場的,才是可長可久的引用來源。

最後一個加分項:清單本身以 CC0-1.0 釋出,等同公共領域,任何人想接手 fork 一份、照著它自己的規則繼續換代更新,沒有任何授權障礙。對台灣讀者來說,這份 306 顆星的清單最實在的用法,也許就是把它當教材而不是當目錄:花十分鐘看懂那四條腳註在講什麼,之後每次挑模型,自己到 HuggingFace 查那一個尺寸的授權標籤。判斷法是自己的之後,清單新不新,就不那麼重要了。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1574

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...