TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南
TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南

Google AI Edge Gallery 是 Google 官方開源的手機離線 AI App,Android、iPhone、Mac 都能裝,模型下載後斷網也能聊天、看圖與語音轉錄。下載前值得先算三件事:官方模型清單把記憶體門檻切成 6GB、8GB、12GB 三級;側載時通用版安裝包就夠用,高通與 Pixel 另有晶片對應版;而 100% 裝置上隱私指的是推論,分析遙測預設開著,記得進設定關掉。
用 AI 摘要這篇文章:
想讓手機在不連網的狀態下跑大型語言模型,Google 官方給的這條路,目前已經是最省事的起點:不用碰命令列,從應用商店裝好 App、下載一個模型就能開始,之後在捷運隧道裡或處理不想送上雲端的文件時,問答都照常運作。真正會影響你裝或不裝的,反而是三件下載前就該算清楚的事:模型檔案要求的記憶體等級、側載時要挑對安裝包版本,以及它標榜的隱私宣稱究竟涵蓋到哪一層。
AI Edge Gallery 是 Google AI Edge 團隊的開源專案,原始碼以 Apache-2.0 授權,把手機當成離線 AI 的實驗場:內建模型瀏覽器讓你一鍵下載開源模型,之後所有問答、看圖、轉錄都在手機處理器上完成。App 本身免費,Android、iPhone、Mac 三個平台都有安裝管道,台灣的 Google Play 與 App Store 都查得到。它目前的身分仍是官方自己標註的實驗性 Beta,定位是讓你體驗與評估端側 AI,而非一個承諾長期穩定的成品服務。

這個 App 最早給人的印象是「手機上的離線聊天室」,現在的功能面已經寬得多。對話模式除了多輪聊天,新的 Thinking Mode 能展開模型逐步推理的過程,官方說明此模式目前限 Gemma 4 系列模型使用。Ask Image 讓你用相簿或鏡頭的照片提問,請模型辨識物件或解題。Audio Scribe 把錄音即時轉成文字並翻譯,語音轉文字從此不經過雲端。Prompt Lab 則是單輪指令的實驗區,可以手動調整溫度與 top-k 這類生成參數,對照同一句提示詞在不同設定下的輸出差異。
再往外一圈,是讓模型跟手機本身互動的功能。Agent Skills 把模型接上查證與工具,例如用 Wikipedia 做事實查核、呼叫地圖、產生摘要卡片;技能還能從指定網址載入,或到 GitHub Discussions 找社群貢獻的項目,底層支援 MCP 工具協定。這裡有個值得停下來想的信任問題:從網址或社群討論串載入技能,等於把手機上的部分能力交給第三方技能作者,動手前先確認來源可不可信,這跟裝瀏覽器擴充功能是同一種判斷。Mobile Actions 用一個 270M 參數的 FunctionGemma 微調模型驅動離線的自動化操作,Tiny Garden 則是把同一個小模型做成用自然語言種花收成的小遊戲,順便展示小模型能做到哪些事。
對想比較模型的人,內建 Benchmark 會在你自己的硬體上量測模型初始化時間與生成吞吐,並把不同模型的結果放在一起對照。這個設計比任何評測文章都實際:同樣的模型在你的晶片上跑出的數字,才是對你真正有用的數字。要留意的是,上述功能都屬於官方文件與原始碼能確認的「能力存在」,實際回答品質與流暢度隨硬體差別很大,官方文件本來就不給保證。另外三個平台的進度並不同步:Android 是主戰場,版本與模型都最新;iPhone 版在台灣 App Store 是 1.0.10,落後 Android 的 1.0.19;以倉庫唯一的 iOS 模型清單檔來看只有三個模型,實際以 App 內顯示為準。macOS 版目前只釋出 0.1.0 的安裝檔,還在很早期的階段。
離線跑 LLM 最先卡住的是手機的記憶體,技術反而簡單。App 目前的內建模型清單有十個,每個模型的下載體積與官方標示的最低裝置記憶體,都寫在專案的模型設定檔裡,以下是 2026 年 9 月版本 1.0.19 的現況:
| 模型 | 下載體積 | 官方最低記憶體 | 可用模式 |
|---|---|---|---|
| Gemma3-1B-IT(4-bit 量化) | 約 0.58 GB | 6 GB | 聊天、Prompt Lab |
| Qwen2.5-1.5B-Instruct(8-bit) | 約 1.6 GB | 6 GB | 聊天、Prompt Lab |
| DeepSeek-R1-Distill-Qwen-1.5B | 約 1.83 GB | 6 GB | 聊天、Prompt Lab |
| Gemma-4-E2B-it | 約 2.59 GB | 8 GB | 聊天、Agent、看圖、語音 |
| Gemma-3n-E2B-it | 約 3.66 GB | 8 GB | 聊天、看圖、語音 |
| Gemma-4-E4B-it | 約 3.66 GB | 12 GB | 聊天、Agent、看圖、語音 |
| Gemma-3n-E4B-it | 約 4.92 GB | 12 GB | 聊天、看圖、語音 |
| MobileActions-270M | 約 0.29 GB | 6 GB | 離線自動化 |
| TinyGarden-270M | 約 0.29 GB | 6 GB | 小遊戲 |
| Magic touch(實驗項目) | 約 0.03 GB | 未標示 | 相簿剪貼簿 |
清單上七個對話模型也都支援 Prompt Lab 的單輪測試,表裡列出的是各自的主要模式。這份官方數字把手機市場直接切成了三個等級。6 GB 記憶體是整份清單的基本門檻,這個等級跑得動三個純文字模型,入場最便宜的是 Gemma3-1B,下載不到 1 GB,拿來確認「我的手機真的能離線生成」很夠用。8 GB 記憶體才碰得到多模態:看圖、語音轉錄、Agent 功能都從 Gemma-4-E2B 這一級開始。而兩個 E4B 大模型掛的是 12 GB 門檻,對應近兩年的高階旗艦記憶體,記憶體不夠的手機下載時會跳出警告,可以硬裝,但大概率跑不動。看圖問答這類體驗實際上是旗艦機的福利,拿中階機的人先從文字模型建立預期,會比看完宣傳影片後失望來得實際。
模型清單本身也在換血:微軟的 Phi-4-mini 曾經入列、後來退出,Gemma 4 系列是現在的主打,30 MB 的實驗項目 Magic touch 則是最新加入的成員。清單隨版本調整,下載前以 App 內顯示為準。清單之外,你還能自己從 Hugging Face 找社群轉檔的 LiteRT 模型拉進 App,模型來源因此擴及整個社群生態;遇到需要授權同意的 gated 模型,新版會先引導你登入 Hugging Face 並確認模型條款,才開放下載。已下載的模型集中在管理頁面,可以刪除釋放空間,試完不喜歡就清掉,不必讓 3 GB 的檔案一直躺著。
多數台灣讀者從 Google Play 或 App Store 安裝就好,兩邊都有上架。真正的細節在側載:專案 GitHub 的 Releases 頁面一直是最主要的安裝包來源,以 1.0.19 版為例,頁面上的 Android 安裝包有七個檔案,一份是不分晶片的通用版(約 49 MB),另外六款是對特定晶片的建置,四款對應高通近年旗艦晶片(sm8550、sm8650、sm8750、sm8850,約 64 MB),兩款對應 Pixel 的 Tensor G5 與 G6。晶片版是為對應處理器做過建置的變體,照自己的手機挑可以得到更貼合硬體的版本。

不知道自己手機用什麼晶片、或用的是聯發科等其他晶片,拿通用版就對了,它就是給清單沒涵蓋的機種用的。比較要避開的是第三方下載站收錄的舊版安裝包:版本與模型清單都會落後,能用商店或官方 Releases 就別繞路。
README 上那句「100% 裝置上隱私」是最容易讀太快的地方。就推論本身,這句話成立:模型下載好之後,問答、看圖、語音轉錄都在手機上執行,與模型取得和推理相關的對外連線只有兩個目的地,一個是下載模型的 Hugging Face,一個是更新模型清單的 GitHub 原始檔位址,提示詞與圖片不送往任何雲端模型 API。斷網之後推理一切照常,你可以自己用飛航模式驗證。不過連線並非只有這兩個目的地:使用遙測與技能功能的外連是另一回事,下一節拆開講。
但「隱私」不只推論一層。App 原始碼裡內建 Firebase Analytics,記錄的是使用行為事件,例如模型下載、生成動作、技能與 MCP 工具的執行;控制它的設定鍵在原始碼中預設值為「未停用」,也就是分析收集預設開啟,要到設定對話盒裡手動關閉,另外 App 也使用 Firebase 的推播通知通道。想連這層都不要的人有兩條路:裝完先進設定關掉分析收集,或用原始碼自己編譯,公開倉庫的建置設定並未啟用 Firebase 整合,自編版本沒有這層遙測。至於 Google 官方發布到商店的安裝包裡遙測啟用到什麼程度,官方沒有公開說明,這點目前無法確認。
授權也有分層。App 原始碼走 Apache-2.0,是商業友善的寬鬆授權;但它下載的 Gemma 系列模型,使用上另受 Google 的 Gemma 條款約束,那份條款並不是標準開源授權。把這個 App 當個人工具使用沒有疑慮,想在別的產品裡沿用它的模型,就要把這兩層分開讀。
這個專案對寫程式的人有另一層價值:它示範了 Google 官方目前給出的端側 AI 技術組合。模型執行靠 LiteRT,這個接替 TensorFlow Lite 的手機端執行環境,對話與生成走 LiteRT-LM 的推理 API,模型檔則來自 Hugging Face 上的 LiteRT 社群轉檔;MediaPipe 在這一版只用在 Magic touch 的影像分割。倉庫附了完整的開發與建置文件,issue 區也常有人問「怎麼把這些模型接進我自己的 App」,官方的回答基本上就是這份原始碼本身。想在手機產品裡做離線 AI 功能的人,把它當樣板讀一遍,比自己從零試錯省得多。當然,它終究是示範性質的 App,介面與功能取捨都以展示為目標,直接拿去當產品骨架之前,該補的工程化細節不會少。
手機離線跑模型只是本機 AI 的其中一條路,幾條路線其實互補。不確定自己的電腦跑不跑得動本地模型,可以先用 Can I Run AI 免費偵測硬體能負擔哪些模型,把結論再搬回手機上用;想在瀏覽器裡用 WebGPU 跑本地推理與網頁自動化,on-device-browser-agent 用的是同一個運算留在本機的思路;Mac 上想要一個能換模型、記憶留在本機的 AI 助理,可以看 Osaurus;若只是想先感受 OpenWeight 開源模型的問答水準,GPT-OSS 官方試用站不用安裝任何東西。AI Edge Gallery 在這張地圖上的位置,是把同一批開源模型帶到「口袋裡、斷網可用」的場景,代價是手機晶片與記憶體撐不起桌機等級的模型。
裝完之後的使用節奏,建議照這個順序走一遍:先用最小的 Gemma3-1B 確認 App 在你手機上能正常生成,再視記憶體等級往上換模型,8 GB 機種以 Gemma-4-E2B 為目標;模型載入後開飛航模式問一個問題,親眼確認離線可用;如果你在意遙測,第一次進設定就把分析收集關掉。這一圈走完,你會很清楚自己的手機在端側 AI 這條路上的實際底線在哪裡。
台灣可以直接安裝嗎?
可以。Google Play 與 App Store 的台灣區都查得到這個 App,App Store 台灣版目前是 1.0.10,開發者登記為 Google LLC。
iPhone 值得裝嗎?
可以裝,前提是接受兩個落差:iOS 版本進度落後 Android,且以倉庫唯一的 iOS 模型清單檔來看只有 Gemma 3n E2B、E4B 與 Gemma3-1B 三個,實際清單以 App 內顯示為準。想體驗最新的 Gemma 4 與 Agent 功能,目前以 Android 為準。
需要登入帳號嗎?
下載內建清單的模型不用帳號。要從 Hugging Face 匯入需要授權同意的 gated 模型時,才需要登入 Hugging Face 並確認該模型的條款。
舊手機跑不動大模型怎麼辦?
對照上面的記憶體門檻表,6 GB 記憶體的機種跑 Gemma3-1B 或 Qwen2.5-1.5B 這一級仍然可行;真要跑 12 GB 級的模型,比較務實的路線是回到電腦端,先用硬體偵測工具確認再選模型。
專案本身的活躍度不需要擔心:GitHub 上超過兩萬四千顆星、兩千六百多個 fork,1.0.19 版在 2026 年 9 月初釋出,提交節奏密集。開發方式有個背景差異:倉庫的變更多由 Google 內部管道同步過來,GitHub 上的 issue 區不是開發主戰場,回應速度自然也參差。
回到開頭那三件事。記憶體等級決定你能跑到哪一級的模型,6 GB 是底、8 GB 起才有看圖與語音、12 GB 才碰得到兩個大模型;安裝管道在台灣走商店即可,側載時通用版就夠用,高通與 Pixel 用戶可以挑晶片對應版;隱私宣稱把推論與遙測分開讀,裝完先進設定看一眼。把這三件事對齊之後,它是目前想把手機變成離線 AI 裝置的人,最值得先裝來試的那一個。