Open-AutoGLM 智譜開源視覺模型,看懂螢幕就能替你操控手機

Open-AutoGLM 是智譜 AI(Z.ai)的開源手機 agent,用視覺模型看螢幕、ADB 模擬點擊,聽自然語言操作 Android 與鴻蒙應用。Android 版主攻國際應用,中文應用要靠鴻蒙版;部署門檻從雲端 API 到 24GB 顯卡本地架設都有,採用前要自己評估效果、合規與維護狀態。

用 AI 摘要這篇文章:

Open-AutoGLM 是智譜 AI(對外品牌 Z.ai)在 2025 年 12 月開源的手機操作 agent,想法很直白:你用一句中文或英文下指令,例如「打開地圖搜尋附近咖啡廳」,它就截下你手機的螢幕、用視覺模型看懂畫面、算出該點哪裡,再透過 ADB 或鴻蒙的 HDC 模擬你的手指去點。這篇文章是工具導覽,所有資訊來自官方文件,沒有實際接手機跑過。效率、穩定度這類問題,官方文件回答不了,要靠自己接手機實測。

會把這條邊界先講在開頭,是因為這類開源 AI agent 的討論常常把「官方列了什麼能力」直接當成「它一定做得到」,兩者差很多。Open-AutoGLM 的價值要先從它怎麼運作、支援哪些應用、部署門檻在哪看起,再決定要不要花時間把模型跑起來。

Open-AutoGLM 的 GitHub 倉庫頁面(zai-org),顯示 25,968 顆星與 Apache-2.0 授權標示Pin
Open-AutoGLM 的 GitHub 倉庫(zai-org/Open-AutoGLM),截至撰稿累計約 2.6 萬顆星,框架程式碼採 Apache-2.0 授權。

看圖點擊的迴圈:AI 怎麼看懂你的螢幕

Open-AutoGLM 的核心是一個不斷重複的迴圈,官方在 README 的自動部署指南裡講得很明白:截圖、視覺模型理解介面、輸出點擊座標、ADB(Android Debug Bridge)或鴻蒙的 HDC 執行動作、回到截圖。換句話說,它不靠呼叫應用程式的 API 或讀懂程式碼過日子,而是像一個盯著你螢幕看的人,靠看圖辨識出「搜尋框在哪、按鈕在哪」,再把座標交給系統工具去點。

這條路決定了它的長處與極限。長處是幾乎不挑應用,只要畫面是人看得懂的圖,模型就有機會理解,不必等應用開放 API。極限是它本質在猜畫面,遇到看不懂的介面、動態載入的內容、或驗證碼這種非視覺能解的關卡,就會卡住。這也是為什麼官方設計了兩個人工介入的開關:敏感操作(例如送出訊息、確認訂單)會先觸發確認回呼,要你點頭才動手;遇到登入或驗證碼,它會發出 Take_over 動作把手動權交還給你,避免硬猜你的密碼。

官方在 README 示範了開啟 verbose 模式後,模型每一步會印出的思考與動作。以「打開 eBay 搜尋無線耳機」為例,第一步它會輸出一段想法(目前在桌面、要先開 eBay),接著執行一個 JSON 動作 {"action":"Launch","app":"eBay"};下一步它看到 eBay 已開、要點搜尋框,就輸出 {"action":"Tap","element":[499,182]}。這個「先想再點、每步可見」的設計,讓你能在模型走偏時及早發現,不用等它點完十步才回頭收拾。每個任務預設最多跑 100 步(環境變數 PHONE_AGENT_MAX_STEPS 可調),超過就停,避免它在錯誤循環裡無限打轉。

背後的模型叫 AutoGLM-Phone-9B,架構與智譜的 GLM-4.1V-9B-Thinking 視覺語言模型相同,分中文版與多語言版兩個版本。中文版針對中文應用調校,多語言版對應英文等情境,選錯版本會直接影響辨識效果。模型在 HuggingFace 與阿里達摩院的 ModelScope 都下載得到,模型卡上標的是 MIT 授權。官方 FAQ 也提到,截圖出現黑屏時通常代表碰到支付、密碼、銀行應用這類敏感頁面,系統會請求人工接管,這是視覺路線下必要的安全設計。

AutoGLM-Phone-9B 的 HuggingFace 模型卡,顯示 MIT 授權與 GLM-4.1V-9B-Thinking 模型架構Pin
AutoGLM-Phone-9B 模型卡(HuggingFace),模型權重採 MIT 授權,架構以 GLM-4.1V-9B-Thinking 為基礎。

順帶一提,智譜在 z.ai 平台也提供同一個模型的付費託管 API,申請 key 就能呼叫,不必自己架 GPU。Open-AutoGLM 這個 GitHub 倉庫的角色,是把同一套視覺模型與操作框架開源出來,讓你想自架、改作、或整合進自己的產品時有個起點。兩者背後是同一個模型家族,差別在於:託管 API 現成可用、每次呼叫計費、畫面上傳到智譜伺服器;開源版則由你自己掌握模型與資料流向,代價是硬體與維護。把它看成同一條技術的託管版與自架版,會比當成兩個不相干的產品來得準確,後面講部署與隱私時這條區分還會再用到。

截圖路線的代價:看得到才點得到

既然 Open-AutoGLM 靠「看螢幕」決定下一步,它就跟人一樣有視角限制。應用正在捲動載入、圖片還沒下載完、或彈出式選單只閃一下就消失,這些畫面上的瞬間變化,截圖未必抓得到,模型也就可能點到已經消失的按鈕。這是「看圖點擊」這條技術路線固有的代價。

另一個結構性限制是它需要看著前景畫面才能動手。你的手機若鎖屏、切到別的應用、或螢幕進入待命,Open-AutoGLM 拿到的截圖就不是它該操作的那個畫面。換句話說,它比較像一個隨時盯著螢幕、需要畫面維持開啟的操作員,而不像那種能把任務丟到背景、關掉螢幕自己跑的自動化。對於需要長時間、背景、多裝置併行的場景,這條路未必划算。

技術社群其實還有另一條做法:在背景開一個虛擬顯示器讓模型操作,這樣不必占用你實際的螢幕。站上介紹過的 OpenCyvis 這類 Android AI agent 走的就是後台虛擬顯示器路線,與 Open-AutoGLM 的前景截圖是兩種不同取捨:前者不搶你的螢幕但實作更複雜,後者直觀易懂但你得把手機畫面讓給它。選哪一條,取決於你是想邊看邊操作,還是想放著讓它自己跑。你也可以對照 瀏覽器本地 RPA 工具 看桌機端的自動化怎麼處理類似的「看得到 vs 背景」問題。

Android 與鴻蒙是兩套世界:先認清常用 App 在哪一軌

Open-AutoGLM 最容易被講錯的一點,是它到底支援哪些應用。官方 README 把支援清單分成兩張表,而且兩張表講的是完全不同的應用世界。

第一張是 Android 表,列的是 50 多個國際主流應用。社群類有 X、TikTok、WhatsApp、Telegram、Instagram、Reddit;生產力有 Gmail、Google Calendar、Google Docs、Joplin;購物有 Amazon、Temu、eBay;工具與媒體有 Chrome、Google Play、Google Maps;旅遊有 Booking、Trip.com、Expedia。換句話說,Android 版主力是歐美與國際通用的應用。

第二張是鴻蒙(HarmonyOS)表,列的是 60 多個大陸中文應用:社群有微信、QQ、微博、飛書、企業微信;電商有淘寶、京東、拼多多、閒魚;外賣與生活有美團、大眾點評、海底撈;出行與訂票有 12306、滴滴、同程、高德、百度地圖;影視有 B 站、抖音、快手、騰訊影音、愛奇藝;還有小紅書、知乎、頭條,以及華為自己的系統應用。這張表才是「中文生活圈」。

這條界線很重要。手上拿的若是 Android 手機,能用的是第一張表的國際應用;想用自然語言讓 AI 操作微信、淘寶、美團這類應用,要走的是鴻蒙版,而鴻蒙版需要 HarmonyOS 系統與華為的 HDC 工具,一般 Android 手機加上 ADB 還不夠。常見的說法把這兩張表混成一張「支援 50 多個主流應用」,會造成誤判,你得先想清楚自己平常要操作的是 Chrome、Gmail 這類國際應用,還是微信、小紅書這類中文應用,再決定走 Android 版還是鴻蒙版。

模型版本的選擇也要呼應這條界線。中文應用配中文版模型、英文介面配多語言版,這是官方的設計意圖;拿中文版去跑全英文應用,或反過來,效果都會打折。這條界線背後其實是訓練資料的語言側重,沒有硬性技術限制擋著:理論上中文版模型也能看 WhatsApp 的畫面,但官方沒針對那類介面調校,能不能準確辨識要自己驗證。

想跑起來要準備什麼:三條路的硬體門檻

Open-AutoGLM 的架構分成兩塊:Agent 程式碼(這個 GitHub 倉庫,跑在你的電腦上,負責叫模型、解析動作、控制手機)與視覺模型服務(可以是遠端 API,也可以是你自己架的)。模型服務這一塊有三條路,硬體門檻差很多。

最省事的是直接用第三方 API。官方文件列出三個已經把模型架好的服務:智譜自家的 z.ai、Novita AI、Parasail。你只要申請一組 API key,就能用 python main.py --base-url ... --apikey ... "打開 Chrome 瀏覽器" 這樣的指令驅動,不必管 GPU。這條路適合大多數不想碰硬體的人。代價有兩層:每次呼叫要付費,而且你的指令內容與每次截圖都會經過這些雲端服務。第二點對隱私敏感的人是條硬決策線,後面會再展開。

想完全自控的話,可以自己用 vLLM 或 SGLang 部署模型。官方在 README 給了完整的 vLLM 啟動指令,但硬體需求寫得很明白:建議 NVIDIA GPU、顯示 24GB 以上、模型檔案約 20GB。這是一張高階顯卡才吃得下的門檻,適合有工作站或租 GPU 伺服器的開發者。好處是截圖與指令都在你自己的機器或區網裡,不外送雲端。

硬體預算有限的話,還有一條社群摸出來的量化路線。在 GitHub issue #230,有人分享用 GGUF 量化把模型塞進 RTX 4060 8GB 顯卡跑起來,這把門檻拉到中階遊戲顯卡等級。不過這是社群方案,不在官方 README 的主線上,量化造成的準確度損失要自己吸收,遇到問題也只能靠 issue 區討論。

不管哪一條路,手機端還有幾件事要先準備好:Android 7.0 以上或鴻蒙系統、開發者模式、USB 偵錯打開,以及一條能傳資料的 USB 線(很多線只能充電)。Android 裝置還要額外裝一個叫 ADB Keyboard 的輸入法,模型才能透過它打字;鴻蒙版用系統原生輸入法,不必裝這個。想脫離 USB 線的話,Android 與鴻蒙都支援 WiFi 遠端偵錯,用 adb connect 192.168.1.100:5555 這類指令把手機接上同一區網就能無線控制。設定不全是最常見的卡關點,官方 FAQ 列了好幾個症狀對照,例如「能開應用卻點不下去」通常是要再打開 USB 偵錯的安全設定選項。

除了命令列,Open-AutoGLM 也提供 Python API,讓你把 PhoneAgent 包進自己的程式裡做成服務。官方 README 還提到一條跨平台延伸:開源 UI 自動化 SDK「Midscene.js」已經接上 AutoGLM 模型,能在 iOS 與 Android 上跑,等於把這個模型的能力帶到蘋果陣營,這條路不在主倉庫的 ADB/HDC 範圍裡,要另外看 Midscene.js 的整合指南。想看桌機端如何把 AI 模型搬到自己機器上跑,可以對照站上的 macOS 本地 AI agent開源桌面 AI agent,硬體門檻的思考方式能互相參考。

官方資料沒告訴你的事:效果、合規與維護狀態

官方文件能回答「這工具是什麼、怎麼運作、支援哪些應用」,但有三件事它講得保留或不講,而你採用前必須自己判斷。

先看實際效果。視覺模型看圖點擊的成功率、延遲、面對動態介面的穩定度,這些只能靠實測得知,官方 README 沒有給開源模型在你機器上的基準數字。研究團隊在 arXiv 發表過兩篇論文(編號 2411.00820 與 2509.18119),但論文層級的測試成績不等於你拿開源權重在自己硬體上跑出來的結果,中間還隔著量化、硬體差異、應用版本更新這些變因。我沒接手機測過,論文數字不能直接當成你機器上的保證。

再看使用邊界與隱私流向。模型卡與 README 都掛了一條免責聲明:這個專案僅供研究與教育用途,禁止用於非法資料存取、系統干擾或任何違法活動,並要求使用者詳閱 Terms of Use。手機自動化天生是雙用途工具,它可以是身障者的輔助、重度使用者的效率幫手,也可以被拿來批量刷單、搶購、自動化他人帳號;實際上 issue #408 就有人直接標題寫「glm5.2 搶購助手」,這條需求真實存在。問題在於 ADB 控制的是你自己登入的手機,操作的是你自己的帳號,但很多應用的服務條款明文禁止自動化操作,違反的是你和該平台之間的約定,Open-AutoGLM 本身並不算違法。

隱私這層還要再拆開看。ADB 控制時,手機與你的電腦在同一個信任域;但模型服務若是走雲端 API(第三方服務那條路),每一次截圖都會上傳到 z.ai、Novita 或 Parasail 的伺服器才能做辨識,等於你手機畫面的快照持續外送。這對操作銀行、通訊軟體這類含個資的應用是條要畫清楚的線。選擇本地部署(自架 vLLM 那條路)就是為了讓截圖留在你的機器或區網裡,代價是要扛 24GB 級顯卡的硬體成本。雲端 API 的便宜與本地部署的隱私,是這類工具共同的取捨,Open-AutoGLM 沒有迴避這條選擇,但它也不會幫你決定。

專案活躍度也得評估。這個倉庫在 2025 年 12 月 8 日建立,目前累積了 25,968 顆星、4,019 個 fork,是非常爆紅的成長曲線。但 main 分支最後一次 commit 停在 2026 年 3 月 6 日,之後將近五個月沒有新的主線更新;與此同時 issues 仍有人在開,2026 年 7 月還有新議題討論功能擴充。換句話說,這是一個爆紅後進入維護停滯、但社群討論未斷的狀態。倉庫沒有正式的 release 標籤,要用就是 clone main 分支,版本全靠 commit 點,長期要靠它的話,得評估官方會不會回來維護,或社群 fork 能不能接手。

先做這一步再決定要不要裝

如果你看完機制與門檻,還是想自己試一輪,Open-AutoGLM 有一個幾乎零成本的前置檢查。把倉庫 clone 下來、裝好 Python 依賴後,依 README 說明先跑 python main.py --list-apps,它會列出這個版本支援的完整應用清單,而且不必啟動模型、不必接手機。你只要看自己最想自動化的那幾個應用到底在不在清單裡。

判斷標準很具體:常用的是 Chrome、Gmail、Google Maps 這類國際應用,Android 版清單有涵蓋,可以往下走;要操作的是微信、淘寶、小紅書,那要確認手上有鴻蒙系統裝置,否則 Android 版幫不上忙。清單裡找不到的應用,不代表完全不能用(視覺模型理論上能看任何介面),但官方沒調校過,成功率自己扛。

確認清單涵蓋你的需求後,接著決定模型服務。不想碰硬體就去 z.ai 申請一組 API key,用最小的指令測一句「打開 Chrome 瀏覽器」,並把 verbose 模式打開,觀察模型每一步的想法與動作是否合理。這是最便宜的驗證:能跑通,再考慮要不要為了隱私或成本自己架模型;跑不通,依官方 FAQ 的症狀對照,多數卡關出在手機端設定(USB 偵錯沒開、ADB Keyboard 沒啟用、線只能充電)。

授權方面,框架程式碼在 GitHub 倉庫標的是 Apache-2.0,模型權重在 HuggingFace 標的是 MIT,兩者都允許商用與改作,但框架與模型是分開授權,採用時兩邊都要看。官方的研究用途免責聲明與 Terms of Use 也要讀過一次,特別是打算拿來做商業流程自動化的人。把這幾項核對完,再投入架設時間,會比看完星數就下手穩得多。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 804

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...