TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南
TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南

ImageToolbox 是 Android 上的開源圖片工具箱,去背、文字辨識與濾鏡都在手機離線執行。FOSS 版與 Google Play 版的引擎和遙測差異、聯絡人權限對應的功能、131 個 AI 模型的來源,以及 F-Droid、GitHub 與 Obtainium 三條安裝路線的選擇,這篇一次整理。
用 AI 摘要這篇文章:
ImageToolbox 是 Android 上的開源圖片工具箱,由開發者 T8RIN(Malik Mukhametzyanov)一個人主力維護,GitHub 上累積超過 14,700 顆星、639 次 fork,採 Apache-2.0 授權,Google Play 顯示 50 萬次以上下載、4.9 顆星評價。它把去背、文字辨識、濾鏡、格式轉換、PDF 處理、QR 產生與掃描收進同一個 App,而且這些運算都在手機上完成,照片不需要先傳上雲端。
安裝之前真正值得想清楚的是三個問題:一個圖片 App 為什麼安裝包超過 100 MB,還要聯絡人權限?Google Play 版和開源 FOSS 版到底差在哪?免費的 AI 功能,代價是什麼?先講結論:功能目錄是真的,運算確實在裝置上執行,真正的分歧在你選哪一種安裝包,兩種版本的差異這個專案直接寫在 README 裡,很少見地攤在陽光下讓你自己挑。

從 F-Droid 的 4.1.0-foss 版權限清單看,這個 App 會用到媒體位置、相機、通知、前景服務、完整網路存取,以及兩個看起來有點嚇人的項目:讀取聯絡人,和 Google 在 Android 11 之後管制的所有檔案存取權(MANAGE_EXTERNAL_STORAGE)。
聯絡人權限對應的是 QR 工具的聯絡人卡片功能。原始碼裡的 ContactPicker 與 QrTypeUtils 兩個檔案顯示,它可以用通訊錄裡的聯絡人生成 QR 卡片,掃到別人分享的聯絡資訊也能寫入通訊錄,走的是 Android 系統的標準聯絡人介面。所有檔案存取權則對應它檔案層級的工具性格:批次重新命名、重複照片搜尋、資料夾整批壓縮這類操作,都需要跨資料夾讀寫。看起來重的權限都有具體功能可以對照,你可以自行判斷用不用得上。
更難得的一個細節在 AndroidManifest.xml:這個專案主動用 tools:node=”remove” 移除了 AD_ID、ACCESS_ADSERVICES_AD_ID 與 READ_PHONE_STATE 三個權限。這三個權限本來會隨著依賴庫自動混進安裝包,開發者把它們擋掉了,所以 FOSS 版最終的權限清單裡看不到廣告識別碼。對一個免費 App 來說,這是權限清單上可以直接驗證的正面訊號。
至於安裝包體積,4.2.0 版的 arm64 安裝包是 117.9 MB,原因不難理解:五百多種濾鏡的運算庫、多套字型、各種處理器的原生程式碼都打包在裡面,而 AI 模型與 OCR 語言檔另行走下載,沒有塞進安裝包。README 也公布了簽章憑證的 SHA-256 雜湊值,從第三方管道下載安裝包的人可以自己比對,這在個人開發的免費工具裡並不常見。
看權限時建議兩邊對照:F-Droid 直接從安裝包解析 manifest 列出完整清單,Google Play 則顯示開發者填寫的資料安全表單,兩者立場不同。把 F-Droid 的權限頁、Play 的資料安全區塊和上表的建置差異放在一起看,比單看任何一邊的說法都準確。
ImageToolbox 最特別的地方,是它同時維護 FOSS 與 Market 兩條建置路線,差異表就放在 README:FOSS 版的 QR 掃描用開源的 ZXing、自動去背用 ONNX 模型、文件掃描用 OpenCV;Market 版這三項都換成 Google 的 ML Kit。Analytics 分析與 Crashlytics 當機報告只存在於 Market 版,FOSS 版不含任何 Google 依賴。
| 項目 | FOSS 安裝包 | Market 安裝包 |
|---|---|---|
| QR 掃描引擎 | ZXing(開源) | Google ML Kit |
| 自動去背引擎 | ONNX 模型 | Google ML Kit |
| 文件掃描 | OpenCV | Google ML Kit |
| RAR 壓縮檔解密 | 不支援 | Junrar |
| Analytics 分析 | 無 | 有 |
| Crashlytics 當機報告 | 無 | 有 |
| 其他 Google 依賴 | 無 | 有 |
| arm64 安裝包大小 | 約 107.8 MB | 約 117.9 MB |
(資料:專案 README 對照表與 4.2.0 版 GitHub 發布資產,2026 年 9 月)
代價與好處兩邊都算得上誠實。Market 版的 ML Kit 通常吃 Google Play 服務的更新,模型由 Google 維護;FOSS 版自己帶開源引擎,安裝包小了約 10 MB,而且全原始碼可審。原始碼裡能對外連線的位址,除了下載模型與語言檔的 HuggingFace 與 Tesseract 官方倉庫、Telegram 社群與贊助連結之外,沒有其他遙測網域。
安裝管道的版本節奏並不同步。GitHub Releases 是最前面的:穩定版 4.2.0 在 2026 年 9 月 4 日發布,隔週還有 4.2.1 的 alpha 測試版。Google Play 在 9 月 5 日跟上穩定版。F-Droid 上的 4.1.0-foss 是 9 月 3 日上架的,落後一個小版本,而且 F-Droid 頁載明這個安裝包由原作者簽署、對應原始碼 tarball,等於多一層可追溯性。要最新功能走 GitHub,要自動更新走 Play,要乾淨建置走 F-Droid,三條路各有取捨。
還有第四條折衷路線:README 內建了 Obtainium 的設定連結,這個開源更新器直接盯著 GitHub Releases,可以選只要穩定版或連測試版一起收,等於用乾淨安裝包換到接近商店版的自動更新體驗。開源社群對兩種安裝包的偏好其實相當接近:4.2.0 版在 GitHub 上,FOSS 版 arm64 安裝包被下載了 12,271 次,Market 版 arm64 是 12,080 次,主動選乾淨建置的人不比要方便的人少。
免費 App 提供 AI 功能,最先該問的就是模型從哪裡來、照片送去哪裡。ImageToolbox 的 AI 工具清單寫在原始碼的 NeuralModel 檔案裡,到 2026 年 9 月 25 日為止有 131 個帶標題的模型,涵蓋放大、降噪、上色、風格轉換、深度估計,甚至有反過來偵測一張圖是不是 AI 生成的模型。模型檔從開發者自己的 HuggingFace 倉庫下載,每個都附 SHA-256 驗證碼,下載後就在裝置上用 ONNX Runtime 執行,辨識過程不再需要網路。
文字辨識(OCR)的架構類似。語言清單在原始碼的資源檔裡定義了 116 個語言代碼,繁體中文的 chi_tra 與簡體中文的 chi_sim 都在列。Tesseract 引擎的語言檔分成快速、標準、最佳三種等級,第一次使用某個語言時才從 Tesseract 官方 GitHub 倉庫下載對應的訓練資料,之後同樣離線可用。這部分倒是兩種安裝包都一樣:引擎都是開源的 Tesseract 加上 PaddleOCR 的 13 個模型家族,中文、日韓、東歐文字到泰文、阿拉伯文各有對應模型,等於同一個功能有兩套離線引擎可以互補,不像 QR 掃描和去背會隨版本換引擎。
AI 目錄裡有一個方向特別值得停下來看:反過來偵測照片是不是 AI 生成的模型,清單裡有 11 個,從 Mirage SigLIP2 到多個針對深偽影像的測定器都有,等於把「鑑定」和「生成」放在同一個工具箱裡。另外它也把檔案加密做成離線工具,以 BouncyCastle 加密庫為底,原始碼裡還維護一份被標記為不建議的弱演算法清單,CAST5、RC5-64 這類老方法會被主動過濾掉。工具箱裡的 67 個模組有相當比例是這種「帶著資安常識做」的小設計,翻目錄的時候可以多看一眼。
換句話說,它的免費建立在「模型自己下載、運算自己跑」的設計上:不收費、不放廣告、沒有帳號系統,開發者靠 Boosty 贊助與 TON 加密貨幣捐款支持開發。手機要多騰出模型空間,多數模型在數十 MB 以內,但深度估計類的幾個大模型超過 900 MB,最大的一個接近 1.4 GB,這是免費背後實際的成本,不過語言檔與模型檔事後都能刪除,原始碼裡兩者都有對應的刪除函式,用完即清是可行的。如果你只是偶爾需要辨識文件或幫圖片去背,站上工具如 RapidOCR 或 Vheer 連瀏覽器就能用;把手機當主要工作環境的人,離線執行的價值才會明顯。
查這個工具的資料時會遇到三個不一樣的濾鏡數字:部分中文介紹寫 160 多種,F-Droid 的說明頁寫 310 多種,GitHub README 的功能清單逐項勾選下來是 541 個,README 自己的標語則寫 500 以上。AI 模型也一樣,F-Droid 說明頁寫 81 個,原始碼裡實際已經有 131 個。
三個數字都曾經是對的,問題在於這個專案的目錄每幾週就在長:2026 年 9 月的提交裡還在新增濾鏡與 PDF 裁切預設,發布節奏也看得出來,從 7 月底的候選版到 9 月中的測試版,兩個月內至少推了八個版本。目錄型工具的數字天然會腐爛,靜態介紹文引用的數字只代表寫作當下,挑版本時看 README 與 release 註記永遠比看介紹文可靠。引用任何數字前,先確認它的檢視日期,再決定要不要相信。
順帶一提,它的 Android 套件名稱是 ru.tech.imageresizershrinker,暴露了這個專案的起點:它最初叫 Image Resizer Shrinker,只做圖片縮圖與壓縮,後來功能一路長成 67 個工具模組的集合,名稱反而來不及換。壓縮與格式轉換至今仍是核心功能之一,HEIF、AVIF、WEBP、JXL 這幾種新舊格式都吃,壓縮工作區還能直接編輯 EXIF。

繁中介面是現成的:資源檔裡的 zh-rTW 目錄有 5,450 條繁中字串,翻譯貢獻持續進到 2026 年 9 月的提交裡,維護頻率跟得上功能變動。介面走 Material You 動態配色,而且在 Android 12 之前的手機上也能用桌布取色,最低系統需求是 Android 7.0,老手機多半裝得起來。外觀的可調度也高:內建 26 套字型、能匯入自己的 OTF 或 TTF,圖示形狀、開關樣式到主畫面版面都能換,同一個 App 在不同人手機上長得不太一樣。
安裝包除了 arm64 與 armeabi-v7a 兩種 ARM 架構,F-Droid 版還提供 x86_64 給模擬器或少數 x86 裝置。它沒有 iOS 版,也沒有桌面版,想在手機與電腦之間搬照片做事的話,搭配電腦端的開源工具鏈會比較順,例如之前介紹過的 Scrcpy Android 投屏工具或 Caesium 圖片壓縮工具。
整理手機相簿的人也能在裡面找到幾個順手的功能:依官方說明頁,拼貼工具支援 2 到 10 張照片、180 多種版型;條碼工具能產生與掃描 13 種格式;浮水印除了文字與圖片,還支援隱寫式的浮水印;重複照片搜尋可以直接清相簿裡的連拍殘檔。這些功能在手機上同樣離線運作,搭配前述的加密與 QR 工具,它取代的是一整排單一功能小 App 的位置。
工程面的邊界則是:這篇文章的結論來自原始碼、README 與商店頁的對照,沒有在實機上跑過它。濾鏡的畫質、AI 去背的乾淨程度、批次處理的流暢度這些效果面,值得你裝起來用自己的照片試一輪再決定去留。
Apache-2.0 授權全文附在倉庫根目錄,允許自由使用、修改與再散布,商業使用也在許可範圍。專案建立於 2022 年 4 月,到 2026 年 9 月 23 日仍有提交,4.2.0 穩定版發布後兩週多又推了兩個 alpha 版,單看節奏是健康的。
結構面則是典型的單人專案:主要開發者 T8RIN 一個人貢獻了 9,174 次提交,第二名是自動翻譯的 Weblate 機器人(555 次),再來是自動更新依賴的 dependabot(406 次)。對照 14,700 顆星的規模,等於整個專案的走向繫於一人之手,這是長期使用要認的風險:開發者一旦停下來,功能目錄的腐爛速度會比一般社群維護的專案快。好的方面是它有 Weblate 上的多語翻譯社群,GitHub 議題區也整理得乾淨,查詢當下未結案的議題只有一筆,反應速度看得出來,而 Apache-2.0 也保證任何人可以接手 fork。
整體判斷:如果你的照片工作大多發生在手機上,希望去背、文字辨識、壓縮轉檔這些事不經過雲端,ImageToolbox 值得裝來試。重視隱私、不介意手動更新,就選 F-Droid 或 GitHub 的 FOSS 安裝包;希望自動更新、能接受 Analytics 與 Crashlytics,就待在 Google Play。兩種選擇都在同一份授權與同一份原始碼之下,差別只在安裝包裡多裝了誰的引擎。