Android 圖片工具箱 ImageToolbox:去背、文字辨識都能離線跑

ImageToolbox 是 Android 上的開源圖片工具箱,去背、文字辨識與濾鏡都在手機離線執行。FOSS 版與 Google Play 版的引擎和遙測差異、聯絡人權限對應的功能、131 個 AI 模型的來源,以及 F-Droid、GitHub 與 Obtainium 三條安裝路線的選擇,這篇一次整理。

用 AI 摘要這篇文章:

ImageToolbox 是 Android 上的開源圖片工具箱,由開發者 T8RIN(Malik Mukhametzyanov)一個人主力維護,GitHub 上累積超過 14,700 顆星、639 次 fork,採 Apache-2.0 授權,Google Play 顯示 50 萬次以上下載、4.9 顆星評價。它把去背、文字辨識、濾鏡、格式轉換、PDF 處理、QR 產生與掃描收進同一個 App,而且這些運算都在手機上完成,照片不需要先傳上雲端。

安裝之前真正值得想清楚的是三個問題:一個圖片 App 為什麼安裝包超過 100 MB,還要聯絡人權限?Google Play 版和開源 FOSS 版到底差在哪?免費的 AI 功能,代價是什麼?先講結論:功能目錄是真的,運算確實在裝置上執行,真正的分歧在你選哪一種安裝包,兩種版本的差異這個專案直接寫在 README 裡,很少見地攤在陽光下讓你自己挑。

ImageToolbox 主選單畫面,列出濾鏡、繪圖、去背、AI 工具等工具分類(官方 Play 商店截圖)Pin
ImageToolbox 主選單:濾鏡、繪圖、去背與 AI 工具都在同一個 App 裡(官方 Play 商店截圖)

一百多 MB 的安裝包,要了哪些權限

從 F-Droid 的 4.1.0-foss 版權限清單看,這個 App 會用到媒體位置、相機、通知、前景服務、完整網路存取,以及兩個看起來有點嚇人的項目:讀取聯絡人,和 Google 在 Android 11 之後管制的所有檔案存取權(MANAGE_EXTERNAL_STORAGE)。

聯絡人權限對應的是 QR 工具的聯絡人卡片功能。原始碼裡的 ContactPicker 與 QrTypeUtils 兩個檔案顯示,它可以用通訊錄裡的聯絡人生成 QR 卡片,掃到別人分享的聯絡資訊也能寫入通訊錄,走的是 Android 系統的標準聯絡人介面。所有檔案存取權則對應它檔案層級的工具性格:批次重新命名、重複照片搜尋、資料夾整批壓縮這類操作,都需要跨資料夾讀寫。看起來重的權限都有具體功能可以對照,你可以自行判斷用不用得上。

更難得的一個細節在 AndroidManifest.xml:這個專案主動用 tools:node=”remove” 移除了 AD_ID、ACCESS_ADSERVICES_AD_ID 與 READ_PHONE_STATE 三個權限。這三個權限本來會隨著依賴庫自動混進安裝包,開發者把它們擋掉了,所以 FOSS 版最終的權限清單裡看不到廣告識別碼。對一個免費 App 來說,這是權限清單上可以直接驗證的正面訊號。

至於安裝包體積,4.2.0 版的 arm64 安裝包是 117.9 MB,原因不難理解:五百多種濾鏡的運算庫、多套字型、各種處理器的原生程式碼都打包在裡面,而 AI 模型與 OCR 語言檔另行走下載,沒有塞進安裝包。README 也公布了簽章憑證的 SHA-256 雜湊值,從第三方管道下載安裝包的人可以自己比對,這在個人開發的免費工具裡並不常見。

看權限時建議兩邊對照:F-Droid 直接從安裝包解析 manifest 列出完整清單,Google Play 則顯示開發者填寫的資料安全表單,兩者立場不同。把 F-Droid 的權限頁、Play 的資料安全區塊和上表的建置差異放在一起看,比單看任何一邊的說法都準確。

同一個 App 有兩種安裝包,差別直接寫在 README

ImageToolbox 最特別的地方,是它同時維護 FOSS 與 Market 兩條建置路線,差異表就放在 README:FOSS 版的 QR 掃描用開源的 ZXing、自動去背用 ONNX 模型、文件掃描用 OpenCV;Market 版這三項都換成 Google 的 ML Kit。Analytics 分析與 Crashlytics 當機報告只存在於 Market 版,FOSS 版不含任何 Google 依賴。

項目FOSS 安裝包Market 安裝包
QR 掃描引擎ZXing(開源)Google ML Kit
自動去背引擎ONNX 模型Google ML Kit
文件掃描OpenCVGoogle ML Kit
RAR 壓縮檔解密不支援Junrar
Analytics 分析無有
Crashlytics 當機報告無有
其他 Google 依賴無有
arm64 安裝包大小約 107.8 MB約 117.9 MB

(資料:專案 README 對照表與 4.2.0 版 GitHub 發布資產,2026 年 9 月)

代價與好處兩邊都算得上誠實。Market 版的 ML Kit 通常吃 Google Play 服務的更新,模型由 Google 維護;FOSS 版自己帶開源引擎,安裝包小了約 10 MB,而且全原始碼可審。原始碼裡能對外連線的位址,除了下載模型與語言檔的 HuggingFace 與 Tesseract 官方倉庫、Telegram 社群與贊助連結之外,沒有其他遙測網域。

安裝管道的版本節奏並不同步。GitHub Releases 是最前面的:穩定版 4.2.0 在 2026 年 9 月 4 日發布,隔週還有 4.2.1 的 alpha 測試版。Google Play 在 9 月 5 日跟上穩定版。F-Droid 上的 4.1.0-foss 是 9 月 3 日上架的,落後一個小版本,而且 F-Droid 頁載明這個安裝包由原作者簽署、對應原始碼 tarball,等於多一層可追溯性。要最新功能走 GitHub,要自動更新走 Play,要乾淨建置走 F-Droid,三條路各有取捨。

還有第四條折衷路線:README 內建了 Obtainium 的設定連結,這個開源更新器直接盯著 GitHub Releases,可以選只要穩定版或連測試版一起收,等於用乾淨安裝包換到接近商店版的自動更新體驗。開源社群對兩種安裝包的偏好其實相當接近:4.2.0 版在 GitHub 上,FOSS 版 arm64 安裝包被下載了 12,271 次,Market 版 arm64 是 12,080 次,主動選乾淨建置的人不比要方便的人少。

AI 去背與文字辨識的原料從哪裡來

免費 App 提供 AI 功能,最先該問的就是模型從哪裡來、照片送去哪裡。ImageToolbox 的 AI 工具清單寫在原始碼的 NeuralModel 檔案裡,到 2026 年 9 月 25 日為止有 131 個帶標題的模型,涵蓋放大、降噪、上色、風格轉換、深度估計,甚至有反過來偵測一張圖是不是 AI 生成的模型。模型檔從開發者自己的 HuggingFace 倉庫下載,每個都附 SHA-256 驗證碼,下載後就在裝置上用 ONNX Runtime 執行,辨識過程不再需要網路。

文字辨識(OCR)的架構類似。語言清單在原始碼的資源檔裡定義了 116 個語言代碼,繁體中文的 chi_tra 與簡體中文的 chi_sim 都在列。Tesseract 引擎的語言檔分成快速、標準、最佳三種等級,第一次使用某個語言時才從 Tesseract 官方 GitHub 倉庫下載對應的訓練資料,之後同樣離線可用。這部分倒是兩種安裝包都一樣:引擎都是開源的 Tesseract 加上 PaddleOCR 的 13 個模型家族,中文、日韓、東歐文字到泰文、阿拉伯文各有對應模型,等於同一個功能有兩套離線引擎可以互補,不像 QR 掃描和去背會隨版本換引擎。

AI 目錄裡有一個方向特別值得停下來看:反過來偵測照片是不是 AI 生成的模型,清單裡有 11 個,從 Mirage SigLIP2 到多個針對深偽影像的測定器都有,等於把「鑑定」和「生成」放在同一個工具箱裡。另外它也把檔案加密做成離線工具,以 BouncyCastle 加密庫為底,原始碼裡還維護一份被標記為不建議的弱演算法清單,CAST5、RC5-64 這類老方法會被主動過濾掉。工具箱裡的 67 個模組有相當比例是這種「帶著資安常識做」的小設計,翻目錄的時候可以多看一眼。

換句話說,它的免費建立在「模型自己下載、運算自己跑」的設計上:不收費、不放廣告、沒有帳號系統,開發者靠 Boosty 贊助與 TON 加密貨幣捐款支持開發。手機要多騰出模型空間,多數模型在數十 MB 以內,但深度估計類的幾個大模型超過 900 MB,最大的一個接近 1.4 GB,這是免費背後實際的成本,不過語言檔與模型檔事後都能刪除,原始碼裡兩者都有對應的刪除函式,用完即清是可行的。如果你只是偶爾需要辨識文件或幫圖片去背,站上工具如 RapidOCR 或 Vheer 連瀏覽器就能用;把手機當主要工作環境的人,離線執行的價值才會明顯。

濾鏡數量的三種說法,與數字會腐爛的原因

查這個工具的資料時會遇到三個不一樣的濾鏡數字:部分中文介紹寫 160 多種,F-Droid 的說明頁寫 310 多種,GitHub README 的功能清單逐項勾選下來是 541 個,README 自己的標語則寫 500 以上。AI 模型也一樣,F-Droid 說明頁寫 81 個,原始碼裡實際已經有 131 個。

三個數字都曾經是對的,問題在於這個專案的目錄每幾週就在長:2026 年 9 月的提交裡還在新增濾鏡與 PDF 裁切預設,發布節奏也看得出來,從 7 月底的候選版到 9 月中的測試版,兩個月內至少推了八個版本。目錄型工具的數字天然會腐爛,靜態介紹文引用的數字只代表寫作當下,挑版本時看 README 與 release 註記永遠比看介紹文可靠。引用任何數字前,先確認它的檢視日期,再決定要不要相信。

順帶一提,它的 Android 套件名稱是 ru.tech.imageresizershrinker,暴露了這個專案的起點:它最初叫 Image Resizer Shrinker,只做圖片縮圖與壓縮,後來功能一路長成 67 個工具模組的集合,名稱反而來不及換。壓縮與格式轉換至今仍是核心功能之一,HEIF、AVIF、WEBP、JXL 這幾種新舊格式都吃,壓縮工作區還能直接編輯 EXIF。

ImageToolbox 圖片壓縮工具畫面,可設定尺寸、品質與 EXIF 編輯(官方 Play 商店截圖)Pin
壓縮與轉檔工作區,可直接調尺寸、品質並編輯 EXIF(官方 Play 商店截圖)

台灣手機上的實際條件

繁中介面是現成的:資源檔裡的 zh-rTW 目錄有 5,450 條繁中字串,翻譯貢獻持續進到 2026 年 9 月的提交裡,維護頻率跟得上功能變動。介面走 Material You 動態配色,而且在 Android 12 之前的手機上也能用桌布取色,最低系統需求是 Android 7.0,老手機多半裝得起來。外觀的可調度也高:內建 26 套字型、能匯入自己的 OTF 或 TTF,圖示形狀、開關樣式到主畫面版面都能換,同一個 App 在不同人手機上長得不太一樣。

安裝包除了 arm64 與 armeabi-v7a 兩種 ARM 架構,F-Droid 版還提供 x86_64 給模擬器或少數 x86 裝置。它沒有 iOS 版,也沒有桌面版,想在手機與電腦之間搬照片做事的話,搭配電腦端的開源工具鏈會比較順,例如之前介紹過的 Scrcpy Android 投屏工具或 Caesium 圖片壓縮工具。

整理手機相簿的人也能在裡面找到幾個順手的功能:依官方說明頁,拼貼工具支援 2 到 10 張照片、180 多種版型;條碼工具能產生與掃描 13 種格式;浮水印除了文字與圖片,還支援隱寫式的浮水印;重複照片搜尋可以直接清相簿裡的連拍殘檔。這些功能在手機上同樣離線運作,搭配前述的加密與 QR 工具,它取代的是一整排單一功能小 App 的位置。

工程面的邊界則是:這篇文章的結論來自原始碼、README 與商店頁的對照,沒有在實機上跑過它。濾鏡的畫質、AI 去背的乾淨程度、批次處理的流暢度這些效果面,值得你裝起來用自己的照片試一輪再決定去留。

授權、活躍度與單人專案的風險

Apache-2.0 授權全文附在倉庫根目錄,允許自由使用、修改與再散布,商業使用也在許可範圍。專案建立於 2022 年 4 月,到 2026 年 9 月 23 日仍有提交,4.2.0 穩定版發布後兩週多又推了兩個 alpha 版,單看節奏是健康的。

結構面則是典型的單人專案:主要開發者 T8RIN 一個人貢獻了 9,174 次提交,第二名是自動翻譯的 Weblate 機器人(555 次),再來是自動更新依賴的 dependabot(406 次)。對照 14,700 顆星的規模,等於整個專案的走向繫於一人之手,這是長期使用要認的風險:開發者一旦停下來,功能目錄的腐爛速度會比一般社群維護的專案快。好的方面是它有 Weblate 上的多語翻譯社群,GitHub 議題區也整理得乾淨,查詢當下未結案的議題只有一筆,反應速度看得出來,而 Apache-2.0 也保證任何人可以接手 fork。

整體判斷:如果你的照片工作大多發生在手機上,希望去背、文字辨識、壓縮轉檔這些事不經過雲端,ImageToolbox 值得裝來試。重視隱私、不介意手動更新,就選 F-Droid 或 GitHub 的 FOSS 安裝包;希望自動更新、能接受 Analytics 與 Crashlytics,就待在 Google Play。兩種選擇都在同一份授權與同一份原始碼之下,差別只在安裝包裡多裝了誰的引擎。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1549

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...