Edit Mind:把整庫影片在本地建成可用一句話搜尋的 AI 素材庫

Edit Mind 是一款 local-first 的多模態影片索引工具,會在你的電腦上用 Whisper、YOLO、DeepFace 與 OCR 把整庫影片分析成可搜尋的元資料,再透過向量資料庫讓你用一句話找到畫面;支援 Ollama 完全離線與 Docker 自架。

用 AI 摘要這篇文章:

剪接師的時間,常常是被「找畫面」這件事吃掉的。幾十個資料夾、幾百支原始素材,要找「兩個人坐在桌邊講話」或「某個人在海邊笑」的畫面,通常只能靠檔名和記憶慢慢翻。Edit Mind 想解決的就是這件事:它會在你自己的電腦上,把整庫影片跑過一輪 AI 分析,把轉寫文字、出現的人臉、畫面裡的物件、螢幕上的字、主色調全都變成可以搜尋的標籤,再讓你用一句白話把畫面找出來。

它和市面上一堆「AI 影片搜尋」服務的關鍵差別,是分析全程在本地跑,影片檔不離開你的機器。這對不能把素材丟上雲端的接案剪接師、企業影音團隊或在意隱私的人來說,是寫在部署架構裡的硬承諾。不過官方文件也講得很明白:專案還在積極開發、不是穩定的成品;而它的授權也不是很多人直覺以為的「開源免費隨便用」。這兩點會決定它現階段到底適不適合你,下面會攤開來講。

一支影片進去,怎麼變成可搜尋的東西

根據官方 repo 的技術文件,Edit Mind 的核心是一條跑在本地的多模態分析管線。當你把某個資料夾加入索引,背景服務會把每一支影片拆開處理,作者把這整套流程形容為替剪接師建立「第二大腦」。整個分析排程由背景任務佇列(BullMQ)管理,處理出來的結構化資料存進 PostgreSQL 與 ChromaDB:前者放可查詢的欄位,後者放供語意比對用的向量。

聲音這層,官方技術棧表顯示它用 OpenAI 的 Whisper 模型,把整段音軌轉成帶時間戳的文字對白,這也是 Voice-Pro 那條本機 Whisper 配音管線背後同一套語音轉寫技術。畫面則會被切成大約兩秒一個片段,再交給一組用 Python 寫的分析模組:YOLO 負責框出畫面裡的物件,DeepFace 辨識鏡頭裡出現的人臉,OCR 抓出螢幕上出現的字(例如簡報內容或路標),另外還會統計每個片段的主色調與構圖資訊。索引完之後你拿到的是一份結構化的元資料清單:第幾秒到第幾秒、誰出現、畫面有什麼、講了哪些話、色調偏暖還是偏冷。

最關鍵的一步,是官方文件說的「多模態對齊」。它會把聽到的對白和看到的畫面按時間戳對齊,轉成向量,存進本地的向量資料庫 ChromaDB。這一步的意義在於:搜尋時比對的層級是意義,不限於字面的關鍵字。官方舉的例子是「找出所有兩個人坐在桌邊說話的鏡頭」這類描述,即使你從沒在任何檔名或標題裡寫過這句話,只要畫面特徵與對白內容對得上,對應片段就會被調出來。

一句話搜尋背後的兩段式查詢

搜尋這一步,官方文件的設計比「AI 幫你找」這句話複雜一點。當你輸入「找出所有看起來很開心的鏡頭」這類自然語言,系統會先把它交給一個語言模型,解析成結構化的查詢條件,再到本地的向量資料庫裡比對出語意對得上的場景。

這裡有個容易被行銷話術蓋過的設計重點:那個負責解析搜尋詞的語言模型,可以用 Google 的 Gemini 雲端 API,也可以用本地的 Ollama 跑開源模型。官方環境設定範本裡,這兩條路就是兩個開關(USE_GEMINI 與 USE_OLLAMA_MODEL),你選哪一個,決定了整套系統是「本地分析、雲端搜尋」還是「全程離線」。對隱私要求最嚴格、連搜尋詞都不想送出機房的人,會想把這個開關也撥到本地,這樣整套系統就連搜尋這一步也不碰雲端。

搜尋之後,還能直接拼出粗剪

索引和搜尋之外,Edit Mind 還往工作流程的下游多走了一步。官方文件說,你可以用自然語言描述想要的片段組合,例如「給我所有主角看起來很開心的鏡頭」,系統會把命中的片段自動排成一條粗剪時間軸。這條時間軸省掉的是剪接師手動「翻素材、標記、拖片段」的前置工作;真正的剪接、節奏與調色,還是得回到 DaVinci Resolve、Final Cut Pro 這類專業軟體做精修。

官方也提到桌機版會進一步做 Resolve 與 Final Cut Pro 的直接整合,但這個整合目前屬於預購中的桌面版 App 才有的功能,自架的 Docker 版本不一定同步。讀者在判斷這個功能時要注意:它屬於作者規劃中的能力,實際完成的程度要自己裝起來看才準。

整條分析管線的另一個特色是它把每個分析能力都拆成 Python 模組。從 repo 的 plugins 資料夾可以看到,目前已實作的包含物件偵測、人臉辨識、景別(鏡頭類型)分析、畫面文字辨識與主色調提取,每個都自成一個檔案。這代表如果你有比較特殊的需求,理論上有機會照著同樣的結構自己寫一支 Python 外掛掛進去,不用動到主程式。

官方介面與 repo 裡實際看到什麼

從 GitHub 上的展示影片與官方首頁來看,Edit Mind 的介面是一個網頁式的操作台。左邊列出你的影片資料夾,點進某支影片可以看到它被切出來的場景片段、每個片段掛了哪些標籤(人臉、物件、文字、色調),搜尋結果會把命中的片段排成時間軸。官方首頁也標明了這個專案入選了 Founders Inc 的 Canopy 加速器計畫,在 GitHub 上累積了上千顆星標,是一個有持續維護跡象、但仍在衝向 1.0 的早期專案。不過這套工具目前主要靠 Docker 跑,還沒有一鍵安裝的桌面版能直接下載來用。

Edit Mind 官方首頁的產品介面與本地影片索引定位Pin
Edit Mind 官方首頁(edit-mind.com),主打把素材在本機建成可搜尋的知識庫。

值得釐清的是它「開源」這個標籤。作者在 2026 年 2 月 21 日之後的版本,已經把授權從原本的 MIT 換成了一套自訂的 Edit Mind License。這套條款允許個人、5 人以下的營利組織、以及非營利機構免費使用(包含商用),但只要是一家超過 5 人的營利公司,就必須另外談商業授權,而且不能拿它的程式碼去做一個跟它直接競爭的產品。嚴格說,這是「原始碼公開、附帶商業限制」的 source-available 授權,不是 OSI 定義下那種可以隨意改作轉售的開源。如果你是個人或小團隊自用,條件相當寬鬆;但如果你在公司裡打算部署給一群人用,就得先把人數和授權算清楚。這個授權細節會直接影響你的採用決定。

Edit Mind 在 GitHub 上的原始碼公開專案倉庫頁面Pin
Edit Mind 的 GitHub 專案倉庫(IliasHad/edit-mind),授權條款與星標數都在這裡查看。

什麼樣的人會用得起來

用這套工具用得最順手的,是素材量大到靠記憶翻不動的人。接案剪接師累積了幾年的空拍、訪談、活動側拍,客戶突然要「之前拍過那個夕陽的畫面」,這時一支能用「夕陽」「暖色調」「戶外」這種白話就調出候選片段的本地索引,確實能省下大量翻素材的時間。

另一種是重視素材機密性的團隊。企業內部訓練影片、未公開產品的拍攝素材、受訪者隱私敏感的紀錄片,這類內容往往合約上就不能上傳到第三方雲端平台做分析。Edit Mind 把分析留在本地、只在你主動開啟雲端模型時才把文字特徵送到 API,這種架構直接對應到這類工作裡真實的合約限制。

還有一種是長期做訪談型內容的創作者。訪談節目、Podcast 的錄影、研討會側錄,這類素材的核心資訊往往藏在「誰講了什麼」裡,而 Whisper 轉寫正好把這些對白變成可搜尋的文字。日後要回頭找「上次某位來賓談到 AI 監管的那段」,靠的是對白內容與人臉辨識,不必再靠記憶翻資料夾。素材越是累積型的長期計畫,這種索引能省下的重看時間就越多。

不過要誠實講:如果你的素材只有幾十支、隨手用資料夾分類就找得到,架這套系統付出的心力不見得換得到對等的方便。它的價值跟你素材庫的規模成正比,素材越多、越雜、越難靠檔名回憶,它才越能發揮作用。

想試的話,門檻與第一步

先把幾個硬限制看清楚。它需要 Docker,整套服務是用 Docker Compose 跑在一組容器裡,你得先裝好 Docker Desktop 並讓它能存取你的影片資料夾,這對沒碰過容器技術的人是一道實實在在的門檻。跑 AI 分析也吃硬體,官方提供了一般版與 NVIDIA GPU 版兩套 Docker 設定檔,桌機沒有獨立顯卡的話,索引速度會很慢。作者在 README 也提到,Docker 容器沒辦法用到 Apple Silicon 的 GPU,這也是後來推出桌面版 App 的原因之一,想榨出 Mac 蘋果晶片效能的人得走那條付費路。而專案版本號目前落在 v0.30,官方 README 明說還在積極開發、尚未達生產級穩定,會有未完成的功能和潛在的 bug,要把它當成早期版本來期待,離成熟產品還有距離。

如果這些條件你都接受,官方提供了一條 easy-mode 安裝指令,背後做的事是把環境設定檔和 Docker Compose 設定檔抓下來,改好你的影片資料夾路徑和要用的 AI 模型,再啟動容器:

curl -sSL https://get.edit-mind.com | sh

跑起來之後,網頁操作台開在本機的 3745 連接埠,用預設帳號登入就能開始加入資料夾、讓它開始建索引。第一次索引會比較吃資源,建議先拿一個小資料夾試跑,確認模型與硬體跑得動,再放進整庫素材。想更深入了解同類自架工具怎麼從 repo 判斷值不值得架的人,可以看看〈Readdig 開源閱讀器:自架前能從 repo 看出什麼〉。

自架免費,但有另一條付費捷徑

Edit Mind 走的是兩條產品線。自己用 Docker 架的那一套是原始碼公開、對個人和小團隊免費的版本,作者也明說這個版本會繼續留在那裡、不會收走。但如果你不想碰 Docker、也不想自己處理模型與容器,官方另外有一個桌面版 App 在預購,定價是 199 美元的終身授權,預計 2026 年第三季出貨,主打一鍵安裝,還加上對 DaVinci Resolve、Final Cut Pro 的直接整合,以及對 Apple Silicon GPU 的支援(這在 Docker 容器裡用不出來)。

這條付費路其實反映了原始碼公開專案常見的現實:社群版讓計畫活下去,付費版讓沒有技術背景的人也用得到。對於願意花時間換免費的人,自架那條路就夠了;對於只想在 Mac 上一鍵打開就跑的人,等桌面版出貨、用 199 美元買省下來的折騰,也是合理的取捨。它是不是適合你,說到底看幾件事:素材量大到值得建索引、能接受用 Docker 換隱私、也願意陪一個還沒到 1.0 的早期專案一起用。這幾項都成立的話,它現階段就值得裝來試。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 877

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...