Video Material GEN Workstation:把短影音素材收進本機統一管理

Video Material GEN Workstation 是開發者 Norsico 的自架專案,把短影音的腳本、配圖、配音、字幕收進同一個本機介面統一管理。但從原始碼與設定檔看,它本身不內建任何 AI 模型,名字裡的 GEN 指的是管理你用外部服務產出的素材;要跑起來得自備 Gemini 相容端點與 TTS Key,字幕側還打包了 Windows 執行檔。這篇從機制、BYOK 門檻、反向代理的灰色地帶到適合誰,一次講清楚。

用 AI 摘要這篇文章:

Video Material GEN Workstation 是開發者 Norsico 放在 GitHub 上的自架專案,把短影音製作裡本來散落在好幾個工具的步驟(腳本、配圖、配音、字幕)收進同一個在本機 localhost:8765 跑的網頁介面。1586 顆星標、278 個 fork 的熱度說明它打到了不少自媒體創作者的痛點。但從 server.js 與設定檔看下來,它有一個必須先講清楚的事實:它本身不內建任何 AI 模型,名字裡的 GEN(生成)指的是它管理你用外部服務產出的素材,而不是它自己生成影片。連作者在 README 都直白寫著「主要還是偏向管理用的,功能不會有你想像的那麼實用」。想知道值不值得裝,先把它的機制與門檻看清楚再決定。

它管素材,不生成影片

server.js(約 1300 行)翻開,會看到這個工作站真正做的事:它是一個 Node.js 寫的本地網頁服務,啟動後打開 index.html 介面,讓你用卡片管理一個個影片專案,背後的 AI 能力全部來自你設定的外部端點。配圖與文案走三個地方都重複出現的 Gemini API 呼叫(第 497、670、1003 行附近),讀的是設定檔裡的 Gemini-API-KEYGemini-BASE-URLGemini-MODEL 三個欄位;配音走 TTS API,讀 TTS-API-KEY;字幕走打包進倉庫的執行檔。

換句話說,工作站的角色是「把你用各種外部服務產出的素材,收進一個可預覽的專案資料夾」,它不做影片剪輯或合成,整支程式裡找不到影片編碼的邏輯。這也是為什麼作者在 README 反覆提醒「接下來如何好好利用這個專案還是得靠自己」「影片內容如何定義、如何做出高流量作品還是需要動腦子」:它給你的是一個把散落步驟收攏的工作台,不是一台會自己產片的機器。期待後者的人,裝完會有明顯落差。

把「管理」這兩個字具體化,它真正提供的生產力來自幾個地方。專案層級的組織:每一期影片是一張卡片,記著輸出目錄與建立時間,指令碼、配圖、字幕、音訊都收在同一個資料夾,不用再自己用檔案總管分類。圖文分軌預覽讓素材可以被替換並即時檢查:圖片、字幕、音訊分開呈現,前端可替換單一元素就看到結果,改一張圖或一段配音不必重跑整個流程。更實用的是提示詞的集中複用:角色描述、場景描述這類會跨期重複的提示詞被收在一起,勾選就能批量丟進繪圖任務,歷史紀錄也留著,這對角色立繪要前後一致的解說類頻道特別有感。這幾層加起來,才是它「工作站」名號的實際內涵。

Video Material GEN Workstation 專案總覽介面截圖,以卡片網格顯示每個影片專案、檔案路徑、建立時間與刪除按鈕Pin
Video Material GEN Workstation 的專案總覽介面(官方提供)。每期影片是一張卡片,記錄輸出目錄與建立時間,介面為簡體中文。

三個設定欄位決定它跑不跑得起來

安裝第一步是 cp env.example.yaml env.yaml,而這份設定檔才是真正的門檻所在。它要求你至少填齊三組值:Gemini API Key、一個 Gemini 相容的 Base URL、要用的模型名稱,再加上獨立的 TTS API Key。沒有這些,介面上的生成按鈕叫不動任何東西,這是典型的 BYOK(Bring Your Own Key)設計,成本與額度都算在你接的那個服務頭上,工作站本身不附帶任何用量。

預設值透露了另一個訊息。env.example.yaml 裡的 Gemini-BASE-URL 範例是 http://127.0.0.1:5345,開頭註解直接寫「我這裡是本地自己部署的反向代理 AI」;README 也說明圖像編輯用的是作者自己部署的「NanoBanana,本地部署的 AIStudio 的反向代理的端點,用來生圖然後給 Sora 也是不錯」。也就是說,作者示範的能跑配置,基礎是自己架了一個 Google AI Studio 的反向代理,不是 Google 官方 API。

這裡要特別提醒:工作站本身是端點無關的,Gemini-BASE-URL 填什麼它就打什麼,你可以填 Google 官方的 AI Studio API 端點、任何正規代理,或沿用作者那種自架反向代理。但「反向代理 AI Studio」這條路涉及 Google 服務條款的灰色地帶,是不是該這樣用、會不會被官方認定違規,工作站沒有幫你判斷,這條合規風險要你自己評估。TTS 那側作者註解推薦的是「模力方舟」的 IndexTTS-2,並提到每天可以免費用 100 次,這同樣是第三方服務的額度,與工作站無關。若想比較正規的免費語音方案,可以參考我們整理的 Edge TTS 文字轉語音工具

Video Material GEN Workstation 的 TTS 合成面板截圖,顯示文案、圖片、TTS、提示詞等多個分頁與語音合成設定Pin
TTS 合成面板(官方截圖)。上方分頁可切換文案生成、配圖、配音與自由創作,配音需填入參考音訊網址與情緒文字。

再往細節看一層,這個工作站對 Gemini 端點的用法涵蓋文字與圖像兩種產出。文案生成是讓模型改寫腳本、產出結構化的場景描述,可單條或整段複製;配圖與立繪呼叫的預設模型是 gemini-2.5-flash-image,也就是 Google 以 Gemini 2.5 Flash 為底的圖像生成/編輯模型,作者把它同時拿來做角色立繪、背景與素材合成,並且支援上傳參考圖、設定寬高比。換句話說,你填進去的其實是一支「能同時做文字與圖像」的 Gemini 相容端點,至於這個模型在 Google 官方計費下要花多少、或反向代理能撐多久,完全取決於你選的那條路,工作站只負責把請求送出去、把回來的素材收進專案。

字幕側靠打包的 Windows 執行檔

字幕功能不是純網頁實作。介面上有個「字幕生成」按鈕,背後呼叫的 /api/open-asr-tool 端點,會用 execFile 啟動 asr/AsrTools.exe 這個執行檔;而 asr/ 目錄裡還打包了一個約 84MB 的 ffmpeg.exe。README 在這段標明「此部分程式碼由其它作者開源」,也就是 ASR 引擎是第三方開源專案,由作者以 Windows 執行檔的形式一起放進倉庫。

這個設計帶來兩個直接後果。這個 84MB 的 ffmpeg 把整個倉庫撐大到約 60MB,第一次 git clone 的下載量不小;而 .exe 與根目錄的 start.bat、以及設定檔裡的預設專案路徑(\Users\lenovo\Desktop\...)都是 Windows 思路,macOS 與 Linux 使用者的 ASR 按鈕會直接失效,要自己找替代的 ASR 工具或跳過這塊。另外,README 提到「字幕抓取」要搭配作者的另一個專案 n8n-http-tools(可從 Bilibili 影片提取字幕),這部分屬於外部依賴,不在主倉庫裡。

順著 n8n-http-tools 往下看,會看到這條字幕鏈其實指向一個明確的使用情境:作者在 README 說明,搭配這個 Bilibili 字幕提取器,可以「參考別人高播放的影片自己學起來也會快很多」。換句話說,工作站預設的取材思路之一,是從現成的高流量短影音抓字幕當腳本範本,再用自己的 Gemini 端點改寫、重新配圖配音。這條路在技術上跑得通,但把別人的影片內容拿來當改寫素材,會碰上版權與原創性的問題,平台對這類「換殼轉載」內容的容忍度也越來越低。把它當成學習與拆解高流量作品結構的練習工具是一回事,要直接當成量產發布的內容來源,風險得自己拿捏。

介面與官方示範長什麼樣

README 提供了六張介面截圖與一張「抖音投放資料」圖,從官方展示可以看出工作台的幾個主要面板:以卡片呈現的專案總覽、結構化的場景腳本區、可單條複製並與提示詞連動的文案區、圖文分軌預覽,以及立繪/背景的提示詞輸入與歷史紀錄。這些截圖是作者官方提供、用來標示「介面有哪些能力存在」,並不代表你裝起來的效果或穩定度;畢竟實際能不能用,取決於你接的端點與 TTS 服務品質,而這些是官方示範圖無法替你保證的。挑圖與配圖的品質,也可以對照我們整理過的 GPT 圖像生成工具 一類方案的思路。

這個「把腳本、配圖、配音、字幕收進同一個自架介面」的定位,與其他自架短影音工作流工具(例如我們介紹過的 YumCut 自架短影片工作流)是同一條思路上的不同實作:兩者都想把產製流程留在自己機器上,差別在於 Video Material GEN Workstation 更偏向「素材管理+BYOK 編排」,而後者在成片環節著墨更多。選哪一種,取決於你缺的是管理介面還是剪輯能力。

另一個容易看漏的定位是它在產製鏈上的位置。README 提到產出的圖像素材「用來生圖然後給 Sora 也是不錯」,作者把這個工作站放在影片生成服務的上游:它負責把腳本、配圖、配音這些原料備齊、管好,真正把素材組成成片的是 Sora 一類的影片生成模型,或你自己後續的剪輯軟體。這跟近年不少把劇本到成片串成一條流程的 AI 短影音專案(像 Jellyfish 開源 AI 短劇工作流)相比,企圖心小一圈,但也意味著它不跟你已有的剪輯流程搶位置,只補「素材備料」這一段。

裝之前要先接受的幾個限制

把會改變你決定的條件集中講清楚:

  • 全 BYOK,沒有 Key 連第一張圖都生不出來。Gemini 相容端點與 TTS Key 是硬門檻,沿用作者的反向代理配置則涉及 Google 服務條款的灰色地帶。
  • 字幕側是 Windows 執行檔。macOS/Linux 使用者的 ASR 功能無法直接使用,且倉庫被 ffmpeg 撐大到 60MB。
  • Docker 部署作者自承現階段有 bug。README 直接把小節標成「通過 Docker 部署(目前有 Bug)」,可用路徑是原始碼部署:npm installnpm start
  • 授權狀態含糊。package.json 寫了 license: MIT,但倉庫沒有 LICENSE 檔案(GitHub 也因此偵測不到授權),README 只有一句「僅供參考交流學習使用,不對任何使用者產生的問題負責」。要商用或二次散布,建議先找作者釐清。
  • 專案進入低維護期。程式碼提交集中在 2025 年 11 月底,之後只在 2026-06-02 更新過 README,近兩個月沒有新的程式碼提交。1586 顆星標是早期熱度,但修 bug 的預期要相應降低。

適合誰,與自己核對一次的方法

這個工作站適合的人其實很明確:已經在用某個 Gemini 相容 API(或願意自己弄到一個)、手上有 TTS 服務、主要產出是解說或劇情類短影音、而且希望用一個本機介面把每一期的腳本與素材管起來的個人創作者或小型團隊。如果你的產出節奏是「一週好幾支、角色與場景會重複出現」,它那套提示詞複用與專案卡片管理才會真正幫上忙;偶爾做一支影片的人,用一般的資料夾加上單獨的生成工具反而更輕。如果你期待的是裝完就一鍵產出可發布的影片、或想要一個自帶算力的生成引擎,它目前都做不到,那會是另一類工具的任務。

想低成本自己核對一次,不必先全部裝起來:先到專案 GitHub 把 README 的六張介面截圖與 env.example.yaml 看過一遍,確認它要求的欄位你都能湊齊;接著用正規的 Gemini API Key(或你本來就在用的相容端點)填進 env.yaml,跑 npm install && npm start,打開 localhost:8765 試著生成一條腳本與一張配圖。如果在這一步介面能正常回應、產出的素材進到你設定的專案資料夾,就代表你的環境跑得動,再決定要不要把整套流程(配音、字幕、分軌預覽)接起來。反之,連預設端點都喬不攏的話,停下來換工具會比硬啃原始碼划算。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 833

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...