Short Video Factory 開源一鍵成片,自動生文案配音剪出短影音

Short Video Factory 是開源的短影音一鍵成片工具,輸入一句賣點就自動生腳本、配音、上字幕,再從素材庫隨機混剪成片,還能掛批量模式循環量產。這篇從原始碼核對它的真實結構:剪輯合成本機跑,文案要自備雲端 API,配音走微軟非官方通道,下載前該確認的四件事一次看清。

用 AI 摘要這篇文章:

在 GitHub 上找短影音自動化方案,Short Video Factory(短影音工廠)是目前聲量最高的開源選項之一:五千一百多顆星、七百多次 fork,AGPL-3.0 授權,Windows、macOS、Linux 都有官方安裝檔。它的承諾一句話講完:輸入一句產品賣點,它自己生腳本、配音、上字幕、從你的素材庫抽片段混剪,渲出一支成片;開批量模式就循環生產,掛著放就能日夜出片。

把它納入生產線之前,值得先分清這條線的真實形狀:四個工作站裡,剪輯合成那一段確實整個在你的電腦上跑,但生文案那站要你自備雲端 AI 的鑰匙,配音那站站在微軟的伺服器前面,而且這條通道隨時可能改規則。

先交代本文的接觸層級:以下來自完整的原始碼檢視與官方資料核對(2026 年 8 月查證),我沒有實際安裝它跑出影片,所以成品好看與否、實際出片多快這類效果問題,本文不替它背書,文末會給你自己驗的方法。官網行銷頁承諾 30 秒出片、新手日更 100 條,還掛著 GPU 加速渲染、性能翻倍的說法,本文能做的是核對這些字面與代碼現實對不對得上。

生產線的四站:文案、配音、分鏡、合成

從原始碼看,一句賣點變成一支片的流程是四站接力,每一站的機制都攤得開。整個程式是 Electron 應用配 Vue 3 介面, ffmpeg 直接綁在程式裡,不安裝額外的轉檔工具也能跑;介面本身也照這四站分工,文案生成、配音控制、素材管理、渲染輸出各一個面板,照著走一遍就是完整流程。

Short Video Factory 應用程式介面,左側選單列出文案生成、素材管理、渲染輸出等分站,主畫面是素材庫檔案清單,右側有分鏡時長範圍設定、語音音色選擇與背景音樂資料夾欄位Pin
Short Video Factory 官方介面截圖:分鏡時長範圍預設 2 到 15 秒,對應原始碼裡的亂數抽樣參數(2026 年 8 月,GitHub repo)

第一站生文案。內建的 AI 生成走 OpenAI 相容介面,設定畫面就三個欄位:API 位址、金鑰、模型名稱,全部由使用者自己填,程式沒有預設任何供應商。原始碼這段用的是 Vercel AI SDK 的 OpenAI 介面卡,所以 DeepSeek、Moonshot,或自己架的 Ollama 相容端點都接得上。這站的白話含義:沒有自己的 API 金鑰,整條線停在第一步;有金鑰,你的賣點文字會送去你填的那朵雲,成本也隨生成次數累計。

第二站配音,用 EdgeTTS。程式直接連微軟 speech.platform.bing.com 的朗讀介面,這個介面本來只服務 Edge 瀏覽器自己的朗讀功能,微軟並沒有把它當對外開放的正式服務來經營。原始碼常數區把喬裝手段寫得很明白:一組寫死的受信任用戶端權杖、把請求來源偽裝成某個瀏覽器擴充功能、User-Agent 偽裝成 Edge 瀏覽器,連 Chromium 版號 143.0.3650.75 都直接寫成常數,另外還有一組動態計算的驗證參數,這正是這條通道被反覆加鎖又解鎖留下的痕跡。配音輸出是 24kHz 單聲道 mp3,逐字的時間邊界也一併回傳,成為下一站字幕的原料。

第三站分鏡,從你指定的素材資料夾隨機抽。每段長度在 2 到 15 秒之間亂數決定,起點也在素材內亂數落點,同一輪用過的素材不再重複,片段總長度貼著配音長度湊,最後一段超長就截短補齊;不到 2 秒的短素材會整支用上。素材庫總時長不夠時不會硬剪,試到上限就直接報錯提醒你補料,錯誤訊息從 v1.2.0 起可以一鍵複製細節,回報問題方便不少。所以行銷文案講的自動混剪,實際機制就是亂數抽樣:成片的多樣性來自骰子,腳本講什麼與畫面播什麼之間沒有對齊邏輯,素材內容與賣點的關聯要靠你自己把素材庫顧好。想把素材先整理成能餵生產線的形狀,可以參考之前介紹過的本機短影音素材庫管理工具

第四站合成,ffmpeg 在本機跑完。濾鏡鏈做裁切、縮放、補邊、拼接,固定 30fps 與 yuv420p,字幕用 subtitles 濾鏡燒進畫面,人聲與背景音樂各自做響度歸一化再混音,背景音樂裁到與配音等長,最後交給 libx264 編碼輸出。背景音樂同樣從你指定的資料夾隨機抽,程式只認 mp3 副檔名,放其他格式會被直接略過,這個小規則值得先知道,免得 BGM 永遠抽不到。輸出解析度、檔名、資料夾都能自訂,直式橫式都行;程式設定存在本機的資料庫裡,重開不會掉。

字幕的來源值得單獨講:字幕的時間軸直接來自配音環節。EdgeTTS 回傳的是逐字時間邊界,程式按朗讀停頓把字邊界分組成斷句,生成 SRT 字幕檔再燒進影片。這個設計省掉了 ASR,代價是字幕只對得上配音軌;你的素材影片裡若有人說話,那些話不會出現在字幕裡。

批量模式就更直白了:渲染成功後清空文案,自動重跑整條流程,每一輪在分鏡與渲染之間隨機停 1 到 3 秒。官網說的 24×7 無人值守,實作就是這個遞迴。

README 寫完全本地,原始碼裡有三個例外

README 的功能清單裡有一條宣稱安全可靠、完全本地本地化運行、用戶資料因此安全。這句話對想把它當生產線的人很重要:隱私邊界與依賴風險都會照它規劃。對著代碼逐項核對,它需要加三個但書。

文案那站先被劃掉。生成腳本要送你自備的雲端 API,這在前面講過;「完全本地」的範圍從第一站就守不住。換個角度看,這也是個清爽的設計:程式沒有綁死任何預設供應商,要外送哪些字、送給誰,決定權在你填的那三個欄位上。

配音那站送微軟,而且這條通道實際會斷。issue #76(2026 年 7 月回報,至今未關)的錯誤紀錄顯示語音清單直接拿到 503;#80 同月回報合成失敗,錯誤訊息一樣指向配音環節。這不是偶發意外,而是非官方通道的結構性風險:微軟哪天改規則,工具就得跟著改喬裝參數,代碼裡那個寫死的版號常數正是每次要追著更新的東西。社群自己也清楚這個依賴,#81 直接提出希望加入本地 TTS。想先不用安裝任何東西就體驗微軟這條通道的脾氣,可以玩玩之前介紹過的 Edge TTS 網頁工具;想把配音整段留在本機不走雲端,Voice-Pro 那類本機配音管線是另一條路線。

GitHub issue 第 76 號畫面,標題為獲取 EdgeTTS 語音列表失敗請檢查網路,內文錯誤紀錄顯示遠端呼叫收到 503 狀態碼Pin
issue #76(2026 年 7 月回報,至今未關):語音清單請求直接收到 503,配音通道斷流的實錄

第三個但書比較意外:v1.2.1 版起(2026 年 3 月),主程式內建了匿名事件統計,會把關鍵流程事件送到開發者自己的統計伺服器 stat.yils.blog。從原始碼看,回報範圍連主視窗載入完成都算在內,渲染開始、成功、失敗、取消全在清單上,附帶螢幕解析度、語系與頁面名稱,正式版無條件送出,請求逾時上限五秒、失敗就靜默略過。公平地說,CHANGELOG 對此有揭露,明說這一版增加了主程式的匿名統計上報,送出的欄位也不含你的文案與素材;但 README 那句「完全本地」在這版之後沒有同步改字,對照起來就是宣稱與現實的落差。在意的人可以在防火牆擋掉這個網域,帳要自己算。

所以精確的說法是:素材與成片確實不離開你的電腦(合成站全本機),但「完全本地」四個字已經描述不了現狀。它的隱私條件比純雲端服務好得多,比字面宣稱少了一截。

GPU 加速渲染這六個字,在代碼裡找不到著落

官網首頁寫「支持 GPU 加速渲染,性能翻倍」,README 裡反而沒有這句。把整個倉庫掃一遍,hwaccel、cuda、vaapi、videotoolbox、nvenc 這些硬體編碼的關鍵字全部零命中,輸出編碼就是一行 libx264 的軟體編碼參數。也就是說,「GPU 加速渲染」在這個專案的代碼裡找不到對應的實作;桌面介面的動畫跑得順,與成片編碼有沒有用到顯示卡是兩回事。

Short Video Factory 官方網站首頁,三張功能卡片寫著一鍵成片 30 秒出片與日更 100 條、批量混剪全自動、跨平台桌面端支援 GPU 加速渲染性能翻倍Pin
官網首頁的三張行銷卡片(2026 年 8 月):30 秒出片、日更 100 條、GPU 加速渲染都在這頁,README 裡反而沒有 GPU 這句

同頁的 30 秒出片與新手日更 100 條也屬於行銷口徑。一支片要走完生文案、雲端配音、本機渲染三段,實際耗時取決於文案長度、素材庫大小與機器等級;文末的驗證步驟能讓你自己量出真實節奏。量產的另一面也值得先想:亂數分鏡產出的成片,本質是素材拼貼,畫面與文案之間沒有內容關聯,這類影片走的是量產背景型的路線,當帳號的主打作品有難度。把它定位成產線,就要接受產線的產品長相。

要公平地說,這些落差發生在行銷頁與代碼之間,專案本身的治理是規矩的:授權條款、CHANGELOG、issue 追蹤都開放完整,前面兩個但書也正是因為代碼攤得開才查得到。開源的誠實紅利就在這裡。

自備 API、配音斷流與 AGPL:下載前的四道關卡

第一道關卡是 API 金鑰。你手上沒有一組 OpenAI 相容的金鑰,這條線就開不了工;有,記得把生成成本算進量產預算,每一支片都會消耗一次。

配音斷流的忍受度同樣關鍵。#76 與 #80 至今開著,通道修復的時間表取決於開發者追微軟改動的速度。macOS 使用者還要加看 #43:部分環境下燒進影片的中文字幕會變亂碼,與 ffmpeg 抓字型的行為有關,裝之前先確認自己躲不躲得過。

授權要看的是商用邊界。AGPL-3.0 對單純拿來產片的使用者沒有影響,產出的影片是你的;但團隊若修改程式再對外提供服務,有相應的開源義務,商業導入前讓法務看一眼(這段是條款推論,不是法律意見)。

專案節奏與介面語言則決定長期相處的品質。這個專案由一位開發者獨力推進:全部 117 個提交裡 116 個出自同一人之手。版本史前段是健康的:2025 年 8 月 v1.1.1、10 月 v1.1.10、2026 年 1 月 v1.2.0、3 月 v1.2.1、4 月 v1.2.2,之後四個多月沒有新版本,最近一次程式碼更新是 2026 年 7 月補的文件素材。v1.2.2 三個平台的安裝檔合計下載約三千三百次,Windows 佔七成三,實際使用者集中在 Windows。放緩但未死,你的用途決定能不能接受這個節奏。介面語言只有簡體中文與英文,沒有繁中。

同樣想把開源 AI 影片流程搬回家、但走劇本驅動路線的,可以對照看之前介紹過的 Jellyfish 開源短劇工作流;兩者的素材準備邏輯可以互相借用。

先花五分鐘驗三關,再決定要不要養這條線

不用急著配 API,最脆的一環可以先驗。裝好 v1.2.2 之後,直接到配音區按試聽:這一步只走微軟通道,聽得到聲音、音色清單拉得下來,通道就是活的;直接 503 或逾時,就是撞上 #76 那類斷流,可以先看 issue 進度再決定等不等。第二關丟兩三支短素材進素材庫,看時長讀不讀得到;讀得到,亂數分鏈就湊得出來,讀不到的素材會在合成階段報錯,等於白排隊。第三關在 macOS 上渲一支帶中文字幕的短片,字幕清楚不是亂碼,#43 的地雷才算繞過。三關都過,再來認真組素材庫與 API 也不遲;試聽就失敗的話,這條線對你暫時只是個倉庫裡的好點子。

已經有素材庫、有自己的 API、需要大量產出同模板變體的人,例如電商商品短片或語錄類內容號,用起來會順手;需要精細剪輯控制、繁中介面或長期穩定保證的團隊,它現在給不了。一句話收尾:想把工廠開在自己電腦上,它給的比想像中完整;想把 AI 也一起關在家裡,那兩站還在雲端,這是它現在的樣子。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 927

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...