TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南
TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南

895 顆星的開源自動影片生成器 auto-video-generateor,體驗站掛著 502、開發停擺近一年,但免費自架路線的語音、生圖、文稿原料至今活著。實測現況、登入頁真相與自架前該知道的連接埠陷阱,一篇看懂值不值得裝。
用 AI 摘要這篇文章:
打開 auto-video-generateor 的體驗站,你會拿到一個 502;打開它的 GitHub,最後一次提交停在 2025 年 10 月;但把它湊成影片的那些免費原料,語音引擎、生圖服務、文稿模型,我在 2026 年 10 月的台灣網路逐一試過,全部活著。這三件事放在一起,就是這款 895 顆星的開源工具目前的真實樣貌:入口斷了,產線還在,只是產線要你自己搬回家組裝。
先講判決。它適合的人很明確:想批次產中文知識型解說影片、願意裝 Python、能自己去申請一支文稿模型金鑰的人,拿到的是一條每個環節都攤開給你看的產線。它不適合的人也明確:只想貼個主題按個按鈕就收片的人,雲端一鍵服務比較近,這條路的組裝與維修成本會把你磨到放棄。至於我這邊的邊界也先交代:體驗站連線、兩個外部服務的實測、原始碼與專案時間線,是我親自查的;完整產線從安裝到產出影片,我沒有跑完,原因和風險下面會講清楚。
這個專案在 GitHub 上的名字叫 kuangdd2024/auto-video-generateor,連名字裡的 generateor 都拚錯了,但功能描述很完整:輸入一個主題,系統叫大語言模型寫出故事或解說文稿,接著用語音合成唸出來、用文生圖配上畫面,最後把聲音和圖黏成一支解說影片。後來的版本還吃 PPT,把每頁備忘稿當逐字稿、投影片當畫面,直接轉成課程影片。
它原本有兩種用法。一種是點開體驗站 avg.kddbot.com 直接玩,另一種是把原始碼抓下來自己架。現況是第一種已經斷了:這個站走 http,連 https 都沒有,2026 年 10 月 7 日連續三次連線,拿到的都是閘道器回的「上游伺服器給了無效回應」,也就是 502。更有意思的是,這件事作者自己早就預告過。README 的體驗區寫著,示範網頁可能會崩、可能連不上,屬正常現象,因為後台太脆。一份官方文件用三個驚嘆號警告自己的後台,這在開源專案裡不算常見。
體驗站的帳密也拿不到。原本的設計是加作者的微信公眾號,傳一句通關密語換帳號密碼。這條路即使站還活著也偏繞:為了試一個工具去裝微信、加公眾號、等私訊,多數人到這一步就退出了。所以剩下的路只有自架,而自架的每一塊原料,正好都可以單獨驗證。
看一個專案還有沒有人照顧,看提交紀錄和 issue 最準。這個 repo 在 2024 年 8 月開張,43 個提交一路做到 2025 年 10 月 15 日,提交訊息寫著 PPT 轉影片功能,然後就停了,到今天將近一年。沒有任何正式發布版,沒有標籤,你抓的就是 main 分支當下的快照。
作者不是消失,是把話說得很白。2024 年 10 月有人問專案還更新嗎,他回還在維護,只是近期沒空管理,未來還會更新。2025 年 4 月又有人問現在還維護嗎,他到 8 月才回:好久沒維護,不定時維護,照著 README 操作即可。同一個月有人回報跑不起來,他的答覆是,什麼報錯就去問 DeepSeek 吧,看看是依賴問題還是別的原因。2026 年 3 月最新的一則「執行報錯」issue,到現在七個月,零則回覆。
| 時間 | 事件 | 出處 |
|---|---|---|
| 2024-08-12 | repo 建立,作者同日在 issue #1 附上樣片宣傳 | issue #1 |
| 2024-10-09 | 作者承諾未來還會更新 | issue #4 |
| 2024-11-26 | 社群提交修正依賴問題的 PR,至今未合併 | PR #9 |
| 2025-08-11 | 作者自述「好久沒維護,不定時維護」 | issue #12 |
| 2025-10-15 | 最後一次提交(PPT 轉影片功能) | GitHub 提交紀錄 |
| 2026-03-17 | 最新一則執行報錯 issue,無人回覆 | issue #14 |
| 2026-10-07 | 體驗站三次連線皆 502 | 實際連線測試 |
對照參考:有人在 2024 年就問過這工具需要顯卡嗎,作者的答覆是不用,普通電腦就可以。這點合理,因為所有 AI 能力都走外部 API,本機只負責組裝。這也意味著它跑不跑得動,取決於那些 API 活不活,跟你的硬體無關。
它的核心設計,是把「生成影片」這件事拆成看得到的四段:文稿、語音、配圖、合成。主題交給文稿模型寫成逐句的稿,每一句送去語音合成變成一個 MP3,再送去文生圖變成一張圖,最後用 moviepy 把句子、聲音、圖對齊,輸出成影片。預設畫面比例是 1280×720。
文稿這步有個容易被忽略的抓手:主題會先套進一段 prompt 模板,再送去給模型。模板裡寫的是「把這個主題寫成什麼樣的稿」,你可以把它改成知識科普腔、故事腔或任何你頻道要的口吻,模型照著寫,後面的語音和配圖都建立在這份稿上。也就是說,整支影片的敘事品質由這段模板決定,整個專案裡最值得投資工時的設定就是這段模板。分句則是照標點符號切,句子切多細,圖和語音就切多細,一支影片的節奏感在這裡成形。
真正值得記的是它處理素材的方式。所有中間產物都存成普通檔案:一個資料夾裡,audio 放每句的語音、image 放每句的配圖、text 放分句後的文字、resource 放對應的參數紀錄,加上一份 story.txt 和最後的 video.mp4。這代表產線的每一步都攤在檔案裡:看得到、改得動,整包素材也能搬去別的剪輯軟體。和雲端服務那種「影片生成了,素材在我們伺服器上」的模式相比,這是兩種完全不同的所有權結構。
它的操作模型也建立在這個設計上。官方工作流程是先生成一輪全部素材,然後進入校對:哪句文稿不順就改哪句,哪張圖不滿意就重生哪張,聲音的語速、音量、音高都能調,設定頁也做得直接,改參數時可以先試聽一句再決定。改到滿意,再合成影片。README 特別警告,一定要把整個流程完整跑過一輪之後,才能去改單項素材,尤其是建檔那一步,順序錯了後面會對不起來。一鍵魔法並不在它的菜單上,它供應的是一條允許你中途插手的產線。
不過校對這步本身蓋到一半就停工了。專案的待辦清單上,素材的切分、合併、增加、刪除這些校對操作還掛著未完成,批次下載整包素材、字幕與畫面分離(現在字幕是直接燒在配圖上的)也都還是願望。所以實際體感會是:能改能重生的範圍比一鍵服務大得多,但離一套完整的素材管理台還有距離,細部操作得回到檔案總管手動搬。
配圖這段有個藏起來的行為,不看原始碼不會知道。文生圖用的是 pollinations.ai 的免費生圖端點,請求帶著 nologo 參數拿乾淨圖。如果這個請求失敗,程式不會報錯也不會停下來,直接把那句文字排版畫成一張圖片,塞進影片裡頂著用。所以當你看到成品裡出現整頁都是字的畫面,那並非刻意的美術風格,只說明生圖服務當下沒回應。判斷方法和處置都簡單:把那幾句重跑一輪就好,別去懷疑自己的設定。順帶一提,生圖的隨機種子取自畫面尺寸描述最後一個字的字碼,換句話說你選同一種尺寸,種子幾乎就是同一個。這對一般使用沒什麼影響,但對想固定風格重現結果的人是個有用的冷知識。
PPT 轉影片這條路線其實 2024 年 11 月就鋪好了,之後又翻了幾版,吃的是 PPT 檔,每頁備忘錄當逐字稿、投影片當畫面,也能讓 AI 先把 PDF 版講義解說一遍再轉。這條路要多裝 LibreOffice,官方說安裝方法自己去問 AI。功能聽起來補齊了最後一塊拼圖,但依賴鏈也最長,我的建議是先跑通純主題路線,再碰它。
整個專案最出乎我意料的地方,在 main.py 的開頭。它有一個登入檢查函式,邏輯翻譯成人話是:正確密碼就是你的帳號本身,大小寫隨便。也就是說這個登入頁攔不住任何人,任何訪客輸入同一組字就進來了。
如果只是本機自用,這無傷大雅。問題在於啟動參數:服務綁在 0.0.0.0 的 9020 連接埠,而且帶著 share=True,這個參數會讓 Gradio 額外開一條公開的轉址隧道,給你一個任何人都能連的臨時網址。兩件事疊起來的意思是:你自架的這台機器,背後接著你付費的文稿模型金鑰、你產的所有素材,而它預設就掛在一條防線等於零的公開隧道後面。要收斂很簡單,把 share=True 拿掉、改成只綁 127.0.0.1,但這兩行程式碼你不讀原始碼就不會知道要改。
同一個檔案裡還有一個小細節:對外請求帶著 verify=False,等於把 https 的憑證檢查關掉了。對一個自架工具來說這稱不上重大漏洞,但它和登入邏輯、公開隧道放在一起看,這個專案的安全假設就是「反正只有我自己用」。要不要接受這個假設,決定權在你,但至少要知情。
自架要跑通,外部依賴得活著。這個專案的依賴分成兩套劇本:預設的 config.env 示範的是中國雲端那套,文稿走 DeepSeek 的 API,語音走豆包(火山引擎)、繪圖和另一條文稿路線走百度千帆;免費那套則是文稿用千帆的免費模型額度、語音用 edge-tts、配圖用 pollinations。
第二套劇本裡的三個免費原料,我逐一實測過。edge-tts 這個微軟語音庫,我直接合成了一段台灣中文:用 zh-TW-HsiaoChen 聲音,一句 18 個字的句子,4.15 秒的 MP3 就生出來了,24kHz 單聲道,檔案 24KB,音質拿去做解說配音綽綽有餘。它的語音清單裡台灣中文有三支(HsiaoChen、HsiaoYu、YunJhe,兩女一男),中國大陸與香港腔另有十一支,都寫死在程式的下拉選單裡。pollinations 的生圖端點我用同樣的參數打了一次,3.9 秒拿到一張 512×288 的圖。DeepSeek 的 API 端點連得到,只是沒金鑰會被擋在門外,401,這表示下一步就是去申請一支金鑰,官方 README 的說法是這條 API 很便宜。
第一套劇本對台灣就沒那麼友善了。豆包和千帆都是中國雲端帳號體系,實名與支付那一關能不能過、介面順不順,我沒有驗證,老實標註未知。但好消息是:以這個專案的架構,你完全可以不走那套,文稿交給 DeepSeek、語音交給 edge-tts、配圖交給 pollinations,一毛錢都不用預付,這三個服務從台灣直連都通。
動手之前還有一個不花錢的功課:README 裡附了四支官方樣片,主題分別是「人的本性是天生的嗎」、歸去來兮辭、空白效應、棘輪效應,標明都是用免費加校對的流程產出的,放在 GitHub 的附件空間,我測試時都還抓得到。先看樣片再決定要不要裝,等於先驗收這條產線的上限:你照著同樣流程做出來的東西,最好也就長那樣。而以它的機制(一句配一圖、字幕直接排在圖上)來推,成品走的是知識解說的樸素路線,期待運鏡與實拍混剪的人,看到樣片就可以收工了。
雲端依賴有個通病值得知道:它們會壞。issue 裡 2024 年 10 月就有人回報 pollinations 502,同年 11 月有人在中國大陸用 edge-tts 撞到 403(當地封鎖,翻牆可解,台灣不受影響)。這些紀錄的意義在於提醒你:產線的每一環都是別人的免費服務,斷一環就得等或換。
自架過程裡最打擊士氣的往往不是大問題,是文件對不上。這個專案有三份官方文件,講了三個連接埠:README 的使用方法說裝完打開 127.0.0.1:8000;main.py 寫死 server_port=9020;docker-compose 把容器的 8000 映射到本機的 7052,可是容器裡跑的指令就是 main.py,聽的還是 9020。照 README 裝完第一次開瀏覽器,撲空的機率很高。實際能用的地址以程式碼為準:本機直跑就是 127.0.0.1:9020,Docker 就要自己改 compose 的映射,把 7052:8000 換成指向 9020。
Docker 路線還有兩個先備知識。Dockerfile 把 apt 換成清華的鏡像源、pip 換成阿里雲的鏡像源,這是為中國網路環境最佳化的寫法,在台灣用會慢但不至於失敗;檔案裡還留著一個明顯從別的專案 copy 過來的建置參數,看得出 Docker 這條路是後來補的,打磨有限。依賴鎖定有個經典陷阱:倉庫裡有兩份 requirements,未釘版本那份列的是 PyMuPDF,釘版本那份列的卻是 fitz 這個名字。PyPI 上叫 fitz 的套件和 PyMuPDF 不是同一個東西,裝錯會在 import 時炸開,這是 Python 生態有名的同名陷阱。自架時認清要用哪一份,能省下一個晚上的除錯。
把這些放進 2026 年的環境跑,能不能一次成功,我不給保證,因為我沒有端到端跑完整條產線,而 2026 年 3 月那則零回覆的運行報錯就擺在那裡。我的估計是:依賴停在 2025 年(moviepy 釘 1.0.3、gradio 釘 5.49.1),一年下來 Python 生態又漂移了一輪,撞到小錯誤是常態,要有自己讀 traceback、自己調依賴版本的準備。這就是「免費」的完整價格:軟體不收錢,維修工時你自己出。
講清楚它跟雲端服務的差別,選擇就簡單了。VideoTube、Pexo 這類平台,貼主題、按生成、等收片,算的是點數;TechMoon 先前介紹過的 Short Video Factory 也是開源,走一句賣點生短片的快速路線。它們的共同優點是十分鐘內看到成果,共同代價是產出規格、素材保存、生成邏輯都在別人手裡,點數規則改了你也只能跟。
auto-video-generateor 站到另一端。機器、金鑰、組裝工時全由你出,換到的是:每句稿、每段語音、每張圖都是你磁碟上的普通檔案,能逐項校對、重做,或直接搬進剪輯軟體二次加工;成本結構透明,文稿按 DeepSeek 計價,語音和配圖的免費路線掛了再說;產線邏輯全部開源,壞了你能修,也能 fork 一份改成自己的樣子。同一個精神我們在 Youtube-Whisper(自架轉錄反而快)和 PDF2Audio(開源 PDF 轉雙人播客)都驗證過:需求一旦上量,自架那條路的穩定度和成本都會翻盤。
給幾個具體的判斷情境。你是知識型頻道經營者,一週要產三支氣象、歷史、科普類的解說影片,台灣中文配音、素材要能存檔複用,這個工具的形態就是為你設計的,值得花一個下午裝起來試。你只是想幫一場活動快速生一支宣傳片,用一次就丟,去用雲端服務,組裝時間比它省下的錢貴。你想做的是社群短影音那種節奏剪輯,這不是它的強項,它做的是「一句一圖一音」的解說體。語音品質若有更高要求,可以參考 LibreTTS 那條免費文字轉語音路線,產出的音檔同樣能掛進這種產線的 audio 資料夾裡手工替換;真要管線化,douyin_upload 那類自動上傳工具則是產線的下一站。
授權是 MIT,商業使用、修改、再發布都允許,附上授權條款即可。專案到 2026 年 10 月的狀態:895 顆星、176 次 fork、43 個提交、無正式發布版;最後提交 2025 年 10 月 15 日;12 個開放 issue 加 1 個未合併的 PR,其中最新一則執行報錯無人回覆;體驗站 avg.kddbot.com 回 502,官方文件自述後台太脆。官方樣片與操作教學連結都還在 README 裡,樣片我測試時仍可播放。這些數字是我在 2026 年 10 月 7 日查詢當下的快照,星數之類會漂移,判斷請以你看到的當下為準。
一句話收攏:把它當「現成的免費影片工廠」,你會失望;把它當「一條攤開的產線藍圖,原料至今活著,組裝自己來」,它給的東西比多數一鍵服務誠實得多。裝得起來的人,拿到的是留得下來、帶得走的產能;裝不起來的人,及時止損去看雲端方案,也是完全正確的決定。