Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

成風口播剪輯是 GitHub 上累積超過 2700 顆星的開源專案,把口播影片剪輯拆成 Agent 負責語意判斷、本地 Runtime 負責確定性動作的 Codex 外掛。這篇拆解它的兩個對外指令、安裝流程與 v0.1.1 版本的真實邊界。
用 AI 摘要這篇文章:
GitHub 上累積超過 2700 顆星的開源專案 chengfeng-videocut(成風口播剪輯),把口播影片的剪輯流程做成了一套需要 Agent 介入判斷、再交由本地 Runtime 執行確定性動作的外掛。它最有意思的地方不在於「一鍵剪片」,而是作者自己在 README 裡寫明:在外掛補齊兩個明確缺口、跑通真實專案端到端流程之前,不該把「外掛可安裝」講成「兩條工作流已經全自動化」。這句誠實告白,剛好是理解這套工具最該有的起點。
這篇會把官方倉庫的架構、兩個對外指令、安裝流程,以及目前版本 v0.1.1 的真實邊界一次拆給你看,讓你判斷它值不值得現在就裝進自己的工作鏈。
chengfeng-videocut 的官方倉庫 由署名 chengfeng(對外品牌為 AI 產品自由)的開發者維護,採用 Apache 2.0 授權,主要語言是 JavaScript。截至 2026 年 7 月,倉庫累積約 2729 顆星、372 個 fork,最早建立於 2026 年 1 月中旬,最近一次推送落在 2026 年 7 月中,屬於還在活躍推進的專案。

它對外暴露的業務入口只有兩個,分別對應口播影片處理的兩個階段:
| 指令 | 技術 ID | 產出 |
|---|---|---|
| 剪口播 | chengfeng-videocut:cut-talking-head | source_cut.mp4 加上 subtitles.srt |
| 口播成片 | chengfeng-videocut:finish-talking-head | final.mp4 加上 verification.json |
這個「只給兩個入口」的設計是有意的。外掛刻意不複製剪輯產品本體,剪輯判斷與流程編排由兩個 Skill 負責,真正會動到影片檔案的確定性動作(剪切片段、算繪成片、驗證結果)全部交給另一個叫做 chengfeng-videocut Runtime 的本地執行層,透過 CLI 或 API 呼叫。只有進入人工審核階段時,才會打開同一個 Studio 介面。
很多人看到「AI 剪輯 Agent」會直覺聯想到「模型直接把影片切好給你」。這套外掛走的不是那條路。它把整件事拆成兩層:
Skill 層(Agent 負責)做的是需要語意理解的工作,例如判斷哪一段是口誤、哪一段靜音該保留、字幕時間軸有沒有對齊。這層的輸出是一份審查紀錄,而不是直接覆寫原片。
Runtime 層(本地執行)做的是不能出錯的確定性動作,例如依審查紀錄把指定時間碼的片段切掉、把字幕燒進影片、跑驗證產出 verification.json。這層的設計原則是「不覆寫、不偷打包舊算繪器」,動作失敗就停下來回報,不會猜著繼續做。
這種拆法的好處是責任分明:Agent 可以犯錯、可以被你打回票,但真正動刀的是可控的 Runtime。README 裡的架構圖把這層關係畫得很清楚,從 Codex 發出的指令會先經過共用的 ensure-runtime 檢查,確認本地 Runtime 就緒才會往下走。
Runtime 的就緒檢查是一個叫 doctor 的流程,會依三種狀態決定下一步:
ready:Runtime 已就緒,直接繼續目前的 Skillmissing:提示一句安裝狀態,引導到 GitHub Release,做 SHA 256 校驗,安裝後重跑 doctor 再繼續unhealthy 或 failed:停止動作,不覆寫、不打開 StudioRuntime 預設安裝在 ~/.chengfeng-videocut 這個路徑,整個外掛則透過 Codex 的 Marketplace 機制安裝,不需要手動複製 Skill 檔案到 ~/.claude/skills 之類的目錄。
安裝分兩步。第一步是把倉庫加入 Codex 的 Marketplace,再啟用外掛:
“`bash
codex plugin marketplace add Agentchengfeng/chengfeng-videocut-skills –ref main
codex plugin add chengfeng-videocut@chengfeng-videocut
“`
第二步在你第一次使用任何一個業務 Skill 時自動發生。外掛會先檢查本地 Runtime 是否存在,若偵測到 missing,會引導你從 GitHub Release 下載、做 SHA 256 校驗,再安裝到 ~/.chengfeng-videocut。
這裡要特別提醒:外掛本身(包含預先打包的 MCP Server,約 1.1MB)和 Runtime 是兩件事。外掛只是 Skill 與編排邏輯,真正會在影片檔案上動工的是 Runtime,兩者缺一不可。這也是為什麼 README 強調「不需要 npm、npx、bunx、DMG 或手工複製 Skill」,但同時又要求 Runtime 必須通過 doctor 檢查。
倉庫結構也呼應了這個分工,主要目錄與檔案分布在幾個位置:
chengfeng-videocut-skills/ 下的 .agents/plugins/marketplace.json 是 Marketplace 註冊檔plugins/chengfeng-videocut/ 是外掛本體,包含 .codex-plugin/plugin.json、.mcp.json、預先打包的 dist/server.mjs(約 1.1MB)、public/review-confirm.html 確認卡頁面,以及 scripts/ 與 references/plugins/chengfeng-videocut/skills/cut-talking-head/ 與 skills/finish-talking-head/LICENSE、NOTICE.md、CITATION.cff 對應 Apache 2.0 授權與引用格式從目錄可以確認,對外的 Skill 確實只有 cut-talking-head 與 finish-talking-head 這兩個,中間的確認卡(review-confirm.html)搭配一個 MCP App,用來把白名單動作、專案 ID 與修訂版次交回 Codex 對話,它本身不執行剪輯,也不是第三個 Skill。

在查證過程裡有一個值得講清楚的事。這個專案的 GitHub 倉庫描述至今仍寫著「用 Claude Code Skills 做的影片剪輯 Agent」,部分早期資訊也以 Claude Code Skill 的角度介紹它(安裝方式是把倉庫複製到 ~/.claude/skills/videocut)。
但官方 README 現在的說法已經不一樣了:它自我定位為「給 Codex 用的中文口播剪輯 Marketplace 外掛」,安裝路徑走的是 codex plugin marketplace add。換句話說,這套工具經歷過一次從 Claude Code Skill 形態、轉到 Codex Marketplace 外掛形態的演進。
對使用者來說,這個差別很實際:你現在要照官方 README 的 Codex 外掛路線安裝,而不是早期資料提到的 Claude Code Skill 路線。如果你看到的是舊版安裝教學,務必回到官方倉庫的 README 對照最新指令,才不會裝錯形態。若你對 Skill 形態的開發工具特別感興趣,TechMoon 先前評測過的 last30days Claude Code Skill 與 能匯出給 Cursor 和 Claude Code 的 Agent Skills 構建器 Refly,可以一起放進參考清單做橫向比較。
口播影片最常見的處理需求,是把大量的靜音空窗、語氣停頓、口誤重複剪掉。傳統做法依賴音訊波形的分貝閾值判斷靜音,門檻抓得太鬆會漏剪,抓得太緊又會把呼吸點一起切掉,成片聽起來生硬機械。
chengfeng-videocut 走的語意路線,差別在於判斷邏輯是建立在對內容的理解上,而不是單純看音量曲線。這意味著系統是在解析口播內容的過程中標記問題,例如逐字識別口誤,並保留符合自然語言邏輯的停頓。審查紀錄產出後會先交給人工決策,確認無誤才會進入實際剪切片段的批處理。
兩種路線的取捨可以這樣比較:
| 比較軸 | 波形靜音剪輯 | 語意剪輯(chengfeng-videocut 走的路線) |
|---|---|---|
| 判斷依據 | 音訊分貝閾值 | 對口播內容的語意理解 |
| 呼吸點處理 | 容易誤刪 | 可依自然語言邏輯保留 |
| 口誤處理 | 只能看音量,難以辨識 | 可逐字識別並標記 |
| 介入方式 | 一次切完 | 先產審查紀錄,人工確認後再動刀 |
| 對算力的要求 | 低 | 較高,需 Runtime 與相關模型就緒 |
要強調的是,這個比較描述的是兩種路線的設計取向,不代表 chengfeng-videocut 已經在每一種素材上都跑通完整流程。它目前能不能在你手上跑出這些結果,取決於下一節要講的版本邊界。
這是整篇最該仔細看的一段,因為它直接決定你會不會裝了才發現跑不起來。README 在「當前邊界」這一節白紙黑字寫著,產品 Runtime v0.1.1 仍有兩個明確缺口:
第一,還沒有正式的原影片 transcribe 或 import 指令。也就是說,當環境裡沒有可用的自動語音識別(ASR)能力時,剪口播這個 Skill 會直接停下來,並回報缺少對應能力,不會硬著頭皮繼續。這代表如果你的本機環境沒有先把 ASR 這層準備好,裝完外掛也跑不出剪後影片。
第二,render run 仍可能要求外部的算繪器。新版 Skill 不會把舊的算繪器偷偷打包回來,但也因此在某些情境下,你得自己準備好符合條件的外部算繪器,成片階段才能順利完成。
README 接著下了一個很重要的結論:在 Runtime 補齊這兩項、並完成真實專案的端到端驗證之前,不把「外掛可安裝」描述為「兩條工作流已經完全自動化」。這是作者本人畫下的界線,也是你評估這套工具時最該尊重的前提。把它當成「已經成熟的開箱即用剪輯神器」會失望;把它當成「架構已就位、還在補最後一哩的開源 Agent 專案」會比較接近事實。
授權方面,本專案使用 Apache License 2.0。原作者署名為 chengfeng,對外品牌是 AI 產品自由。官方列出的身分與管道如下:
Apache 2.0 是相對寬鬆的開源授權,允許商業使用與修改,但要求保留原作者、原始倉庫連結、LICENSE 與 NOTICE.md。若你打算把它包進自己的產品或做二次開發,記得遵守這幾項歸屬要求。想做正式引用的話,倉庫還附了 CITATION.cff 方便你取得標準引用格式。
綜合上面的拆解,給三種情況的建議:
適合現在就跟進的人:你本來就在用 Codex 做開發或內容產製,本機環境已經備好 ASR 與算繪相關依賴,願意陪一個還在補齊階段的開源專案一起迭代,也接受跑不通時自己排查。這種使用者最能吃到它架構拆分的好處,也能從審查紀錄裡逐步把自己的剪輯偏好寫進配置。
建議先觀望的人:你只想找一套裝完就能全自動產出成片的工具,不想處理 Runtime 安裝、doctor 檢查、外部算繪器準備這些事。在 v0.1.1 的兩個缺口補上、端到端跑通之前,這套外掛離你的期待還有距離。先把它放進 watch 清單,等 Runtime 補齊 transcribe 與 render 的正式指令再回來。
可以順便參考的替代路線:如果你重視的是 AI 影片產製的整體工作鏈,而不只是口播剪輯這一環,那麼把視角拉大一點會更有收穫。像是以小說拆鏡與角色鎖定為核心的 Toonflow AI 短劇產生器,或是把劇本到影片串成一條流程的 Jellyfish 開源 AI 短劇工作流,以及一鍵部署私人 AI 助理的 OpenClaw 第三方一鍵部署工具,都能讓你從不同角度理解目前開源 AI 影片與 Agent 生態的長相。
chengfeng-videocut 是免費的嗎?
是。專案以 Apache 2.0 開源,程式碼可免費取得、修改與商業使用,只要保留原作者與授權標示。要留意的是「外掛免費」不代表「使用零成本」,你仍得自行準備本機 Runtime、ASR 與算繪環境,這些基礎建設的硬體與設定成本由你自己吸收。
它只能在 Codex 上用嗎?
依目前官方 README 的說明,它是以 Codex Marketplace 外掛的形式發布,安裝走 codex plugin 指令。雖然倉庫描述保留了「Claude Code Skills」的歷史用語,但現行的安裝與執行路線是 Codex 外掛,建議照官方 README 操作,不要混用舊的 Skill 安裝教學。
它會自動把我的口播影片剪好嗎?
不會全自動。剪口播會先產出一份審查紀錄交給你確認,確認後才會執行批處理剪輯,這是它「判斷交給 Agent、動作交給 Runtime」的設計。而且在 v0.1.1 裡,若本機沒有可用的 ASR 能力,剪口播會直接停下來回報缺能力,不會勉強產出。
我需要自己準備哪些依賴?
至少要準備好能通過 doctor 檢查的本地 Runtime,以及 ASR 相關能力(因為目前沒有正式的 transcribe 指令)。成片階段的 render run 也可能要求你備妥符合條件的外部算繪器。具體依賴會隨版本演進調整,務必以官方倉庫 README 的最新說明為準。
它和一般靜音剪輯工具差在哪?
最大差別在判斷依據。一般靜音剪輯看的是音訊波形的分貝閾值,容易誤刪呼吸點;這套外掛走的是語意理解路線,標記口誤時是逐字識別內容,並保留符合自然語言邏輯的停頓。但語意路線對算力與環境的要求也更高,這是取捨。