TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南
TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南

Video2X 是超過兩萬顆星的開源影片放大工具,用 Real-ESRGAN 等模型在本機把低畫質影片放大到 4K。實測以官方測試片對照:放大結果重現官方樣本、優於傳統縮放;影格插值在靜態鏡頭量得到反例,Mac 使用者要走 Docker 或 Colab。
用 AI 摘要這篇文章:
手機裡十年前的家庭影片、收藏的 DVD 片段、只有 480p 的老動畫,搬到新電視上看總是糊成一片。Video2X 是 GitHub 上超過兩萬一千顆星的開源專案(截至 2026 年 9 月),做的事情就是把這類低解析度影片用機器學習模型在本機放大,官方標榜可以拉到 4K,順帶提供把影格補密的插值功能。我把它的原始碼和官方文件梳理過一輪,也拿官方發布的測試片實際跑了一輪對照。先講結論:放大這條路是真的,輸出和官方樣本對得上,也量得出它比傳統縮放多補了多少東西;但你的機器跑不跑得動、Mac 使用者要怎麼繞、影格插值該不該開,這三件事比模型本身更值得先看清楚。
先看它怎麼運作,這決定了後面所有判斷。Video2X 的本體是一條影片處理管線:用 FFmpeg 把影片解碼成一張張畫面,交給模型放大,再即時編碼成影片檔。整條路在記憶體裡串流完成,README 標榜處理時不需要額外的磁碟空間,放得下最終輸出檔就好;我在原始碼裡找不到任何暫存檔寫入,這個宣稱和程式行為一致。很多同類工具的做法是把影片先拆成幾萬張圖片寫進硬碟再慢慢跑,相比之下這個設計對空間緊張的人是實質差異。
模型端它支援四個家族。Anime4K 用顯示卡的著色器直接跑,速度最快、效果最輕;Real-ESRGAN 和 Real-CUGAN 是為動漫與照片訓練的神經網路,走 ncnn 推理框架以 Vulkan 運算;RIFE 則負責影格插值。模型檔大多直接綁在倉庫裡,免另外下載(安裝包內附的 RIFE 以新版為主,要用舊變體得自己從倉庫補檔),選單預設值也反映各家族的定位:Real-ESRGAN 的預設是為動漫影片訓練的 realesr-animevideov3(附二、三、四倍三個版本),處理實拍照片要手動換成 realesrgan-plus 或 generalv3 系列;Real-CUGAN 的預設是兼顧速度的 models-se,追求細節可換 models-pro,還能指定除噪強度,老 DVD 抓下來的雜訊多的素材特別用得到。
四個家族怎麼挑,一個實用的分法是先問素材多長、多髒。短片且畫質還行,先用 Anime4K 快速跑一輪看成果,不滿意再換神經網路模型;長片或雜訊重,直接上 Real-ESRGAN 或 Real-CUGAN,讓它跑整夜。RIFE 插值則獨立於放大之外,可以只開插值不放大,也可以兩段式先放大再補影格。
輸出端它把編碼器整個交給你。預設是 H.264,想換 H.265、想指定畫質參數或壓縮速度都可以下指令,等於放大歸模型、壓縮品質歸你自己。授權採 AGPL 3.0,個人使用沒有問題;想拿它改成對外服務的人要注意這是要求衍生作品跟著開源的條款。它引用的引擎(ncnn、Real-ESRGAN、RIFE、Anime4K)多為 MIT 或 BSD 授權,分層清楚。比較少被提到的一層在模型檔:Real-CUGAN 的訓練來源倉庫 bilibili/ailab 本身沒有附授權條款,要把放大後的影片拿去商業使用的人,這層要自己釐清。
判斷放大工具好不好,最怕「看起來好像有比較銳利」的感覺論。這段用官方自己發布的素材做對照。Video2X 的倉庫提供一支標準測試片:426×240 的動畫片段,456 個影格,19 秒,另外附了官方用 Real-ESRGAN 放大四倍後的樣本影片,專門讓使用者驗證自己的環境跑得對不對。
我沒有裝它的 Windows 安裝包,測的是它倉庫附的模型檔(與安裝包取自同一來源),丟進同一套 ncnn 引擎的公開版本在 Mac(M4 Max)上跑,對照放大品質有效,安裝包的介面體驗則留給 Windows 使用者。做法是從測試片抽出三個影格,用預設家族的 realesr-animevideov3 模型放大到 1704×960,再和官方樣本的對應影格逐像素比對。
三個影格的峰值訊噪比(衡量兩張圖差異的標準指標,數字越高越接近)都落在 37.4 到 38.2 dB。這組數字說明兩件事。我跑出來的結果和官方樣本幾乎一致,剩下的差異主要來自影片編碼損失的量級,代表它宣稱的放大效果可以被外人重現。更有價值的對照組是:同一批影格用傳統的 Lanczos 演算法(不經 AI)拉到同樣尺寸,和官方樣本比只剩 30.7 到 33.2 dB。中間五到七個 dB 的差距,就是模型真的補出線條與細節、單純放大給不出來的部分,不是心理作用。

速度給一個實測參考點:這個引擎在測試機上暖機後單張約 0.08 秒,把 19 秒的測試片 456 格全部跑完,模型運算含啟動約 37 秒。換算下來模型運算的速度大約是播放速度的一半,一個小時的素材線性換算要約兩小時的純模型運算,這還沒算解碼與編碼。這類工具的時間成本要有預期,沒有獨立顯示卡的人,後面有借 Google 顯卡的免費路線。
Video2X 同時內建 RIFE 影格插值,可以把 24fps 的片子補成 48fps 或更高,讓動態看起來更滑順。介紹文多半把它寫成順手的加分項,但我實測到一個值得停下來的反例。
一樣用官方測試片。我挑了一個幾乎靜止、只有臉上水滴在動的鏡頭,取前後隔一格的兩個影格,讓 RIFE 生成中間那格,再和影片裡真實存在的影格比對。結果插值出來的影格只有 22.95 dB;直接重複前一格反而有 47.15 dB,就連把前後兩格各混一半的偷懶做法(25.59 dB)都比它好。換句話說,在這個鏡頭上,模型憑空猜的那一格比什麼都不做還差。看圖更清楚:正在移動的水滴被前後影格混成殘影,髮絲邊緣糊掉,畫面右上角原有的小字直接崩開。

插值自然有它的用武之地,補中間格的目的本來就是讓動態更平順,鏡頭有連續明顯動作時才吃得到這個好處。但有兩個工程細節要先知道。原始碼裡場景偵測的門檻預設是 100,等於關閉,跨越鏡頭切換的影格預設照樣插值,剪接頻繁的片子要自己把門檻調低才避得開怪結果。另外我測的是 RIFE v4 模型,目前程式碼的預設是更新的 v4.26,同屬一個家族,但我的反例數字不能直接替新版本背書。收斂成一句話:放大是本體,插值要看素材特性的選配。
它對硬體有兩條明確的底線,官方文件寫得很直白。CPU 要支援 AVX2 指令集,落在 Intel 2013 年、AMD 2015 年之後的處理器;顯示卡要支援 Vulkan,NVIDIA 從 GTX 600 系列、AMD 從 Radeon HD 7000 系列、Intel 內顯從 HD 4000 起算,差不多是 2012 年以後的卡都跨得過門檻。現在的電腦多半過得了這兩條線,真正卡人的是平台。
Video2X 6.x 的官方安裝包只出了 Windows 和 Linux。Windows 有圖形介面安裝程式,6.4.0 版 220MB,這個安裝包在 GitHub 上被下載超過 48 萬次;Linux 有 Arch 系的 AUR 套件和通用的 AppImage(231MB)。macOS 沒有原生包,官方倉庫裡支援 macOS 命令列的合併請求到 2026 年 8 月還開著沒進主線。
Mac 使用者的替代路線有兩條,代價不同。一條是官方 Docker 映像檔,能在 macOS 上跑是因為映像檔內建軟體模擬的 Vulkan,運算落在 CPU 上,速度預期比真顯卡慢一截,勝在完全不用碰編譯。另一條是官方提供的 Google Colab 筆記本,借 Google 機器上的 T4、L4 或 A100 顯卡,單節最長 12 小時,免費帳號就能用,我確認過連結目前活著。官方同一頁也寫了提醒:這是免費資源,不要開著連續整天跑,被 Google 盯上封號是自己的損失。沒有獨顯又想試完整功能的人,Colab 是成本最低的一條路;連 GitHub 下載都卡的人,官方另有檔案鏡像站。
介面語言也要先有底:圖形介面支援英文、簡中、日文、葡文、法文、德文六種,沒有繁體中文。簡中介面多半讀得懂,但用語是對岸慣用寫法,名詞要自己轉一下。
Windows 使用者裝完安裝包就有完整的圖形介面,把影片拖進任務佇列、選處理器與模型、指定輸出位置就能開跑,處理中還能繼續加新任務。圖形介面由另一個同名 Qt6 倉庫維護,同樣開源。

想走命令列的人,它附的 CLI 一行就能跑。把 input.mp4 用 Real-ESRGAN 放大四倍:
video2x -i input.mp4 -o output.mp4 -s 4 -p realesrgan
換成 RIFE 插值就是 -p rife 加倍率參數,要自訂輸出品質再接編碼器參數。命令列跑的過程中可以按空白鍵暫停、按 q 中止,不用怕中途反悔。圖形介面這邊,6.4 版起處理中也能繼續往佇列加檔案或移除任務,還能指定跑完之後要關機、睡眠還是休眠,掛整夜的批次比較安心。Docker 版的啟動指令官方文件也寫好了,把資料夾掛進容器即可,Linux 上還能把真顯卡直接派給容器用。
最後一個該知道的現實是專案節奏。6.0 到 6.4 五個版本擠在 2024 年 10 月到 2025 年 1 月之間發布,之後沒有新 release;原始碼主線的最後修改停在 2026 年 3 月,內容是把 RIFE 預設模型換到 v4.26,順手修了空指標崩潰和資源洩漏。2026 年的待辦堆著沒進版:有人請求重新打包新的 Linux AppImage、有人回報 Windows 上因為系統留著舊版 Visual C++ 執行階段導致程式打不開、有人提交了處理中斷後能續跑的補丁,目前都沒有下文。
兩萬顆星等級的專案走到這種節奏,我的讀法是核心管線已經穩定到作者不太需要動它,代價是短期內別期待新功能或新模型,下載頁停在舊版屬於正常狀態,不是你找錯地方。Linux 套件生態倒是仍有人接手:Arch 的 AUR 套件主要由作者自己維護,中文圈的 archlinuxcn 倉庫另有第三方維護的版本,這兩條會跟著原始碼更新,比等安裝包勤快。另外要留意外面的舊教學:這個專案 5.0 時代是 Python 寫的,安裝問題很多,官方在 6.0 的說明裡自己下了重話,說這次是真的能用、比 5.0.0 beta 省事很多;更早的展示影片用的還是 waifu2x 和 DAIN 引擎,如今 6.x 的陣容裡已經沒有它們。照著兩三年前的文章操作,裝到的會是另一個東西。
收斂成判斷。手上有動畫、老電影片段或低解析度家庭影片,機器是近十年的 Windows 或 Linux 且有獨立顯卡,願意讓電腦跑幾個小時換畫質的人,Video2X 值得裝來用:放大結果可驗證、模型免費、處理全程不出你的電腦。對不想把家庭影片或私人素材丟上雲端放大服務的人,本機處理本身就是它相對於線上工具的最大賣點,隱私邊界由硬體決定,由條款頁面決定不了。Mac 使用者先用 Docker 或 Colab 試水溫,確定效果值得再考慮為它留一台 Windows 機器。
只想放大單張圖片的人不必動用到影片管線,Waifu2x 網頁版或 Real-ESRGAN 的桌面圖形介面快得多;動漫圖片的專用路線,可以再比較 CYKSM 和其他線上圖片放大工具。影格插值則守住一條:先拿一段有靜態鏡頭的素材,比對開與不開的差異,再決定要不要讓它跑完整部片。放大交給工具,判斷留給自己。