Paper2Poster 論文 PDF 轉學術海報,輸出是你改得動的 PPTX

Paper2Poster 把論文 PDF 轉成可編輯的 PPTX 學術海報,MIT 開源並登上 NeurIPS 2025。三種跑法代價不同:Hugging Face demo 免介面費但 OpenAI 金鑰自備、論文內容會送雲端;本機全本地路線要自架兩個 vLLM 模型端點,才有 0.005 美元一張的成本;Skill 路線零依賴,產出的是海報文案包。

用 AI 摘要這篇文章:

論文投出去之後,很多研究者的下一關是研討會海報。最省事的直覺是把 PDF 丟給 ChatGPT,叫它直接畫一張海報圖。Paper2Poster 團隊在論文裡實測過這條路:GPT-4o 生成的海報遠看像回事,放大之後文字常常是壞的,小字讀不清楚。他們提出的替代方案是一套開源軟體:吃進論文 PDF,吐出一份能打開來改字、換圖、調版面的 PowerPoint 檔。專案 2025 年 5 月開源、同年登上 NeurIPS 2025 資料與基準賽道,到 2026 年 9 月累積近四千顆星。

動手之前先想清楚一件事:這個工具有三種跑法,從在網頁貼上自己的 OpenAI 金鑰、到在本機架出兩個模型端點、到什麼都不裝,成本跟隱私帳算起來差很多。官方文件、原始碼與問題追蹤板攤開來看,三條路各自的代價可以列得很清楚,你再看自己適合哪一條。

輸出是 PPTX 檔,這是它跟 AI 生圖最根本的差別

Paper2Poster 背後的系統叫 PosterAgent,用一組分工的 AI 代理跑完整條流程,可以拆成三段看。第一段先把論文解析成一份結構化素材庫,文字、圖表、表格各自配好關係;第二段把文字跟視覺元素配對,排成保留閱讀順序與畫面平衡的樹狀版面;第三段是渲染與修改的迴圈,畫完一輪就讓視覺模型回頭檢查,文字溢出、沒對齊就再改。這段設計是它跟「一次生圖碰運氣」最大的分別:版面問題是被反覆檢查出來修掉的,壞字不會靜靜藏在角落。

產出格式要單獨講。預設輸出是 48×36 英寸的 PPTX,正好是研討會海報的常見尺寸,尺寸本身是參數,要直式或別的比例都改得掉;拿到 PowerPoint、Keynote 或 LibreOffice Impress 都能直接編輯。指導教授要你把結論那段放大、換掉一張圖,改的是投影片物件,重新生成整張海報不會連帶把你已經滿意的部分也重擲一次。把「簡報交給 AI 生成」的服務這一兩年不少,像用多代理架構做簡報的 MultiAgentPPT模板取向的咔片 PPT 走的都是多頁投影片路線,Paper2Poster 顧的是單頁海報這個更窄、更講排版紀律的品類。

專案的出身是它可信度的主柱。授權是 MIT,授權條款檔案就放在儲存庫根目錄;論文作者群來自滑鐵盧大學、牛津大學與 Vector Institute;arXiv 論文編號 2505.21497,所有評測資料與配對資料集都公開。論文裡最有力的一組宣稱:完全開源的 Qwen 系列變體在幾乎所有指標上贏過 GPT-4o 驅動的同類系統,token 用量少 87%,把一份 22 頁論文轉成海報的成本約 0.005 美元。這是作者自己評測出來的口徑,而且有個重要前提,下面講錢的時候會回來。

這個專案連「怎麼評一張海報好不好」都一起開源了,這點少見。團隊設計的 PaperQuiz 評法是先用模型對原論文出選擇題,再讓模型只看生成的海報作答,答對率代表海報把論文核心內容講清楚了沒有;另配一個視覺模型當評審,對美感與資訊密度打分。換句話說,它宣稱的品質有可以被反覆驗證的量尺撐著,你可以對同一組數字存疑,但量尺本身是公開的,這在工具型專案裡少見。

論文裡也把幾條既有路線抓來對照過:直接用 GPT-4o 生圖的版本,文字渲染放大就穿幫;用 HTML 排版的版本與另一套多代理系統 OWL,產出的是部落格式、文字密度過高的長條版面;標榜簡報生成的 PPTAgent 則常有面板消失的排版失誤。這些對照組正好解釋了 PosterAgent 的兩個堅持:版面要排成樹狀結構保住閱讀順序,畫完要有視覺回饋迴圈兜底。單次生成碰運氣的天花板,就是這個專案想推掉的東西。

Paper2Poster 官方專案頁首頁,標示論文、程式碼、資料集與 demo 入口,並展示 PosterAgent 流程示意圖Pin
Paper2Poster 官方專案頁:從論文、程式碼、資料集到線上 demo 的入口都在這頁,下半的示意圖拆解 Parser、Planner 到 Painter-Commenter 迴圈的完整流程。

三種入口,最輕的也要自備 OpenAI 金鑰

跑法前置條件論文內容會離開你的機器嗎最後拿到什麼
Hugging Face 網頁 demo一組 OpenAI API 金鑰會,PDF 送 OpenAI 雲端LaTeX 編譯的海報 PDF 與可上傳 Overleaf 的原始碼包
本機安裝Python 環境+LibreOffice+poppler+金鑰或自架模型走 GPT 系列會;全本地路線不會poster.pptx+全部參數
Agent Skill 套件本來就在用 Claude 或 Codex取決於你用的模型端點海報文案包,不是 PPTX

最輕的入口在 Hugging Face 上,帳號屬於 CAMEL AI 這個協作組織。介面很直覺:貼 arXiv 連結或直接上傳 PDF,再填一個欄位,OpenAI API 金鑰,另外可以上傳機構或會議標誌、指定主題色。翻它的介面程式碼可以看到兩件事:金鑰欄是必填,而且文字與視覺模型都寫死用 GPT-5,你沒得選。介面本身零費用,生成的每一個 token 都從你的 OpenAI 帳單走。實驗室還沒決定要不要投資這套流程的人,這條路花一杯咖啡的 API 額度就能看到實際產出品質,是合理的起點。

Paper2Poster 在 Hugging Face Spaces 上的 Gradio demo 介面,含 OpenAI API Key 輸入欄與 PDF 上傳區Pin
Hugging Face 上的官方 demo:貼 arXiv 連結或上傳 PDF 之後,還要填自己的 OpenAI API 金鑰才能開始生成,介面免費、模型用量計費。

兩條路最後交給你的東西不一樣,這點容易搞混。本機路線拿到的是 poster.pptx 與一頁頁的中間產物;demo 介面讓你下載的其實是 LaTeX 編譯的海報 PDF,外加一包能直接上傳 Overleaf 繼續改的原始碼,內部流程雖然也會產生 PPTX,介面並沒有開放下載。生成速度跟論文長度、模型選擇都有關係,官方在 2025 年 9 月加入了按章節平行處理的參數,用平行生成換時間。版面樣式有 YAML 設定檔可以調,全域預設放在 config 目錄,單篇論文旁邊也可以放自己的設定覆寫;會議標誌給個名稱就會自動找,先查儲存庫內建的標誌庫,找不到才上網搜。這些細節平時不用管,等你要把輸出調成自己實驗室的風格時會用上。

本機安裝這條路,帳就重了。儲存庫的依賴清單是整個 CAMEL 框架的生態系,從 vLLM、OCR 到各種文件解析庫數百個套件一次裝好,另外還要裝 LibreOffice 的轉檔程式與 poppler。官方有提供 Docker 設定,能省掉一部分環境地獄,但議題板上連「能不能直接提供打包好的映像檔」這種等級的求助都開著。Windows 使用者要有心理準備:問題板上有一條 2026 年 5 月回報、至今開著的議題,安裝時會在文件解析模組的匯入階段直接報錯。更實際的訊號是那條標題寫著「安裝極其困難」的議題,2026 年 4 月開到現在。

Skill 這條路 2026 年 6 月才出現,最適合不想碰 Python 的人。團隊在儲存庫裡放了一個輕量 Skill 套件,零額外依賴,用法是讓 Claude 或 Codex 讀它的說明檔,然後把論文交給代理,產出一份海報準備包:內容簡報、海報文案、版面規劃、執行腳本與樣式設定檔。要明白產出形態的差別:Skill 路線給的是素材與規劃,實際的 PPTX 還是要靠前兩條路或自己動手排。

0.005 美元一張的宣傳數字,前提是自己架上兩個模型端點

論文摘要裡那句「22 頁論文轉海報只要 0.005 美元」流傳很廣,但它對應的是完全本地的跑法,前提是自己用 vLLM 起兩個服務:一個跑 Qwen2.5-7B 處理文字,一個跑 Qwen2.5-VL 處理畫面,兩個端點分別聽不同連接埠。這在實驗室伺服器上是幾行指令的事,在只有筆電的個人研究者手上就是一道硬門檻,顯示卡、驅動、模型權重都要自己張羅。

官方文件裡還有一個容易誤讀的名字。安裝說明把「經濟路線」標成 Qwen 跑文字、GPT-4o 看畫面的組合,看起來像省錢的折衷,實際上只要用到 GPT-4o,OpenAI 金鑰就少不了,論文的頁面內容照樣會送出去。對還沒發表的論文來說,這層資料流向該當成正式的決策變數看:投稿前的手稿送進任何雲端模型服務,都脫離不了你對那家服務的信任。真的要求內容不出門,全本地路線是唯一答案。

原始碼裡的模型設定檔也揭露了官方文件沒有放在最前面的彈性:除了 OpenAI 系列,設定函式還內建 OpenRouter、DeepInfra 這類代理平台上的 Qwen 變體,以及若干開源視覺模型的本地位址。換服務商不換架構,對已經有慣用平台的人是好消息;但資料流向的本質不變,內容出門只是換個門牌。還有一個工程細節:設定函式對認不得的模型名稱會落入 OpenAI 相容模式,接自家或第三方的相容端點做得到,只是要動到程式設定層。議題板上從 2026 年 3 月底起有人請求把自訂端點位址做成環境變數等級的設定,到 9 月仍沒有下文,這類小摩擦也是研究程式碼的日常。標誌搜尋倒是照顧得周到:會議與機構標誌的自動搜尋預設先查本地素材庫,找不到才上網搜,走 DuckDuckGo 不用金鑰,想更準可以換 Google 自訂搜尋。

研究程式碼的維護節奏,裝機前要算進風險

判斷一個開源工具能不能依賴,看的是金流的缺席:沒有商業公司 backing 的研究專案,維護能量通常跟著論文發表週期走。Paper2Poster 的時間線正是這個樣子:2025 年 5 月釋出、9 月登上 NeurIPS、10 到 11 月密集加入 Docker、標誌支援、Gradio 介面,10 月官方還宣布了後續專案 Paper2Video,把同一套方法往影片簡報延伸;2026 年 6 月補上 Skill 套件之後,主分支到 9 月為止只剩零星文件更新。釋出(release)頁面是空的,沒有打包版本可用,安裝一律從原始碼來。

問題追蹤板的狀態也得誠實說:23 條開著的議題裡,除了前述安裝問題,還有兩條 2026 年 6 月回報的依賴安全議題,專案把 transformers 鎖在有拒絕服務漏洞的版本上,至今沒有回應。這不代表專案爛,近四千顆星與被頂級會議收錄的基準都是硬指標;它代表的是你用它做正事時,環境問題要自己扛,遇到問題的答案要去議題板翻,等不到官方修。

依情境選路線,第一步這樣走

把前面的帳合起來,分流其實很清楚。手上有一組 OpenAI 金鑰、想先看看成品品質的人,直接開 Hugging Face 的 demo,用一篇已發表的論文試跑,成本就幾分錢額度;實驗室有顯示卡、一學期要產出好幾張海報的團隊,值得把全本地路線架起來,長期省下的 API 費與隱私顧慮都化得來;論文還在修、只是想先把海報的內容架構生出來的人,Skill 套件配你慣用的 AI 代理最省事。反過來說,需要商業支援、保證更新頻率或完全不想碰命令列的人,這個專案現在給不了這些。

如果論文處理是你的日常,把 Paper2Poster 跟把 PDF 論文轉成 Markdown 的工具放在同一個工作箱裡挺好用:先用後者把文獻拆成可搜尋的筆記,要出海報時再把原 PDF 交給前者。起手式給三個連結:Hugging Face demo 搜 camel-ai/Paper2Poster、原始碼在 GitHub 的 Paper2Poster 組織下、論文與資料集的完整評測都在 arXiv 2505.21497。跑一份論文的實際耗時與成品觀感,用 demo 拿一篇已發表的論文試一輪最快有答案;海報這種成品,工具先給你八十分的自動草稿,剩下二十分留給你判斷什麼值得放上版面,這個分工想清楚了,它就有資格進你的工作箱。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1245

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...