Unpaywall 論文查找工具,撞到付費牆先確認有沒有免費版

查論文撞到付費牆,先別急著付錢。Unpaywall 是非營利組織 OurResearch 的免費開源瀏覽器擴充功能,資料庫收了 5,691 萬篇從合法來源收割的免費學術文章,官方自述約 52% 的論文找得到免費版本,本文拆解它的 DOI 比對機制、隱私邊界,以及找不到免費版的那一半該往哪去。

用 AI 摘要這篇文章:

Unpaywall 這個名字取得很壞。Un-pay-wall,不付費牆,聽起來像一套教你逃票的工具,實際上它連一塊磚都沒推倒。它做的事樸素得多:當你打開一篇要付費的學術論文,它去查「這篇有沒有一個已經合法免費公開的版本」,有,就在頁面邊邊亮一個綠色鎖頭,點下去就是全文。查論文頻率不低的人,這個鎖頭值得在你想刷卡之前先亮一次。

這件事成立的前提,是學術出版有個反直覺的現況:很多論文其實已經免費了。作者把投稿前的版本放上預印本網站、大學把研究存進機構庫、出版社自己開放部分文章,只是這些免費版本散落各處,搜尋引擎不會主動告訴你。Unpaywall 做的是把散落的那一半接回你眼前:官網首頁標示的收錄量是 56,911,808 篇免費學術文章(動態計數,會持續增加),收割自超過 50,000 個出版社與文獻庫。它的能力邊界與資料流向,官方文件寫得意外清楚,下面直接攤開,每一個查法你都可以自己重做一遍。

Unpaywall 官方網站首頁,標示收錄 5,691 萬篇免費學術文章的動態計數Pin
Unpaywall 官網首頁:收錄量是動態計數(unpaywall.org)

名字像教你逃票,機制其實是查身分證

先講清楚它怎麼運作,因為這決定了它合不合法。

每篇正式出版的學術文章都有一個 DOI(數位物件識別碼),可以想成論文的身分證字號,一輩子只對到一篇文,長相像 10.1038/nature12373 這樣:10 開頭,斜線前是註冊機關給的出版者前綴,斜線後是出版者自訂的尾碼。Unpaywall 的瀏覽器擴充功能在你開啟論文頁面時,掃出頁面裡的 DOI,拿去比對自家資料庫:這篇有沒有免費版本?免費版在哪?整個資料庫有個舊名叫 oaDOI,後來專案把擴充功能和資料庫統一都叫 Unpaywall,查的永遠是同一份資料。

資料庫裡的免費版本只有兩種來源。一種是出版社自己開放取用的文章,一種是作者把稿子存進大學或研究機構的資料庫,兩者都是內容本來就免費、合法可連的東西。收割的方式,官方 FAQ 列得具體:直接從超過五萬個期刊與開放取用儲存庫抓內容,另外併用 PubMed Central、DOAJ(開放取用期刊目錄)、Crossref 的授權資訊與 DataCite 的開放資料。官網 FAQ 對「Unpaywall 合法嗎」這題也答得很直接:內容全部收割自合法來源,包括大學、政府與學術學會經營的儲存庫,以及出版社自行開放的內容;發現侵權內容,通報就下架。

官方產品頁的示範畫面是這樣的:你停在出版社的論文頁,頁面右緣浮出一個綠色的鎖頭小分頁,點它就帶你去免費全文;查不到免費版時,綠色分頁就不出現,頁面照舊。整個互動就這麼多,沒有別的介面。

這裡要看清它跟盜版論文網站的本質差異:盜版站搬的是沒被授權的付費內容,Unpaywall 索引的是本來就免費的內容,它沒有解鎖任何上鎖的東西。官網也自述資料已整合進全球數千個圖書館系統與搜尋平台。名字裡那個 un-,行銷成分大於事實描述。

官方產品頁自述:使用者可以免費讀到 52% 的研究論文。這是官方給的數字,意思是每兩篇約有一篇找得到免費版。反過來讀也成立:剩下那一半,它幫不上忙。

拿三個真實 DOI 去查,兩種結局都出現了

它背後的資料庫有一個免金鑰的公開 API,擴充功能查的就是同一份資料。查法是把 DOI 接在 https://api.unpaywall.org/v2/ 後面,加上 ?email=你的信箱。拿三個真實 DOI 各查一次,兩種結局都會遇到。

先看找得到的。DOI 10.1038/nature12373,Nature 期刊 2013 年一篇在活細胞裡做奈米級測溫的研究,回應是 is_oa: true,而且一次回報好幾個免費位置,包含 nature.com 上出版社自己放的 PDF(標 publisher、publishedVersion)與 arXiv 的作者自存版(標 repository、submittedVersion)。這篇論文即使發在收費大刊,全文其實一直免費放在多個地方,只是沒人告訴你。再查 DOI 10.3310/hta25550,英國 Health Technology Assessment 期刊的一項研究方法學論文,同樣查得到,免費版是出版社釋出的正式版。

回應裡要先認識的是 host_type 和 version 這兩個欄位。host_type 告訴你免費版放在誰家裡,publisher 是出版社網站,repository 是大學或機構的儲存庫;version 告訴你那是哪一版,publishedVersion 是刊出的正式版,submittedVersion 是作者投稿前後的自存版,兩者是同一份研究的稿件,但自存版可能少了同儕審查後的修訂,版面也不一樣。下一段會看到這個欄位為什麼實用。

然後是潑冷水的那種。DOI 10.1016/j.neuron.2023.01.001,Neuron 期刊一篇關於斑馬魚游泳神經迴路的研究,回應是 is_oa: false,資料庫裡查無任何免費版本。這種時候鎖頭不會亮,你還是得回去面對付費牆。

三個樣本推不出命中率,量級參考用官方那個 52% 就好。但這個查法本身就是最好的試用:你手上最需要的那幾篇,裝之前先查一遍,答案就出來了。

它送出門的資料:一個 DOI,加上非送不可的 IP

隱私這題,官方 FAQ 寫得比多數工具仔細,值得逐條攤開。

擴充功能在你載入網頁時掃描頁面文字找 DOI,找到才對外連線一次,送出去的就是那個 DOI,加上任何網路請求都會帶的 IP 位址。姓名、信箱、頁面上的其他內容都不送;使用者的設定存在自己瀏覽器的本機儲存,不會上傳。伺服器端的請求紀錄放在 Papertrail 這個日誌服務,官方說明只用於除錯與流量分析,個別請求紀錄不與第三方共享,對外發布的只有去掉個人資訊的聚合統計,例如「某段時間內有多少比例的請求配對到免費文章」這種層級的數字。

不過誠實地讀,它仍然會知道「某個 IP 正在讀哪篇論文」,DOI 不難連回研究主題。介意這件事有兩個做法:走 VPN,或把擴充功能設成點擊才運作。Chrome 裡的操作是擴充功能頁 → 詳細資料 → 網站存取權(Site Access)→ 點選時(On click),設好之後它平常完全沉默,你按工具列上的 Unpaywall 圖示它才查。

FAQ 裡還有個值得知道的細節:擴充功能偶爾會在 API 說沒有的時候說有。原因是它除了查資料庫,還會當場讀出版社頁面的原始碼,有些頁面直接內嵌免費 PDF 連結,資料庫還沒收錄到。對使用者來說這是好事,實際命中率會比純資料庫查詢再高一點。

程式碼停在 2021 年,90 萬人還在用

翻到它的 GitHub 專案 ourresearch/unpaywall-extension,會看到一條反差很大的時間軸。

專案 2016 年開源,MIT 授權,在 GitHub 上累積五百多顆星。master 分支最後一次實質修改停在 2021 年 7 月 28 日,內容是把一個預印本網域加進辨識清單這種小事;之後唯一的動靜,是 2025 年 1 月 2 日 manifest_2025 分支上一筆 manifest 修補,分支名與提交訊息都直指 manifest,提交紀錄裡沒有功能性改動。對照 Chrome 商店頁顯示的「2025 年 1 月 8 日更新」,上架版已超過一年半沒有功能更新,這兩個日期的對應是依時間與性質推測,官方沒有另行說明。

GitHub 上 ourresearch/unpaywall-extension 儲存庫頁面,顯示 MIT 授權與最後提交時間Pin
擴充功能原始碼儲存庫 ourresearch/unpaywall-extension(GitHub)

一個程式碼凍結的擴充功能,為什麼還能正常運作?因為它的任務本來就極簡:掃 DOI、查 API、畫鎖頭,三步。真正複雜、真正需要持續維護的是資料庫那一端,5,691 萬篇免費文章的位置資訊要不停收割更新,那一端是活的。對使用者來說這有兩面:任務極簡、能壞的點少,但瀏覽器平台改版時它仍可能要修補才跟得上,2025 年那筆 manifest 修補就是例子;新功能則不用期待。

使用規模有兩個數字可以對照:官方產品頁寫「Chrome 與 Firefox 合計 60 萬以上使用者」,Chrome 商店目前顯示 90 萬位使用者、4.0 顆星(281 則評分)。官方文案落後於現況的例子還有一個:官網首頁的瀏覽器標題至今寫著「2,000 萬篇」,內文數字卻已是 5,691 萬。文案會懶,資料庫不會,這種「頁面舊、資料新」的落差,本身就是它健康程度的線索。這是長壽、大規模、被圖書館界普遍接受的工具,不是實驗性小專案。

先看清邊界:只認 DOI、只管學術、一半機率

裝之前,幾個邊界會直接決定它對你有沒有用。

它只認 DOI,而且收錄對象是同儕審查的期刊文章與 arXiv 這類預印本。FAQ 明講:紐約時報、華盛頓郵報那類報紙雜誌的付費牆,它幫不上,拿它解新聞網站的訂閱牆會撲空;書籍章節、技術報告即使註冊了 DOI,也不在它的收錄對象內。

它只索引免費版存在的內容。官方自述 52% 的另一半意思是:大約每兩篇有一篇,你查了、鎖頭沒亮,這不是故障。撲空時的正路是圖書館,多數大學圖書館有館際借閱與文獻傳遞服務;不然就是靠機構訂閱,或直接寫信跟通訊作者要一份,研究者收到這類信多半習以為常。

找到的版本未必是正式版。前面 Nature 那個例子回應裡的 arXiv 位置標的是 submittedVersion,就是作者投稿時的自存稿:跟正式版是同一份研究,但可能少了同儕審查後的修訂,頁碼、排版、刊出資訊也不一樣。引用要以正式版為準,學校若要求正式版引用,拿免費版讀完後要回正式版核對格式。

介面與文件全英文,沒有中文。以它的功能複雜度來說,這道牆不算高。

裝之前先花 30 秒:拿你卡住的那篇 DOI 查一次

安裝入口在官網產品頁(unpaywall.org/products/extension),有 Chrome 與 Firefox 兩條連結;Chrome 也可以直接在商店搜 Unpaywall,認明開發者網站是 unpaywall.org。

不過更推薦的順序是先驗證再安裝。打開你正在卡的那篇論文,DOI 通常就在頁面明顯處:網址列的 doi.org 連結、引用區,或論文標題下方的出版資訊裡。把它接進上面那個 API 網址,瀏覽器直接打開就是 JSON 回應,看 is_oa 是 true 還是 false。拿你真的會用到的那幾篇各查一次,五篇裡有兩三篇 true,這工具對你就是省錢省時間;全 false,代表你的領域免費版本少,裝了也只是多一個不會亮的鎖頭。

找到 PDF 之後的事,看需求接手:掃描版論文要轉成可搜尋的文字,可以接自架的 PDF 轉 Markdown 工具;寫作端要整理研究賽題或論文草稿,也有數模論文 AI 助手這類流程可以搭配。要找的如果是中文學術資源的入口地圖,之前介紹過的中國學術資源導航站跟 Unpaywall 的免費版查找剛好互補。

授權與專案狀態

Unpaywall 由非營利組織 OurResearch 經營,擴充功能 MIT 開源、免費。官網產品頁列出的產品線,除了瀏覽器擴充功能,還有資料庫快照、資料訂閱 Data Feed、REST API、簡單查詢工具與圖書館連結解析器整合,看得出資料端服務才是主力,擴充功能是同一套資料的免費入口。原始碼最後實質修改停在 2021 年 7 月,manifest 修補在 2025 年 1 月,Chrome 商店版更新日期為 2025 年 1 月 8 日;官網首頁的收錄數字是動態計數,這個數字會隨時間繼續增加。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1209

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...