OpenAI 承諾讓外部評估者以近似員工權限進駐,跟進降速提案

OpenAI 執行長 Sam Altman 公開支持 Anthropic 的降速提案,承諾讓獨立評估者取得近似員工的存取權。從首席科學家長文、研究員辭職風波到 Musk 與白宮的反應,承諾的規格落差、兩派批評者的原文說法,以及可驗收的四個公開訊號。

用 AI 摘要這篇文章:

OpenAI 執行長 Sam Altman 在台北時間 9 月 13 日凌晨於 X 發文,公開支持 Anthropic 執行長 Dario Amodei 的降速提案,並留下一句後續效應最大的承諾:「承諾讓獨立評估者取得近似員工的存取權是個好主意,我們也會照做(we will do the same)。」這是 Amodei 9 月 12 日發表〈We Must Pace the Frontier〉長文、宣布 Anthropic 將單方面引進嵌入式評估者之後,第一家把跟進寫成具體承諾的同業。比他早九十分鐘,Elon Musk 已先表態,但只留下一句話。

TechMoon 先前整理 Amodei 提案時指出,這份提案的確定部分只有 Anthropic 的單方面承諾,真正的考驗是 OpenAI、Google 等同業會不會跟進(詳見這篇)。考驗來得很快,形式卻值得細看:OpenAI 版的承諾目前只有一句貼文,時程、機構名單、權限範圍一概未見,Altman 自己也只補了一句「很快就會有更多可分享的內容」。承諾能不能當真,接下來要看內部鋪陳、各方反應的原文,以及幾個可以驗收的公開訊號。

「我們也會照做」承諾了什麼,還缺什麼

先把 Altman 那則貼文的全文攤開。發文時間是 9 月 12 日 16 時 30 分(UTC),距離 Amodei 宣布長文的貼文只隔兩個半小時,內容分兩段:「我同意 Dario 的看法,我們需要為前沿設速。這是 OpenAI 近幾週內部討論的主要主題。」「承諾讓獨立評估者取得近似員工的存取權是個好主意,我們也會照做。很快就會有更多可分享的內容。」

Sam Altman 於 2026 年 9 月 12 日在 X 發布的承諾貼文:同意 Dario Amodei 需要為前沿設速,並承諾讓獨立評估者取得近似員工的存取權,OpenAI 也會照做Pin
Altman 的跟進承諾貼文,引述的正是 Amodei 的降速提案宣布(圖片來源:X)

四句話裡真正新的東西是「我們也會照做」。要衡量這句話的分量,得對照 Amodei 側已經寫出來的規格。Anthropic 承諾給外部評估者的待遇,包括辦公室裡的座位、門禁識別證、公司筆電,以及與內部風險評估團隊大致可比的工作空間、工具與權限;契約上,評估者有權公開風險等級、事故、公司的安全做法,以及他們取得或沒能取得的存取權,Anthropic 沒有編輯控制權,僅能因資安敏感、法律特權、商業機密或第三方機密做窄範圍刪減,不能只因結論難看就刪。文中引的先例是銀行業:監理機關的督察人員直接坐在行員旁邊。

OpenAI 這邊,對應的規格全部付之闕如。幾位評估者、來自哪些機構、何時進駐、權限涵蓋訓練管線還是只有已部署模型、能否不經公司審核獨立公開報告,這些問題在貼文與後續表態裡都沒有答案。CNBC 的報導也只引述到同一段文字為止。換句話說,Amodei 給的是一份規格書加上一個先例,Altman 給的是一句意向宣言;兩者可以指向同一件事,但可驗收的程度完全不同。

Amodei 本人在長文裡也把界線畫得很清楚:設速不等於停止模型訓練或技術進步,而是讓公司有足夠時間做好對齊與防護,並由第三方評估者確認這件事真的有做。Altman 的貼文引用的正是這個框架,沒有再加碼,也沒有縮水。

承諾前一週,OpenAI 內部已先把話說重

把時間往回撥,這句承諾並非突然出現。9 月 6 日,OpenAI 首席科學家 Jakub Pachocki 在官方網站發表長文〈An Alien Mind〉,用內部研究者的口吻把風險寫得比執行長更直白。這家公司今年的內部研究進展與對外宣稱曾數度成為新聞,包括一場關於數學證明宣稱的信任風波,TechMoon 當時的整理在。文中有三段值得逐字讀。

OpenAI 官方網站 2026 年 9 月 6 日刊出的長文 An Alien Mind 標題頁,作者為 OpenAI 首席科學家 Jakub PachockiPin
OpenAI 首席科學家 Pachocki 的長文刊頭,分類為 Safety 與 Research(圖片來源:OpenAI 官方網站)

談進展速度,他寫:「基於內部結果,我有強烈的預期,這個進展速度可以一路持續到遞迴自我改進。」談全產業的準備度,他寫:「我目前相信,沒有任何一間實驗室已經把對齊與監控解到足以繼續以全速負責任地擴張很久的程度。我期待也希望能見到自願放慢成為常態,直到共享的安全門檻被建立起來。」至於 OpenAI 自己的立場,他寫:「這是一個需要極端謹慎的時刻。我擔心沒有人為機器智慧持續快速上升的後果做好準備。OpenAI 會繼續尋求對齊與監控的技術解方、建立防禦系統,並在需要時單方面暫停進一步的擴張;但我相信,更廣泛的介入是必要的。」

Pachocki 長文中呼籲極端謹慎的段落原文:這是需要極端謹慎的時刻,擔心沒有人為機器智慧持續快速上升的後果做好準備,OpenAI 會在需要時單方面暫停進一步擴張Pin
長文開頭的謹慎宣言段落(圖片來源:OpenAI 官方網站)

三天後的 9 月 9 日,另一記重錘落在產業頭上。曾先後任職於 OpenAI 與 Anthropic 的研究員 Jacob Coxon 公開辭職,Politico 歐洲版當天報導了他的辭職貼文。Coxon 稱兩家雇主「賭上我們的性命」(gambling with our lives),寫道:「這些很快就會是能駭進任何東西、一夜之間翻轉任何領域、並取得真實權力與資源的超人系統。我們都見證了每個領域的進展,而進展沒有放慢。」他在後續貼文補了一句更重的:「打造 AI 的人真心相信,它可能在十年內殺死我們所有人。」

更關鍵的是 Anthropic 內部的回應。帶領對齊工作的研究員主管 Evan Hubinger 在跟進貼文中寫:「Jacob 在這點上是對的:我們真的真心相信 AI 可能殺死人類。」他估計這件事在未來十年內發生的機率高於百分之十,並說在超級智慧情境下,公司目前還沒有對齊計畫。Politico 同篇報導提到,美國參議員 Bernie Sanders 已宣布將提案禁止企業開發超級智慧;歐盟的 AI 法案則早已要求企業評估並減緩所謂失去控制的風險。

把三個時間點連起來,9 月 6 日首席科學家說產業還沒準備好,9 月 9 日離職研究員說兩家巨頭在賭命、在職主管承認相信風險是真的,9 月 12 日 Amodei 提出降速三步驟,同日 Altman 表態跟進。對照 TechMoon 先前對 Fortune 專訪的整理,Altman 在同一場專訪裡親口排除 2026 年上市,理由正是安全工作以私公司身分做起來更順手(詳見這篇)。表態與商業時程決策出現在同一週,這個巧合後面還會再回來一次。

同框與反對:一個提案,四種解讀

Altman 之外,另一個表態讓媒體直接用「死對頭之間罕見的一致」下標:Elon Musk。Guardian 報導,Musk 在 Amodei 長文刊出後於 X 寫下「Dario 是對的」(Dario is right),並稱自己早就持續對 AI 示警,引用他 2014 年的貼文「我們必須對 AI 非常小心。它可能比核武更危險」。CNBC 補充,Musk 的 xAI 今年稍早被他的火箭公司 SpaceX 收購,他過去對 Anthropic 的批評相當尖銳,五月雙方宣布大型算力合作後態度才轉變。CNBC 的總結是,三家常在市場上激烈競爭的公司,在「該放慢」這件事上出現了不尋常的一致表態。

Google DeepMind 共同創辦人 Demis Hassabis 的說法相對保留:「細節仍需研究,但方向正確,足以因應這個關鍵時刻。」美國政府方面則出現兩種否定。美國總統 Trump 在愛爾蘭談到這波警告時說,是「非常負面的力量」在「提起不會發生的事」,並強調「我們在 AI 領域領先中國,誰贏得 AI,誰就贏了」。總統科技顧問委員會共同主席 David Sacks 的質疑更結構性:「別再假裝你需要別人的許可。別再假裝放慢的動機純粹出於利他。如果你的產品促成真正具破壞力的網路攻擊,你將面臨龐大的產品責任風險。」

安全陣營內部也有人認為提案遠遠不夠。蒙特婁大學助理教授、英國 AI 安全研究所創始團隊研究總監 David Krueger 的說法是:「我們需要針對前沿 AI 開發的立即、無限期、國際性暫停。」結果是,這份提案同時被指控太激進與太溫和:市場懷疑它是商業煙幕,安全研究者嫌它連暫停都談不上。

財報焦慮與開源生死,兩種不相信的理由

批評聲音裡,有兩條思路各自成派,而且都有具名原文。其中一條是財務動機論。AI 研究者與連續創業家 Dr. Eli David 在 X 寫道:「Anthropic 和 OpenAI 延後 IPO,因為 S-1 會揭露他們正在大量失血,而且沒有獲利路徑。解方?『AI 放慢』,好砍掉新模型的訓練成本。這一切跟 IPO 有關,跟安全無關。」帳號 FinanceLancelot 的版本更直白:「公司上市時必須提交揭露財務的文件。這麼做會暴露 OpenAI 驚人的現金消耗。所以 Sam Altman 不能上市,但他的錢也已經燒得差不多。」

這條思路的邏輯核心是:上市公司每季都要交代營收與成本,而訓練支出正是最大的成本塊;把「放慢」包裝成安全敘事,可以同時合理化支出縮減與延後揭露財報。必須說清楚的是,這是批評者的主張。OpenAI 與 Anthropic 的財務都未公開,虧損規模、現金水位與獲利路徑外界無從核對,動機論與安全論目前都缺乏可核對的證據。能對帳的只有行為一致性:OpenAI 確實在 8 月 18 日的公告中暫停過部署模型的強化學習訓練,也確實把最大規模的前沿訓練繼續停住,這些是可查的公開動作,不是修辭。

另一條是開源存亡論。Matteo Pellegrini 在 X 用三個步驟諷刺整場表態潮:「用三個簡單步驟殺死開源模型:對前沿模型製造恐慌。讓最大的 AI 公司幫忙寫『安全』規則。Pellegrini 特別標註,現在就停在這一步。接著把規則弄沉重到開源無法競爭。」文末補上一句「真是談判的藝術」。這條思路擔心的是,安全門檻一旦寫進法規,合規成本的落差會把資源有限的開源團隊與新創排除在門外,最後受保護的是既有巨頭。Amodei 的三步驟計畫裡,的確有一步是民主陣營的前沿公司協調建立共同安全標準,需要政府協助處理反托拉斯限制;批評者盯上的正是這個介面。

讓張力更立體的是另一個時間點。Guardian 報導,Anthropic 正在籌備被認為將是史上最大規模的 IPO,計畫規模超過 2 兆美元,預期很快展開行銷;CNBC 的說法是公司確實在積極準備,但尚未官方揭露時間。倡議放慢能力增速的一方,同時在推進資本市場史上最大的案件之一,這個並置本身就是批評者動機論最肥沃的土壤。兩件事不必然矛盾,私公司照樣可以 IPO,但讀者應該知道全貌。

9 月 14 日的兩則後續:人類陣營的原文

表態潮並沒有停在 9 月 12 日。台北時間 9 月 14 日中午,Altman 再於 X 發布兩則貼文,是這波表態迄今內容最完整的闡述。其中一則寫:「世界值得對開發越來越強大 AI 的美國企業抱有信心,相信它們會負責任地行事,尤其在進展軌跡日益陡峭的此刻。每一家前沿實驗室都必須做到這點,做不到的話,我們任何人都沒有理由來上班。」

另一則直接處理最壞情境:「AI 的進展有兩種可能變得非常糟糕、我們必須避免的方式。第一種是我們可能把未來的控制權輸給 AI。這無法接受;我們堅定站在人類陣營(Team Humanity)這一邊,AI 必須永遠服務人群。為了確保這點,我們需要讓對齊與安全技術保持在模型能力進展之前。第二種是我們可能落入權力過度集中的世界。如果一個無比強大的 AI 被一個人或一家公司用來把自己的世界觀強加於所有人,結果可能極端反烏托邦。」他接著補,避開這兩種威脅需要走一條狹窄的中間路線,並點出兩個要避開的形態:一個國家取得過大權力,或者一間實驗室握有過大權力。在這段文字裡,立場句的分量相當重:一家前沿實驗室的執行長,把「不失去對未來的控制」與「權力不過度集中」並列為公司存在的先決條件,而不是眾多目標之一。第二種威脅談的權力集中,與開源陣營對少數實驗室壟斷前沿能力的疑慮指向同一個方向,只是開出的解方不同。

什麼訊號出現,承諾才算數

與其爭論動機,不如把「有沒有真的做」升級成可判斷的訊號,四個關卡都是公開可查的。最直接的是 OpenAI 公布「更多可分享的內容」:時程、機構、人數、權限範圍與獨立公開權一次攤開,承諾才從意向變成規格。再來是首位嵌入式評估者實際進駐任一實驗室;Amodei 側到 9 月 12 日為止也只到「近期打算邀請」的層級,連團隊名單都還沒有,兩家公司都適用這個檢驗。評估者的第一份公開報告出現時,可檢驗的問題很具體:報告能不能不經公司公關審核刊出、關鍵段落有沒有被刪到看不出結論。訓練節奏則是硬指標,OpenAI 8 月公告中續停的最大規模前沿訓練何時重啟、重啟時官方交代了哪些安全補強,會直接反映「放慢」是不是可持續的政策。

最後把不確定的部分列清楚。OpenAI 承諾的落地細節全部未公布,包含時程、機構、權限範圍與評估者能否獨立發布結果;Amodei 側的承諾同樣還沒有首位進駐者。至於這波表態是不是財務或競爭考量包裝出來的,在兩家公司財務與內部文件公開之前,任何方向的斷言都超過現有證據。比較穩的讀法是:一位執行長把「我們也會照做」說出口,把驗收標準順手交給了所有人;在第一位評估者拿著識別證走進 OpenAI 辦公室之前,這句承諾的分量就停在那句貼文上。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1310

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...