OpenAI 發表 Astra for Law:GPT-6 Astra 換上法律索引與保密治理

OpenAI 在美國時間 9 月 17 日發表 Astra for Law,把逾 2.3 億個 URL 的法律搜尋索引、專屬法律指令與零資料保留等治理控制加到 GPT-6 Astra 上,先透過 Trusted Access 開放入選律所,API 之後才上線。官方自報在 Vals AI 私有驗證集拿下 54%,但公開排行榜榜首是三個模型同分的 55.29%,這組數字該怎麼讀、Harvey 為何變成客戶、一般用戶現在能用什麼,本文逐項拆解。

用 AI 摘要這篇文章:

美東時間 9 月 17 日下午,OpenAI 發表 Astra for Law,一個給律師事務所與法律科技公司在其專業上建立 AI 產品與工作流的專用基座。消息在台北 18 日凌晨 4 時前後傳開:專業媒體 Legal IT Insider 在 19 點 59 分(UTC)搶發,ABA Journal 與 Law.com 隨後跟上,Hacker News 上的討論串累積約 570 分、超過 670 則留言。這是 OpenAI 一週內的第二個垂直產業產品,9 月 10 日的金融業版 ChatGPT 才剛上線。

先講這次到底換了什麼。模型沒有換:引擎還是 9 月 9 日發表的 GPT-6 Astra。被換掉的是模型腳下的工具層,一個涵蓋逾 2.3 億個 URL 的法律搜尋索引、一套專為法律分析與寫作調校的指令,以及畫在治理層的保密控制。在 ChatGPT 與 Codex 的模型選單裡,它會以 GPT-6 Astra Law 的名稱出現;API 版本叫 gpt-6-astra-law,但 API 要等之後才上線。

數字面有三個宣傳重點需要各自解讀:官方自報在 Vals AI 法律研究基準的私有驗證集拿下 54%,這個數字量的是進步幅度,公開榜的榜首 55.29% 由三個模型並列;「覆蓋 99.9% 美國判例」的原始出處是資料提供方 Free Law Project 在 2023 年寫下的自述;而法律 AI 獨角獸 Harvey 這次以客戶身分出現。以下逐項攤開。

產品本體:模型不動,接上法律檢索層

公告對 Astra for Law 的定位寫得很直白:一個讓律所與法律科技公司圍繞自身專業建立 AI 產品與工作流的新基座,把 GPT-6 Astra 與為專業法律工作調校過的設定、工具和脈絡組合在一起。它不是一個裝好就用的律師 App,而是模型加索引加指令的底層組合,律所要自己在上面蓋工作流。

檢索層是這次的主角。新的法律搜尋索引涵蓋逾 2.3 億個 URL,內容橫跨美國判例法、成文法、法規、法院規則與行政裁決,來源每天新增。其中判例部分來自與非營利組織 Free Law Project 的合作,把對方維護的 CourtListener 判例集接進檢索體驗。公告同時畫了一條界線:這個索引是來補充律所既有的付費內容與專業產品的,點名 Thomson Reuters 這類供應商仍在配置裡。

指令層處理的是法律工作特有的判斷。公告舉的例子包括:區分法院判決中具拘束力的裁判主旨(holding)與順帶發表的意見(dicta)、正面處理削弱己方論點的判例、解釋合約例外條款如何在雙方之間移轉風險。這些是法學訓練裡的基本功,也是通用模型最容易出錯的地方。

54% 的正確讀法:進步是真的,排名是另一回事

官方公布的測試設定是:在 Vals AI 法律研究基準的私有驗證集 200 道美國法律研究題上,兩邊都開到最高推理檔位。結果是 Astra for Law 的完整設定在整體正確率檢核通過 54.0%,對比 GPT-6 Astra 只用網路搜尋的 38.7%,官方稱相對提升 40%。兩個附帶數字:在判例法類題目上找到的參考判例多 24%;在經稽核的目標段落集合上,同檔位比較「最多」多檢索到 54% 的相關段落,原文帶著 up to 的但書。

OpenAI 公告中 Astra for Law 與 GPT-6 Astra 的測試數字段落Pin
官方公告的原始數字段落:54.0% 對 38.7%,比較對象是同一顆 GPT-6 Astra 只用網路搜尋。

這組對比的關鍵在比較對象:38.7% 出自同一顆 GPT-6 Astra 關掉法律配置後的設定,比較對象裡沒有其他家模型。它量測的是「同一顆模型換掉接地層」的進步幅度。而 Vals AI 的計分方式相當嚴格:每題的評分細項由執業律師命題並同儕審閱,從 1 項到 31 項不等,採全對制計分,所有細項全過才算該題通過,否則記零分;每題限時三小時。在這種計分下,54% 與 38.7% 的差距有實質意義。

但把它讀成「法律 AI 基準奪冠」就錯了。Vals AI 的公開排行榜(截至 9 月 19 日的版本)上,榜首是三個模型同分的 55.29%:Meta 的 Muse Spark 1.3 Max、Anthropic 的 Claude Opus 5 與 Claude Fable 5.1。榜上最好的 OpenAI 模型是 GPT-5.6 Sol 的 48.08%,而排行榜表格列出的模型裡,Astra for Law 與 GPT-6 Astra 都缺席。54.0% 是 OpenAI 自己在私有驗證集上跑出來的自報數字,與公開榜的測試集不同、口徑不同,兩者不能直接換算成排名。

Vals AI Legal Research Bench 公開排行榜前十二名Pin
公開排行榜現況:前三名同分 55.29%,OpenAI 最好的 GPT-5.6 Sol 排第七(48.08%),Astra for Law 不在這份榜上。

公告裡還有一個單題示範:給定一段自有品牌製造合約的不實陳述求償情境,Astra for Law 回傳兩個貼近事實的先例;同樣的題目下,Claude Fable 5.1 在訴訟例子回傳了一個已經被上訴推翻的判決,在交易例子則回稱找不到這類案件。這是 OpenAI 自己挑的對比案例,只能當單題展示。對照公開榜上 Fable 5.1 並列第一的成績,比較誠實的讀法是:在 OpenAI 選的案例裡它輸了接地,在 Vals 的公開測試裡它仍屬最強梯隊,兩件事並不矛盾。

Business Insider 在發布當天的簡報報導補了幾個細節。OpenAI 的 Sherwin Wu 說模型調校的核心是用「實際判例法」定錨,這讓幻覺變少、法律推理更健全;產品的回答長度約為一般 Astra 回應的兩倍,因為「律師喜歡長回答」,負責法律產品的 Jason Boehmig 這樣解釋。金融業版推出的引用功能(citations)之後也會移植到法律版。這些都是官方說法,獨立複核還不存在。

99.9% 覆蓋率的出處:一間非營利的自述

「覆蓋超過 99.9% 美國已出版判例」這個數字,公告裡連結到的原始出處是 Free Law Project 自己的說明頁。原文寫的是:截至 2023 年,他們相信 CourtListener 收錄了美國已出版具先例價值判例的 99.9% 以上,剩下的 0.1% 正靠掃描實體判例集補齊。幾個但書要知道:這是資料方對自己資料庫的涵蓋自述,時間標記停在 2023 年;範圍限於具先例價值的判例,不包含各法院大量的非先例性裁決;CourtListener 現有超過 900 萬份判決、來自逾 2,000 個法院,資料骨幹包括哈佛法學院圖書館的 Caselaw Access Project 掃描計畫。

同一天還有另一層合作上架:CourtListener 自己的 ChatGPT 外掛。Free Law Project 在部落格宣布,這個外掛把 ChatGPT 接上 CourtListener 的完整研究平台,包含判例、來自 RECAP 資料庫的聯邦法院檔案、引證網路、口頭辯論逐字稿與案件及查詢警示,而且原本就支援 MCP 協定,任何相容的客戶端都能用。為了慶祝上架,CourtListener 的 API 速率限制到 10 月 1 日為止一律加倍。執行長 Michael Lissner 的說法是,ChatGPT 是世界上最多人使用的 AI 助理,也是數百萬人已經在問法律問題的地方,今天的宣布幫助他們實現把高品質法律研究工具帶給所有人的使命;FLP 的文章本身則期待免費開放的法院資料因此走進法律專業人士每天在用的工具。

Free Law Project 部落格宣布 CourtListener 的 ChatGPT 外掛上架Pin
Free Law Project 的宣布段落:CourtListener 外掛讓判例與 PACER 資料走進 ChatGPT。

把兩件事放在一起看更清楚:外掛目錄裡的 CourtListener 外掛已經上架,人人看得到,能不能啟用要看方案與工作區設定;Astra for Law 裡的索引整合是給入選律所的深層配置,要排隊等資格。對 Westlaw 與 LexisNexis 這類付費編纂資料庫而言,免費開放的判例索引如今能從 ChatGPT 的外掛目錄直達,相對位置確實變了,但付費資料庫的加值層(如引證旗幟、編纂索引)並不在這次任何一方的比較範圍裡,誰取代誰目前沒有證據。

律所拿到三個客製工具與一道保密牆

發表當天同步亮相的,是 OpenAI 前線部署工程師與幾家律所一起做出來的客製工具。Sullivan & Cromwell 做了合約分析器,把該所的談判手冊與精選先例帶進新交易的審閱,標出條款連讀才會浮現的風險,再轉成建議的紅線修改與可供律師挑戰修改的客戶草稿。Ropes & Gray 的盡職調查系統圍繞資料室工作流設計,每個發現都能回溯源頭文件,並標出可能影響收購的問題,例如關鍵客戶合約是否需要通知或同意。Cooley 的 GO Public 把資本市場專業放進上市準備流程,從 IPO 申請文件的起草到辨識值得管理層注意的風險,交易條件變動時會把變動連動到整份文件。

一個容易誤讀的細節:這三家律所的工具是建在 ChatGPT 企業版上由 OpenAI 工程師客製改裝的,Cooley 的專文寫明 GO Public 以 ChatGPT Work 為底,並未直接呼叫 Astra for Law 的 API。同一天發表的兩層東西要分開看:Astra for Law 是模型與檢索的基座,律所工具是蓋在 ChatGPT 上的應用層,兩者屬於同一個策略的上下層。

法律業最在意的保密與利益衝突,被做成產品規格。合格律所的 API 用量適用零資料保留(ZDR),ChatGPT 企業版的用量預設排除於人工審查之外;OpenAI 並與 Latham & Watkins 合作設計資訊權限、道德牆、客戶指示與事務所監督機制。另一家精品所 Wachtell, Lipton 則與 OpenAI 的研究團隊合作,探索 AI 如何支撐複雜法律判斷的工作。這些控制全部落在治理層,是這次發表裡法律業特有的工程。

Harvey 從對手變客戶,Thomson Reuters 留在場內

生態布局是這次發表的另一個看點。同日上線的 26 個夥伴外掛裡,iManage 讓律師在 ChatGPT 裡起草談判簡報後直接存回案件檔案,Intapp 會浮現可能需要補計時的活動,DeepJudge 把過往交易拉進比較;Thomson Reuters 把 HighQ 的案件脈絡帶進 ChatGPT,並預覽即將推出的 CoCounsel Legal 連接器。另外有 9 個由 LegalQuants、LECG 與 Skills.law 的律師和法律工程師製作的社群外掛,附帶 47 個可改編的技能。ChatGPT for Word 也在同一天正式推出,做校對、修改建議與格式檢查。

外掛目錄的法律分類截至 9 月 19 日可見 21 個外掛,Harvey 與 Legora 自己也在列。這呼應公告開頭的定位:Harvey 與 Legora 是 API 客戶,會把 Astra for Law 的能力帶進自家產品。OpenAI 的說法是「建立在 OpenAI 上應該意味著從生態系得到更多,而不是取代它」。Business Insider 的簡報報導裡,Boehmig 講得更白:這次鎖定的目標是美國兩百大律所(AmLaw 200)與法律科技產業,「贏的方法是聚焦客戶而非競爭」。

產業脈絡也讓這場發表的時點更有意思。Business Insider 把它對位到 Anthropic 五月的法律工具擴張,形容 OpenAI 把 AI 競爭帶進大型律所;而 OpenAI 自己正處於上市準備期,接連推出金融、法律等產業專用產品,是對投資人展示企業業務縱深的連續動作。Hacker News 討論串裡看得到的質疑包括幻覺沒有量化指標,也有人點出律師把 AI 產出照舊計費的誘因問題,後者正是計費工時辯論會不會被這類工具改寫的癥結,但目前沒有任何一方提出實測數字。

誰現在用得到,誰還要等

入選律所是第一批使用者。Astra for Law 先透過 Trusted Access 計畫在 ChatGPT 與 Codex 裡開放,對象是 OpenAI 挑選的律所,律師與其督導下的人員可以用於專業法律工作。想搶先的律所與法律科技公司走的路是聯絡 OpenAI,資格細節與價格都沒有公開。

開發者要再等。公告寫明 API 即將推出(coming soon),而 9 月 19 日當天,gpt-6-astra-law 這個名稱在 OpenAI 的 API 模型文件與定價頁上都還查不到,法律版的價格自然也未公布。對照基準:gpt-6-astra 在 API 的牌價是每百萬 tokens 輸入 10 美元、輸出 50 美元,是 OpenAI 定價表上最貴的模型線;法律版會怎麼定價,等上線才知道。

一般用戶與台灣的法律工作者現在有三個可以碰到的東西:外掛目錄裡的 CourtListener 外掛(免費,能不能啟用視方案與工作區設定)、ChatGPT for Word,以及持續存在的 CourtListener 網站本身。Astra for Law 本體則跟一般訂閱無關,台灣律所能不能進入 Trusted Access,取決於 OpenAI 的資格認定,公告沒有揭露地區限制,也沒有承諾任何地區。

還沒確定的事

在 9 月 19 日檢視,這幾件事仍是未知數:API 上線時間與價格;Trusted Access 的完整資格條件與開放範圍會不會超出美國兩百大律所;從金融版移植的引用功能何時到位;CoCounsel Legal 連接器何時正式上線;Astra for Law 會不會進入 Vals AI 的公開排行榜接受同一套評分。另外,官方承諾隨前沿模型推進會把法律能力帶到最新模型上,這代表這個產品線的疊代節奏會跟著模型走,幾個月後的樣貌可能又不一樣。

該不該注意 Astra for Law?該,但注意點不在「AI 律師來了」這種敘事,而在一個更結構性的變化:法律檢索的接地層被模型廠商做進了產品規格,保密與利益衝突控制也被寫進同一份規格表。54% 說的是同一顆模型換掉檢索層後的進步,55.29% 的公開榜說的是這個領域還沒有贏家,這兩個數字一起看,才是這場發表真正的位置。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1412

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...