OpenAI 推 ChatGPT Data agent,把公司資料分析搬進對話裡

OpenAI 在 9 月 10 日深夜發表 ChatGPT Work 的 Data agent,用自然語言連公司資料源、追查指標變化並產出可更新的互動儀表板。查詢沿用既有帳號權限、夥伴端工具全設成唯讀,但官方沒有公布正確率基準,指標定義的整備度才是能不能用的關鍵。

用 AI 摘要這篇文章:

台北時間 9 月 10 日晚間 11 點 05 分,OpenAI 的 ChatGPT 官方帳號在 X 上發文,第一行只有一句「Now everyone can put data to work」,接著宣布 ChatGPT Work 推出新的 Data agent(資料代理)。同一時間,官方部落格刊出長文,首發合作夥伴的技術文件與外媒專訪也同步解禁。這是 OpenAI 連續第三天有產品級發表:9 月 8 日先推出 ChatGPT Images 2.5,9 月 9 日談 GPT-6 Astra 的商用定位,9 月 10 日輪到企業資料分析。

Data agent 做的事用一句話講:讓沒學過 SQL 的同事,直接用自然語言問「上週活躍用戶為什麼變少」,它去連公司核定過的資料源追查、攤開每個發現背後的證據,再把結果做成可以分享、會跟著資料更新的互動儀表板。官方列出的連接來源涵蓋 Amazon Redshift、Datadog、Google BigQuery、ClickHouse、Databricks、MongoDB、Snowflake 七個資料平台,清單以 and more 收尾,支援來源不止這七個;Google Drive 與 SharePoint 裡的文件也帶得進分析。它還能跟 Omni、Oracle BI、Power BI、Sigma、Tableau、ThoughtSpot 這些既有 BI 工具互動,把儀表板直接建在原本的系統裡。

不過對要決定「公司要不要開放這種用法」的人來說,比功能清單更值得先看的,是 OpenAI 把這條產品的邊界畫在哪裡:它只讀不寫、權限完全沿用連接帳號原本那套,而且答案的對錯,責任最後還是落在公司自己的指標定義上。

OpenAI 自己先當了一年客戶

這個產品不是憑空設計出來的。OpenAI 在官方部落格另有長文,攤開內部版資料代理的打造過程:內部資料平台服務超過 3,500 名員工,資料量超過 600 PB、跨 7 萬個資料集,規模大到連找對那張資料表,都是分析流程裡最花時間的環節之一。外媒在報導中提到,這套內部工具一月就曾在工程部落格亮相,九月上旬又補上實際用法的細節。內部版的幾個設計延續到對外產品:存取完全沿用員工本來的權限,答案要附推理過程和底層結果的證據。內部版還會用人工撰寫的標準答案題庫做回歸測試,改壞了會被抓到。

OpenAI 企業科技事業線總經理 Arpan Shah 接受外媒專訪時說得很直白,對外版就是內部工具的「外部化、通用化」版本;一年前 OpenAI 內部資料問題能自助拿到答案的只占很小一部分,現在內部每個人都能自助查。官方公告頁也刊載內部採用數字:幾乎全體產品部門、超過三分之二的業務與市場推廣組織都在用。但同一頁有一句前提常被略過:這一切的前提,是 OpenAI 的資料團隊先建立了共用的指標定義、存取規則與敏感資料防護。那句前提,其實就是這個產品能不能用的答案。

內外版本有一個值得注意的差異。Shah 在專訪中證實,對外的 Data agent 沒有為客戶建立可以持續累積的組織知識層(原文的說法是 context layer),它把各來源的定義與脈絡在對話當下拼接起來用;OpenAI 內部版則有記憶系統,會把修正與經驗留下來。也就是說,買到的是同一套方法的外部版,不是 OpenAI 內部那台機器本身。

只讀不寫,權限沿用你原本那一套

資料要接進 AI 對話,企業第一個問題永遠是「它會看到多少、能改多少」。這次官方文件給的答案有三層。第一層,企業管理員決定哪些資料連線可用、哪些角色能使用;第二層,所有查詢沿用連接帳號本來的權限,包含資料表、資料列、欄位三個層級的限制,沒有薪資表權限的員工,不會因為裝了外掛就突然看得到薪資表;第三層,OpenAI 的說明中心明文寫著,安裝外掛不等於完成授權,帳號連接要另外完成個別的授權流程,而且安裝外掛無法繞過供應商或工作區的任何權限設定。

「唯讀」這件事在夥伴端有實際證據。首發夥伴 ClickHouse 的技術文件寫得相當細:它的外掛由託管在 ClickHouse Cloud 的遠端 MCP 伺服器與開源的技能包組成,伺服器端提供 13 個工具,涵蓋列出資料庫與資料表、檢視結構、執行 SELECT 查詢、讀取服務、備份與帳單資訊,每一個工具都標記唯讀,整個外掛裡沒有任何能修改資料或變更服務設定的能力。查詢結果做成儀表板的過程,也不會反過頭去寫進 ClickHouse。

ClickHouse 官方部落格文章截圖,段落標題 What's in the plugin,內容說明遠端 MCP 伺服器提供 13 個工具,每個工具都是唯讀並帶 readOnlyHint true 標記Pin
ClickHouse 首發外掛的 13 個 MCP 工具全部唯讀,官方說明寫明外掛裡沒有任何能修改資料或變更服務設定的能力(圖片來源:ClickHouse 部落格)

寫入類的動作發生在另一條軌道上。Data agent 可以建議下一步、找出該參與的人,透過 Slack 或電子郵件分享分析結果,但官方公告的原文寫的是「執行經你同意的動作」:對外的行動要經過使用者點頭才會發生。對採購方來說,這代表讀取邊界在產品設計裡,對外動作的邊界在管理設定裡,兩邊都要自己驗。

連的不只是資料庫,還有你家的指標定義

ChatGPT 要連資料源回答問題,先前就做得到,單點查詢式的連接工具早就存在,OpenAI 自家教材也是這樣教:Chat 適合問單一問題,Work 做多步驟任務。這次的新東西在另外三件事。一是追查可以連續進行,沿著同一段對話細分客群、換維度驗證;二是產出變成可編輯、可分享、可刷新的互動儀表板,還能套上公司的品牌規範;三是它讀的不只是資料表,還包括公司的語意層,Databricks Genie Ontology、dbt、GitHub、Snowflake Horizon 與既有 BI 儀表板裡的指標定義與資料關聯。Shah 在專訪裡把這個定位講清楚:MCP 只是起點,Data agent 做的是資料工作流的編排。

把語意層拉進來,是整份公告裡最影響成敗的一段設計。同一個營收問題,財務看含稅與否、業務看訂單成立時點、產品看實際使用,口徑本來就會不一樣;AI 如果只看得到欄位名稱,回答可以又快又流暢,但用的可能是別的部門的算法。接上公司已經核定一致的定義,不同團隊才有機會拿到相同的答案。反過來說,還沒有建立共用定義的公司,這一段就是空的,分析速度加快只會讓錯誤也加速。這也是它與一般「自然語言查資料庫」工具的分野,沒有語意層的開源方案(例如我們先前介紹過的 開源資料分析助手)靠模型自己猜口徑,這套產品把口徑當成接線的前提。

生態系的站位也值得看一眼:AWS、ClickHouse、Databricks、Snowflake、MongoDB、G2 六家平台,加上 Tableau、微軟(Power BI)、Sigma、ThoughtSpot 四家 BI 供應商,全部具名站台。OpenAI 沒有做資料倉儲,也沒有做 BI,它卡的位置是對話層;既有廠商急著進場,正好說明現在畫出來的分工是「接上」而非「取代」。想看 OpenAI 近期在企業端的另一手布局,可以參考我們寫過的 Claude Marketplace 夥伴擴充一文裡的採購機制變化。

官方沒有給的東西:正確率基準

翻遍官方公告與說明文件,找不到任何檢索正確率或答案正確性的基準數字。Shah 對外媒的說法是,OpenAI 內部有把代理的結果與自家資料工具做對比,確認與內部預期一致,但那是內部對比,沒有公布數字,更不是獨立驗證的基準。對照同週的新聞,Databricks 剛發布自家研究,宣稱其檢索方法在相近答案品質下平均 5.8 秒回應。一邊給了可檢驗的數字,一邊選擇用流程與客戶引言代替數字,這個差距,企業採購時自己要補上驗證這一步。

客戶引言的部分也要用對等級去看。OpenAI 頁面刊載了 11 家 Alpha 企業的用法:ServiceTitan 用它做出儀表板,發現自家 AI 助手 Atlas 的使用者啟動行銷活動的比率約為非使用者的三倍;micro1 的營運團隊用自然語言在半小時內重建績效追蹤儀表板,順便抓出原報表的錯誤;NTT DATA 則提到非工程師的業務與行政同仁開始自建儀表板。這些是廠商頁面上的客戶宣稱,證明的是使用情境存在,證明不了貴公司裝了會得到同樣結果。有個小細節順帶一提:公告的客戶段落首句把 ServiceTitan 與 Piston 兩家公司寫成了「ServicePiston」,頁面層級的筆誤,剛好提醒讀者這份名單屬於行銷素材層,逐句引用時以個別引言為準。

9 月 10 日正式發表,8 月就有人先學會用

嚴格說,這次是「正式發表」,不是第一次出現。OpenAI Academy 在 8 月下旬錄製的研討會教材,已經在教 Data plugin 的安裝與 @Data 的用法,教材裡還列了資料品質檢查、指標診斷、KPI 報表幾個隨附技能;換句話說,正式發表前,部分工作區已經用了一段時間。首發夥伴 ClickHouse 的說法是,9 月 10 日這波帶來的是代理式儀表板、擴充的管理控制與改善的資料連線。對已經在用的人,這一天的重點是生態一次補齊。

OpenAI Academy 研討會資源頁截圖,標題為 ChatGPT Work for data teams Webinar Resource Guide,頁面屬於 ChatGPT for Work 社群資源Pin
OpenAI Academy 在 8 月下旬錄製的研討會教材已在教 Data plugin 的用法,正式發表前部分工作區已能使用(圖片來源:OpenAI Academy)

想試的團隊,入口是 ChatGPT Work 側邊欄的 Plugins 目錄,找名稱就叫做「Data」的那個項目;工作區還沒開放的話,要請管理員到 Workspace settings 的 Plugins 頁面開放或代為安裝,並啟用 Databricks、Snowflake 這類資料源外掛。完成帳號連接後,在對話裡輸入 @Data 再提問。官方給了三條示範問句,翻譯如下:「診斷上週活躍用戶變化的原因,找出可能的驅動因素,與前期比較,並建議接下來檢查什麼」「為新產品領域設計 KPI 架構,包含主要指標、驅動指標、護欄指標、目標與資料驗證需求」「把這個月的指標整理成主管可直接閱讀的更新,包含實際值、比較基準、驅動因素、注意事項與建議行動」。對外掛目錄生態不熟悉的讀者,可以先看我們整理過的 ChatGPT 中小企業外掛清單

可用性方面要誠實說:官方沒有逐市場列出時間表,說明中心的口徑是依方案、工作區、角色與地區而異。ChatGPT Work 這個載體本身,桌機版開放所有方案,網頁與行動版開放 Plus、Pro、Business、Enterprise、Edu;Data agent 是否含在既有方案內、有沒有額外計價,公告裡沒有提。台灣的團隊現階段該問的是兩件事:你的方案層級,以及工作區管理員有沒有把那個項目打開。

導入前先盤的三件事

如果評估後決定試,有三件事值得在開放給全公司之前先做。先實測權限:拿一個本來就沒有某些資料表權限的帳號連上去問,確認列與欄層級的限制真的生效,而不是只信文件上的承諾;也不要圖方便用共用管理帳號把所有來源一次接上。再盤點指標定義:公司有沒有 dbt、Genie、Horizon 這類語意層可以接,各部門對活躍用戶、營收、續約率有沒有統一口徑;沒有的話,先指定權威定義與負責人,再談 AI。最後是證據與把關:要求每次回答附上來源與篩選條件,重要決策抽查底層查詢,對外分享與寫入類動作設成需要人工確認。

這三件事做完,資料團隊的角色也就清楚了:從替每個人拉數字,轉向維護定義、權限與稽核軌跡。OpenAI 內部那句前提(資料團隊先建好共用定義、存取規則與防護)講的就是同一件事。這次發表真正透露的訊息是,擋在「人人自助查資料」前面的技術問題,OpenAI 認為大致解掉了;剩下來的,都是每家公司自己的治理作業。資料整備好的團隊,多了一個縮短排隊的新選項;口徑還亂的公司,第一筆預算該花在整理定義,不是急著把所有系統接進對話框。

後續值得回查的變數:首發名單與管理控制會滾動調整,官方若補上正確率基準或計價方式,本文對應段落就該更新;各市場的開放時程,以工作區實際看到的目錄狀態為準。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1224

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...