Freya Adam、Eve AI 語音是什麼?把榜首成績單讀懂再決定

Freya 於 9 月 21 日發表英文 AI 語音 Adam 與 Eve,Adam 在 Design Arena 盲聽真實感榜拿下所有 AI 模型第一、僅次真人錄音。本文核對公開榜單與評測方法,整理這張成績單能證明什麼、還缺哪些證據,以及申請方式與部署選項。

用 AI 摘要這篇文章:

2026 年 9 月 21 日,語音 AI 新創 Freya 的創辦人暨執行長 Tunga Bayrak 在 X 發文,宣布當天推出 Adam 與 Eve 兩款 AI 語音,貼文稱它們是「我們打造過最像真人的 AI 語音」,並補上一句企圖心很強的結論:「我們相信已經跨越了恐怖谷」。支撐這句話的證據放在同一則貼文裡:Adam 在 Design Arena 的 AudioRealismBench 盲聽測驗中,排名所有 AI 模型第一。

先講讀者最需要的判斷。這個第一名是真的:截至 9 月 22 日,Design Arena 的公開資料顯示 Adam 的 Elo 分數為 1418,在全部 23 個條目裡僅次於真人錄音的 1463,領先第三名的 Bland Speech v3 達 49 分。對需要英文語音的產品團隊來說,Freya 值得排進下一輪測試名單。但這張成績單的範圍比「跨越恐怖谷」幾個字窄得多:測的是美式英語、多數約 40 字的短句;同場發表的 Eve 在榜上沒有任何條目;Adam 在電話客服與自然對談兩個分項榜也查無資料。

本文的數字與時間均核對自 Design Arena 公開榜單 API、評測方法頁、Freya 官網與 Y Combinator 公司頁(皆於 2026 年 9 月 22 日查閱),文末附回查期限。

Freya 是誰:一班人馬很新的企業語音新創

Freya 是 Y Combinator 2025 年夏季梯次的新創,在 YC 目錄上的定位是「企業語音 AI」,2025 年創立,團隊規模 14 人。創辦人 Tunga Bayrak 的背景是視覺語言模型與音訊 Transformer 的研究工程師。公司主業是接聽來電的語音代理(Voice Agent)平台:聽懂來電、生成回答、再把回答說出來。這次發表的 Adam 與 Eve 屬於最後一哩的「怎麼說」環節,也就是文字轉語音(TTS)。聲音像真人,與查對帳單、遵守退費規則是兩件事,榜單也只評前者。

Freya 官網首頁放了一個盲聽小遊戲:同一句話播放兩個版本,一個是真人、一個是 Freya,訪客自己選哪個是人。頁面另一處還預告了一場一百美元挑戰賽,留下信箱等開賽通知。這些設計把「你聽得出來嗎」直接變成行銷本身。

有個名字要先分開:FreyaTTS-small 是這家公司先前公開的土耳其語研究模型,Apache 2.0 授權,論文、權重與評測資料集都開放,音訊輸出取樣率 48 kHz。它與這次申請制的英文商業聲音是不同的產品,看到「Freya 開源」的說法時別混為一談。

Adam 與 Eve 怎麼用:申請制 API,還沒有公開價格

官網對新品的說明寫得很直白:兩款英文聲音,Adam 與 Eve,共用一套 API,存取採申請制、分批開放。申請表只要求姓名與電子郵件,公司名稱可選填,送出後由官方回信告知下一步。換句話說,這是正式亮相加早期開放,還不到人人能自助開通、刷卡拿金鑰的階段。

價格也還看不到。Adam 與 Eve 沒有公布獨立費率;企業端的語音代理方案採客製報價,官方列出三個報價輸入:通話量、部署模式與工程需求。部署有兩條路:用 Freya 管理的雲端(機房在土耳其),或把模型裝進自家機房的 on-prem 方案,後者支援氣隙網路安裝,官方頁面明說這是給受監管產業的選項。延遲、同時連線數與服務等級承諾,目前都沒有數字。

誰該留意:聲音自然度會直接影響任務完成的英文產品,例如客服、預約、教學與 Podcast 旁白。誰可以先不動:需要繁體中文的產品(兩款聲音都標示為英文,中文有聲內容可以先看既有的中文文字轉語音實測)、要固定單價才能內部報帳的團隊,以及想立刻自助試用的個人創作者。

榜單本身:真人 1463 分,Adam 1418 分

Design Arena 的 Audio Realism Benchmark 是一個持續進行的盲聽榜,總榜資料版本更新於 9 月 18 日。前五名如下:

名次聲音/模型Elo 分數勝率欄位比較場次
1真人錄音(Humanity)146384.9%943
2Freya TTS Adam V1141877.7%314
3Bland Speech v3136977.7%573
4Kalpa TTS Beta V0.1134371.8%471
5Cartesia Sonic 3.6130664.5%152

幾個讀法先講清楚。Elo 是把大量兩兩對決的勝負換算成的相對分數,1418 對 1463 的意思是:在這批比較裡,Adam 讓聽眾選它「更像真人」的頻率高於其他所有 AI 模型,但真人錄音仍在前面,差距 45 分。表裡的勝率欄位是該聲音在所有對決中的整體成績,77.7% 不能解讀成「Adam 有七成七的機率騙過真人」;方法頁雖提到可以另外衡量對真人的揀選率,公開榜單目前沒有提供那個分項。

Design Arena Audio Realism Bench 總榜頁面,長條圖顯示 Humanity 1463、Freya TTS Adam V1 1418、Bland Speech v3 1369 等 Elo 分數與比較場次Pin
Design Arena 盲聽榜總榜:真人錄音 1463 分居首,Freya TTS Adam V1 以 1418 分排在所有 AI 模型前面(圖片來源:Design Arena)

榜單也會動。Freya 官網首頁貼的快照量測於 9 月 16 日,寫的是真人 1462、Adam 1419;兩天後的榜單版本變成 1463 與 1418。這中間沒有誰抄錯,Elo 本來就會隨新增投票漂移,累積投票數在 9 月 18 日版本已達 5,182 次。名次要當時點看,不當永久頭銜看。

Freya 官網首頁的榜單快照,標註 Measured 2026-09-16,列出 Human speech 1462、Freya TTS Adam V1 1419 等 Elo 分數Pin
Freya 官網首頁快照(量測於 2026-09-16):真人 1462、Adam 1419,與兩天後的榜單版本略有差異,Elo 會隨投票漂移(圖片來源:Freya 官方網站)

榜上的熟面孔值得認一下。Adam 之下依序是 Cartesia Sonic 3.6(1306)、MAI-Voice-2(1213)、Eleven v3 Conversational(1202)、Cartesia Sonic 3.5(1188)、Grok TTS(1150)與 MiniMax Speech 2.8 HD(1130)。Google 表現最好的語音模型是 Gemini 2.5 Pro TTS,1101 分排在第 12 名;OpenAI 最好的 GPT Realtime 2 拿 1071,排在第 14 名。換句話說,這份榜單上 Freya 領先 Google 與 OpenAI 目前公開參賽的語音模型都超過 300 分。Google 近來把語音代理 API 拆成快聊與深想兩款對外開放,正在比較語音供應商的團隊可以對照著看。

這場盲聽測驗到底測了什麼

Design Arena 的方法頁寫得比多數 AI 產品公告誠實,重點有五:

  • 測「像不像真人」,不測「好不好聽」:聽眾每次聽同一句話的兩個版本,不知道模型名稱、左右順序隨機,選一個聽起來更像真人的。
  • 語料是 500 句永久不公開的版本化提示,多數約 40 字(約 15 秒),電話類單句更短;文字保留猶豫、重說與填充詞,數字按口語寫法呈現。
  • 語料分三個分項:電話客服(來自 HarperValleyBank 銀行通話語料)、對談與解說(來自 The People’s Speech),兩個來源都以 CC BY 4.0 授權。
  • 每個模型選一男一女兩個美式英語聲音,每場對決同性別,聲線性別不會成為勝負變數;聽眾是經篩選的英語母語者。
  • 真人錄音進入同一個池子當基準,每個模型都直接與真人比過。

邊界也畫得明白:表演性強的語音(遊戲角色、戲劇台詞、陪伴型角色)明確排除在這一版之外,留給日後的表演軌道;評測鎖定美式英語,也不衡量回應速度、長文一致性、打斷後恢復與價格。順帶一提,這個榜單由 Design Arena 經營,方法頁公開語料來源、語料清理流程與收錄標準,也留了信箱讓外界推薦新模型,收錄名單持續在長。對一家 2025 年才成立的新創來說,讓自家聲音進到這種公開、可對照、有真人基準的比賽裡,本身就是一種表態。

分項榜的缺席:客服與對談場景查無 Adam

總榜之外,三個分項榜的資料也抓下來比對過,結果值得單獨看:

分項榜條目數Adam 條目該榜 AI 榜首
解說(explainers)17有,1378 分Freya TTS Adam V1
電話客服(phone agents)15查無Bland Speech v3(1353)
對談(conversations)13查無Bland Speech v3(1322)

Adam 在解說分項是 AI 第一(1378 分,僅次真人的 1451),該分項的勝率欄位 81.5% 還比總榜的 77.7% 高;它的 314 場對決裡,有 189 場來自這個分項。教學與解說類產品因此是現有證據最直接支持的用途。但在電話客服與對談兩個分項,榜上沒有 Adam 的條目,這兩項目前的 AI 榜首都是 Bland Speech v3。

對談分項的榜面還透露一件有意思的事:Google 的 Gemini 2.5 Pro TTS 在那裡排到 AI 第三(1121 分),是它在三個分項裡最好的名次;電話客服分項的第四名則是 Eleven v3 Conversational。不同場景的強弱會洗牌,這正是分項榜存在的理由,也是只看總榜會漏掉的部分。

官方沒有解釋缺席的原因。合理的可能至少有兩個:評測覆蓋還在進行,或者這個聲音尚未送測那兩項。無論是哪一種,結論都一樣:總榜第一不能外推成「打電話也第一」。而電話客服恰恰是 Freya 這類企業語音代理最核心的應用場景。

要說跨越恐怖谷,還欠四張成績單

恐怖谷本來是描述人形角色的詞:越像人、又差一點的東西,反而讓人不舒服。放到語音上,破綻會是過度乾淨的呼吸、突然切換的情緒、奇怪的重音,或長對話中慢慢走音的聲線。打電話到客服的人不會給模型第二次機會,一句語氣不對就可能直接掛斷轉人工,所以「像真人」對這個市場是真需求,也值得用嚴格的標準檢視。用這個標準看,Freya 的宣稱要先補齊四件事。

最先欠的是 Eve 的成績:同場發表的第二款聲音,在榜單裡沒有條目,Adam 的分數延伸不到 Eve 身上。語言範圍也還沒有第二張單:評測鎖定美式英語,繁體中文、台灣口音、中英混讀、人名與地址的唸法全部沒有資料,新品頁也只標英文聲音。完整對話是另一題:使用者真實感受到的是「說完之後等多久、能不能插話、回答對不對」,這些都不在真實感榜的範圍裡。長時間穩定同樣未知:15 秒像真人,與 30 分鐘通話不漂移,中間還有一段距離。

所以我的位置是:Adam 已經拿出比官方精選示範強得多的證據(第三方經營、匿名比較、有真人對照組),值得認真對待;「最像真人」當行銷語可以,當全面結論還早。

誰該申請、誰該再等

英文語音產品團隊:把申請表填了排隊,同時準備一輪公平的對照測試。拿到資格後,用同一批來自真實情境、清掉個資的腳本(量級抓 50 到 100 段就夠做第一輪判斷),讓 Adam、Eve 與現有供應商唸同樣內容。匿名成對比較只回答自然度一件事,旁邊要自己補上幾個欄位:正確性(人名、金額、日期、縮寫有沒有唸錯)、任務合適度(道歉、提醒、確認的語氣對不對)、端到端延遲、重複生成與尖峰時段的穩定性,以及把 TTS、語音辨識與語言模型加總的完整成本。通過條件建議設務實一點:自然度進步的同時任務完成率沒有掉、延遲與成本落在可接受區間,才進下一輪。

採購端還要把資料落地問清楚:雲端方案的機房在土耳其,錄音與逐字稿存在哪裡會直接影響合規判斷;資料不能出境的產業,官方提供了裝進自家機房、支援氣隙網路的 on-prem 選項,這在語音代理採購裡常比榜首名次更有分量。

繁體中文產品:等官方釋出多語言資訊再說。用英文榜單外推中文品質,現在沒有任何依據。

一般讀者:官網的盲聽小遊戲可以直接玩,自己聽一次比看十篇報導準。聲音擬真帶來的風險也提醒在這裡:聲音越難分辨,產品端越該主動揭露「這是 AI」,通話涉及匯款與身分驗證時加上第二道確認。想實際感受聲音複製技術現況的讀者,可以參考我們實測過的免費語音克隆工具

還沒確定的事,與這篇文章的保存期限

四件事維持未知:Eve 的品質與評測條目何時出現;Adam 是否會進入電話客服與對談分項;公開費率與延遲數字;以及榜單排名的後續變化(9 月 18 日資料版本之後,每多一場投票都可能改寫名次)。

時效聲明:本文榜單數字以 2026 年 9 月 22 日查閱的公開 API 內容為準(資料版本 9 月 18 日);Freya 公布 Eve 的評測條目、費率或延遲資訊,或 Design Arena 更新分項覆蓋時,本文對應段落即需回查。建議的回查時點是 2026 年 10 月上旬,或任何一方官宣新版本之後。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1479

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...