標籤 後訓練

Perplexity Computer 向錯誤學習,工具失敗率相對降 21.2%

TechMoon 精選圖|AI 代理從錯誤中學習,工具呼叫失敗率下降的訓練方法

Perplexity 研究團隊公開 Computer 的後訓練方法:把使用者修正與工具錯誤整理成可驗證的提示,結合拒絕採樣微調與策略內自我蒸餾訓練模型。線上 A/B 測試中,兩個後訓練版本的工具呼叫失敗率從 2.24% 降到 1.77%,相對降幅 21.2%,但對原始模型的線上差異未達統計顯著,使用者不滿意度也沒有變化。

Share to...