AI 新聞NVIDIA 論文在解題翻盤的那一步評基礎模型,訓練前先量潛力NVIDIA 與兩所大學的研究者在 arXiv 發表新評量法:重播成功解題軌跡,找出讓測試由敗轉勝的決定性步驟,在那一點用三種方式評基礎模型的後訓練潛力。十組模型的排序與後訓練 SWE-bench Verified 成績相近;直接跑完整流程的六個基礎模型有五個零分,唯一有分的那個排序還指向錯誤方向。 Sliven 褚崇名2026-10-11