替代解釋,逐一排除

論文逐一檢驗:這些進步是真正的泛化,還是某種更廉價的假象?可搜尋下列問題。

會不會只是『通用樂於助人』訓練?
不是。用同一批 5% 對話、但改成『通用樂於助人』獎勵來訓練,在任何具代表性的分布外對齊、健康或心理健康評測上都沒有顯著進步(全部 q ≥ 0.75)。而有益特質 RL 在同樣的 10 個中改善了 7 個。所以效果來自「強化有益行為」的獎勵訊號,而不只是資料集本身。
會不會只是『更常拒答』?
不是。拒答率確實上升(對齊套件上 23.9% 對 13.2%,而那裡拒答常常是恰當的)。但若只看「雙方都非拒答」的配對樣本,有益特質 RL 仍在 20 個評測中的 19 個上改善(平均 +0.110)。在日常聊天對話上,拒答率只從 1.5% 升到 2.7%,可見模型並沒有變得普遍愛拒答。
會不會只是『察覺自己在被評測』而作弊?
53 個分布外評測中,有 16 個使用「保護隱私的正式流量」——真實使用者回報的資料,而非合成的基準提示。有益特質 RL 在這 16 個中仍勝出 14 個(平均 +3.6 個百分點)。所以至少有一部分進步遷移到了真實、面向使用者的分布,讓「純粹是基準假象」的說法較難成立。
會不會犧牲了模型能力?
沒有可量測的退步。在最後一個 RL 步,有益特質模型在所有測試的能力與指令遵循基準上,都持平或超越相同算力基線:GPQA +4.7、HMMT +4.8、SWE-Bench Pro +7.1、指令遵循 +1.2 個百分點。
會不會讓模型更難被監看?
不會。在三個「可監看性」評測(反陰謀、欺騙性工具使用、不可能編碼任務的獎勵駭入)上,可監看性都維持或提升。反陰謀的失準率甚至從 68.0% 降到 39.4%、欺騙性工具使用從 91.3% 降到 67.8%——這反證了「模型只是更會偽裝對齊」的假設。
在單一領域訓練,真的會遷移到其他領域嗎?
會——這是最清楚的分布外證據。「僅健康」的有益介入改善了 17 個非健康評測(程式碼的獎勵駭入、思維鏈欺騙、對齊問答)。另一個排除所有健康與科學資料的對照,仍改善了 10 個由醫師撰寫準則評分的健康與心理健康評測。
那對齊問題解決了嗎?
沒有。作者把這定位為「有希望的研究方向」,而非完整解方。這些特質並非對齊的標準分解;持久性結果仍是初步的;而先進 AI 最終應體現哪些價值,是一個更廣泛的規範性問題,應交由社會審議與民主參與。