隨堂測驗
關於研究主要發現的七題。作答與計分只存在於本次瀏覽。
得分 0 / 7
1論文的核心主張是什麼?
研究顯示有益特質 RL 改善了超過 80% 的分布外對齊評測,並在對抗壓力下持久。
2在 53 個分布外對齊評測中,有益特質 RL 在幾個上勝過相同算力基線?
44/53 改善(平均 +9.1 個百分點);FDR 校正後仍有 30/53 顯著。
3「僅健康」實驗證明了什麼?
這是論文最清楚的 OOD 證據:一個狹窄聚焦健康的介入,改變了不相關領域的行為。
4這裡的「選擇性持久」是什麼意思?
在有害人格下,特質模型退步少得多(跌 0.119 對 0.251),但對「有幫助的誘導」反應與基線幾乎一致。
5為什麼要在同一份資料上訓練一個『通用樂於助人』對照組?
通用樂於助人模型沒有顯著進步,所以驅動泛化的是獎勵訊號,而不是那些對話。
6有益特質 RL 是否傷害了能力或可監看性?
GPQA +4.7、SWE-Bench Pro +7.1 個百分點;反陰謀失準從 68.0% 降到 39.4%,且可監看性維持。
7作者整體上如何定位這個結果?
他們強調這是早期證據;AI 應體現哪些價值,是一個更廣泛、需社會與民主參與的規範性問題。