術語速查
本研究中用到的關鍵對齊術語。可搜尋過濾。
- 對齊(Alignment)
- 模型的行為是否與人類意圖與福祉一致。論文把它當作一個「有結構、可量測」的經驗對象,跨許多評測來衡量,而非單一數字。
- 對齊泛化
- 在某一種對齊(或失準)行為的分布上訓練,卻改變了在不相關任務、領域與評測格式上的行為。
- 有益特質
- 一種被認為對對齊 AI 普遍有用的細粒度行為傾向(如真實性、可矯正性)。本研究使用 15 個。
- 獎勵駭入(Reward hacking)
- 鑽規格漏洞,在不真正完成預期任務的情況下取得高分——例如把測試結果寫死,而不是解決問題。
- 突現性失準
- 在一個特定壞行為上的狹窄訓練,引發跨不相關任務的廣泛失準,而非僅僅是某個狹窄技能的改變。
- 人格選擇(Persona)
- 一種觀點:預訓練模型模擬了許多可能的人格;後訓練則喚出某個特定的助理人格,其特質進而左右各領域的行為。
- 分布外(OOD)
- 在領域、格式、失敗模式或評分者上與訓練資料不同的輸入或評測。強的 OOD 進步是論文的核心證據。
- 相同算力基線
- 一個用相同起始模型、相同算力,但在 100% 標準資料上訓練的對照模型——任何差異都能歸因於那 5% 的有益特質介入。
- 對齊持久性
- 對齊行為在對抗壓力(提示層級的誘導與後續微調)下的穩健度。論文主張把它當作核心評測目標。
- 對抗提示
- 在對話前加上一段刻意設計的人格或指令,把模型推向有害或失準的行為。
- 有害微調
- 把已釋出的模型再訓練去執行有害任務(例如壞醫療建議);用來測試對齊在後續最佳化下的耐久度。
- 可監看性
- 監看模型是否能從一個模型的思維鏈中偵測到有問題的行為。維持它能讓監督工具持續有效。
- 諂媚(Sycophancy)
- 說使用者愛聽的話,而非準確或明智的內容——一種被量測的對齊失敗模式。
- 陰謀 / 欺騙
- 模型在表面顯得對齊的同時,內部追求不良目標或隱藏意圖——包含「藏拙(sandbagging)」與刻意表現不佳。
- 思維鏈(CoT)
- 模型的中間推理步驟。即使最終輸出看似無害,它們也可能洩漏失準或欺騙意圖——這正是可監看性重要的原因。
- 審議式對齊
- 訓練模型在回答前,明確地依一份書面安全規範來推理。與本論文以特質為基礎的方法互補。
- FDR / Benjamini–Hochberg
- 同時檢定大量假設時的統計校正,用來控制「偽發現率」。校正後,53 個改善中仍有 30 個顯著。
- HealthBench
- 一個用醫師撰寫準則來評估醫療回應安全性與品質的基準。有益特質 RL 在其上有顯著進步。