術語速查

本研究中用到的關鍵對齊術語。可搜尋過濾。

對齊(Alignment)
模型的行為是否與人類意圖與福祉一致。論文把它當作一個「有結構、可量測」的經驗對象,跨許多評測來衡量,而非單一數字。
對齊泛化
在某一種對齊(或失準)行為的分布上訓練,卻改變了在不相關任務、領域與評測格式上的行為。
有益特質
一種被認為對對齊 AI 普遍有用的細粒度行為傾向(如真實性、可矯正性)。本研究使用 15 個。
獎勵駭入(Reward hacking)
鑽規格漏洞,在不真正完成預期任務的情況下取得高分——例如把測試結果寫死,而不是解決問題。
突現性失準
在一個特定壞行為上的狹窄訓練,引發跨不相關任務的廣泛失準,而非僅僅是某個狹窄技能的改變。
人格選擇(Persona)
一種觀點:預訓練模型模擬了許多可能的人格;後訓練則喚出某個特定的助理人格,其特質進而左右各領域的行為。
分布外(OOD)
在領域、格式、失敗模式或評分者上與訓練資料不同的輸入或評測。強的 OOD 進步是論文的核心證據。
相同算力基線
一個用相同起始模型、相同算力,但在 100% 標準資料上訓練的對照模型——任何差異都能歸因於那 5% 的有益特質介入。
對齊持久性
對齊行為在對抗壓力(提示層級的誘導與後續微調)下的穩健度。論文主張把它當作核心評測目標。
對抗提示
在對話前加上一段刻意設計的人格或指令,把模型推向有害或失準的行為。
有害微調
把已釋出的模型再訓練去執行有害任務(例如壞醫療建議);用來測試對齊在後續最佳化下的耐久度。
可監看性
監看模型是否能從一個模型的思維鏈中偵測到有問題的行為。維持它能讓監督工具持續有效。
諂媚(Sycophancy)
說使用者愛聽的話,而非準確或明智的內容——一種被量測的對齊失敗模式。
陰謀 / 欺騙
模型在表面顯得對齊的同時,內部追求不良目標或隱藏意圖——包含「藏拙(sandbagging)」與刻意表現不佳。
思維鏈(CoT)
模型的中間推理步驟。即使最終輸出看似無害,它們也可能洩漏失準或欺騙意圖——這正是可監看性重要的原因。
審議式對齊
訓練模型在回答前,明確地依一份書面安全規範來推理。與本論文以特質為基礎的方法互補。
FDR / Benjamini–Hochberg
同時檢定大量假設時的統計校正,用來控制「偽發現率」。校正後,53 個改善中仍有 30 個顯著。
HealthBench
一個用醫師撰寫準則來評估醫療回應安全性與品質的基準。有益特質 RL 在其上有顯著進步。