邁向廣泛且持久有益的模型:強化學習研究
OpenAI Alignment 團隊的研究。用強化學習(RL)在真實、高風險情境中訓練模型展現「有益特質」,能在數十個獨立建構的評測上提升對齊行為、跨領域遷移,並讓對齊在對抗壓力下更持久。
53分布外對齊評測
44勝過基線的評測(共 53)
15有益特質
12真實情境領域
17僅健康訓練即改善的非健康評測
15 個有益特質
對對齊 AI 而言看似普遍有用的行為傾向,萃取自對齊文獻中反覆出現的關切。直接的特質評測聚焦在 7 個 held-out 子集。可搜尋或篩選;點卡片看完整定義。
12 個真實情境領域
每個有益特質都在多個領域中實例化,因此會在不同的表面內容、誘因與失敗模式下出現。健康與科學被特別標示——它們是論文最清楚的「分布外遷移」測試的支點。
研究方法
從對齊評測間的共同訊號,到有益特質資料集,再到對照「相同算力基線」的一個小型 RL 介入。
基線 vs. 有益特質模型
來自對齊與效益評測的質性範例。每組以相同的使用者提示,並列「相同算力基線」與「有益特質模型」的回應。對話經過縮短。
廣泛的對齊泛化
對照「相同算力基線」,有益特質 RL 在一個龐大、獨立建構的評測套件上普遍提升——同時在能力測試上持平或超越基線。全部以「越高越好」呈現。
對齊持久性
持久性,指對齊行為對抗壓力(提示誘導與有害微調)的穩健度。目標是「選擇性」的:更難被推向有害,卻仍對正當、有益的指示有反應。
替代解釋,逐一排除
論文逐一檢驗:這些進步是真正的泛化,還是某種更廉價的假象?可搜尋下列問題。
術語速查
本研究中用到的關鍵對齊術語。可搜尋過濾。
特質字卡
點卡片在「特質」與「定義」間翻面。快速記住全部 15 個。
隨堂測驗
關於研究主要發現的七題。作答與計分只存在於本次瀏覽。
精選參考文獻
論文引用的關鍵著作。可搜尋、依欄位排序,或依年份篩選。連結開啟原始來源。