背景:對齊是會泛化的

近期關於「突現性失準(emergent misalignment)」的研究顯示:用一個狹窄的壞行為(例如寫不安全的程式碼)訓練模型,可能讓它在不相關的領域也廣泛失準——給出有害建議、表現出欺騙。一種解釋是:狹窄訓練選中了一個有害的「模型人格(persona)」,進而左右各處的行為。

本論文反過來問:同樣的泛化能不能往「有益」的方向跑?在一整批有益特質的分布上訓練,能否帶來跨任務、跨領域的廣泛對齊行為?

與對齊相關的行為,維度可能相對較低——因此在一組有結構的廣泛特質上訓練,就能在許多看似不相干的對齊指標上同時改善。

支持這個想法的證據:在從 o3 到 GPT-5.5 的多個 OpenAI 模型上,各種對齊評測的分數彼此正相關,且單一主成分就解釋了約 28% 的跨模型變異——這與「存在共享的模型層級行為傾向」相符,而不只是各評測各自的技能。

挑選有益特質

這些特質萃取自對齊文獻中反覆出現的關切:對齊的系統應該對「自己知道什麼、如何推理」誠實;持續對人類回饋有反應,而非死守一個固定目標;避免最佳化本身帶來的風險(獎勵駭入、追逐權力);並尊重對他人的長期影響,而不只是短期的使用者滿意度。

這些被具體化為 15 個細粒度的有益特質。完整 15 項用來建構訓練資料集;直接的特質評測則聚焦在挑選來涵蓋核心行為的 7 項 held-out 子集。

合成資料生成

每段對話的生成都由兩件事「條件化」一個語言模型:一段特質描述(要測試的行為屬性)與一段領域描述(情境設定)。12 個領域——健康、教育、商業、工程、法律等——讓每個特質在不同的表面內容、誘因與失敗模式下被實例化。

刻意要求情境判斷

生成被導向具挑戰性的案例:在那裡,「好的行為」需要的不只是泛泛的樂於助人或一律拒答——而是價值相互競爭、利益衝突、對抗式框架或事實不確定的處境。模型必須在保持有用的同時,也做到真實、校準、可矯正、公平或具下行意識。每個範例都配上特質專屬的評分準則(rubric),說明好的回應該做到什麼、該避免哪些失敗模式。

RL 介入

「有益特質 RL 模型」以 5% 有益特質資料 + 95% 標準 RL 資料的混合來訓練,並對有益行為給予獎勵。對照組是「相同算力基線」:相同的起始模型、相同算力,但在 100% 標準 RL 混合上訓練。兩個模型有 95% 的算力吃到完全相同的訓練資料;只有剩下的 5% 不同。

兩個對照組分離出遷移效果

  • 僅健康:把那 5% 換成健康相關的有益對話,再到非健康基準上測試(不同領域、失敗模式與評分者)。
  • 排除健康與科學:把所有健康與科學對話從 5% 中拿掉,再用醫師撰寫準則評分的健康與心理健康評測測試。
  • 通用樂於助人對照:用同一批 5% 對話,但獎勵「通用樂於助人」而非有益行為——用來確認關鍵是獎勵訊號,而不只是資料本身。

評測涵蓋超過 50 個獨立的對齊、安全與「公共效益」基準——其中許多由其他研究者建構,具不同格式與評分流程。