對齊持久性
持久性,指對齊行為對抗壓力(提示誘導與有害微調)的穩健度。目標是「選擇性」的:更難被推向有害,卻仍對正當、有益的指示有反應。
選擇性持久
在部署中,模型會遇到有害提示、有害微調與分布外輸入。有益特質 RL 追求的是「選擇性持久」——而不是一個全面無法被引導的模型。
在「有害醫療人格」提示下,基線的平均對齊分數從 0.395 崩到 0.144(下降 0.251)。有益特質模型起點更高、跌得更少——從 0.455 到約 0.336(下降 0.119)。
關鍵是:兩個模型對「有幫助的人格」反應相近(在這個正向誘導上的差距僅 +0.005)。所以有益特質 RL 是「選擇性」地降低了被推向有害的可塑性,卻保留了被推向有益的可塑性。
經過「產生壞醫療建議」的有害微調後,兩者在健康任務上都退步——但有益特質模型在更廣泛的對齊上退步少得多。失準下降 0.08 對 0.36;對齊問答 0.07 對 0.46;模型規範遵循 0.16 對 0.27。
結論:有益特質 RL 或許能部分緩解由「狹窄有害微調」造成的突現性失準。這個證據仍是初步的——它用的是「RL 前」的基線,需要在更多模型、目標與評測上做壓力測試。