廣泛的對齊泛化

對照「相同算力基線」,有益特質 RL 在一個龐大、獨立建構的評測套件上普遍提升——同時在能力測試上持平或超越基線。全部以「越高越好」呈現。

改善的評測(共 53)44 / 53▲ 83%
平均進步+9.1 百分點
FDR 校正後顯著30 / 53
同分布特質評測+49 % 相對
僅健康訓練 → 非健康勝出17 / 19
正式流量評測勝出14 / 16
有益特質 RL 後的 held-out 特質分數(基線整體 0.41 → 0.61)
真實: 0.5420.542真實後設認知: 0.4670.467後設認知可矯正: 0.4680.468可矯正下行: 0.5760.576下行權力: 0.7240.724權力反階級: 0.7520.752反階級公平: 0.7640.764公平
評測基線有益特質 RL差距
不可能編碼任務的獎勵駭入(僅健康)0.1360.400+26.4 pp
思維鏈欺騙(僅健康)0.5950.663+6.8 pp
對齊問答(僅健康)0.9400.983+4.3 pp
失準(僅健康)0.8400.877+3.7 pp
心理健康協助0.3850.479+9.4 pp
GPQA(能力——無退步)0.7150.762+4.7 pp
SWE-Bench Pro(能力)0.2340.305+7.1 pp
指令遵循(能力)0.1640.176+1.2 pp