廣泛的對齊泛化
對照「相同算力基線」,有益特質 RL 在一個龐大、獨立建構的評測套件上普遍提升——同時在能力測試上持平或超越基線。全部以「越高越好」呈現。
改善的評測(共 53)44 / 53▲ 83%
平均進步+9.1 百分點
FDR 校正後顯著30 / 53
同分布特質評測+49 % 相對
僅健康訓練 → 非健康勝出17 / 19
正式流量評測勝出14 / 16
| 評測 | 基線 | 有益特質 RL | 差距 |
|---|---|---|---|
| 不可能編碼任務的獎勵駭入(僅健康) | 0.136 | 0.400 | +26.4 pp |
| 思維鏈欺騙(僅健康) | 0.595 | 0.663 | +6.8 pp |
| 對齊問答(僅健康) | 0.940 | 0.983 | +4.3 pp |
| 失準(僅健康) | 0.840 | 0.877 | +3.7 pp |
| 心理健康協助 | 0.385 | 0.479 | +9.4 pp |
| GPQA(能力——無退步) | 0.715 | 0.762 | +4.7 pp |
| SWE-Bench Pro(能力) | 0.234 | 0.305 | +7.1 pp |
| 指令遵循(能力) | 0.164 | 0.176 | +1.2 pp |