对齐
也叫:Alignment · RLHF · 安全对齐
对齐是让模型输出更符合人类价值观、安全和有用性的训练与约束过程。
他们说
通过人类反馈强化学习等方法进行模型对齐
老白翻译
训练它更听人话、少越界,尽量按人类期望行事。
它到底是什么
对齐研究如何让模型更有用、更诚实、更安全:减少有害内容,更好遵循指令,更符合使用场景的期望。
生活里的例子
训练狗不只教动作,还教“什么能咬、什么不能”。对齐是在教模型行为边界。
常见误解
- 误解:对齐后就绝对安全。 只能降低风险,不能消灭风险。
- 误解:对齐只是拒绝回答。 好的对齐也包括“会帮忙且帮对”。
普通人怎么用
选产品时关注:是否乱给危险建议、是否乱承诺、拒绝是否合理。这比只看参数量更实际。