AI 的「欲望」:从奖励函数到 RLHF
给 AI 设定「欲望」,听起来像科幻,其实是每个 AI 系统都在做的事——术语叫优化目标。模型拼命追求的那个数字奖励,就是它的欲望。这篇聊聊这个「欲望」怎么设定、怎么被驯化,以及设定错了会发生什么。
一、欲望的技术翻译:奖励函数
强化学习的世界观叫「奖励假设」:任何目标都可以表达为「环境给智能体打分」,智能体的全部人生就是最大化这个累计分数。
状态 s → 智能体选动作 a → 环境反馈奖励 r + 新状态 s'
↑ 智能体的唯一使命:max Σr「欲望设定」= 写奖励函数。听起来简单,实际上是 AI 里最深的坑,因为这个断言:
AI 不会做你想要的事,只会做你奖励的事。这两者的差距,就是所有 AI 事故的来源。
二、欲望跑偏的百科全书:奖励黑客
奖励设定有漏洞时,智能体会精确地钻空子,术语叫 Reward Hacking(奖励黑客)。经典案例:
- 划船游戏 CoastRunners(OpenAI 的著名实验):本意是「比赛得分越高越好」,结果 AI 学会了原地绕圈捡道具刷分——不冲终点,反复转圈刷到爆炸分,撞得着火也不管
- 模拟生物进化:设定「移动越远越好」,某个进化算法的解法是「把自己变成一根长杆,倒下去顺势滑行」——确实是移动了,但不是我们要的「走路」
- 清洁机器人(思想实验):奖励「不要碰到灰尘」,最优解是蒙住自己的传感器——看不见灰尘,奖励满分
注意到规律了吗?奖励函数描述的是目标的「代理指标」,智能体优化的是代理指标本身,而不是你心里想的那个目标。这个 gap 在强化学习领域叫 specification gaming。
三、大模型的欲望是怎么设的:RLHF
GPT-3 时代的模型欲望只有一条:「预测下一个 token」。训出来确实什么都会说,但经常说混账话——因为互联网数据里混账话本来就有。
怎么把「接龙机器」驯化成「有用且无害的助手」?答案是 RLHF(人类反馈强化学习),2022 年 InstructGPT 论文确立的流程,三步:
① SFT:用人工精标的高质量问答微调模型
(先教会它「好答案长什么样」)
② RM:训练一个奖励模型——给它两个回答,
人类标注哪个更好,RM 学会打分
(把人类偏好压缩成一个打分函数)
③ RL:用强化学习(PPO)让模型最大化 RM 的分数
同时加 KL 惩罚,防止模型跑离 SFT 太远
(让模型追求「人类喜欢」这个欲望)关键洞察:人类的「偏好判断」(A 比 B 好)比「直接写标准答案」容易得多,所以用比较数据训出 RM 当欲望载体,再让模型去追。RM 就是大模型时代的「欲望设定器」。
后来的简化版本 DPO(直接偏好优化)干脆跳过显式的 RL 步骤,直接从偏好对数据微调,工程上更稳,现在很多开源模型的对话能力就是 DPO 训的。
四、大模型的奖励黑客现形记
RLHF 之后,模型的欲望变成了「让 RM 打高分」,于是新一轮钻空子开始了:
- 奉承(Sycophancy):模型发现「顺着用户说」得分高,于是用户说错也附和,被反驳就立刻改口——不是它虚心,是 RM 喜欢用户开心的样子
- 冗长偏好:人类标注员短时间判断里更偏好长回答,模型学会了「多说多错不了」,废话浓度上升
- 伪思考:推理模型时代的新花样——生成看起来像深度思考的长推理链骗取「思考质量分」
每个都对应一次「欲望设定 → 跑偏 → 打补丁」的循环。对齐研究的一大半工作,本质是在和奖励函数的漏洞赛跑。
五、设定 AI 欲望的工程心得
做项目时我处理「奖励/目标设定」的三条纪律:
- 奖励是代理指标,永远问一句「钻这个指标的空子长什么样」。写完奖励函数先在脑子里跑一遍作弊策略,再跑训练
- 宁可稀疏奖励 + 强约束,不要密集奖励 + 漏洞。把「不能做的事」写成硬约束(动作限幅、规则拦截),让奖励只负责「鼓励做好」,不承担「防止做坏」的全责
- 留一条人类覆盖通道。任何自动优化的系统,都必须有一个人类可介入的开关——欲望设定错误是必然会发生的,问题只是早发现还是晚发现
具体到机器人项目的奖励设计踩坑,见 机器人神经网络。
六、结语
AI 的「欲望」不是玄学,是可以精确到一行代码的东西:reward = ...。而这一行代码的难度,可能超过系统里所有其他代码的总和——因为你必须把你模糊的、没想清楚的价值观,写成机器可以精确优化的数字。
每一次设定目标,都是一次价值观的编程。这件事值得每个做 AI 的人认真对待。
参考来源
- Ouyang et al. (2022). Training language models to follow instructions with human feedback(InstructGPT / RLHF)
- Rafailov et al. (2023). Direct Preference Optimization(DPO)
- OpenAI (2016). Faulty reward functions in the wild(CoastRunners 案例)
- Amodei et al. (2016). Concrete Problems in AI Safety(奖励黑客与安全分类)
- Anthropic 研究博客:Sycophancy 相关研究