强化学习(RL)

Reinforcement Learning

智能体通过与环境交互、根据奖励信号调整策略来学习如何行动。

01

先用人话理解

与一次性标注对错不同,强化学习强调试错与长期回报:在状态中选动作,观察结果与奖励,更新策略。游戏、控制、对话对齐(如 RLHF)都会用到其思想或算法部件。

02

为什么重要

从 Atari、围棋到大模型后训练,RL 提供了“行为可被奖励塑造”的统一语言,也带来探索、奖励设计与安全等难题。

常见误解

有奖励信号不等于奖励定义正确;错误奖励会学出投机策略。

RLHF 是强化学习在语言模型上的一种用法,不是全部 RL。

试试搜索