Plain-language definition
一句话定义
让一个「智能体」在环境里不断试错,做得好给奖励、做得差给惩罚,慢慢学会最优策略。
Original definition
英文原文定义
Reinforcement learning trains an agent to make sequential decisions by interacting with an environment, maximizing cumulative reward through trial and error.
Two levels
分难度讲解
入门版
就像训练小狗:做对了给零食(奖励),做错了大喝一声(惩罚)。反复几次,它就知道该怎么做了。AlphaGo 下围棋就是这套思路。
进阶版
RL 用马尔可夫决策过程 (S, A, P, R, γ) 建模,目标是学习策略 π(a|s) 使期望折扣回报 E[Σγᵗrₜ] 最大。主要方法:值函数法(Q-learning、DQN)、策略梯度(REINFORCE、PPO)、Actor-Critic(A3C、SAC)。
Real-world example
真实例子
AlphaGo 通过自己和自己下几百万盘棋(赢了奖励、输了惩罚),学会了超越人类的围棋策略。
Keep exploring