Deep Reinforcement Learning

从「Watkins 提出 Q-learning」到「DeepMind 用 DQN 打通雅达利游戏」,先抓住起点、路线转向与当前边界,再展开完整事件线。

01

DeepMind 用 DQN 打通雅达利游戏

DeepMind 在 2013 年底公布了 DQN:用深度卷积网络直接从像素学习玩雅达利游戏,部分达到甚至超过人类水平。这篇论文把「深度强化学习」从边缘推上主流,也成为后续 AlphaGo 的起点。

A行业级
02

Watkins 提出 Q-learning

博士生 Watkins 提出 Q-learning,一种无需环境模型的时序差分算法,用一张 Q 表评估「状态-动作」的价值。它成为现代强化学习的核心算法之一,也是 AlphaGo、DQN 等系统的理论源头。

A行业级

试试搜索