强化学习
从「Arthur Samuel 的跳棋程序」到「DeepMind 发布 Gato 通才智能体」,先抓住起点、路线转向与当前边界,再展开完整事件线。
DeepMind 发布 Gato 通才智能体
DeepMind 发布 Gato,一个用单一 Transformer 权重同时完成 604 项任务的多模态智能体,从电子游戏、机械臂控制到对话与图像描述。它被视为「通才智能体」路线的标志性实验。
OpenAI Five 击败 Dota 2 世界冠军
OpenAI Five 在一场三局两胜的公开赛中连胜两局,击败 2018 年 Dota 2 世界冠军 OG。比赛使用 17 名可选英雄及若干规则限制,五个智能体各自控制一名角色并实时协作。
AlphaStar 击败职业星际玩家
DeepMind 公布 AlphaStar,一个在《星际争霸 II》中击败顶级职业玩家的 AI,展示了深度强化学习在不完美信息、长时决策的实时战略游戏中的能力。
AlphaZero 用自我博弈统一棋类学习
DeepMind 发布 AlphaZero,用同一套自我对弈、策略—价值网络和蒙特卡洛树搜索方法分别学习国际象棋、将棋与围棋。三个网络各自从随机参数训练,并不共享已经学到的棋艺。
AlphaGo 击败李世石
AlphaGo 在首尔五局赛中以 4 比 1 战胜李世石。系统把人类棋谱学习、自我对弈和蒙特卡洛树搜索组合在一起。
DeepMind 用 DQN 打通雅达利游戏
DeepMind 在 2013 年底公布了 DQN:用深度卷积网络直接从像素学习玩雅达利游戏,部分达到甚至超过人类水平。这篇论文把「深度强化学习」从边缘推上主流,也成为后续 AlphaGo 的起点。
DeepMind 成立
Demis Hassabis、Shane Legg 与 Mustafa Suleyman 在伦敦创立 DeepMind,目标是构建通用学习系统,再用它解决现实问题。
TD-Gammon 与时间差分学习
Gerald Tesauro 在 IBM 开发 TD-Gammon,让一个带时序差分学习的小型神经网络仅靠与自己对弈训练,棋力逼近人类大师。它把「从经验中学习价值」变成了可以量化的现实。
Watkins 提出 Q-learning
博士生 Watkins 提出 Q-learning,一种无需环境模型的时序差分算法,用一张 Q 表评估「状态-动作」的价值。它成为现代强化学习的核心算法之一,也是 AlphaGo、DQN 等系统的理论源头。
Arthur Samuel 的跳棋程序
在 IBM 702 上,Arthur Samuel 编写了一个会下跳棋的程序,并让它通过与自己对弈持续改进棋力。他后来把这项工作称为「机器学习」的一个早期实例,这个术语也由此进入公共词汇。