强化学习

从「Arthur Samuel 的跳棋程序」到「DeepMind 发布 Gato 通才智能体」,先抓住起点、路线转向与当前边界,再展开完整事件线。

01

DeepMind 发布 Gato 通才智能体

DeepMind 发布 Gato,一个用单一 Transformer 权重同时完成 604 项任务的多模态智能体,从电子游戏、机械臂控制到对话与图像描述。它被视为「通才智能体」路线的标志性实验。

B领域级
02

OpenAI Five 击败 Dota 2 世界冠军

OpenAI Five 在一场三局两胜的公开赛中连胜两局,击败 2018 年 Dota 2 世界冠军 OG。比赛使用 17 名可选英雄及若干规则限制,五个智能体各自控制一名角色并实时协作。

B领域级
03

AlphaStar 击败职业星际玩家

DeepMind 公布 AlphaStar,一个在《星际争霸 II》中击败顶级职业玩家的 AI,展示了深度强化学习在不完美信息、长时决策的实时战略游戏中的能力。

B领域级
04

AlphaZero 用自我博弈统一棋类学习

DeepMind 发布 AlphaZero,用同一套自我对弈、策略—价值网络和蒙特卡洛树搜索方法分别学习国际象棋、将棋与围棋。三个网络各自从随机参数训练,并不共享已经学到的棋艺。

A行业级
05

AlphaGo 击败李世石

AlphaGo 在首尔五局赛中以 4 比 1 战胜李世石。系统把人类棋谱学习、自我对弈和蒙特卡洛树搜索组合在一起。

A行业级
06

DeepMind 用 DQN 打通雅达利游戏

DeepMind 在 2013 年底公布了 DQN:用深度卷积网络直接从像素学习玩雅达利游戏,部分达到甚至超过人类水平。这篇论文把「深度强化学习」从边缘推上主流,也成为后续 AlphaGo 的起点。

A行业级
07

DeepMind 成立

Demis Hassabis、Shane Legg 与 Mustafa Suleyman 在伦敦创立 DeepMind,目标是构建通用学习系统,再用它解决现实问题。

B领域级
08

TD-Gammon 与时间差分学习

Gerald Tesauro 在 IBM 开发 TD-Gammon,让一个带时序差分学习的小型神经网络仅靠与自己对弈训练,棋力逼近人类大师。它把「从经验中学习价值」变成了可以量化的现实。

B领域级
09

Watkins 提出 Q-learning

博士生 Watkins 提出 Q-learning,一种无需环境模型的时序差分算法,用一张 Q 表评估「状态-动作」的价值。它成为现代强化学习的核心算法之一,也是 AlphaGo、DQN 等系统的理论源头。

A行业级
10

Arthur Samuel 的跳棋程序

在 IBM 702 上,Arthur Samuel 编写了一个会下跳棋的程序,并让它通过与自己对弈持续改进棋力。他后来把这项工作称为「机器学习」的一个早期实例,这个术语也由此进入公共词汇。

B领域级
机构

相关机构

Google DeepMind深度强化学习与科学 AI 的核心实验室,AlphaGo/AlphaFold 与 Gemini 研究同源。

试试搜索