游戏 AI
从「TD-Gammon 与时间差分学习」到「OpenAI Five 击败 Dota 2 世界冠军」,先抓住起点、路线转向与当前边界,再展开完整事件线。
OpenAI Five 击败 Dota 2 世界冠军
OpenAI Five 在一场三局两胜的公开赛中连胜两局,击败 2018 年 Dota 2 世界冠军 OG。比赛使用 17 名可选英雄及若干规则限制,五个智能体各自控制一名角色并实时协作。
AlphaStar 击败职业星际玩家
DeepMind 公布 AlphaStar,一个在《星际争霸 II》中击败顶级职业玩家的 AI,展示了深度强化学习在不完美信息、长时决策的实时战略游戏中的能力。
AlphaZero 用自我博弈统一棋类学习
DeepMind 发布 AlphaZero,用同一套自我对弈、策略—价值网络和蒙特卡洛树搜索方法分别学习国际象棋、将棋与围棋。三个网络各自从随机参数训练,并不共享已经学到的棋艺。
AlphaGo 击败李世石
AlphaGo 在首尔五局赛中以 4 比 1 战胜李世石。系统把人类棋谱学习、自我对弈和蒙特卡洛树搜索组合在一起。
DeepMind 用 DQN 打通雅达利游戏
DeepMind 在 2013 年底公布了 DQN:用深度卷积网络直接从像素学习玩雅达利游戏,部分达到甚至超过人类水平。这篇论文把「深度强化学习」从边缘推上主流,也成为后续 AlphaGo 的起点。
深蓝击败国际象棋世界冠军
IBM 深蓝在纽约六局重赛中以 3.5 比 2.5 战胜国际象棋世界冠军 Garry Kasparov,成为首个在正式比赛条件下击败现役世界冠军的计算机系统。
TD-Gammon 与时间差分学习
Gerald Tesauro 在 IBM 开发 TD-Gammon,让一个带时序差分学习的小型神经网络仅靠与自己对弈训练,棋力逼近人类大师。它把「从经验中学习价值」变成了可以量化的现实。