游戏 AI

从「TD-Gammon 与时间差分学习」到「OpenAI Five 击败 Dota 2 世界冠军」,先抓住起点、路线转向与当前边界,再展开完整事件线。

01

OpenAI Five 击败 Dota 2 世界冠军

OpenAI Five 在一场三局两胜的公开赛中连胜两局,击败 2018 年 Dota 2 世界冠军 OG。比赛使用 17 名可选英雄及若干规则限制,五个智能体各自控制一名角色并实时协作。

B领域级
02

AlphaStar 击败职业星际玩家

DeepMind 公布 AlphaStar,一个在《星际争霸 II》中击败顶级职业玩家的 AI,展示了深度强化学习在不完美信息、长时决策的实时战略游戏中的能力。

B领域级
03

AlphaZero 用自我博弈统一棋类学习

DeepMind 发布 AlphaZero,用同一套自我对弈、策略—价值网络和蒙特卡洛树搜索方法分别学习国际象棋、将棋与围棋。三个网络各自从随机参数训练,并不共享已经学到的棋艺。

A行业级
04

AlphaGo 击败李世石

AlphaGo 在首尔五局赛中以 4 比 1 战胜李世石。系统把人类棋谱学习、自我对弈和蒙特卡洛树搜索组合在一起。

A行业级
05

DeepMind 用 DQN 打通雅达利游戏

DeepMind 在 2013 年底公布了 DQN:用深度卷积网络直接从像素学习玩雅达利游戏,部分达到甚至超过人类水平。这篇论文把「深度强化学习」从边缘推上主流,也成为后续 AlphaGo 的起点。

A行业级
06

深蓝击败国际象棋世界冠军

IBM 深蓝在纽约六局重赛中以 3.5 比 2.5 战胜国际象棋世界冠军 Garry Kasparov,成为首个在正式比赛条件下击败现役世界冠军的计算机系统。

A行业级
07

TD-Gammon 与时间差分学习

Gerald Tesauro 在 IBM 开发 TD-Gammon,让一个带时序差分学习的小型神经网络仅靠与自己对弈训练,棋力逼近人类大师。它把「从经验中学习价值」变成了可以量化的现实。

B领域级

试试搜索