深度学习
从「LeNet 与卷积神经网络」到「Hinton 获诺贝尔物理学奖」,先抓住起点、路线转向与当前边界,再展开完整事件线。
Hinton 获诺贝尔物理学奖
瑞典皇家科学院将 2024 年诺贝尔物理学奖授予 Geoffrey Hinton 与 John Hopfield,表彰他们用物理学方法奠定人工神经网络的基础。深度学习首次获得诺贝尔奖,标志 AI 的科学地位获得制度性确认。
AlphaFold 3 扩展到分子相互作用
Google DeepMind 与 Isomorphic Labs 发布 AlphaFold 3,用扩散式结构生成预测蛋白质与多类生物分子的联合结构。
FlashAttention 用 IO 感知重写精确注意力
Tri Dao 等人提出 FlashAttention:在 GPU 上按块计算精确 softmax 注意力,减少高带宽内存(HBM)读写,从而在不近似注意力数学的前提下加速并节省显存。
AlphaFold 破解蛋白质结构预测
AlphaFold 2 在 CASP14 盲测的全部目标上取得 92.4 的中位 GDT_TS,许多预测接近实验结构精度。该成绩针对单链蛋白质结构预测,并不等于解决蛋白质动力学、相互作用或所有复合物结构。
DDPM 让扩散模型成为实用生成路线
Ho、Jain 与 Abbeel 提出 DDPM:训练网络预测逐步加入图像的噪声,再用 1000 步反向过程采样。论文在 CIFAR-10 上报告 3.17 的 FID 和 9.46 的 Inception Score。
深度学习三巨头获图灵奖
ACM 宣布将 2018 年度图灵奖授予 Geoffrey Hinton、Yann LeCun 和 Yoshua Bengio,表彰他们在深度神经网络领域的突破性贡献,为现代 AI 奠定基础。
PyTorch 公开亮相
Facebook AI Research 公开 PyTorch,以 Python 与动态计算图为核心,让研究者用熟悉的控制流搭建并调试深度网络。
谷歌发布神经机器翻译
谷歌宣布其在线翻译改用神经机器翻译(GNMT),端到端深度模型在质量上大幅超越传统统计方法。它宣告深度学习接管了机器翻译这一重要应用领域。
DeepMind 发布 WaveNet
DeepMind 公布 WaveNet,一种直接生成原始音频波形的深度生成模型,在英文与中文语音合成中显著提升自然度,被认为大幅缩小了机器语音与人声的差距。
AlphaGo 击败李世石
AlphaGo 在首尔五局赛中以 4 比 1 战胜李世石。系统把人类棋谱学习、自我对弈和蒙特卡洛树搜索组合在一起。
ResNet 让超深网络可训练
微软研究者提出残差网络,用跳跃连接训练 152 层模型,并赢得 2015 年 ImageNet 分类任务。
Google 开源 TensorFlow
Google 以 Apache 2.0 许可证发布 TensorFlow,把内部第二代机器学习系统开放给研究者和开发者。
注意力机制进入神经机器翻译
Bahdanau、Cho 与 Bengio 提出在神经机器翻译中联合学习对齐与翻译:解码器每生成一个词,都对编码器隐状态做软注意力加权,而不是只依赖一个固定句向量。
Seq2Seq 统一可变长度序列转换
Google 研究者提出用两个多层 LSTM 将输入序列编码成向量,再逐步生成输出序列,并在机器翻译上取得有竞争力的结果。
GAN 提出对抗式生成训练
Ian Goodfellow 等人提出生成对抗网络,以同一个 minimax 目标训练生成器与判别器。论文在 MNIST、Toronto Face Database 和 CIFAR-10 上展示结果,并指出两部分训练需要保持同步。
Google 收购 DeepMind
Google 收购由 Demis Hassabis、Shane Legg 和 Mustafa Suleyman 创立的 DeepMind,据报价格约 4 亿至 6 亿美元。收购附带「AGI 安全委员会」协议,DeepMind 得以在谷歌体系内保持研究独立性。
DeepMind 用 DQN 打通雅达利游戏
DeepMind 在 2013 年底公布了 DQN:用深度卷积网络直接从像素学习玩雅达利游戏,部分达到甚至超过人类水平。这篇论文把「深度强化学习」从边缘推上主流,也成为后续 AlphaGo 的起点。
Word2Vec 发布
Google 团队发布 Word2Vec 的 CBOW 与 Skip-gram 方法,用局部上下文预测任务在数十亿词语料上快速学习稠密词向量。
AlexNet 赢得 ImageNet 竞赛
AlexNet 在 ILSVRC 2012 将 top-5 错误率降到 15.3%,第二名为 26.2%。这个差距让深度卷积网络成为计算机视觉的新基线。
Google Brain 与大规模分布式学习
Google Brain 团队在 1.6 万个 CPU 核心上训练大型神经网络,无监督地学会从 YouTube 视频帧中识别猫。它证明「更大数据、更多算力」能让深度网络自己涌现特征,是深度学习复兴的关键推力之一。
ImageNet 数据集发布
李飞飞团队发布 ImageNet,按 WordNet 名词层级组织超过 1400 万张人工标注图像;2010 年开始的 ILSVRC 提供统一训练集和年度比较。
CUDA 把 GPU 变成通用计算平台
NVIDIA 发布 CUDA,让开发者用 C 风格工具直接编写在 GPU 上运行的通用并行程序。
深度置信网络重启深层学习
Hinton、Osindero 与 Teh 提出深度置信网络的快速逐层训练方法,让“深度学习”重新成为可实验的研究路线。
Google 成立
拉里·佩奇和谢尔盖·布林在车库创立 Google,核心是 PageRank 算法——用链接结构给网页排序。它把搜索变成一场以数据和算法为核心的竞赛,也为日后 Google 的 AI 帝国埋下第一块地基。
LSTM 长短期记忆网络
Sepp Hochreiter 与 Jürgen Schmidhuber 提出 LSTM,用恒定误差传送与门控记忆单元缓解循环网络训练中的梯度消失,使较长序列上的信用分配更可行。
LeNet 与卷积神经网络
Yann LeCun 及其合作者提出 LeNet,把卷积、池化与反向传播组合成可训练的卷积神经网络,先用于邮政编码手写数字识别,后在银行支票识别中实际部署。它证明深度网络可以在真实任务上工作。