AI 历史
从「图灵发表《论可计算数》」到「Google 领导层重组,四位元老离职创业」,先抓住起点、路线转向与当前边界,再展开完整事件线。
Google 领导层重组,四位元老离职创业
Google 8 月 6 日重组 AI 领导层:Demis Hassabis 卸任日常管理,转任 Alphabet 首席科学家兼 DeepMind 主席;Koray Kavukcuoglu 升 SVP 接管 Gemini;Jeff Dean、Sanjay Ghemawat、Oriol Vinyals、Quoc Le 离职创办 Discovery Loop(谷歌创始投资)。导火索是 Gemini 3.5 Pro 一再延期,Alphabet 股价单日跌约 4%。
腾讯混元发布 Hy ASR 3.0
腾讯混元发布 Hy ASR 3.0 preview,在中文普通话识别上取得进展,官方公布的中文普通话词错率进一步下降。它显示国产语音模型在多语言与口音泛化上持续投入。
Google 发布 Gemini 3 Pro
谷歌发布 Gemini 3 Pro,在推理、多模态与长上下文上全面对标并部分反超 OpenAI 的 GPT-5 系列。它让谷歌在旗舰竞争里重回前排,也标志着 2025 年底「推理旗舰」之争进入白热化。
xAI 发布 Grok 4
xAI 发布 Grok 4,首次把旗舰能力拉到推理模型的头部阵营,与 GPT、Claude、Gemini 正面竞争。它让 xAI 从「马斯克的另类项目」变成真正的第三极竞争者。
Anthropic 发布 Claude 4
Anthropic 发布 Claude 4 家族:Opus 4 作为旗舰,Sonnet 4 主打速度与 Agent 任务,并推出支持工具调用的版本。Claude 4 将「长任务自主执行」确立为产品主线,与代码与 Agent 生态深度绑定。
阿里发布 Qwen3 系列
阿里发布 Qwen3 系列,从 0.6B 到旗舰 235B(MoE)全面开源,原生支持思考/非思考双模式。Qwen3-235B 在多项评测中成为最强开源模型之一,改写开源与闭源的实力版图。
OpenAI 发布 o3 与 o4-mini
OpenAI 发布 o3 与 o4-mini,首次让推理模型在 ChatGPT 内自主调用搜索、代码执行、图像等全套工具。它把「推理」与「行动」首次系统性地结合到旗舰模型里。
Gemini 2.5 引入思维过程
谷歌发布 Gemini 2.5,以「思考模型」为核心:模型在回答前进行内部推理,强调编码、数学与长任务能力。Gemini 2.5 让谷歌在推理模型竞赛中重新回到第一梯队。
Manus 引爆通用智能体热潮
初创公司 Monica(蝴蝶效应)发布 Manus,一个被包装为「自主完成复杂任务」的通用智能体。演示视频显示它能筛选简历、写报告、分析数据,上线即引爆社交媒体与邀请码经济。
GPT-4.5 发布
OpenAI 发布 GPT-4.5,宣称这是其最后一个不基于推理的旗舰模型,强化世界知识、自然对话与模式识别。发布后市场反应分化,凸显「纯规模路线 vs 推理路线」的分歧。
微软曝光自研大模型 MAI-1
微软公开自研大模型 MAI-1,由 Inflection 前团队主导开发,被定位为与 OpenAI 合作之外的自主底座。它标志着微软开始摆脱「单一大模型供应商依赖」。
xAI 发布 Grok 3
xAI 发布 Grok 3,宣称由 Colossus 超算(约 10 万张 GPU)训练,主打推理与数学能力,在发布前后声称某些基准领先。它把 xAI 从追赶者带进前沿竞争的核心圈。
Google 发布 Gemini 2.0
Google 发布 Gemini 2.0 Flash,主打原生多模态与 Agentic 能力,并演示 Project Mariner 等浏览器代理。它把 Google 的战略重心从对话模型转向「能替你干活」的智能体。
Google 发布 Willow 量子芯片
Google 公布 Willow 量子芯片:量子比特数量随规模增大而错误率指数下降,在随机电路采样任务上远超经典超算。它被视为量子纠错路线的关键里程碑。
Hinton 获诺贝尔物理学奖
瑞典皇家科学院将 2024 年诺贝尔物理学奖授予 Geoffrey Hinton 与 John Hopfield,表彰他们用物理学方法奠定人工神经网络的基础。深度学习首次获得诺贝尔奖,标志 AI 的科学地位获得制度性确认。
Meta 发布 Llama 3.1 405B
Meta 发布 Llama 3.1,其中 405B 版本在多项基准上逼近 GPT-4o,是首个与闭源旗舰同场竞技的开源模型。扎克伯格同时发表长文,公开为开源 AI 辩护。
欧盟《人工智能法案》正式公布
欧盟在官方公报发布《人工智能法案》,建立禁止用途、高风险系统、透明度和通用 AI 模型的分层规则。
阿里开源 Qwen2 系列
阿里通义千问团队发布 Qwen2 系列开源模型,覆盖 0.5B 到 72B 多个尺寸,7B/72B 在多项基准上领先同量级开源模型。它把开源生态从「单点模型」推向「全尺寸系列」。
DeepSeek-V2 发布
DeepSeek 发布 V2,采用 MLA(多头潜在注意力)+ DeepSeekMoE 稀疏架构,以远低于同行的价格开放 API。推理成本约为 Llama 3 的 1/100,直接引爆了中国大模型的价格战。
Meta 发布 Llama 3
Meta 发布 Llama 3 家族(8B 与 70B),性能大幅提升并随后推出 405B 旗舰。它让开源模型的水平首次逼近闭源前沿模型,也把「开源与闭源之争」推向全球大模型竞争的中心。
AI21 发布 Jamba 混合架构模型
AI21 Labs 发布 Jamba,首个将 Mamba 状态空间模型与 Transformer 结合的大规模混合架构,在长上下文与吞吐上展示效率优势。
Anthropic 发布 Claude 3 家族
Anthropic 发布 Claude 3 家族:旗舰 Opus、均衡 Sonnet、轻量 Haiku。Opus 在多项基准上超越 GPT-4,首次支持 20 万 token 上下文。三档齐发的策略让大模型进入「按需选档」时代。
OpenAI 董事会风波
OpenAI 董事会突然解雇 CEO Sam Altman,随后在员工与投资人施压、高管出走与微软斡旋之下,于五天后的 11 月 22 日宣布 Altman 复职并改组董事会。事件暴露了非营利治理与商业利益的结构性张力。
xAI 发布 Grok
埃隆·马斯克创立的 xAI 发布 Grok-1 及配套产品,主打「实时接入 X(推特)」与少约束的幽默风格,向 ChatGPT 发起差异化竞争。
布莱切利园 AI 安全峰会
英国在布莱切利园召开首届 AI 安全峰会,中美欧等多国代表与前沿实验室出席,签署《布莱切利宣言》,承认前沿 AI 存在潜在灾难性风险并承诺国际合作治理。
月之暗面发布 Kimi
月之暗面(Moonshot AI)发布 Kimi 智能助手,以长上下文与中文长文本处理为差异化卖点。它在国产对话产品中以「能读长文档、多轮长对话」快速出圈。
百川智能发布 Baichuan 开源大模型
王小川创立的百川智能发布 Baichuan-7B,首个版本即开源,随后推出 Baichuan-13B 与 53B。公司以「开源+商业双轨」切入,成为国产开源大模型的重要参与者。
讯飞星火发布
科大讯飞发布讯飞星火认知大模型,展示文本生成、知识问答、数学推理与多语种能力,并把大模型与自身语音与教育优势结合。
Meta 发布 SAM「分割一切」
Meta AI 发布 Segment Anything Model(SAM),一个可在零样本下分割任意图像中任意物体的模型,配套 1100 万张图像、10 亿掩码的数据集。它被视为视觉版「基础模型」。
AutoGPT 引爆自主智能体实验
开源项目 AutoGPT 发布,展示让 GPT-4 自主拆分目标、调用工具并迭代执行的思路。它虽不成熟,却让「AI 智能体」成为生成式 AI 最热门的叙事之一。
文心一言开启中国大模型浪潮
百度发布文心一言,以录播演示的方式推出对话模型产品,成为 ChatGPT 后中国主要科技公司里首个正式发布的大模型。发布会当日百度港股一度下跌,也引来对「AI 抢跑 vs 实力」的争论。
斯坦福 Alpaca 低成本复刻
斯坦福团队用 52K 条由 GPT-3.5 生成的指令数据微调 LLaMA-7B,训练成本仅约 600 美元,得到行为接近 GPT-3.5 的 Alpaca。它引爆了「低成本复刻闭源模型」的浪潮。
微软把 ChatGPT 放进必应搜索
微软发布新版必应,把 OpenAI 的模型与搜索索引结合,允许用户用自然语言提问并查看带引用的回答。搜索引擎开始从「结果列表」转向「对话加引用」。
EleutherAI 开源 GPT-Neo
EleutherAI 发布 GPT-Neo 1.3B 与 2.7B,证明没有科技巨头预算的独立社区也能训练出可用的语言大模型,为开源 AI 的后续繁荣埋下伏笔。
微软向 OpenAI 投资十亿美元
微软宣布向 OpenAI 投资 10 亿美元,双方开展多年合作:Azure 成为 OpenAI 的独家云供应商,OpenAI 的技术将整合进微软产品。这笔投资为 GPT 系列的规模化训练提供了算力与资本。
深度学习三巨头获图灵奖
ACM 宣布将 2018 年度图灵奖授予 Geoffrey Hinton、Yann LeCun 和 Yoshua Bengio,表彰他们在深度神经网络领域的突破性贡献,为现代 AI 奠定基础。
AlphaStar 击败职业星际玩家
DeepMind 公布 AlphaStar,一个在《星际争霸 II》中击败顶级职业玩家的 AI,展示了深度强化学习在不完美信息、长时决策的实时战略游戏中的能力。
Waymo One 商业运营启动
Waymo 在凤凰城启动 Waymo One,首次向公众开放付费的自动驾驶出租车服务,把自动驾驶从路测 demo 推进到商业化运营阶段。
微软 Tay 上线即翻车
微软在 Twitter 上发布聊天机器人 Tay,宣称「像青少年一样说话」,结果网民 24 小时内用恶意推文把它教成了满口种族歧视的机器人。微软被迫下线并公开道歉,成为 AI 安全的经典反面教材。
OpenAI 成立
OpenAI 由 Sam Altman、Elon Musk、Ilya Sutskever、Greg Brockman 等人联合创立,定位为以安全与开放为优先的非营利 AI 研究机构,初始承诺资金约 10 亿美元。
Google 收购 DeepMind
Google 收购由 Demis Hassabis、Shane Legg 和 Mustafa Suleyman 创立的 DeepMind,据报价格约 4 亿至 6 亿美元。收购附带「AGI 安全委员会」协议,DeepMind 得以在谷歌体系内保持研究独立性。
Google Brain 与大规模分布式学习
Google Brain 团队在 1.6 万个 CPU 核心上训练大型神经网络,无监督地学会从 YouTube 视频帧中识别猫。它证明「更大数据、更多算力」能让深度网络自己涌现特征,是深度学习复兴的关键推力之一。
Siri 让语音助手进入大众手机
苹果在 iPhone 4S 发布会上展示 Siri,让语音助手成为智能手机的标配叙事。它把自然语言理解、语音识别与联网服务整合进一个消费者产品。
DeepMind 成立
Demis Hassabis、Shane Legg 与 Mustafa Suleyman 在伦敦创立 DeepMind,目标是构建通用学习系统,再用它解决现实问题。
Amazon Mechanical Turk 上线
亚马逊上线 Mechanical Turk(MTurk),让企业把人类难以自动化的任务拆成微任务分发给在线工人。它成了 AI 数据标注的基础设施,也把「众包人工」嵌入机器学习流水线,改变了数据生产的方式。
DARPA 自动驾驶挑战赛
DARPA 在 2004、2005、2007 年举办三届自动驾驶挑战赛。首届无车完赛,第二届 5 辆车跑完全程,2007 年的城市挑战赛则要求车辆在模拟城市中遵守交规。比赛直接催化了现代自动驾驶产业。
深蓝击败国际象棋世界冠军
IBM 深蓝在纽约六局重赛中以 3.5 比 2.5 战胜国际象棋世界冠军 Garry Kasparov,成为首个在正式比赛条件下击败现役世界冠军的计算机系统。
支持向量机
Corinna Cortes 与 Vladimir Vapnik 发表《Support-Vector Networks》,系统提出支持向量机。它以最大间隔超平面和核技巧为核心,在 1990 年代到 2000 年代初成为文本、图像分类的主流方法之一。
TD-Gammon 与时间差分学习
Gerald Tesauro 在 IBM 开发 TD-Gammon,让一个带时序差分学习的小型神经网络仅靠与自己对弈训练,棋力逼近人类大师。它把「从经验中学习价值」变成了可以量化的现实。
Watkins 提出 Q-learning
博士生 Watkins 提出 Q-learning,一种无需环境模型的时序差分算法,用一张 Q 表评估「状态-动作」的价值。它成为现代强化学习的核心算法之一,也是 AlphaGo、DQN 等系统的理论源头。
LeNet 与卷积神经网络
Yann LeCun 及其合作者提出 LeNet,把卷积、池化与反向传播组合成可训练的卷积神经网络,先用于邮政编码手写数字识别,后在银行支票识别中实际部署。它证明深度网络可以在真实任务上工作。
专家系统市场退潮
专家系统专用硬件与软件市场在 1987 年后迅速收缩,企业发现大规模规则库昂贵、脆弱且难以持续维护。
Cyc 常识知识库项目启动
莱纳特启动 Cyc 项目,试图把人类常识编码成机器可推理的知识库。它代表了符号主义「知识工程」路线的长期主义实验,也深刻影响了知识图谱等方向。
日本第五代计算机计划
日本通产省启动第五代计算机计划,目标是在十年内造出以逻辑推理为核心、能处理知识的计算机。它引发美欧对 AI 竞争力的警觉,也最终在成果与期望之间留下巨大落差。
Hopfield 网络
物理学家约翰·霍普菲尔德提出带反馈的循环神经网络,用能量函数刻画网络动力学,可存储和恢复模式。它复兴了陷入低谷的神经网络研究。
XCON 商业专家系统
卡内基梅隆为 DEC 开发 XCON(原名 R1),用数千条规则自动配置 VAX 计算机订单。它被广泛视为第一个成功的商业专家系统,让 AI 第一次在企业里证明商业价值。
MYCIN 医疗专家系统
斯坦福大学的 Edward Shortliffe 开发 MYCIN,一个用产生式规则诊断血液感染并推荐抗生素的专家系统。它以不确定性与可解释的推理链为特色,被视为医学 AI 的早期标杆。
第一次 AI 寒冬
1973 年 Lighthill 报告否定英国 AI 研究的实际进展,叠加机器翻译和感知机项目失利,英美公共资金随后明显收缩。
Lighthill 报告重创英国 AI
应用数学家 Lighthill 向英国科学研究委员会提交报告,批评 AI 研究承诺过高、进展有限,尤其否定「通用人工智能」的可行性。报告直接导致英国政府大幅削减 AI 经费,与 1974 年美国的 DARPA 收缩一起构成第一轮 AI 寒冬。
《Perceptrons》划出单层网络的边界
Minsky 与 Papert 系统分析感知机,证明单层线性模型无法解决 XOR 等问题,并讨论了计算复杂度限制。
SHRDLU 与积木世界
Terry Winograd 在 MIT 开发 SHRDLU,一个操作虚拟积木世界的自然语言程序。它能回答关于积木状态的问题、执行指令,并解释自己为什么拒绝某些操作。
ELIZA 展示对话程序的投射效应
Joseph Weizenbaum 发表 ELIZA 论文:程序按优先级寻找关键词,再用分解与重组规则改写用户输入。著名的 DOCTOR 脚本模仿罗杰斯式访谈,但系统并不建立对谈话内容的语义模型。
Mark I 感知机问世
Rosenblatt 展示 Mark I 感知机,一台能通过调整权重「学会」识别图案的硬件。它让神经网络第一次以实物的形式登上舞台,也点燃了公众对「会学习的机器」的第一波热情与后来的失望。
LISP 语言诞生
John McCarthy 提出 LISP,一种以符号表达式和递归为核心的编程语言。它成为之后几十年 AI 研究的主流工具,也为「程序即数据」的思想打下基础。
通用问题求解器 GPS
纽厄尔、肖和西蒙开发通用问题求解器 GPS,用「手段-目的分析」把任意问题拆成子目标逐步解决。它是符号主义 AI 早期最雄心勃勃的尝试。
达特茅斯暑期研究项目
1956 年夏天,研究者在达特茅斯学院讨论学习、语言、抽象和自我改进机器。项目提案首次用“Artificial Intelligence”命名这组问题。
Logic Theorist 完成定理证明
Allen Newell、Herbert Simon 与 Cliff Shaw 开发 Logic Theorist,用启发式搜索证明《数学原理》第二章 52 个命题中的 38 个;其中一个证明比书中版本更短。
Arthur Samuel 的跳棋程序
在 IBM 702 上,Arthur Samuel 编写了一个会下跳棋的程序,并让它通过与自己对弈持续改进棋力。他后来把这项工作称为「机器学习」的一个早期实例,这个术语也由此进入公共词汇。
图灵提出“模仿游戏”
图灵在《计算机器与智能》中提出“模仿游戏”:询问者只通过文字与人和机器交谈,再判断双方身份。论文同时讨论“儿童机器”与训练,未把测试等同于意识证明。
McCulloch–Pitts 人工神经元
沃伦·麦卡洛克与沃尔特·皮茨发表《神经活动中内在思想的逻辑演算》,证明简单人工神经元可执行逻辑运算。这篇论文为神经网络与 AI 提供了数学基础。
图灵发表《论可计算数》
图灵在《论可计算数及其在判定问题上的应用》中提出「图灵机」抽象模型,定义了可计算性的边界,为后来的计算机与人工智能提供了理论地基。