AI 行业编年史
2026—1936
一条可以慢慢翻的时间轴:249 个关键事件,从「机器能否思考」的思想实验,到聊天框进入亿万人日常。
19361940195019601970198019902000201020202026
智谱开源 GLM-5.3-Flash(Ox Alpha)
A 智谱「认领」此前以匿名身份 Ox Alpha(中文社区称「牛来」)上线的模型为 GLM-5.3-Flash:320B-A18B,GLM-5 系列首个原生多模态模型,以 MIT 协议开源;其训练使用数十万亿词元、由约 10 万张国产芯片支撑,匿名盲测期间曾登顶 OpenRouter 并终结 DeepSeek 连续 56 天霸榜。阿里发布并开源 Qwen3.8-Flash
A 阿里发布并开源 Qwen3.8-Flash:总参 125B、单 token 激活 6B 的多模态 MoE,采用全新「Next」架构(QSA 稀疏注意力 + Gated DeltaNet 混合注意力),训练成本较 Qwen3.7-Plus 下降约 90%,推理定价每百万输入 1 元、输出 3 元;被视为 Qwen4 的雏形,首发上线「千问办公」。OpenAI 自研推理芯片 Jalapeño 公布测试成绩
B OpenAI 在 Hot Chips 大会公布自研推理芯片 Jalapeño 的测试成绩:峰值吞吐下每瓦性能为参照系统(英伟达 GB200/GB300)的 1.5~1.9 倍,交互式工作负载优势达 2.1~4.1 倍;芯片由 OpenAI 与博通联合开发,2026 年底前开始在自有基础设施部署,与英伟达并行采购而非替代。OpenAI 首次主动放缓前沿模型训练
A OpenAI 发布《Pacing model development in an era of cyber-critical capabilities》,首次主动放缓前沿模型开发:暂停计划部署模型的两周强化学习训练,加固研究环境并扩大监控;此前内部评估认定下一代旗舰 Astra 的网络安全能力可能达到《准备框架》最高级别「关键」门槛。智谱发布 GLM-5.3
A 智谱发布 GLM-5.3:基座与 GLM-5.2 相同,通过极致的后训练 Scaling(强化学习)大幅提升智能上界,编程能力较前代提升约 50%,主打智能体编程与防御性网络安全;官方承诺安全评估完成后两周内开源权重。DeepSeek-V4 Pro 正式版发布
A DeepSeek 将 V4 Pro 更新为 0813 正式版:1.6T 总参 MoE、1M 上下文、最大输出 38.4 万 token,首次原生支持图像推理;DeepSWE 从预览版 12.8 升至 62.7,超过 Claude Opus 4.8,部分智能体基准逼近甚至反超 Claude Fable 5。同日发布开源 Agent 开发框架 DeepSeek Harness v0.1。Google 发布 Gemini 3.7 Flash
A Google 发布 Gemini 3.7 Flash:距 3.6 Flash 仅三周,官方称其为「编程与智能体场景下最智能的主力模型」,DeepSWE 从 49.0% 升至 65.3%、WebDev Arena Elo 1588;限时五折定价(输入 0.75 美元/百万 token),并同步接入 Gemini Spark 与 Enterprise Agent Platform。xAI 发布 Grok 4.6
A xAI 发布 Grok 4.6:总参数约 1.5T 的 MoE 旗舰,重点强化长时间运行的智能体任务、复杂交互与视觉工作,在 Artificial Analysis 综合智能指数上与 GPT-5.6 Sol 持平(61 分),API 定价明显低于竞品,同步上线 Cursor 与 Grok Build。Meta 发布并开源 Muse Glimmer
B Meta 超级智能实验室发布 Muse Glimmer:约 30B 参数的稠密多模态智能体模型,由闭源基座 Muse Spark 逻辑蒸馏而来,Apache 2.0 开源,可在 24GB 显存消费级 GPU 或 M4/M5 Max MacBook 上完全本地运行;扎克伯格同日发文宣布 Meta 重返开源。GPT-5.6 Luna 向免费用户开放
A OpenAI 宣布免费与 Go 用户默认模型切换为 GPT-5.6 Luna,下周起无限次文本聊天,并新增 Think 按钮让免费档首次可主动调用更高推理;Plus/Pro 的 GPT-5.6 Sol 同步升级,事实错误率较 GPT-5.5 Instant 降约 68%。Google 领导层重组,四位元老离职创业
A Google 8 月 6 日重组 AI 领导层:Demis Hassabis 卸任日常管理,转任 Alphabet 首席科学家兼 DeepMind 主席;Koray Kavukcuoglu 升 SVP 接管 Gemini;Jeff Dean、Sanjay Ghemawat、Oriol Vinyals、Quoc Le 离职创办 Discovery Loop(谷歌创始投资)。导火索是 Gemini 3.5 Pro 一再延期,Alphabet 股价单日跌约 4%。字节发布 SeedRealtime 音视频全双工模型
A 字节跳动发布 SeedRealtime:原生音视频全双工大模型,统一端到端架构融合音频、视频与文本,豆包 App 全量上线视频通话;官方称相比级联模型,节奏问题减少约 50%。Google 发布 Gemini Robotics 2
A Google DeepMind 发布 Gemini Robotics 2:VLA 模型 + ER 2 具身推理 + On-Device 2 端侧模型,在 Apptronik Apollo 2 人形机器人上演示,并推出 ASIMOV-Agentic 安全基准。腾讯混元发布 Hy ASR 3.0
B 腾讯混元发布 Hy ASR 3.0 preview,在中文普通话识别上取得进展,官方公布的中文普通话词错率进一步下降。它显示国产语音模型在多语言与口音泛化上持续投入。智谱公开 GLM-5 预告
B 智谱的 ZCode 页面意外曝光了 GLM-5 的预告信息,暗示下一代旗舰将在编程与 Agent 能力上发力。GLM 系列从 GLM-4.5 到 GLM-5 的迭代节奏,是中国大模型竞争加速的缩影。阿里发布 Qwen3.8 与 Qwen3.8-Max
A 阿里云发布 Qwen3.8 与 Qwen3.8-Max:总参数 2.4T、每 token 激活约 950B 的稀疏 MoE 架构,原生多模态视觉与 1M 上下文,CodeArena 全球第四;官方宣布下周开源 Max 权重与 Qwen3.8-27B,并同步推出 Agent 产品「千问办公」。欧盟《人工智能法》扩大实施,透明度与通用模型义务开始执法
A 欧盟《人工智能法》于 2026 年 8 月 2 日进入新的执法阶段:面向公众的系统必须披露 AI 身份,深度伪造必须带机器可读标识,通用 AI 模型提供商开始受欧洲 AI 办公室监管;高风险条款经"综合简化"一揽子计划推迟至 2027 年 12 月起分批适用。DeepSeek-V4-Flash 正式版发布
A DeepSeek 发布 V4-Flash 正式版(V4-Flash-0731),取代预览版:思考/非思考双模式、1M 上下文、Agent 能力增强与推测解码;8 月 6 日公告整体上调 API 定价,市场解读为低价策略转折与 V4-Pro 正式版信号。Claude Opus 5 发布
A Anthropic 发布 Claude Opus 5,定位接近旗舰前沿智能、定价与 Opus 4.8 持平,成为 Claude Max 的新默认模型与 Claude Pro 的最强选项,并随发布带来对话中途工具切换、API 安全回退等工程化机制。Gemini 3.6 Flash 发布,旗舰 3.5 Pro 继续缺席
B Google DeepMind 发布 Gemini 3.6 Flash,以及 3.5 Flash-Lite 与面向政府试点的 3.5 Flash Cyber;3.6 Flash 把输出定价下调并保持 1M 上下文,官方同时确认旗舰 3.5 Pro 仍在测试、Gemini 4 预训练已经启动。Kimi K3 发布并开源
A 月之暗面发布 Kimi K3,总参数 2.8 万亿、每 token 激活约 1040 亿的 MoE 架构模型,原生支持视觉与百万级上下文;7 月 27 日权重开放,成为当时全球参数最大的开源模型,并在 WebDev Arena 上首次由开源模型登顶。GPT-5.6 发布
B OpenAI 发布 GPT-5.6,以 Sol、Terra、Luna 三档覆盖旗舰能力、成本平衡与高吞吐,并加入程序化工具调用、多 Agent 编排、显式缓存和持久推理。OpenAI 发布 GPT-Live 全双工语音模型
B OpenAI 发布全双工语音模型 GPT-Live-1 与 GPT-Live-1 mini,让 ChatGPT 语音能同时听与说,支持同声传译、智能垫话与后台委派;两者分别成为付费与免费用户的默认语音模型,并向 iOS、Android 与网页端逐步推送。Seedance 2.5 冲击 30 秒连续生成
B 火山引擎 Force 后,Seedance 2.5 进入公开上线窗口,宣称单次扩散生成最长约 30 秒连续片段、减少分段拼接,把视频生成竞争轴从画质推进到原生时长。Claude 5 家族成形
B Anthropic 在六月先后推出 Claude Fable 5 与 Sonnet 5:前者面向长时间运行的高难度 Agent,后者强调速度与智能的综合平衡。Gemini 3.5 Flash 发布
B Google 发布 Gemini 3.5 Flash 正式版,把持续高强度 Agent 与代码任务定位为 Flash 主力场景,并将其设为 gemini-flash-latest 的默认模型。Sora 网页与应用停服
A OpenAI 于 2026 年 4 月 26 日停用 Sora 网页与应用体验;API 计划于同年 9 月 24 日关停。短视频生成旗舰从必须对标变成可持续性反例。DeepSeek-V4 预览版发布
B DeepSeek 开源 V4 Pro 与 Flash 预览版,把 1M 上下文、思考模式和 Agent 编程能力放进同一家族,并继续强调稀疏架构的成本效率。Seedance 2.0 发布与版权风暴
A 字节 Seed 团队正式发布 Seedance 2.0,写实多模态视频生成迅速出圈;数日内好莱坞片方与行业协会密集发函,全球上线节奏受阻,视频生成进入“能力—版权”硬碰撞阶段。DeepSeek 发布 V3.2
B DeepSeek 在 2025 年底发布 V3.2,采用更激进的稀疏注意力与 MoE 架构,在保持能力的同时把推理成本进一步压低,继续推动开源模型的效率革命。Anthropic 发布 Claude Opus 4.5
A Anthropic 发布 Claude Opus 4.5,在深度推理、长任务执行与代码能力上进一步压榨上限,被视为与 GPT-5 系列、Gemini 3 并列的旗舰之一。Google 发布 Gemini 3 Pro
A 谷歌发布 Gemini 3 Pro,在推理、多模态与长上下文上全面对标并部分反超 OpenAI 的 GPT-5 系列。它让谷歌在旗舰竞争里重回前排,也标志着 2025 年底「推理旗舰」之争进入白热化。OpenAI 发布 GPT-5.1
A OpenAI 发布 GPT-5.1,作为 GPT-5 系列的稳定升级,重点优化推理速度、API 成本与工具调用稳定性。它是「旗舰模型按季迭代」节奏里的关键一环。OpenAI 发布 Sora 2
A OpenAI 发布 Sora 2 旗舰视频与音频生成模型,同步 iOS 应用与水印策略,把 2024 年底的订阅生成能力升级为更强的多模态产品,并探索信息流式分发。Anthropic 发布 Claude Sonnet 4.5
A Anthropic 发布 Claude Sonnet 4.5,在代码与 Agent 能力上比肩甚至超过更大尺寸的旗舰,同时保持更低成本。它把「尺寸不是一切」的竞争逻辑推向极致。DeepSeek 发布 V3.1
B DeepSeek 发布 V3.1,把上下文窗口大幅扩展并强化工具调用能力,延续「高性价比开源旗舰」路线。它巩固了 DeepSeek 在中国开源模型中的领先位置。GPT-5 发布
A OpenAI 发布 GPT-5。ChatGPT 以路由系统在快速模型与深度推理模型之间选择;API 则提供 GPT-5、mini 和 nano 三档独立模型及可配置的推理强度,而不是照搬 ChatGPT 路由。月之暗面开源 Kimi K2
A 月之暗面发布 Kimi K2,约 1T 总参数、32B 激活的开放 MoE,编码与 Agent 基准表现突出,把 Kimi 从长上下文聊天产品扩展为全球可下载的旗舰权重。xAI 发布 Grok 4
A xAI 发布 Grok 4,首次把旗舰能力拉到推理模型的头部阵营,与 GPT、Claude、Gemini 正面竞争。它让 xAI 从「马斯克的另类项目」变成真正的第三极竞争者。字节跳动发布 Seedance 1.0
A 火山引擎 Force 大会发布 Seedance 1.0 与 Pro 等视频生成基座,支持文/图输入与多镜头叙事,并接入豆包等内容入口,把字节的视频生成能力推到公开产品前台。Anthropic 发布 Claude 4
A Anthropic 发布 Claude 4 家族:Opus 4 作为旗舰,Sonnet 4 主打速度与 Agent 任务,并推出支持工具调用的版本。Claude 4 将「长任务自主执行」确立为产品主线,与代码与 Agent 生态深度绑定。Google 发布 Veo 3 原生音频视频
A Google 在 I/O 2025 周期发布 Veo 3,强调原生同步音频(对白、音效、环境声)与更强可控性,并逐步接入 Gemini 应用与 API。OpenAI Codex 云端编程 Agent 上线
A OpenAI 在 ChatGPT 中发布 Codex 研究预览,为每个任务启动隔离云端环境,读取仓库、修改代码、运行测试并返回补丁证据。阿里发布 Qwen3 系列
A 阿里发布 Qwen3 系列,从 0.6B 到旗舰 235B(MoE)全面开源,原生支持思考/非思考双模式。Qwen3-235B 在多项评测中成为最强开源模型之一,改写开源与闭源的实力版图。OpenAI 开源 Codex CLI 终端编程 Agent
A OpenAI 在发布 o3 与 o4-mini 的同时开源 Codex CLI:可在本地终端读仓库、改文件、跑命令的编程 Agent,与云端 Codex 任务队列形成终端与云端双轨。OpenAI 发布 o3 与 o4-mini
A OpenAI 发布 o3 与 o4-mini,首次让推理模型在 ChatGPT 内自主调用搜索、代码执行、图像等全套工具。它把「推理」与「行动」首次系统性地结合到旗舰模型里。Llama 4 发布
B Meta 发布 Llama 4 Scout 与 Maverick,采用混合专家架构并原生支持多模态,把开放权重模型推向超长上下文和更高计算效率。Gemini 2.5 引入思维过程
A 谷歌发布 Gemini 2.5,以「思考模型」为核心:模型在回答前进行内部推理,强调编码、数学与长任务能力。Gemini 2.5 让谷歌在推理模型竞赛中重新回到第一梯队。百度发布文心 4.5 与 X1
A 百度同日上线文心 4.5(原生多模态)与文心 X1(深度思考),并在文心一言免费开放,随后承诺开源 4.5 系列,把搜索大厂重新拉回模型军备第一排。OpenAI 推出 Responses API 与 Agents SDK
B OpenAI 发布 Responses API、内置网页搜索、文件搜索和计算机使用工具,并开源 Agents SDK 管理工具、交接、护栏和追踪。Manus 引爆通用智能体热潮
A 初创公司 Monica(蝴蝶效应)发布 Manus,一个被包装为「自主完成复杂任务」的通用智能体。演示视频显示它能筛选简历、写报告、分析数据,上线即引爆社交媒体与邀请码经济。GPT-4.5 发布
A OpenAI 发布 GPT-4.5,宣称这是其最后一个不基于推理的旗舰模型,强化世界知识、自然对话与模式识别。发布后市场反应分化,凸显「纯规模路线 vs 推理路线」的分歧。微软曝光自研大模型 MAI-1
B 微软公开自研大模型 MAI-1,由 Inflection 前团队主导开发,被定位为与 OpenAI 合作之外的自主底座。它标志着微软开始摆脱「单一大模型供应商依赖」。Anthropic 发布 Claude 3.7 Sonnet
A Anthropic 发布 Claude 3.7 Sonnet,首创「混合推理」模式:同一模型既可在标准模式下快速回答,也可在扩展思维模式下长时间推理。它让推理能力从「特殊模型」变成「默认开关」。Claude Code 发布
B Anthropic 随 Claude 3.7 Sonnet 发布 Claude Code 研究预览。这个命令行工具读取仓库、修改文件、运行命令,并在每次高风险操作前请求权限。xAI 发布 Grok 3
A xAI 发布 Grok 3,宣称由 Colossus 超算(约 10 万张 GPU)训练,主打推理与数学能力,在发布前后声称某些基准领先。它把 xAI 从追赶者带进前沿竞争的核心圈。OpenAI 推出 Deep Research
A OpenAI 面向 Pro 用户发布 Deep Research,让模型自主多轮搜索、阅读与整合资料,输出带引用的研究报告。它把「研究助理」变成了 AI 的成熟产品形态。OpenAI 发布 Operator
A OpenAI 推出 Operator,一个能独立操作浏览器完成订餐、填表、购物等任务的通用 Agent。它是「AI 替你干活」从聊天走向行动的代表性产品。DeepSeek-R1 发布
A DeepSeek 发布开放推理模型 DeepSeek-R1,以强化学习驱动的推理能力和开放权重迅速引发全球关注。月之暗面发布 Kimi K1.5
A 月之暗面发布 Kimi K1.5,用强化学习训练出具备长上下文推理能力的模型,多项基准对齐或超越当时的国际头部推理模型,成为国产推理模型的代表作品。Luma 发布 Ray2 视频模型
B Luma 在 Dream Machine 上线 Ray2,宣称相对前代约 10 倍训练算力,强调快速连贯运动、细节与事件逻辑,面向付费订阅创作者。DeepSeek-V3 发布
B DeepSeek 发布 DeepSeek-V3,以开放权重和显著的训练效率引发行业关注,并让前沿模型的成本结构成为公开讨论的焦点。Google 发布 Gemini 2.0
A Google 发布 Gemini 2.0 Flash,主打原生多模态与 Agentic 能力,并演示 Project Mariner 等浏览器代理。它把 Google 的战略重心从对话模型转向「能替你干活」的智能体。Google 发布 Willow 量子芯片
A Google 公布 Willow 量子芯片:量子比特数量随规模增大而错误率指数下降,在随机电路采样任务上远超经典超算。它被视为量子纠错路线的关键里程碑。Sora 对 ChatGPT 用户正式开放
A OpenAI 将 Sora 向 ChatGPT Plus/Pro 用户开放(先美国等地),把 2024 年 2 月的研究演示推进为可在产品内生成短视频的订阅能力。亚马逊发布 Nova 模型家族
B 亚马逊在 re:Invent 发布 Nova 系列基础模型,覆盖文本、多模态与视频生成,通过 Bedrock 提供给企业。Nova 让亚马逊补上自研大模型拼图,与 Anthropic 合作并行推进。腾讯开源混元视频模型
A 腾讯开源 HunyuanVideo 等视频生成基础模型,以较大参数规模进入开源视频权重第一梯队,并在 Hugging Face 等平台获得高下载量。MCP 协议发布
B Anthropic 发布 Model Context Protocol,定义 AI 应用发现和调用外部工具、资源及提示模板的客户端—服务器接口。Codeium 发布 Windsurf AI IDE
B Codeium 推出 Windsurf 编辑器与 Cascade Agent,强调跨文件流程与持续上下文,与 Cursor 竞争“AI 原生 IDE”品类。ChatGPT 上线联网搜索
A OpenAI 发布 ChatGPT Search,让聊天助手直接联网检索并以实时信息作答,附带来源链接。它把 AI 对话推向搜索场景,直接挑战传统搜索引擎。Claude Computer Use 公测:模型操作图形界面
A Anthropic 在 2024 年 10 月 22 日将 computer use 以公测形式接入 API:模型根据屏幕截图决定移动光标、点击与键入等动作,在实验性条件下用人类方式操作计算机。Hinton 获诺贝尔物理学奖
A 瑞典皇家科学院将 2024 年诺贝尔物理学奖授予 Geoffrey Hinton 与 John Hopfield,表彰他们用物理学方法奠定人工神经网络的基础。深度学习首次获得诺贝尔奖,标志 AI 的科学地位获得制度性确认。李飞飞创办 World Labs
B AI 教母李飞飞宣布创办 World Labs,专注「空间智能」:让 AI 理解三维世界的几何与物理。公司几个月后发布首个可交互生成世界模型,把世界模型路线从概念推向产品。OpenAI o1 发布
A OpenAI 发布 o1-preview,把更多计算放到回答前的推理过程,在数学、科学和编程任务上显著提高复杂问题求解能力。Cursor 确立 AI 原生编辑器路线
B Anysphere 宣布完成 6000 万美元 A 轮融资。Cursor 已把模型聊天、代码库索引和生成式编辑直接放进基于 VS Code 的开发环境。xAI 发布 Grok-2
B xAI 发布 Grok-2,支持图像理解与生成,能力进入全球第一梯队。马斯克的「叛逆」人设与 X 平台数据形成独特打法,也引发关于 AI 约束与安全的持续讨论。Black Forest Labs 发布 FLUX.1
A Black Forest Labs 发布 FLUX.1 家族(pro / dev / schnell),在提示遵循与细节上显著抬升开放与 API 文生图上限,并迅速成为社区默认高质量选项之一。Meta 发布 Llama 3.1 405B
A Meta 发布 Llama 3.1,其中 405B 版本在多项基准上逼近 GPT-4o,是首个与闭源旗舰同场竞技的开源模型。扎克伯格同时发表长文,公开为开源 AI 辩护。OpenAI 发布 GPT-4o mini
B OpenAI 发布 GPT-4o mini,以极低的价格提供接近 GPT-4o 的能力,把「小模型 + 低价」变成主流选择,引发开发者大规模迁移与行业价格跟进。欧盟《人工智能法案》正式公布
A 欧盟在官方公报发布《人工智能法案》,建立禁止用途、高风险系统、透明度和通用 AI 模型的分层规则。华为云发布盘古大模型 5.0
B 华为在 HDC 2024 发布盘古 5.0,覆盖 NLP、多模态、视觉、预测与科学计算等分支与多档参数,强调昇腾部署与行业场景,把“硬件+模型+云”绑成一条国产全栈叙事。Claude 3.5 Sonnet 发布
B Anthropic 发布 Claude 3.5 Sonnet,以更低的价格和更快的速度达到接近或超过上一代旗舰的代码、视觉和推理表现。Runway 发布 Gen-3 Alpha
B Runway 发布 Gen-3 Alpha,在运动、时序一致性与可控性上相对 Gen-2 明显抬升,巩固其在广告与影视预演工具链中的位置。Apple 发布 Apple Intelligence
A 苹果在 WWDC 公布 Apple Intelligence:端侧 Foundation Models 与私有云协同,把写作、图像、通知摘要与 Siri 升级做成系统级功能,而不是独立聊天 App。快手发布可灵 Kling 1.0
A 快手发布可灵(Kling)1.0 文/图生视频模型,强调大幅运动、镜头语言与较高时序一致性,迅速成为全球视频生成产品对照系之一。阿里开源 Qwen2 系列
A 阿里通义千问团队发布 Qwen2 系列开源模型,覆盖 0.5B 到 72B 多个尺寸,7B/72B 在多项基准上领先同量级开源模型。它把开源生态从「单点模型」推向「全尺寸系列」。昆仑万维推进天工 / Skywork 大模型
B 昆仑万维以天工产品与 Skywork 模型系列推进搜索增强对话、多模态与后续开放权重,成为中国互联网第二梯队中坚持全栈模型品牌的代表之一。Claude Tool Use 正式可用
B Anthropic 宣布 Claude Tool Use 正式可用。开发者用 JSON Schema 定义客户端工具,Claude 返回 `tool_use` 内容块和结构化参数;实际执行、权限检查与结果回传仍由客户端负责。Google 发布 Veo 视频生成模型
A Google 在 I/O 2024 公布 DeepMind 的 Veo 文生视频模型,宣称可生成更高分辨率、更长片段的视频,与 Sora 演示后的全球赛道正式对位。GPT-4o 发布
A OpenAI 发布 GPT-4o,以同一神经网络处理文本、视觉与音频,让实时语音和视觉交互第一次成为通用模型的原生能力。AlphaFold 3 扩展到分子相互作用
A Google DeepMind 与 Isomorphic Labs 发布 AlphaFold 3,用扩散式结构生成预测蛋白质与多类生物分子的联合结构。DeepSeek-V2 发布
A DeepSeek 发布 V2,采用 MLA(多头潜在注意力)+ DeepSeekMoE 稀疏架构,以远低于同行的价格开放 API。推理成本约为 Llama 3 的 1/100,直接引爆了中国大模型的价格战。生数发布 Vidu 1.0
B 生数科技发布 Vidu 1.0 文生视频模型与应用,强调动态一致性与角色稳定,成为 Sora 演示之后最早一批可实际试用的中国视频生成产品之一。商汤发布日日新 SenseNova 5.0
B 商汤在技术日发布 SenseNova 5.0,强调知识、数学、推理与代码,并推出云到端全栈产品矩阵,把 CV 起家的公司更明确地绑在通用大模型战线上。Meta 发布 Llama 3
A Meta 发布 Llama 3 家族(8B 与 70B),性能大幅提升并随后推出 405B 旗舰。它让开源模型的水平首次逼近闭源前沿模型,也把「开源与闭源之争」推向全球大模型竞争的中心。AI21 发布 Jamba 混合架构模型
B AI21 Labs 发布 Jamba,首个将 Mamba 状态空间模型与 Transformer 结合的大规模混合架构,在长上下文与吞吐上展示效率优势。Kimi 凭超长上下文破圈
A 月之暗面把 Kimi 的长文本能力推到 200 万字级别,能一次读完几十本书或整份招股书。这一能力让 Kimi 在国产大模型里脱颖而出,成为 2024 年初最出圈的 AI 应用之一。Devin 把“软件工程 Agent”带入大众视野
B Cognition 公布 Devin,展示一个在沙箱中规划任务、编辑代码、运行命令、浏览文档并提交结果的软件工程 Agent。Cohere 发布 Command R
B Cohere 发布 Command R 系列,专为企业场景优化,强化检索增强生成(RAG)与多语言能力,走「开源可用、企业友好」的差异化路线。Anthropic 发布 Claude 3 家族
A Anthropic 发布 Claude 3 家族:旗舰 Opus、均衡 Sonnet、轻量 Haiku。Opus 在多项基准上超越 GPT-4,首次支持 20 万 token 上下文。三档齐发的策略让大模型进入「按需选档」时代。Stability AI 发布 Stable Diffusion 3
B Stability AI 发布 Stable Diffusion 3,采用新的多模态扩散变压器架构,在文字渲染与多主体遵循上显著进步。开源图像生成迎来架构换代。Google 开源 Gemma
B Google 发布开源模型 Gemma,提供 2B 与 7B 两种规模。这是谷歌首次向社区开放自家大模型权重,标志着开源与闭源双线作战成为巨头标配。Google 发布 Gemini 1.5
A Google 发布 Gemini 1.5 Pro,首次将上下文窗口推向 100 万 token,可在一次推理中处理数小时视频、整本书籍与超长代码库。它把「长上下文」从演示变成可用的产品能力。Sora 展示长时文生视频
A OpenAI 公布 Sora 研究预览,可根据文字生成最长一分钟、保持较高视觉质量和镜头连贯性的视频。Apple Vision Pro 发售
B Apple Vision Pro 正式发售,以眼动、手势与语音为交互方式,把计算从平面屏幕带进空间。它首次让「空间计算」成为大众可购买的产品形态,也展示了苹果对 AI 与硬件的融合思路。面壁开源 MiniCPM 端侧模型
B 面壁智能与 OpenBMB 开源 MiniCPM 系列,以小参数中文友好基座强调端侧可部署;随后 MiniCPM-V 把多模态也压进边缘设备叙事。Neuralink 完成首例人体植入
B 马斯克创办的 Neuralink 宣布完成首例人体大脑植入,患者在术后能用意念控制电脑光标。它是脑机接口领域的标志性事件,也是「AI 与人脑直连」愿景的临床起点。智谱发布 GLM-4
B 智谱发布 GLM-4,性能对标同期 GPT-4,同时延续开源策略。GLM 系列成为国产大模型中「学术出身、开源与商业并进」路线的代表。Midjourney 发布 V6
B Midjourney V6 在提示遵循与文字渲染上明显进步,使社区默认美学从“氛围滤镜”更接近可执行的设计说明。Mistral 发布 Mixtral 8x7B 混合专家模型
A Mistral AI 以 Apache 2.0 发布 Mixtral 8x7B 稀疏混合专家模型:每层 8 组专家、每 token 路由 2 个,总参数约 46.7B、每 token 约 12.9B 激活。厂商报告在多数基准上超过 Llama 2 70B、推理更快,并匹配或超过 GPT-3.5;这些比较由发布方给出。Google 发布 Gemini 1.0
A Google DeepMind 发布 Gemini 1.0,以 Ultra、Pro、Nano 三个规模覆盖数据中心、通用产品和端侧设备。发布当日 Bard 接入 Pro,Nano 登上 Pixel 8 Pro;Ultra 则等到 2024 年才面向用户开放。OpenAI 董事会风波
A OpenAI 董事会突然解雇 CEO Sam Altman,随后在员工与投资人施压、高管出走与微软斡旋之下,于五天后的 11 月 22 日宣布 Altman 复职并改组董事会。事件暴露了非营利治理与商业利益的结构性张力。阶跃星辰发布 Step 系列
B 阶跃星辰由姜大昕创立,发布 Step 系列大模型,主打万亿参数与多模态能力,成为「大模型六小龙」中的代表之一,其 Step 系列持续迭代并开源部分版本。OpenAI 发布 Assistants API
B OpenAI 在 DevDay 以测试版发布 Assistants API,定义 Assistant、Thread、Message 与 Run 等托管对象,并接入文件检索、Code Interpreter 和函数调用。它把会话状态交给平台管理,也引入了由平台规定的运行状态机。OpenAI 推出自定义 GPTs
B OpenAI 在首届 DevDay 发布 GPTs,让 ChatGPT Plus 和 Enterprise 用户用指令、上传文件、内置工具及自定义 Actions 配置专用助手,无需重新训练模型。原定 11 月上线的 GPT Store 延至 2024 年 1 月开放。xAI 发布 Grok
B 埃隆·马斯克创立的 xAI 发布 Grok-1 及配套产品,主打「实时接入 X(推特)」与少约束的幽默风格,向 ChatGPT 发起差异化竞争。零一万物发布 Yi 系列
B 零一万物由李开复创立,发布 Yi 系列大模型,其中 Yi-34B 以较强的中英文综合能力进入开源模型第一梯队,成为「大模型六小龙」中的代表。布莱切利园 AI 安全峰会
A 英国在布莱切利园召开首届 AI 安全峰会,中美欧等多国代表与前沿实验室出席,签署《布莱切利宣言》,承认前沿 AI 存在潜在灾难性风险并承诺国际合作治理。百度发布文心大模型 4.0
B 百度在 2023 百度世界大会上发布文心大模型 4.0,宣称综合能力与 GPT-4 相当,并接入搜索、地图、网盘等全线产品。它被视为国产大模型对标国际旗舰的标志性一役。SWE-bench 用真实 GitHub Issue 评测编程 Agent
A 普林斯顿团队发布 SWE-bench,把真实 Python 仓库中的 2,294 个已解决 Issue 转成可执行的软件工程评测任务。月之暗面发布 Kimi
A 月之暗面(Moonshot AI)发布 Kimi 智能助手,以长上下文与中文长文本处理为差异化卖点。它在国产对话产品中以「能读长文档、多轮长对话」快速出圈。Mistral 7B 以小模型进入开放生态
B Mistral AI 以 Apache 2.0 许可证发布 Mistral 7B 权重。模型采用分组查询注意力和 4096 token 滑动窗口;发布方报告它在多项基准上超过 Llama 2 13B,但这属于厂商基准比较。微软把 Copilot 铺满全产品线
A 微软在 2023 年秋季发布会上宣布统一品牌 Copilot:Bing、Windows、Microsoft 365 全线接入 AI 助手。微软把「AI 作为软件的新交互层」推向亿级用户,确立了生产力软件拥抱大模型的模板。腾讯混元大模型发布
A 腾讯正式发布混元大模型,覆盖文本、代码、图像等多模态能力,并接入微信、腾讯云等业务。至此,国内互联网巨头全部站上自研大模型的牌桌。MiniMax 发布大模型与海螺 AI
B MiniMax 发布自研大模型并推出 AI 对话应用海螺 AI,主打多模态与效率。2025 年其 MiniMax-01 系列以新型 MoE 架构与 400 万上下文引发关注,成为国产模型的技术派代表。字节发布豆包
B 字节跳动推出 AI 对话助手豆包,依托火山引擎的云雀大模型。豆包随后凭借字节的流量分发与免费策略迅速成长,成为中国用户规模领先的 AI 应用之一。通义千问开放 Qwen 权重
B 阿里云发布 Qwen-7B 与 Qwen-7B-Chat 的代码和权重;基础模型以超过 2.2 万亿 token 预训练,覆盖中文、英文、代码和多语言文本。许可允许研究使用,月活用户低于一亿的商业主体可直接使用,更大规模须另行申请。Continue 开源 IDE 编程助手
B Continue 以开源 VS Code / JetBrains 扩展提供聊天、补全与代码库上下文,强调开发者自带模型与可定制工作流,成为商业 AI IDE 之外的开放对照。Meta 发布 Llama 2 开放权重
A Meta 发布 Llama 2 预训练与对话微调权重,参数规模 7B、13B、70B,并宣布研究与商业用途免费可用。许可为 Llama 2 社区许可(含可接受使用政策与月活门槛等附加条款),不是无限制的 OSI 开源软件许可;微软为优先云合作方。上海 AI 实验室开源 InternLM
B 上海人工智能实验室发布并开源书生 InternLM 系列大模型,这是中国科研机构主导的国产开源大模型代表,后续迭代出 InternLM2、InternLM3 等版本,并配套开源工具链。vLLM 与 PagedAttention 重塑 LLM 服务吞吐
A UC Berkeley 等研究者开源 vLLM,并以 PagedAttention 把 KV 缓存拆成可非连续映射的页,降低显存碎片与预留浪费,显著提高大模型服务吞吐。百川智能发布 Baichuan 开源大模型
B 王小川创立的百川智能发布 Baichuan-7B,首个版本即开源,随后推出 Baichuan-13B 与 53B。公司以「开源+商业双轨」切入,成为国产开源大模型的重要参与者。OpenAI API 加入函数调用
A OpenAI 在 0613 版 GPT-4 与 GPT-3.5 Turbo 中加入函数调用。开发者用 JSON Schema 声明函数,模型返回函数名与参数;应用仍须校验参数、执行函数并把结果送回模型。智谱开源 ChatGLM
B 智谱 AI 发布并开源 ChatGLM 系列,其中包括中文场景优化的对话模型,成为国产开源大模型的重要代表,随后迭代出 ChatGLM2、ChatGLM3 与 GLM-4。英伟达市值突破万亿美元
B 英伟达市值突破 1 万亿美元,成为历史上首家达成这一里程碑的芯片公司。ChatGPT 引爆的 AI 算力需求让 GPU 从游戏配件变成 AI 时代的「石油」。讯飞星火发布
B 科大讯飞发布讯飞星火认知大模型,展示文本生成、知识问答、数学推理与多语种能力,并把大模型与自身语音与教育优势结合。Aider 把 Git 结对写进终端
B 开源工具 Aider 在终端中对接多厂商 LLM,按聊天指令直接修改本地 Git 仓库并生成可审查 diff,成为 Agent Coding 兴起前最重要的开源结对路径之一。阿里通义千问正式发布
B 阿里云宣布通义千问正式开启测试,这是阿里自研大语言模型向公众开放的关键节点。此后通义千问通过 API 与开源(Qwen 系列)两条路扩展,成为国际开源模型格局中的中国代表。Meta 发布 SAM「分割一切」
A Meta AI 发布 Segment Anything Model(SAM),一个可在零样本下分割任意图像中任意物体的模型,配套 1100 万张图像、10 亿掩码的数据集。它被视为视觉版「基础模型」。AutoGPT 引爆自主智能体实验
B 开源项目 AutoGPT 发布,展示让 GPT-4 自主拆分目标、调用工具并迭代执行的思路。它虽不成熟,却让「AI 智能体」成为生成式 AI 最热门的叙事之一。ChatGPT 插件连接外部服务
B OpenAI 向候补名单用户开放 ChatGPT 插件测试。第三方以域名下的清单文件和 OpenAPI 规范描述接口,模型可据此选择调用;最初的浏览器和代码解释器插件由 OpenAI 自己提供。文心一言开启中国大模型浪潮
A 百度发布文心一言,以录播演示的方式推出对话模型产品,成为 ChatGPT 后中国主要科技公司里首个正式发布的大模型。发布会当日百度港股一度下跌,也引来对「AI 抢跑 vs 实力」的争论。Anthropic 发布 Claude
A Anthropic 发布 Claude,并通过 API 及 Slack、Notion 等合作入口提供访问。公司把可预测性、减少有害输出和长文本处理列为产品重点;这些是发布方定位,不是对准确性或安全性的独立认证。GPT-4 发布
A OpenAI 发布 GPT-4,并报告其在模拟律师资格考试中达到约前 10%,而 GPT-3.5 约在后 10%。图像输入最初仅限合作方测试;技术报告未披露参数量、训练数据构成、架构或训练算力。斯坦福 Alpaca 低成本复刻
A 斯坦福团队用 52K 条由 GPT-3.5 生成的指令数据微调 LLaMA-7B,训练成本仅约 600 美元,得到行为接近 GPT-3.5 的 Alpaca。它引爆了「低成本复刻闭源模型」的浪潮。Meta 发布 LLaMA
A Meta 发布 7B、13B、33B 和 65B 参数的 LLaMA 论文,并向获批研究者提供非商业许可权重;其中 65B 模型用 1.4 万亿 token 训练。权重随后外泄,社区迅速开发量化、微调和本地推理工具。微软把 ChatGPT 放进必应搜索
A 微软发布新版必应,把 OpenAI 的模型与搜索索引结合,允许用户用自然语言提问并查看带引用的回答。搜索引擎开始从「结果列表」转向「对话加引用」。艺术家集体起诉生成式 AI 公司
B 一批艺术家对 Stability AI、Midjourney 等公司提起集体诉讼,指控其用受版权保护的图像训练模型。这开启了对 AI 训练数据合法性的全球法律博弈。Constitutional AI:用原则与 AI 反馈训练无害性
A Anthropic 提出 Constitutional AI:用人类写定的原则列表让模型批评与改写自身输出,再以 AI 反馈做强化学习(RLAIF),在减少有害性人工标签的同时训练更少回避、更能解释拒绝的助手。Perplexity AI 上线
B Perplexity AI 上线,把检索与生成结合成「答案引擎」:直接引用来源给出回答。它开创了对话式 AI 搜索的新范式,与传统的「十条蓝色链接」形成对比。ChatGPT 发布
S OpenAI 以免费“研究预览”发布基于 GPT-3.5 的 ChatGPT,把经过人工反馈训练的模型放进保留上下文的网页对话界面。它能连续追问、改写文本和解释代码,也会自信地给出错误答案。特斯拉发布 Optimus 人形机器人
B 特斯拉在 AI Day 上首次展示 Optimus 人形机器人原型,宣称将复用造车的电机、电池与 FSD 算法。它把「人形机器人」从实验室概念推向公众视野与产业热度。OpenAI 开源 Whisper 语音识别
A OpenAI 发布 Whisper:在约 68 万小时多语、多任务监督音频上训练的端到端语音系统,并开源推理代码与模型权重。官方称在多样数据集上零样本表现更稳健,错误约比专项模型少 50%。Character.AI 公测
B 由前谷歌研究员创办的 Character.AI 开放公测,用户可以和虚构人物、历史人物或自建角色对话,开创了「AI 伴侣与角色扮演」这一消费级赛道。Stable Diffusion 开放文生图权重
S Stability AI 与 CompVis 发布 Stable Diffusion 1.4 的代码和约 4GB 权重。模型在压缩潜空间中去噪,能在消费级 GPU 上生成 512×512 图像,也让本地微调和第三方界面迅速扩散。Midjourney 在 Discord 里开启文生图热潮
A Midjourney 以 Discord 机器人形式开放公开测试,用户通过文本指令生成风格独特的图像。它凭借社群传播与独特美学快速走红,成为文生图大众化的标志性产品之一。FlashAttention 用 IO 感知重写精确注意力
A Tri Dao 等人提出 FlashAttention:在 GPU 上按块计算精确 softmax 注意力,减少高带宽内存(HBM)读写,从而在不近似注意力数学的前提下加速并节省显存。DeepMind 发布 Gato 通才智能体
B DeepMind 发布 Gato,一个用单一 Transformer 权重同时完成 604 项任务的多模态智能体,从电子游戏、机械臂控制到对话与图像描述。它被视为「通才智能体」路线的标志性实验。DALL·E 2 让文生图进入实用阶段
A OpenAI 发布 DALL·E 2,用扩散模型把文本描述转成高分辨率图像,支持编辑与变体生成。它让「文生图」从研究演示变成大众可体验的创作工具。Chinchilla 修正算力最优缩放配比
A DeepMind 在 arXiv 发表《Training Compute-Optimal Large Language Models》,训练 400 余个规模从约 7000 万到逾 160 亿参数的模型。结论是算力最优时模型大小与训练 token 应近似等比放大;同算力的 70B Chinchilla(约 1.4T token)全面超过 280B Gopher。InstructGPT 用人类反馈对齐指令
S OpenAI 公开 InstructGPT 的三阶段训练方法:监督示范微调、人工偏好奖励模型、再用 PPO 强化学习。标注员在成对比较中更常选择 1.3B InstructGPT,而不是大约大 100 倍的 175B GPT-3,但该结果只代表这套任务和标注规范。OpenAI Codex 把 GPT-3 适配到代码
A OpenAI 发布 Codex API 私有测试版。Codex 由 GPT-3 继续在公开代码上训练,早期 12B 版本在 HumanEval 单次采样中解出 28.8% 的题目,并为 GitHub Copilot 提供模型能力。GitHub Copilot 发布
A GitHub 发布 Copilot 技术预览,把 OpenAI Codex 生成的单行或整段函数建议直接放进 Visual Studio Code。开发者需主动接受建议,GitHub 同时明确提示生成代码可能错误或复现训练数据中的模式。LoRA 提出大模型低秩适配
A 微软研究者提出 LoRA:冻结预训练权重,在 Transformer 层注入可训练的低秩分解矩阵。相对全量微调 GPT-3 175B,论文报告可训练参数约降一万倍、显存约降三倍,合并后不增加推理延迟。华为发布盘古大模型
B 华为在华为云开发者大会上发布盘古系列大模型,覆盖 NLP、视觉、多模态等方向,主打行业场景落地。它是中国早期由科技巨头主导的大模型尝试之一。EleutherAI 开源 GPT-Neo
B EleutherAI 发布 GPT-Neo 1.3B 与 2.7B,证明没有科技巨头预算的独立社区也能训练出可用的语言大模型,为开源 AI 的后续繁荣埋下伏笔。CLIP 用自然语言监督连接图文
A OpenAI 发布 CLIP:在大规模图文对上对比训练图像编码器与文本编码器,使模型可用自然语言描述做零样本图像分类,并开放代码与权重示例。OpenAI 发布 DALL·E
A OpenAI 公布约 120 亿参数的 DALL·E:把文本与图像离散 token 编入同一序列,用解码器 Transformer 从文字描述生成图像,并通过受控样例展示组合概念与零样本式生成。AlphaFold 破解蛋白质结构预测
A AlphaFold 2 在 CASP14 盲测的全部目标上取得 92.4 的中位 GDT_TS,许多预测接近实验结构精度。该成绩针对单链蛋白质结构预测,并不等于解决蛋白质动力学、相互作用或所有复合物结构。DDPM 让扩散模型成为实用生成路线
A Ho、Jain 与 Abbeel 提出 DDPM:训练网络预测逐步加入图像的噪声,再用 1000 步反向过程采样。论文在 CIFAR-10 上报告 3.17 的 FID 和 9.46 的 Inception Score。GPT-3 发布
A OpenAI 训练 1750 亿参数 GPT-3,并以零样本、单样本和少样本提示评估它。模型无需更新权重即可尝试翻译、问答、文本生成和简单代码,但不同任务的结果差异很大。RAG 检索增强生成论文
A Facebook AI 提出 RAG:用稠密检索从文档库取出相关段落,再与预训练序列到序列模型一起条件生成答案,在开放域问答等任务上验证有效。神经语言模型缩放规律被量化
A OpenAI 研究者在跨越七个数量级的计算规模上拟合经验幂律,测量语言模型交叉熵损失随参数量、数据量和训练计算量的变化,并提出当时的计算预算分配公式。微软向 OpenAI 投资十亿美元
A 微软宣布向 OpenAI 投资 10 亿美元,双方开展多年合作:Azure 成为 OpenAI 的独家云供应商,OpenAI 的技术将整合进微软产品。这笔投资为 GPT 系列的规模化训练提供了算力与资本。OpenAI Five 击败 Dota 2 世界冠军
B OpenAI Five 在一场三局两胜的公开赛中连胜两局,击败 2018 年 Dota 2 世界冠军 OG。比赛使用 17 名可选英雄及若干规则限制,五个智能体各自控制一名角色并实时协作。深度学习三巨头获图灵奖
A ACM 宣布将 2018 年度图灵奖授予 Geoffrey Hinton、Yann LeCun 和 Yoshua Bengio,表彰他们在深度神经网络领域的突破性贡献,为现代 AI 奠定基础。GPT-2 展示零样本任务迁移
A OpenAI 公布在约 800 万个网页文档上训练的 15 亿参数 GPT-2,并演示模型在不做任务微调时完成基础问答、摘要和翻译。公司起初只发布较小版本,随后于 2019 年 11 月放出完整模型。AlphaStar 击败职业星际玩家
B DeepMind 公布 AlphaStar,一个在《星际争霸 II》中击败顶级职业玩家的 AI,展示了深度强化学习在不完美信息、长时决策的实时战略游戏中的能力。Waymo One 商业运营启动
B Waymo 在凤凰城启动 Waymo One,首次向公众开放付费的自动驾驶出租车服务,把自动驾驶从路测 demo 推进到商业化运营阶段。Hugging Face Transformers 库成型
A Hugging Face 推出并扩展 Transformers 库,把 BERT 等预训练模型的加载、分词与微调收成统一 API,降低复现与迁移成本。BERT 发布
A Google 发布 BERT,以掩码语言建模和下一句预测预训练双向 Transformer 编码器。3.4 亿参数的 BERT-Large 只增加小型输出层,便在 GLUE、SQuAD 等 11 项任务上刷新当时最佳结果。GPT-1 验证生成式预训练
A OpenAI 在 BooksCorpus 上预训练 1.17 亿参数、12 层的 Transformer 解码器,再分别微调到 12 个有监督任务;论文报告其中 9 项刷新当时最佳结果。Google Duplex 用 AI 打电话订餐
B Google 在 I/O 大会上演示 Duplex:AI 用自然的语气打电话替用户预约理发与餐厅,与真人对话时语气词、停顿都惟妙惟肖。它让「AI 替人打电话」从科幻变成演示,也引发关于透明度的伦理讨论。Deepfake 引发全球警惕
B 基于生成式模型的换脸视频「Deepfake」在网络上大规模传播,首次让公众直面 AI 造假对信任、隐私与安全的冲击,也催生了检测与治理的长期军备竞赛。AlphaZero 用自我博弈统一棋类学习
A DeepMind 发布 AlphaZero,用同一套自我对弈、策略—价值网络和蒙特卡洛树搜索方法分别学习国际象棋、将棋与围棋。三个网络各自从随机参数训练,并不共享已经学到的棋艺。Transformer 架构论文发表
S Google 研究者在机器翻译论文中提出 Transformer,用自注意力、前馈网络和位置编码构成编码器—解码器,去掉循环和卷积。百度开放 Apollo 自动驾驶平台
A 百度发布 Apollo 自动驾驶开放平台,向全球开发者与车企开放高精地图、感知、规划等模块。它希望用开放生态对抗 Waymo 的封闭路线,成为中国自动驾驶的标志性事件。PyTorch 公开亮相
A Facebook AI Research 公开 PyTorch,以 Python 与动态计算图为核心,让研究者用熟悉的控制流搭建并调试深度网络。谷歌发布神经机器翻译
A 谷歌宣布其在线翻译改用神经机器翻译(GNMT),端到端深度模型在质量上大幅超越传统统计方法。它宣告深度学习接管了机器翻译这一重要应用领域。DeepMind 发布 WaveNet
B DeepMind 公布 WaveNet,一种直接生成原始音频波形的深度生成模型,在英文与中文语音合成中显著提升自然度,被认为大幅缩小了机器语音与人声的差距。Google 发布 TPU
B Google 在 I/O 2016 公布自研 Tensor Processing Unit,这是一款针对神经网络推理优化的专用芯片,已在 AlphaGo 与搜索排序等场景使用。TPU 标志着大公司开始为深度学习定制硬件。YOLO 提出实时目标检测
B Redmon 等人提出 YOLO(You Only Look Once),把目标检测变成单次回归问题,一帧图像一次前向推理即可输出所有目标的位置与类别,速度达到实时。它开创了单阶段检测路线,深刻影响自动驾驶、监控与终端视觉。微软 Tay 上线即翻车
A 微软在 Twitter 上发布聊天机器人 Tay,宣称「像青少年一样说话」,结果网民 24 小时内用恶意推文把它教成了满口种族歧视的机器人。微软被迫下线并公开道歉,成为 AI 安全的经典反面教材。AlphaGo 击败李世石
A AlphaGo 在首尔五局赛中以 4 比 1 战胜李世石。系统把人类棋谱学习、自我对弈和蒙特卡洛树搜索组合在一起。OpenAI 成立
A OpenAI 由 Sam Altman、Elon Musk、Ilya Sutskever、Greg Brockman 等人联合创立,定位为以安全与开放为优先的非营利 AI 研究机构,初始承诺资金约 10 亿美元。ResNet 让超深网络可训练
A 微软研究者提出残差网络,用跳跃连接训练 152 层模型,并赢得 2015 年 ImageNet 分类任务。Google 开源 TensorFlow
A Google 以 Apache 2.0 许可证发布 TensorFlow,把内部第二代机器学习系统开放给研究者和开发者。特斯拉上线 Autopilot
B 特斯拉通过 OTA 向 Model S 推送 Autopilot,把车道保持、自适应巡航等辅助驾驶能力带到量产车上。它是「用数据+软件迭代做自动驾驶」路线的标志性起点。注意力机制进入神经机器翻译
A Bahdanau、Cho 与 Bengio 提出在神经机器翻译中联合学习对齐与翻译:解码器每生成一个词,都对编码器隐状态做软注意力加权,而不是只依赖一个固定句向量。Amazon Echo 与 Alexa 问世
B 亚马逊发布 Echo 智能音箱与 Alexa 语音助手,把语音交互带进客厅。它验证了「对话式 AI + 硬件」的产品形态,也让语音助手之战从手机蔓延到家庭。Seq2Seq 统一可变长度序列转换
A Google 研究者提出用两个多层 LSTM 将输入序列编码成向量,再逐步生成输出序列,并在机器翻译上取得有竞争力的结果。GAN 提出对抗式生成训练
A Ian Goodfellow 等人提出生成对抗网络,以同一个 minimax 目标训练生成器与判别器。论文在 MNIST、Toronto Face Database 和 CIFAR-10 上展示结果,并指出两部分训练需要保持同步。Google 收购 DeepMind
A Google 收购由 Demis Hassabis、Shane Legg 和 Mustafa Suleyman 创立的 DeepMind,据报价格约 4 亿至 6 亿美元。收购附带「AGI 安全委员会」协议,DeepMind 得以在谷歌体系内保持研究独立性。没有匹配的事件
试试更短的关键词,或调整级别与主题筛选。