AI 安全
从「Google 收购 DeepMind」到「OpenAI 首次主动放缓前沿模型训练」,先抓住起点、路线转向与当前边界,再展开完整事件线。
OpenAI 首次主动放缓前沿模型训练
OpenAI 发布《Pacing model development in an era of cyber-critical capabilities》,首次主动放缓前沿模型开发:暂停计划部署模型的两周强化学习训练,加固研究环境并扩大监控;此前内部评估认定下一代旗舰 Astra 的网络安全能力可能达到《准备框架》最高级别「关键」门槛。
Google 发布 Gemini Robotics 2
Google DeepMind 发布 Gemini Robotics 2:VLA 模型 + ER 2 具身推理 + On-Device 2 端侧模型,在 Apptronik Apollo 2 人形机器人上演示,并推出 ASIMOV-Agentic 安全基准。
欧盟《人工智能法》扩大实施,透明度与通用模型义务开始执法
欧盟《人工智能法》于 2026 年 8 月 2 日进入新的执法阶段:面向公众的系统必须披露 AI 身份,深度伪造必须带机器可读标识,通用 AI 模型提供商开始受欧洲 AI 办公室监管;高风险条款经"综合简化"一揽子计划推迟至 2027 年 12 月起分批适用。
Hinton 获诺贝尔物理学奖
瑞典皇家科学院将 2024 年诺贝尔物理学奖授予 Geoffrey Hinton 与 John Hopfield,表彰他们用物理学方法奠定人工神经网络的基础。深度学习首次获得诺贝尔奖,标志 AI 的科学地位获得制度性确认。
xAI 发布 Grok-2
xAI 发布 Grok-2,支持图像理解与生成,能力进入全球第一梯队。马斯克的「叛逆」人设与 X 平台数据形成独特打法,也引发关于 AI 约束与安全的持续讨论。
欧盟《人工智能法案》正式公布
欧盟在官方公报发布《人工智能法案》,建立禁止用途、高风险系统、透明度和通用 AI 模型的分层规则。
布莱切利园 AI 安全峰会
英国在布莱切利园召开首届 AI 安全峰会,中美欧等多国代表与前沿实验室出席,签署《布莱切利宣言》,承认前沿 AI 存在潜在灾难性风险并承诺国际合作治理。
Anthropic 发布 Claude
Anthropic 发布 Claude,并通过 API 及 Slack、Notion 等合作入口提供访问。公司把可预测性、减少有害输出和长文本处理列为产品重点;这些是发布方定位,不是对准确性或安全性的独立认证。
艺术家集体起诉生成式 AI 公司
一批艺术家对 Stability AI、Midjourney 等公司提起集体诉讼,指控其用受版权保护的图像训练模型。这开启了对 AI 训练数据合法性的全球法律博弈。
Constitutional AI:用原则与 AI 反馈训练无害性
Anthropic 提出 Constitutional AI:用人类写定的原则列表让模型批评与改写自身输出,再以 AI 反馈做强化学习(RLAIF),在减少有害性人工标签的同时训练更少回避、更能解释拒绝的助手。
InstructGPT 用人类反馈对齐指令
OpenAI 公开 InstructGPT 的三阶段训练方法:监督示范微调、人工偏好奖励模型、再用 PPO 强化学习。标注员在成对比较中更常选择 1.3B InstructGPT,而不是大约大 100 倍的 175B GPT-3,但该结果只代表这套任务和标注规范。
GPT-2 展示零样本任务迁移
OpenAI 公布在约 800 万个网页文档上训练的 15 亿参数 GPT-2,并演示模型在不做任务微调时完成基础问答、摘要和翻译。公司起初只发布较小版本,随后于 2019 年 11 月放出完整模型。
Deepfake 引发全球警惕
基于生成式模型的换脸视频「Deepfake」在网络上大规模传播,首次让公众直面 AI 造假对信任、隐私与安全的冲击,也催生了检测与治理的长期军备竞赛。
微软 Tay 上线即翻车
微软在 Twitter 上发布聊天机器人 Tay,宣称「像青少年一样说话」,结果网民 24 小时内用恶意推文把它教成了满口种族歧视的机器人。微软被迫下线并公开道歉,成为 AI 安全的经典反面教材。
OpenAI 成立
OpenAI 由 Sam Altman、Elon Musk、Ilya Sutskever、Greg Brockman 等人联合创立,定位为以安全与开放为优先的非营利 AI 研究机构,初始承诺资金约 10 亿美元。
Google 收购 DeepMind
Google 收购由 Demis Hassabis、Shane Legg 和 Mustafa Suleyman 创立的 DeepMind,据报价格约 4 亿至 6 亿美元。收购附带「AGI 安全委员会」协议,DeepMind 得以在谷歌体系内保持研究独立性。