AI 应用

从「MYCIN 医疗专家系统」到「GPT-5.6 Luna 向免费用户开放」,先抓住起点、路线转向与当前边界,再展开完整事件线。

01

GPT-5.6 Luna 向免费用户开放

OpenAI 宣布免费与 Go 用户默认模型切换为 GPT-5.6 Luna,下周起无限次文本聊天,并新增 Think 按钮让免费档首次可主动调用更高推理;Plus/Pro 的 GPT-5.6 Sol 同步升级,事实错误率较 GPT-5.5 Instant 降约 68%。

A行业级
02

字节发布 SeedRealtime 音视频全双工模型

字节跳动发布 SeedRealtime:原生音视频全双工大模型,统一端到端架构融合音频、视频与文本,豆包 App 全量上线视频通话;官方称相比级联模型,节奏问题减少约 50%。

A行业级
03

Google 发布 Gemini Robotics 2

Google DeepMind 发布 Gemini Robotics 2:VLA 模型 + ER 2 具身推理 + On-Device 2 端侧模型,在 Apptronik Apollo 2 人形机器人上演示,并推出 ASIMOV-Agentic 安全基准。

A行业级
04

腾讯混元发布 Hy ASR 3.0

腾讯混元发布 Hy ASR 3.0 preview,在中文普通话识别上取得进展,官方公布的中文普通话词错率进一步下降。它显示国产语音模型在多语言与口音泛化上持续投入。

B领域级
05

Sora 网页与应用停服

OpenAI 于 2026 年 4 月 26 日停用 Sora 网页与应用体验;API 计划于同年 9 月 24 日关停。短视频生成旗舰从必须对标变成可持续性反例。

A行业级
06

Seedance 2.0 发布与版权风暴

字节 Seed 团队正式发布 Seedance 2.0,写实多模态视频生成迅速出圈;数日内好莱坞片方与行业协会密集发函,全球上线节奏受阻,视频生成进入“能力—版权”硬碰撞阶段。

A行业级
07

OpenAI 发布 Sora 2

OpenAI 发布 Sora 2 旗舰视频与音频生成模型,同步 iOS 应用与水印策略,把 2024 年底的订阅生成能力升级为更强的多模态产品,并探索信息流式分发。

A行业级
08

Manus 引爆通用智能体热潮

初创公司 Monica(蝴蝶效应)发布 Manus,一个被包装为「自主完成复杂任务」的通用智能体。演示视频显示它能筛选简历、写报告、分析数据,上线即引爆社交媒体与邀请码经济。

A行业级
09

OpenAI 推出 Deep Research

OpenAI 面向 Pro 用户发布 Deep Research,让模型自主多轮搜索、阅读与整合资料,输出带引用的研究报告。它把「研究助理」变成了 AI 的成熟产品形态。

A行业级
10

OpenAI 发布 Operator

OpenAI 推出 Operator,一个能独立操作浏览器完成订餐、填表、购物等任务的通用 Agent。它是「AI 替你干活」从聊天走向行动的代表性产品。

A行业级
11

Luma 发布 Ray2 视频模型

Luma 在 Dream Machine 上线 Ray2,宣称相对前代约 10 倍训练算力,强调快速连贯运动、细节与事件逻辑,面向付费订阅创作者。

B领域级
12

Sora 对 ChatGPT 用户正式开放

OpenAI 将 Sora 向 ChatGPT Plus/Pro 用户开放(先美国等地),把 2024 年 2 月的研究演示推进为可在产品内生成短视频的订阅能力。

A行业级
13

ChatGPT 上线联网搜索

OpenAI 发布 ChatGPT Search,让聊天助手直接联网检索并以实时信息作答,附带来源链接。它把 AI 对话推向搜索场景,直接挑战传统搜索引擎。

A行业级
14

Runway 发布 Gen-3 Alpha

Runway 发布 Gen-3 Alpha,在运动、时序一致性与可控性上相对 Gen-2 明显抬升,巩固其在广告与影视预演工具链中的位置。

B领域级
15

Apple 发布 Apple Intelligence

苹果在 WWDC 公布 Apple Intelligence:端侧 Foundation Models 与私有云协同,把写作、图像、通知摘要与 Siri 升级做成系统级功能,而不是独立聊天 App。

A行业级
16

快手发布可灵 Kling 1.0

快手发布可灵(Kling)1.0 文/图生视频模型,强调大幅运动、镜头语言与较高时序一致性,迅速成为全球视频生成产品对照系之一。

A行业级
17

Google 发布 Veo 视频生成模型

Google 在 I/O 2024 公布 DeepMind 的 Veo 文生视频模型,宣称可生成更高分辨率、更长片段的视频,与 Sora 演示后的全球赛道正式对位。

A行业级
18

生数发布 Vidu 1.0

生数科技发布 Vidu 1.0 文生视频模型与应用,强调动态一致性与角色稳定,成为 Sora 演示之后最早一批可实际试用的中国视频生成产品之一。

B领域级
19

Sora 展示长时文生视频

OpenAI 公布 Sora 研究预览,可根据文字生成最长一分钟、保持较高视觉质量和镜头连贯性的视频。

A行业级
20

Apple Vision Pro 发售

Apple Vision Pro 正式发售,以眼动、手势与语音为交互方式,把计算从平面屏幕带进空间。它首次让「空间计算」成为大众可购买的产品形态,也展示了苹果对 AI 与硬件的融合思路。

B领域级
21

Neuralink 完成首例人体植入

马斯克创办的 Neuralink 宣布完成首例人体大脑植入,患者在术后能用意念控制电脑光标。它是脑机接口领域的标志性事件,也是「AI 与人脑直连」愿景的临床起点。

B领域级
22

百度发布文心大模型 4.0

百度在 2023 百度世界大会上发布文心大模型 4.0,宣称综合能力与 GPT-4 相当,并接入搜索、地图、网盘等全线产品。它被视为国产大模型对标国际旗舰的标志性一役。

B领域级
23

微软把 Copilot 铺满全产品线

微软在 2023 年秋季发布会上宣布统一品牌 Copilot:Bing、Windows、Microsoft 365 全线接入 AI 助手。微软把「AI 作为软件的新交互层」推向亿级用户,确立了生产力软件拥抱大模型的模板。

A行业级
24

Perplexity AI 上线

Perplexity AI 上线,把检索与生成结合成「答案引擎」:直接引用来源给出回答。它开创了对话式 AI 搜索的新范式,与传统的「十条蓝色链接」形成对比。

B领域级
25

ChatGPT 发布

OpenAI 以免费“研究预览”发布基于 GPT-3.5 的 ChatGPT,把经过人工反馈训练的模型放进保留上下文的网页对话界面。它能连续追问、改写文本和解释代码,也会自信地给出错误答案。

S范式级
26

特斯拉发布 Optimus 人形机器人

特斯拉在 AI Day 上首次展示 Optimus 人形机器人原型,宣称将复用造车的电机、电池与 FSD 算法。它把「人形机器人」从实验室概念推向公众视野与产业热度。

B领域级
27

OpenAI 开源 Whisper 语音识别

OpenAI 发布 Whisper:在约 68 万小时多语、多任务监督音频上训练的端到端语音系统,并开源推理代码与模型权重。官方称在多样数据集上零样本表现更稳健,错误约比专项模型少 50%。

A行业级
28

Character.AI 公测

由前谷歌研究员创办的 Character.AI 开放公测,用户可以和虚构人物、历史人物或自建角色对话,开创了「AI 伴侣与角色扮演」这一消费级赛道。

B领域级
29

Stable Diffusion 开放文生图权重

Stability AI 与 CompVis 发布 Stable Diffusion 1.4 的代码和约 4GB 权重。模型在压缩潜空间中去噪,能在消费级 GPU 上生成 512×512 图像,也让本地微调和第三方界面迅速扩散。

S范式级
30

OpenAI 发布 DALL·E

OpenAI 公布约 120 亿参数的 DALL·E:把文本与图像离散 token 编入同一序列,用解码器 Transformer 从文字描述生成图像,并通过受控样例展示组合概念与零样本式生成。

A行业级
31

Waymo One 商业运营启动

Waymo 在凤凰城启动 Waymo One,首次向公众开放付费的自动驾驶出租车服务,把自动驾驶从路测 demo 推进到商业化运营阶段。

B领域级
32

Google Duplex 用 AI 打电话订餐

Google 在 I/O 大会上演示 Duplex:AI 用自然的语气打电话替用户预约理发与餐厅,与真人对话时语气词、停顿都惟妙惟肖。它让「AI 替人打电话」从科幻变成演示,也引发关于透明度的伦理讨论。

B领域级
33

百度开放 Apollo 自动驾驶平台

百度发布 Apollo 自动驾驶开放平台,向全球开发者与车企开放高精地图、感知、规划等模块。它希望用开放生态对抗 Waymo 的封闭路线,成为中国自动驾驶的标志性事件。

A行业级
34

谷歌发布神经机器翻译

谷歌宣布其在线翻译改用神经机器翻译(GNMT),端到端深度模型在质量上大幅超越传统统计方法。它宣告深度学习接管了机器翻译这一重要应用领域。

A行业级
35

YOLO 提出实时目标检测

Redmon 等人提出 YOLO(You Only Look Once),把目标检测变成单次回归问题,一帧图像一次前向推理即可输出所有目标的位置与类别,速度达到实时。它开创了单阶段检测路线,深刻影响自动驾驶、监控与终端视觉。

B领域级
36

特斯拉上线 Autopilot

特斯拉通过 OTA 向 Model S 推送 Autopilot,把车道保持、自适应巡航等辅助驾驶能力带到量产车上。它是「用数据+软件迭代做自动驾驶」路线的标志性起点。

B领域级
37

Amazon Echo 与 Alexa 问世

亚马逊发布 Echo 智能音箱与 Alexa 语音助手,把语音交互带进客厅。它验证了「对话式 AI + 硬件」的产品形态,也让语音助手之战从手机蔓延到家庭。

B领域级
38

Netflix 百万美元推荐大赛

Netflix 宣布悬赏 100 万美元,奖励能把其推荐算法准确率提升 10% 的团队。大赛吸引了全球上千支队伍,最终由多团队融合算法夺冠,也让「机器学习竞赛」成为普及概念。

B领域级
39

Amazon Mechanical Turk 上线

亚马逊上线 Mechanical Turk(MTurk),让企业把人类难以自动化的任务拆成微任务分发给在线工人。它成了 AI 数据标注的基础设施,也把「众包人工」嵌入机器学习流水线,改变了数据生产的方式。

B领域级
40

DARPA 自动驾驶挑战赛

DARPA 在 2004、2005、2007 年举办三届自动驾驶挑战赛。首届无车完赛,第二届 5 辆车跑完全程,2007 年的城市挑战赛则要求车辆在模拟城市中遵守交规。比赛直接催化了现代自动驾驶产业。

B领域级
41

iRobot 发布 Roomba

iRobot 推出 Roomba 扫地机器人,用简单的传感器与随机覆盖策略完成清扫。它没有「智能」光环,却第一次让机器人成为大众消费品,为后来家用机器人与具身智能积累了用户与数据基础。

C补充
42

Mobileye 让视觉走进量产汽车

希伯来大学教授沙舒亚创办 Mobileye,用单目摄像头和专用视觉芯片做量产车的辅助驾驶感知。它把「机器看懂道路」从论文变成前装量产件,成为自动驾驶产业最早也最成功的商业化路线之一。

C补充
43

Google 成立

拉里·佩奇和谢尔盖·布林在车库创立 Google,核心是 PageRank 算法——用链接结构给网页排序。它把搜索变成一场以数据和算法为核心的竞赛,也为日后 Google 的 AI 帝国埋下第一块地基。

B领域级
44

XCON 商业专家系统

卡内基梅隆为 DEC 开发 XCON(原名 R1),用数千条规则自动配置 VAX 计算机订单。它被广泛视为第一个成功的商业专家系统,让 AI 第一次在企业里证明商业价值。

A行业级
45

MYCIN 医疗专家系统

斯坦福大学的 Edward Shortliffe 开发 MYCIN,一个用产生式规则诊断血液感染并推荐抗生素的专家系统。它以不确定性与可解释的推理链为特色,被视为医学 AI 的早期标杆。

B领域级
谱系

相关模型谱系

Runway Gen 视频谱系Gen-3 / 后续
机构

相关机构

Neuralink以高密度电极与机器人手术推进脑机接口,目标从医疗辅助走向人机融合。 Runway以 Gen 系列视频模型与创意工具链推动文/图生视频进入专业制作工作流。

试试搜索