多模态 AI

从「GAN 提出对抗式生成训练」到「阿里发布并开源 Qwen3.8-Flash」,先抓住起点、路线转向与当前边界,再展开完整事件线。

01

智谱开源 GLM-5.3-Flash(Ox Alpha)

智谱「认领」此前以匿名身份 Ox Alpha(中文社区称「牛来」)上线的模型为 GLM-5.3-Flash:320B-A18B,GLM-5 系列首个原生多模态模型,以 MIT 协议开源;其训练使用数十万亿词元、由约 10 万张国产芯片支撑,匿名盲测期间曾登顶 OpenRouter 并终结 DeepSeek 连续 56 天霸榜。

A行业级
02

阿里发布并开源 Qwen3.8-Flash

阿里发布并开源 Qwen3.8-Flash:总参 125B、单 token 激活 6B 的多模态 MoE,采用全新「Next」架构(QSA 稀疏注意力 + Gated DeltaNet 混合注意力),训练成本较 Qwen3.7-Plus 下降约 90%,推理定价每百万输入 1 元、输出 3 元;被视为 Qwen4 的雏形,首发上线「千问办公」。

A行业级
03

字节发布 SeedRealtime 音视频全双工模型

字节跳动发布 SeedRealtime:原生音视频全双工大模型,统一端到端架构融合音频、视频与文本,豆包 App 全量上线视频通话;官方称相比级联模型,节奏问题减少约 50%。

A行业级
04

Google 发布 Gemini Robotics 2

Google DeepMind 发布 Gemini Robotics 2:VLA 模型 + ER 2 具身推理 + On-Device 2 端侧模型,在 Apptronik Apollo 2 人形机器人上演示,并推出 ASIMOV-Agentic 安全基准。

A行业级
05

阿里发布 Qwen3.8 与 Qwen3.8-Max

阿里云发布 Qwen3.8 与 Qwen3.8-Max:总参数 2.4T、每 token 激活约 950B 的稀疏 MoE 架构,原生多模态视觉与 1M 上下文,CodeArena 全球第四;官方宣布下周开源 Max 权重与 Qwen3.8-27B,并同步推出 Agent 产品「千问办公」。

A行业级
06

Gemini 3.6 Flash 发布,旗舰 3.5 Pro 继续缺席

Google DeepMind 发布 Gemini 3.6 Flash,以及 3.5 Flash-Lite 与面向政府试点的 3.5 Flash Cyber;3.6 Flash 把输出定价下调并保持 1M 上下文,官方同时确认旗舰 3.5 Pro 仍在测试、Gemini 4 预训练已经启动。

B领域级
07

Kimi K3 发布并开源

月之暗面发布 Kimi K3,总参数 2.8 万亿、每 token 激活约 1040 亿的 MoE 架构模型,原生支持视觉与百万级上下文;7 月 27 日权重开放,成为当时全球参数最大的开源模型,并在 WebDev Arena 上首次由开源模型登顶。

A行业级
08

Seedance 2.5 冲击 30 秒连续生成

火山引擎 Force 后,Seedance 2.5 进入公开上线窗口,宣称单次扩散生成最长约 30 秒连续片段、减少分段拼接,把视频生成竞争轴从画质推进到原生时长。

B领域级
09

Google 发布 Gemini 3 Pro

谷歌发布 Gemini 3 Pro,在推理、多模态与长上下文上全面对标并部分反超 OpenAI 的 GPT-5 系列。它让谷歌在旗舰竞争里重回前排,也标志着 2025 年底「推理旗舰」之争进入白热化。

A行业级
10

OpenAI 发布 Sora 2

OpenAI 发布 Sora 2 旗舰视频与音频生成模型,同步 iOS 应用与水印策略,把 2024 年底的订阅生成能力升级为更强的多模态产品,并探索信息流式分发。

A行业级
11

字节跳动发布 Seedance 1.0

火山引擎 Force 大会发布 Seedance 1.0 与 Pro 等视频生成基座,支持文/图输入与多镜头叙事,并接入豆包等内容入口,把字节的视频生成能力推到公开产品前台。

A行业级
12

Google 发布 Veo 3 原生音频视频

Google 在 I/O 2025 周期发布 Veo 3,强调原生同步音频(对白、音效、环境声)与更强可控性,并逐步接入 Gemini 应用与 API。

A行业级
13

Llama 4 发布

Meta 发布 Llama 4 Scout 与 Maverick,采用混合专家架构并原生支持多模态,把开放权重模型推向超长上下文和更高计算效率。

B领域级
14

Gemini 2.5 引入思维过程

谷歌发布 Gemini 2.5,以「思考模型」为核心:模型在回答前进行内部推理,强调编码、数学与长任务能力。Gemini 2.5 让谷歌在推理模型竞赛中重新回到第一梯队。

A行业级
15

百度发布文心 4.5 与 X1

百度同日上线文心 4.5(原生多模态)与文心 X1(深度思考),并在文心一言免费开放,随后承诺开源 4.5 系列,把搜索大厂重新拉回模型军备第一排。

A行业级
16

Luma 发布 Ray2 视频模型

Luma 在 Dream Machine 上线 Ray2,宣称相对前代约 10 倍训练算力,强调快速连贯运动、细节与事件逻辑,面向付费订阅创作者。

B领域级
17

Google 发布 Gemini 2.0

Google 发布 Gemini 2.0 Flash,主打原生多模态与 Agentic 能力,并演示 Project Mariner 等浏览器代理。它把 Google 的战略重心从对话模型转向「能替你干活」的智能体。

A行业级
18

Sora 对 ChatGPT 用户正式开放

OpenAI 将 Sora 向 ChatGPT Plus/Pro 用户开放(先美国等地),把 2024 年 2 月的研究演示推进为可在产品内生成短视频的订阅能力。

A行业级
19

亚马逊发布 Nova 模型家族

亚马逊在 re:Invent 发布 Nova 系列基础模型,覆盖文本、多模态与视频生成,通过 Bedrock 提供给企业。Nova 让亚马逊补上自研大模型拼图,与 Anthropic 合作并行推进。

B领域级
20

腾讯开源混元视频模型

腾讯开源 HunyuanVideo 等视频生成基础模型,以较大参数规模进入开源视频权重第一梯队,并在 Hugging Face 等平台获得高下载量。

A行业级
21

Claude Computer Use 公测:模型操作图形界面

Anthropic 在 2024 年 10 月 22 日将 computer use 以公测形式接入 API:模型根据屏幕截图决定移动光标、点击与键入等动作,在实验性条件下用人类方式操作计算机。

A行业级
22

Black Forest Labs 发布 FLUX.1

Black Forest Labs 发布 FLUX.1 家族(pro / dev / schnell),在提示遵循与细节上显著抬升开放与 API 文生图上限,并迅速成为社区默认高质量选项之一。

A行业级
23

Runway 发布 Gen-3 Alpha

Runway 发布 Gen-3 Alpha,在运动、时序一致性与可控性上相对 Gen-2 明显抬升,巩固其在广告与影视预演工具链中的位置。

B领域级
24

Apple 发布 Apple Intelligence

苹果在 WWDC 公布 Apple Intelligence:端侧 Foundation Models 与私有云协同,把写作、图像、通知摘要与 Siri 升级做成系统级功能,而不是独立聊天 App。

A行业级
25

快手发布可灵 Kling 1.0

快手发布可灵(Kling)1.0 文/图生视频模型,强调大幅运动、镜头语言与较高时序一致性,迅速成为全球视频生成产品对照系之一。

A行业级
26

昆仑万维推进天工 / Skywork 大模型

昆仑万维以天工产品与 Skywork 模型系列推进搜索增强对话、多模态与后续开放权重,成为中国互联网第二梯队中坚持全栈模型品牌的代表之一。

B领域级
27

Google 发布 Veo 视频生成模型

Google 在 I/O 2024 公布 DeepMind 的 Veo 文生视频模型,宣称可生成更高分辨率、更长片段的视频,与 Sora 演示后的全球赛道正式对位。

A行业级
28

GPT-4o 发布

OpenAI 发布 GPT-4o,以同一神经网络处理文本、视觉与音频,让实时语音和视觉交互第一次成为通用模型的原生能力。

A行业级
29

生数发布 Vidu 1.0

生数科技发布 Vidu 1.0 文生视频模型与应用,强调动态一致性与角色稳定,成为 Sora 演示之后最早一批可实际试用的中国视频生成产品之一。

B领域级
30

商汤发布日日新 SenseNova 5.0

商汤在技术日发布 SenseNova 5.0,强调知识、数学、推理与代码,并推出云到端全栈产品矩阵,把 CV 起家的公司更明确地绑在通用大模型战线上。

B领域级
31

Google 发布 Gemini 1.5

Google 发布 Gemini 1.5 Pro,首次将上下文窗口推向 100 万 token,可在一次推理中处理数小时视频、整本书籍与超长代码库。它把「长上下文」从演示变成可用的产品能力。

A行业级
32

Sora 展示长时文生视频

OpenAI 公布 Sora 研究预览,可根据文字生成最长一分钟、保持较高视觉质量和镜头连贯性的视频。

A行业级
33

面壁开源 MiniCPM 端侧模型

面壁智能与 OpenBMB 开源 MiniCPM 系列,以小参数中文友好基座强调端侧可部署;随后 MiniCPM-V 把多模态也压进边缘设备叙事。

B领域级
34

Midjourney 发布 V6

Midjourney V6 在提示遵循与文字渲染上明显进步,使社区默认美学从“氛围滤镜”更接近可执行的设计说明。

B领域级
35

Google 发布 Gemini 1.0

Google DeepMind 发布 Gemini 1.0,以 Ultra、Pro、Nano 三个规模覆盖数据中心、通用产品和端侧设备。发布当日 Bard 接入 Pro,Nano 登上 Pixel 8 Pro;Ultra 则等到 2024 年才面向用户开放。

A行业级
36

阶跃星辰发布 Step 系列

阶跃星辰由姜大昕创立,发布 Step 系列大模型,主打万亿参数与多模态能力,成为「大模型六小龙」中的代表之一,其 Step 系列持续迭代并开源部分版本。

B领域级
37

xAI 发布 Grok

埃隆·马斯克创立的 xAI 发布 Grok-1 及配套产品,主打「实时接入 X(推特)」与少约束的幽默风格,向 ChatGPT 发起差异化竞争。

B领域级
38

MiniMax 发布大模型与海螺 AI

MiniMax 发布自研大模型并推出 AI 对话应用海螺 AI,主打多模态与效率。2025 年其 MiniMax-01 系列以新型 MoE 架构与 400 万上下文引发关注,成为国产模型的技术派代表。

B领域级
39

GPT-4 发布

OpenAI 发布 GPT-4,并报告其在模拟律师资格考试中达到约前 10%,而 GPT-3.5 约在后 10%。图像输入最初仅限合作方测试;技术报告未披露参数量、训练数据构成、架构或训练算力。

A行业级
40

OpenAI 开源 Whisper 语音识别

OpenAI 发布 Whisper:在约 68 万小时多语、多任务监督音频上训练的端到端语音系统,并开源推理代码与模型权重。官方称在多样数据集上零样本表现更稳健,错误约比专项模型少 50%。

A行业级
41

Stable Diffusion 开放文生图权重

Stability AI 与 CompVis 发布 Stable Diffusion 1.4 的代码和约 4GB 权重。模型在压缩潜空间中去噪,能在消费级 GPU 上生成 512×512 图像,也让本地微调和第三方界面迅速扩散。

S范式级
42

DeepMind 发布 Gato 通才智能体

DeepMind 发布 Gato,一个用单一 Transformer 权重同时完成 604 项任务的多模态智能体,从电子游戏、机械臂控制到对话与图像描述。它被视为「通才智能体」路线的标志性实验。

B领域级
43

DALL·E 2 让文生图进入实用阶段

OpenAI 发布 DALL·E 2,用扩散模型把文本描述转成高分辨率图像,支持编辑与变体生成。它让「文生图」从研究演示变成大众可体验的创作工具。

A行业级
44

CLIP 用自然语言监督连接图文

OpenAI 发布 CLIP:在大规模图文对上对比训练图像编码器与文本编码器,使模型可用自然语言描述做零样本图像分类,并开放代码与权重示例。

A行业级
45

OpenAI 发布 DALL·E

OpenAI 公布约 120 亿参数的 DALL·E:把文本与图像离散 token 编入同一序列,用解码器 Transformer 从文字描述生成图像,并通过受控样例展示组合概念与零样本式生成。

A行业级
46

DDPM 让扩散模型成为实用生成路线

Ho、Jain 与 Abbeel 提出 DDPM:训练网络预测逐步加入图像的噪声,再用 1000 步反向过程采样。论文在 CIFAR-10 上报告 3.17 的 FID 和 9.46 的 Inception Score。

A行业级
47

GAN 提出对抗式生成训练

Ian Goodfellow 等人提出生成对抗网络,以同一个 minimax 目标训练生成器与判别器。论文在 MNIST、Toronto Face Database 和 CIFAR-10 上展示结果,并指出两部分训练需要保持同步。

A行业级
谱系

相关模型谱系

Qwen(通义千问)模型谱系Qwen3.8-Flash / Qwen3.8-Max Amazon Nova 模型谱系Nova Premier / 最新档 Apple Intelligence / 端侧模型谱系Apple Intelligence 文心 ERNIE 模型谱系文心 5.x Flux 模型谱系Flux 1.1 / Pro 豆包 / Seed 模型谱系SeedRealtime · Seedance 2.5 / Seed2.1 Gemini 模型谱系Gemini 3.7 Flash Gemma 模型谱系Gemma 3 讯飞星火模型谱系星火 X1 / 高阶版本 快手可灵 Kling 谱系Kling 2.x 天工 Skywork 谱系Skywork / SkyReels Luma Dream Machine 谱系Ray2 / Dream Machine Llama 模型谱系Llama 4 Scout / Maverick Midjourney 模型谱系V7 / 最新 MiniMax 模型谱系MiniMax-M3 面壁 MiniCPM 谱系MiniCPM 最新代 OpenAI 模型谱系GPT-5.6(Sol / Terra / Luna)· GPT-Live Runway Gen 视频谱系Gen-3 / 后续 商汤日日新 SenseNova 谱系SenseNova 最新代 Stable Diffusion 谱系Stable Diffusion 3 / 后续 阶跃星辰 Step 模型谱系Step 系列最新旗舰 混元 / Hy 模型谱系Hy4 preview Vidu 视频谱系Vidu 2.x Grok 模型谱系Grok 4.6
机构

相关机构

阿里巴巴 / Alibaba通过通义千问(Qwen)家族把中文与多语言开放模型做成持续迭代的云与开发者生态。 Amazon / AWS以 Amazon Nova 自研模型与 Bedrock 多厂商托管平台服务企业生成式 AI。 Apple以 Apple Intelligence 与端侧 Foundation Models 把生成式 AI 写入操作系统,强调隐私与设备侧推理。 百度 / Baidu以文心(ERNIE)知识增强预训练与文心一言产品为核心,覆盖搜索、云与行业大模型。 Black Forest LabsStable Diffusion 核心作者团队创立,以 Flux 系列重新定义开放与 API 文生图质量。 字节跳动 / ByteDance以豆包大模型与 Seed 研究品牌覆盖通用、推理、语音与视频生成,并通过火山引擎与 C 端豆包形成双轮交付。 Google以 Gemini 与 Gemma 覆盖闭源旗舰与开放轻量,并把模型嵌入搜索与云。 科大讯飞 / iFlytek以语音技术起家,星火大模型面向教育、办公与政企,强调中文与行业落地。 快手 / Kuaishou以可灵(Kling)视频生成模型进入全球文生视频竞争,依托短视频内容生态。 昆仑万维 / Kunlun以天工 Skywork 大模型覆盖搜索、对话与多模态,并布局海外产品矩阵。 Luma AI以 Dream Machine 视频模型与 3D 捕获技术连接生成媒体与空间计算。 Meta以 Llama 开放权重推动全球开源生态,覆盖研究、企业与端侧。 Midjourney以 Discord 社区驱动的文生图产品定义消费级生成美学与迭代节奏。 MiniMax以 abab / M 系列语言模型与海螺视频等多媒体生成见长,强调小激活参数下的强 Agent 与编码能力。 面壁智能 / ModelBest以 MiniCPM 端侧与 CP 系列开放模型强调小而强与设备侧部署。 OpenAI大语言模型、AI 产品化和 Agent 方向的核心推动者。 Runway以 Gen 系列视频模型与创意工具链推动文/图生视频进入专业制作工作流。 商汤 / SenseTime计算机视觉起家的中国 AI 公司,以日日新 SenseNova 大模型覆盖多模态与行业。 Stability AI以 Stable Diffusion 开放文生图权重点燃本地生成生态,并延伸到视频与 3D。 阶跃星辰 / StepFun以 Step 系列多模态与推理模型见长的中国创业公司,覆盖图像、视频与长上下文。 腾讯 / Tencent以混元(Hunyuan/Hy)大模型服务微信、元宝与云生态,并在视频、3D 与开源侧扩张。 生数科技 / Shengshu以 Vidu 视频大模型进入全球文生视频赛道,强调动态一致性与中文场景。 xAI埃隆·马斯克创立,以 Grok 模型与 X 平台实时信息结合,强调推理、工具与少审查风格。

试试搜索