图像生成

从「GAN 提出对抗式生成训练」到「Black Forest Labs 发布 FLUX.1」,先抓住起点、路线转向与当前边界,再展开完整事件线。

01

Black Forest Labs 发布 FLUX.1

Black Forest Labs 发布 FLUX.1 家族(pro / dev / schnell),在提示遵循与细节上显著抬升开放与 API 文生图上限,并迅速成为社区默认高质量选项之一。

A行业级
02

Stability AI 发布 Stable Diffusion 3

Stability AI 发布 Stable Diffusion 3,采用新的多模态扩散变压器架构,在文字渲染与多主体遵循上显著进步。开源图像生成迎来架构换代。

B领域级
03

Midjourney 发布 V6

Midjourney V6 在提示遵循与文字渲染上明显进步,使社区默认美学从“氛围滤镜”更接近可执行的设计说明。

B领域级
04

Stable Diffusion 开放文生图权重

Stability AI 与 CompVis 发布 Stable Diffusion 1.4 的代码和约 4GB 权重。模型在压缩潜空间中去噪,能在消费级 GPU 上生成 512×512 图像,也让本地微调和第三方界面迅速扩散。

S范式级
05

Midjourney 在 Discord 里开启文生图热潮

Midjourney 以 Discord 机器人形式开放公开测试,用户通过文本指令生成风格独特的图像。它凭借社群传播与独特美学快速走红,成为文生图大众化的标志性产品之一。

A行业级
06

DALL·E 2 让文生图进入实用阶段

OpenAI 发布 DALL·E 2,用扩散模型把文本描述转成高分辨率图像,支持编辑与变体生成。它让「文生图」从研究演示变成大众可体验的创作工具。

A行业级
07

OpenAI 发布 DALL·E

OpenAI 公布约 120 亿参数的 DALL·E:把文本与图像离散 token 编入同一序列,用解码器 Transformer 从文字描述生成图像,并通过受控样例展示组合概念与零样本式生成。

A行业级
08

DDPM 让扩散模型成为实用生成路线

Ho、Jain 与 Abbeel 提出 DDPM:训练网络预测逐步加入图像的噪声,再用 1000 步反向过程采样。论文在 CIFAR-10 上报告 3.17 的 FID 和 9.46 的 Inception Score。

A行业级
09

GAN 提出对抗式生成训练

Ian Goodfellow 等人提出生成对抗网络,以同一个 minimax 目标训练生成器与判别器。论文在 MNIST、Toronto Face Database 和 CIFAR-10 上展示结果,并指出两部分训练需要保持同步。

A行业级
谱系

相关模型谱系

Qwen(通义千问)模型谱系Qwen3.8-Flash / Qwen3.8-Max Flux 模型谱系Flux 1.1 / Pro Gemini 模型谱系Gemini 3.7 Flash Gemma 模型谱系Gemma 3 Midjourney 模型谱系V7 / 最新 OpenAI 模型谱系GPT-5.6(Sol / Terra / Luna)· GPT-Live Stable Diffusion 谱系Stable Diffusion 3 / 后续 混元 / Hy 模型谱系Hy4 preview Grok 模型谱系Grok 4.6
机构

相关机构

阿里巴巴 / Alibaba通过通义千问(Qwen)家族把中文与多语言开放模型做成持续迭代的云与开发者生态。 Black Forest LabsStable Diffusion 核心作者团队创立,以 Flux 系列重新定义开放与 API 文生图质量。 Google以 Gemini 与 Gemma 覆盖闭源旗舰与开放轻量,并把模型嵌入搜索与云。 Midjourney以 Discord 社区驱动的文生图产品定义消费级生成美学与迭代节奏。 OpenAI大语言模型、AI 产品化和 Agent 方向的核心推动者。 Stability AI以 Stable Diffusion 开放文生图权重点燃本地生成生态,并延伸到视频与 3D。 腾讯 / Tencent以混元(Hunyuan/Hy)大模型服务微信、元宝与云生态,并在视频、3D 与开源侧扩张。 xAI埃隆·马斯克创立,以 Grok 模型与 X 平台实时信息结合,强调推理、工具与少审查风格。

试试搜索