图像生成
从「GAN 提出对抗式生成训练」到「Black Forest Labs 发布 FLUX.1」,先抓住起点、路线转向与当前边界,再展开完整事件线。
Black Forest Labs 发布 FLUX.1
Black Forest Labs 发布 FLUX.1 家族(pro / dev / schnell),在提示遵循与细节上显著抬升开放与 API 文生图上限,并迅速成为社区默认高质量选项之一。
Stability AI 发布 Stable Diffusion 3
Stability AI 发布 Stable Diffusion 3,采用新的多模态扩散变压器架构,在文字渲染与多主体遵循上显著进步。开源图像生成迎来架构换代。
Midjourney 发布 V6
Midjourney V6 在提示遵循与文字渲染上明显进步,使社区默认美学从“氛围滤镜”更接近可执行的设计说明。
Stable Diffusion 开放文生图权重
Stability AI 与 CompVis 发布 Stable Diffusion 1.4 的代码和约 4GB 权重。模型在压缩潜空间中去噪,能在消费级 GPU 上生成 512×512 图像,也让本地微调和第三方界面迅速扩散。
Midjourney 在 Discord 里开启文生图热潮
Midjourney 以 Discord 机器人形式开放公开测试,用户通过文本指令生成风格独特的图像。它凭借社群传播与独特美学快速走红,成为文生图大众化的标志性产品之一。
DALL·E 2 让文生图进入实用阶段
OpenAI 发布 DALL·E 2,用扩散模型把文本描述转成高分辨率图像,支持编辑与变体生成。它让「文生图」从研究演示变成大众可体验的创作工具。
OpenAI 发布 DALL·E
OpenAI 公布约 120 亿参数的 DALL·E:把文本与图像离散 token 编入同一序列,用解码器 Transformer 从文字描述生成图像,并通过受控样例展示组合概念与零样本式生成。
DDPM 让扩散模型成为实用生成路线
Ho、Jain 与 Abbeel 提出 DDPM:训练网络预测逐步加入图像的噪声,再用 1000 步反向过程采样。论文在 CIFAR-10 上报告 3.17 的 FID 和 9.46 的 Inception Score。
GAN 提出对抗式生成训练
Ian Goodfellow 等人提出生成对抗网络,以同一个 minimax 目标训练生成器与判别器。论文在 MNIST、Toronto Face Database 和 CIFAR-10 上展示结果,并指出两部分训练需要保持同步。