DeepSeek 模型谱系

从代码模型与稠密 LLM 起步,经 MoE、MLA、稀疏注意力到开放推理与超长上下文,DeepSeek 把训练/推理效率写成持续主线。

21 代

历代模型

21

DeepSeek-V4-Pro 正式版(V4-Pro-0813)

Pro 预览转正:1.6T 总参 MoE、1M 上下文、最大输出 38.4 万 token,首次原生支持图像推理;DeepSWE 12.8→62.7 超过 Opus 4.8,V4 系列全部 GA;同日开源 Agent 框架 DeepSeek Harness v0.1。

current
20

DeepSeek-V4-Flash 正式版(V4-Flash-0731)

Flash 预览转正:思考/非思考双模式、1M 上下文、Agent 能力增强与推测解码;8 月 6 日公告整体上调 API 定价,低价策略进入转折期。

legacy
19

DeepSeek-V4 Pro / Flash

开放 1M 上下文预览:Pro(约 1.6T 总参)主打高难度推理与 Agent 编程,Flash(约 284B)以更小激活提供接近能力与更高效率。

legacy
18

DeepSeek-V3.2

稀疏注意力与推理效率正式版,并附 Speciale 等强化推理变体。

legacy
17

DeepSeek-Math-V2

基于 V3.2-Exp 骨干的数学增强,延续自验证与可验证奖励训练思路。

legacy
16

DeepSeek-V3.2-Exp

引入 DeepSeek Sparse Attention,为更长上下文与更低注意力成本做实验性落地。

legacy
15

DeepSeek-V3.1-Terminus

修复中英混杂与异常字符等问题,提升生产可用性。

legacy
14

DeepSeek-V3.1

同一模型整合思考/非思考模式,并显著强化工具使用与 Agent 编程相关基准。

legacy
13

DeepSeek-R1-0528

R1 增量更新,在多项基准上超过初代 R1 与 V3-0324。

legacy
12

DeepSeek-Prover-V2

形式化证明专用系列,把可验证数学推向独立模型线。

legacy
11

DeepSeek-V3-0324

V3 后训练升级(MIT),强化推理、代码与工具使用,并吸收 R1 阶段经验。

legacy
10

DeepSeek-R1

以强化学习驱动长链条推理并开放权重(含蒸馏小模型),重新定价推理模型能力与获取门槛。

legacy
09

DeepSeek-V3

671B MoE(约 37B 激活),低精度训练与高数据效率展示开放前沿模型的成本优势。

legacy
08

DeepSeek-VL2

视觉—语言系列,把多模态理解并入 DeepSeek 效率架构路线。

legacy
07

DeepSeek-V2.5

合并通用对话与代码能力,单一 chat 端点覆盖开发者日常工作流。

legacy
06

DeepSeek-Coder-V2

基于 V2 MoE 骨干的代码系列,覆盖更多编程语言与更长上下文,面向仓库级开发。

legacy
05

DeepSeek-V2

MLA(多头潜在注意力)+ MoE,大幅降低 KV 缓存与训练/推理成本,并扩展长上下文。

legacy
04

DeepSeek-Math

在 Coder 基座上强化数学;配套 GRPO 等强化学习算法,为后续推理训练埋线。

legacy
03

DeepSeek-MoE

引入共享专家 + 路由专家的 MoE 变体,以约 2.7B 激活逼近更大稠密模型表现。

legacy
02

DeepSeek-LLM

7B/67B 中英通用模型(Base/Chat),架构接近 Llama 路线,补齐通用对话与知识能力。

legacy
01

DeepSeek Coder

首个公开模型系列(约 1.3B–33B Base/Instruct),以代码预训练为主,奠定「先做开发者工具」的路径。

legacy

试试搜索