推理模型

从「xAI 发布 Grok-2」到「智谱发布 GLM-5.3」,先抓住起点、路线转向与当前边界,再展开完整事件线。

01

智谱发布 GLM-5.3

智谱发布 GLM-5.3:基座与 GLM-5.2 相同,通过极致的后训练 Scaling(强化学习)大幅提升智能上界,编程能力较前代提升约 50%,主打智能体编程与防御性网络安全;官方承诺安全评估完成后两周内开源权重。

A行业级
02

DeepSeek-V4 Pro 正式版发布

DeepSeek 将 V4 Pro 更新为 0813 正式版:1.6T 总参 MoE、1M 上下文、最大输出 38.4 万 token,首次原生支持图像推理;DeepSWE 从预览版 12.8 升至 62.7,超过 Claude Opus 4.8,部分智能体基准逼近甚至反超 Claude Fable 5。同日发布开源 Agent 开发框架 DeepSeek Harness v0.1。

A行业级
03

xAI 发布 Grok 4.6

xAI 发布 Grok 4.6:总参数约 1.5T 的 MoE 旗舰,重点强化长时间运行的智能体任务、复杂交互与视觉工作,在 Artificial Analysis 综合智能指数上与 GPT-5.6 Sol 持平(61 分),API 定价明显低于竞品,同步上线 Cursor 与 Grok Build。

A行业级
04

GPT-5.6 Luna 向免费用户开放

OpenAI 宣布免费与 Go 用户默认模型切换为 GPT-5.6 Luna,下周起无限次文本聊天,并新增 Think 按钮让免费档首次可主动调用更高推理;Plus/Pro 的 GPT-5.6 Sol 同步升级,事实错误率较 GPT-5.5 Instant 降约 68%。

A行业级
05

智谱公开 GLM-5 预告

智谱的 ZCode 页面意外曝光了 GLM-5 的预告信息,暗示下一代旗舰将在编程与 Agent 能力上发力。GLM 系列从 GLM-4.5 到 GLM-5 的迭代节奏,是中国大模型竞争加速的缩影。

B领域级
06

Claude Opus 5 发布

Anthropic 发布 Claude Opus 5,定位接近旗舰前沿智能、定价与 Opus 4.8 持平,成为 Claude Max 的新默认模型与 Claude Pro 的最强选项,并随发布带来对话中途工具切换、API 安全回退等工程化机制。

A行业级
07

GPT-5.6 发布

OpenAI 发布 GPT-5.6,以 Sol、Terra、Luna 三档覆盖旗舰能力、成本平衡与高吞吐,并加入程序化工具调用、多 Agent 编排、显式缓存和持久推理。

B领域级
08

Claude 5 家族成形

Anthropic 在六月先后推出 Claude Fable 5 与 Sonnet 5:前者面向长时间运行的高难度 Agent,后者强调速度与智能的综合平衡。

B领域级
09

Gemini 3.5 Flash 发布

Google 发布 Gemini 3.5 Flash 正式版,把持续高强度 Agent 与代码任务定位为 Flash 主力场景,并将其设为 gemini-flash-latest 的默认模型。

B领域级
10

DeepSeek-V4 预览版发布

DeepSeek 开源 V4 Pro 与 Flash 预览版,把 1M 上下文、思考模式和 Agent 编程能力放进同一家族,并继续强调稀疏架构的成本效率。

B领域级
11

Anthropic 发布 Claude Opus 4.5

Anthropic 发布 Claude Opus 4.5,在深度推理、长任务执行与代码能力上进一步压榨上限,被视为与 GPT-5 系列、Gemini 3 并列的旗舰之一。

A行业级
12

Google 发布 Gemini 3 Pro

谷歌发布 Gemini 3 Pro,在推理、多模态与长上下文上全面对标并部分反超 OpenAI 的 GPT-5 系列。它让谷歌在旗舰竞争里重回前排,也标志着 2025 年底「推理旗舰」之争进入白热化。

A行业级
13

OpenAI 发布 GPT-5.1

OpenAI 发布 GPT-5.1,作为 GPT-5 系列的稳定升级,重点优化推理速度、API 成本与工具调用稳定性。它是「旗舰模型按季迭代」节奏里的关键一环。

A行业级
14

Anthropic 发布 Claude Sonnet 4.5

Anthropic 发布 Claude Sonnet 4.5,在代码与 Agent 能力上比肩甚至超过更大尺寸的旗舰,同时保持更低成本。它把「尺寸不是一切」的竞争逻辑推向极致。

A行业级
15

GPT-5 发布

OpenAI 发布 GPT-5。ChatGPT 以路由系统在快速模型与深度推理模型之间选择;API 则提供 GPT-5、mini 和 nano 三档独立模型及可配置的推理强度,而不是照搬 ChatGPT 路由。

A行业级
16

月之暗面开源 Kimi K2

月之暗面发布 Kimi K2,约 1T 总参数、32B 激活的开放 MoE,编码与 Agent 基准表现突出,把 Kimi 从长上下文聊天产品扩展为全球可下载的旗舰权重。

A行业级
17

xAI 发布 Grok 4

xAI 发布 Grok 4,首次把旗舰能力拉到推理模型的头部阵营,与 GPT、Claude、Gemini 正面竞争。它让 xAI 从「马斯克的另类项目」变成真正的第三极竞争者。

A行业级
18

阿里发布 Qwen3 系列

阿里发布 Qwen3 系列,从 0.6B 到旗舰 235B(MoE)全面开源,原生支持思考/非思考双模式。Qwen3-235B 在多项评测中成为最强开源模型之一,改写开源与闭源的实力版图。

A行业级
19

OpenAI 发布 o3 与 o4-mini

OpenAI 发布 o3 与 o4-mini,首次让推理模型在 ChatGPT 内自主调用搜索、代码执行、图像等全套工具。它把「推理」与「行动」首次系统性地结合到旗舰模型里。

A行业级
20

Gemini 2.5 引入思维过程

谷歌发布 Gemini 2.5,以「思考模型」为核心:模型在回答前进行内部推理,强调编码、数学与长任务能力。Gemini 2.5 让谷歌在推理模型竞赛中重新回到第一梯队。

A行业级
21

百度发布文心 4.5 与 X1

百度同日上线文心 4.5(原生多模态)与文心 X1(深度思考),并在文心一言免费开放,随后承诺开源 4.5 系列,把搜索大厂重新拉回模型军备第一排。

A行业级
22

Anthropic 发布 Claude 3.7 Sonnet

Anthropic 发布 Claude 3.7 Sonnet,首创「混合推理」模式:同一模型既可在标准模式下快速回答,也可在扩展思维模式下长时间推理。它让推理能力从「特殊模型」变成「默认开关」。

A行业级
23

xAI 发布 Grok 3

xAI 发布 Grok 3,宣称由 Colossus 超算(约 10 万张 GPU)训练,主打推理与数学能力,在发布前后声称某些基准领先。它把 xAI 从追赶者带进前沿竞争的核心圈。

A行业级
24

DeepSeek-R1 发布

DeepSeek 发布开放推理模型 DeepSeek-R1,以强化学习驱动的推理能力和开放权重迅速引发全球关注。

A行业级
25

月之暗面发布 Kimi K1.5

月之暗面发布 Kimi K1.5,用强化学习训练出具备长上下文推理能力的模型,多项基准对齐或超越当时的国际头部推理模型,成为国产推理模型的代表作品。

A行业级
26

OpenAI o1 发布

OpenAI 发布 o1-preview,把更多计算放到回答前的推理过程,在数学、科学和编程任务上显著提高复杂问题求解能力。

A行业级
27

xAI 发布 Grok-2

xAI 发布 Grok-2,支持图像理解与生成,能力进入全球第一梯队。马斯克的「叛逆」人设与 X 平台数据形成独特打法,也引发关于 AI 约束与安全的持续讨论。

B领域级
谱系

相关模型谱系

Qwen(通义千问)模型谱系Qwen3.8-Flash / Qwen3.8-Max Claude 模型谱系Claude Fable 5 / Opus 5 / Sonnet 5 文心 ERNIE 模型谱系文心 5.x DeepSeek 模型谱系DeepSeek-V4-Pro(0813 正式版)· V4-Flash(正式版) Gemini 模型谱系Gemini 3.7 Flash Gemma 模型谱系Gemma 3 MiniMax 模型谱系MiniMax-M3 Kimi 模型谱系Kimi K3 OpenAI 模型谱系GPT-5.6(Sol / Terra / Luna)· GPT-Live Grok 模型谱系Grok 4.6 智谱 GLM 模型谱系GLM-5.3 / GLM-5.3-Flash
机构

相关机构

阿里巴巴 / Alibaba通过通义千问(Qwen)家族把中文与多语言开放模型做成持续迭代的云与开发者生态。 Anthropic以 AI 安全为核心、以长上下文和可靠 Agent 为产品特色的大模型公司。 百度 / Baidu以文心(ERNIE)知识增强预训练与文心一言产品为核心,覆盖搜索、云与行业大模型。 DeepSeek(深度求索)以高效训练和开源策略著称的中国大模型公司,以低成本实现前沿性能。 Google以 Gemini 与 Gemma 覆盖闭源旗舰与开放轻量,并把模型嵌入搜索与云。 MiniMax以 abab / M 系列语言模型与海螺视频等多媒体生成见长,强调小激活参数下的强 Agent 与编码能力。 月之暗面 / Moonshot AI以超长上下文与 Kimi 产品闻名的中国大模型公司,后以 K2 开放 MoE 进入全球编码与 Agent 竞争。 OpenAI大语言模型、AI 产品化和 Agent 方向的核心推动者。 xAI埃隆·马斯克创立,以 Grok 模型与 X 平台实时信息结合,强调推理、工具与少审查风格。 智谱 AI / Zhipu以 GLM 架构与 ChatGLM 开源生态起家,提供基座模型、多模态与 Agent 产品的国产大模型公司。

试试搜索