模型效率
从「神经语言模型缩放规律被量化」到「腾讯混元发布并开源 Hy4 preview」,先抓住起点、路线转向与当前边界,再展开完整事件线。
腾讯混元发布并开源 Hy4 preview
腾讯混元发布并开源 Hy4 preview:770B 总参、49B 激活的 MoE,上下文突破 1M,Apache 2.0 协议;定位「为生产力而生」,聚焦软件工程、办公分析、游戏开发与科学研究,在 WorkBuddy/CodeBuddy、元宝、ima 等产品同步首发,并首次参与自身研发全链路形成「初步的递归自我改进闭环」。
智谱开源 GLM-5.3-Flash(Ox Alpha)
智谱「认领」此前以匿名身份 Ox Alpha(中文社区称「牛来」)上线的模型为 GLM-5.3-Flash:320B-A18B,GLM-5 系列首个原生多模态模型,以 MIT 协议开源;其训练使用数十万亿词元、由约 10 万张国产芯片支撑,匿名盲测期间曾登顶 OpenRouter 并终结 DeepSeek 连续 56 天霸榜。
阿里发布并开源 Qwen3.8-Flash
阿里发布并开源 Qwen3.8-Flash:总参 125B、单 token 激活 6B 的多模态 MoE,采用全新「Next」架构(QSA 稀疏注意力 + Gated DeltaNet 混合注意力),训练成本较 Qwen3.7-Plus 下降约 90%,推理定价每百万输入 1 元、输出 3 元;被视为 Qwen4 的雏形,首发上线「千问办公」。
OpenAI 自研推理芯片 Jalapeño 公布测试成绩
OpenAI 在 Hot Chips 大会公布自研推理芯片 Jalapeño 的测试成绩:峰值吞吐下每瓦性能为参照系统(英伟达 GB200/GB300)的 1.5~1.9 倍,交互式工作负载优势达 2.1~4.1 倍;芯片由 OpenAI 与博通联合开发,2026 年底前开始在自有基础设施部署,与英伟达并行采购而非替代。
Google 发布 Gemini 3.7 Flash
Google 发布 Gemini 3.7 Flash:距 3.6 Flash 仅三周,官方称其为「编程与智能体场景下最智能的主力模型」,DeepSWE 从 49.0% 升至 65.3%、WebDev Arena Elo 1588;限时五折定价(输入 0.75 美元/百万 token),并同步接入 Gemini Spark 与 Enterprise Agent Platform。
xAI 发布 Grok 4.6
xAI 发布 Grok 4.6:总参数约 1.5T 的 MoE 旗舰,重点强化长时间运行的智能体任务、复杂交互与视觉工作,在 Artificial Analysis 综合智能指数上与 GPT-5.6 Sol 持平(61 分),API 定价明显低于竞品,同步上线 Cursor 与 Grok Build。
Meta 发布并开源 Muse Glimmer
Meta 超级智能实验室发布 Muse Glimmer:约 30B 参数的稠密多模态智能体模型,由闭源基座 Muse Spark 逻辑蒸馏而来,Apache 2.0 开源,可在 24GB 显存消费级 GPU 或 M4/M5 Max MacBook 上完全本地运行;扎克伯格同日发文宣布 Meta 重返开源。
阿里发布 Qwen3.8 与 Qwen3.8-Max
阿里云发布 Qwen3.8 与 Qwen3.8-Max:总参数 2.4T、每 token 激活约 950B 的稀疏 MoE 架构,原生多模态视觉与 1M 上下文,CodeArena 全球第四;官方宣布下周开源 Max 权重与 Qwen3.8-27B,并同步推出 Agent 产品「千问办公」。
DeepSeek-V4-Flash 正式版发布
DeepSeek 发布 V4-Flash 正式版(V4-Flash-0731),取代预览版:思考/非思考双模式、1M 上下文、Agent 能力增强与推测解码;8 月 6 日公告整体上调 API 定价,市场解读为低价策略转折与 V4-Pro 正式版信号。
Gemini 3.6 Flash 发布,旗舰 3.5 Pro 继续缺席
Google DeepMind 发布 Gemini 3.6 Flash,以及 3.5 Flash-Lite 与面向政府试点的 3.5 Flash Cyber;3.6 Flash 把输出定价下调并保持 1M 上下文,官方同时确认旗舰 3.5 Pro 仍在测试、Gemini 4 预训练已经启动。
Kimi K3 发布并开源
月之暗面发布 Kimi K3,总参数 2.8 万亿、每 token 激活约 1040 亿的 MoE 架构模型,原生支持视觉与百万级上下文;7 月 27 日权重开放,成为当时全球参数最大的开源模型,并在 WebDev Arena 上首次由开源模型登顶。
DeepSeek-V4 预览版发布
DeepSeek 开源 V4 Pro 与 Flash 预览版,把 1M 上下文、思考模式和 Agent 编程能力放进同一家族,并继续强调稀疏架构的成本效率。
DeepSeek 发布 V3.2
DeepSeek 在 2025 年底发布 V3.2,采用更激进的稀疏注意力与 MoE 架构,在保持能力的同时把推理成本进一步压低,继续推动开源模型的效率革命。
Llama 4 发布
Meta 发布 Llama 4 Scout 与 Maverick,采用混合专家架构并原生支持多模态,把开放权重模型推向超长上下文和更高计算效率。
DeepSeek-R1 发布
DeepSeek 发布开放推理模型 DeepSeek-R1,以强化学习驱动的推理能力和开放权重迅速引发全球关注。
月之暗面发布 Kimi K1.5
月之暗面发布 Kimi K1.5,用强化学习训练出具备长上下文推理能力的模型,多项基准对齐或超越当时的国际头部推理模型,成为国产推理模型的代表作品。
DeepSeek-V3 发布
DeepSeek 发布 DeepSeek-V3,以开放权重和显著的训练效率引发行业关注,并让前沿模型的成本结构成为公开讨论的焦点。
OpenAI 发布 GPT-4o mini
OpenAI 发布 GPT-4o mini,以极低的价格提供接近 GPT-4o 的能力,把「小模型 + 低价」变成主流选择,引发开发者大规模迁移与行业价格跟进。
Apple 发布 Apple Intelligence
苹果在 WWDC 公布 Apple Intelligence:端侧 Foundation Models 与私有云协同,把写作、图像、通知摘要与 Siri 升级做成系统级功能,而不是独立聊天 App。
DeepSeek-V2 发布
DeepSeek 发布 V2,采用 MLA(多头潜在注意力)+ DeepSeekMoE 稀疏架构,以远低于同行的价格开放 API。推理成本约为 Llama 3 的 1/100,直接引爆了中国大模型的价格战。
AI21 发布 Jamba 混合架构模型
AI21 Labs 发布 Jamba,首个将 Mamba 状态空间模型与 Transformer 结合的大规模混合架构,在长上下文与吞吐上展示效率优势。
面壁开源 MiniCPM 端侧模型
面壁智能与 OpenBMB 开源 MiniCPM 系列,以小参数中文友好基座强调端侧可部署;随后 MiniCPM-V 把多模态也压进边缘设备叙事。
Mistral 发布 Mixtral 8x7B 混合专家模型
Mistral AI 以 Apache 2.0 发布 Mixtral 8x7B 稀疏混合专家模型:每层 8 组专家、每 token 路由 2 个,总参数约 46.7B、每 token 约 12.9B 激活。厂商报告在多数基准上超过 Llama 2 70B、推理更快,并匹配或超过 GPT-3.5;这些比较由发布方给出。
Mistral 7B 以小模型进入开放生态
Mistral AI 以 Apache 2.0 许可证发布 Mistral 7B 权重。模型采用分组查询注意力和 4096 token 滑动窗口;发布方报告它在多项基准上超过 Llama 2 13B,但这属于厂商基准比较。
vLLM 与 PagedAttention 重塑 LLM 服务吞吐
UC Berkeley 等研究者开源 vLLM,并以 PagedAttention 把 KV 缓存拆成可非连续映射的页,降低显存碎片与预留浪费,显著提高大模型服务吞吐。
斯坦福 Alpaca 低成本复刻
斯坦福团队用 52K 条由 GPT-3.5 生成的指令数据微调 LLaMA-7B,训练成本仅约 600 美元,得到行为接近 GPT-3.5 的 Alpaca。它引爆了「低成本复刻闭源模型」的浪潮。
FlashAttention 用 IO 感知重写精确注意力
Tri Dao 等人提出 FlashAttention:在 GPU 上按块计算精确 softmax 注意力,减少高带宽内存(HBM)读写,从而在不近似注意力数学的前提下加速并节省显存。
Chinchilla 修正算力最优缩放配比
DeepMind 在 arXiv 发表《Training Compute-Optimal Large Language Models》,训练 400 余个规模从约 7000 万到逾 160 亿参数的模型。结论是算力最优时模型大小与训练 token 应近似等比放大;同算力的 70B Chinchilla(约 1.4T token)全面超过 280B Gopher。
LoRA 提出大模型低秩适配
微软研究者提出 LoRA:冻结预训练权重,在 Transformer 层注入可训练的低秩分解矩阵。相对全量微调 GPT-3 175B,论文报告可训练参数约降一万倍、显存约降三倍,合并后不增加推理延迟。
神经语言模型缩放规律被量化
OpenAI 研究者在跨越七个数量级的计算规模上拟合经验幂律,测量语言模型交叉熵损失随参数量、数据量和训练计算量的变化,并提出当时的计算预算分配公式。