大语言模型
从「Transformer 架构论文发表」到「腾讯混元发布并开源 Hy4 preview」,先抓住起点、路线转向与当前边界,再展开完整事件线。
腾讯混元发布并开源 Hy4 preview
腾讯混元发布并开源 Hy4 preview:770B 总参、49B 激活的 MoE,上下文突破 1M,Apache 2.0 协议;定位「为生产力而生」,聚焦软件工程、办公分析、游戏开发与科学研究,在 WorkBuddy/CodeBuddy、元宝、ima 等产品同步首发,并首次参与自身研发全链路形成「初步的递归自我改进闭环」。
智谱开源 GLM-5.3-Flash(Ox Alpha)
智谱「认领」此前以匿名身份 Ox Alpha(中文社区称「牛来」)上线的模型为 GLM-5.3-Flash:320B-A18B,GLM-5 系列首个原生多模态模型,以 MIT 协议开源;其训练使用数十万亿词元、由约 10 万张国产芯片支撑,匿名盲测期间曾登顶 OpenRouter 并终结 DeepSeek 连续 56 天霸榜。
阿里发布并开源 Qwen3.8-Flash
阿里发布并开源 Qwen3.8-Flash:总参 125B、单 token 激活 6B 的多模态 MoE,采用全新「Next」架构(QSA 稀疏注意力 + Gated DeltaNet 混合注意力),训练成本较 Qwen3.7-Plus 下降约 90%,推理定价每百万输入 1 元、输出 3 元;被视为 Qwen4 的雏形,首发上线「千问办公」。
DeepSeek-V4 Pro 正式版发布
DeepSeek 将 V4 Pro 更新为 0813 正式版:1.6T 总参 MoE、1M 上下文、最大输出 38.4 万 token,首次原生支持图像推理;DeepSWE 从预览版 12.8 升至 62.7,超过 Claude Opus 4.8,部分智能体基准逼近甚至反超 Claude Fable 5。同日发布开源 Agent 开发框架 DeepSeek Harness v0.1。
Google 发布 Gemini 3.7 Flash
Google 发布 Gemini 3.7 Flash:距 3.6 Flash 仅三周,官方称其为「编程与智能体场景下最智能的主力模型」,DeepSWE 从 49.0% 升至 65.3%、WebDev Arena Elo 1588;限时五折定价(输入 0.75 美元/百万 token),并同步接入 Gemini Spark 与 Enterprise Agent Platform。
xAI 发布 Grok 4.6
xAI 发布 Grok 4.6:总参数约 1.5T 的 MoE 旗舰,重点强化长时间运行的智能体任务、复杂交互与视觉工作,在 Artificial Analysis 综合智能指数上与 GPT-5.6 Sol 持平(61 分),API 定价明显低于竞品,同步上线 Cursor 与 Grok Build。
GPT-5.6 Luna 向免费用户开放
OpenAI 宣布免费与 Go 用户默认模型切换为 GPT-5.6 Luna,下周起无限次文本聊天,并新增 Think 按钮让免费档首次可主动调用更高推理;Plus/Pro 的 GPT-5.6 Sol 同步升级,事实错误率较 GPT-5.5 Instant 降约 68%。
Google 领导层重组,四位元老离职创业
Google 8 月 6 日重组 AI 领导层:Demis Hassabis 卸任日常管理,转任 Alphabet 首席科学家兼 DeepMind 主席;Koray Kavukcuoglu 升 SVP 接管 Gemini;Jeff Dean、Sanjay Ghemawat、Oriol Vinyals、Quoc Le 离职创办 Discovery Loop(谷歌创始投资)。导火索是 Gemini 3.5 Pro 一再延期,Alphabet 股价单日跌约 4%。
智谱公开 GLM-5 预告
智谱的 ZCode 页面意外曝光了 GLM-5 的预告信息,暗示下一代旗舰将在编程与 Agent 能力上发力。GLM 系列从 GLM-4.5 到 GLM-5 的迭代节奏,是中国大模型竞争加速的缩影。
阿里发布 Qwen3.8 与 Qwen3.8-Max
阿里云发布 Qwen3.8 与 Qwen3.8-Max:总参数 2.4T、每 token 激活约 950B 的稀疏 MoE 架构,原生多模态视觉与 1M 上下文,CodeArena 全球第四;官方宣布下周开源 Max 权重与 Qwen3.8-27B,并同步推出 Agent 产品「千问办公」。
Claude Opus 5 发布
Anthropic 发布 Claude Opus 5,定位接近旗舰前沿智能、定价与 Opus 4.8 持平,成为 Claude Max 的新默认模型与 Claude Pro 的最强选项,并随发布带来对话中途工具切换、API 安全回退等工程化机制。
Gemini 3.6 Flash 发布,旗舰 3.5 Pro 继续缺席
Google DeepMind 发布 Gemini 3.6 Flash,以及 3.5 Flash-Lite 与面向政府试点的 3.5 Flash Cyber;3.6 Flash 把输出定价下调并保持 1M 上下文,官方同时确认旗舰 3.5 Pro 仍在测试、Gemini 4 预训练已经启动。
Kimi K3 发布并开源
月之暗面发布 Kimi K3,总参数 2.8 万亿、每 token 激活约 1040 亿的 MoE 架构模型,原生支持视觉与百万级上下文;7 月 27 日权重开放,成为当时全球参数最大的开源模型,并在 WebDev Arena 上首次由开源模型登顶。
GPT-5.6 发布
OpenAI 发布 GPT-5.6,以 Sol、Terra、Luna 三档覆盖旗舰能力、成本平衡与高吞吐,并加入程序化工具调用、多 Agent 编排、显式缓存和持久推理。
OpenAI 发布 GPT-Live 全双工语音模型
OpenAI 发布全双工语音模型 GPT-Live-1 与 GPT-Live-1 mini,让 ChatGPT 语音能同时听与说,支持同声传译、智能垫话与后台委派;两者分别成为付费与免费用户的默认语音模型,并向 iOS、Android 与网页端逐步推送。
Claude 5 家族成形
Anthropic 在六月先后推出 Claude Fable 5 与 Sonnet 5:前者面向长时间运行的高难度 Agent,后者强调速度与智能的综合平衡。
Gemini 3.5 Flash 发布
Google 发布 Gemini 3.5 Flash 正式版,把持续高强度 Agent 与代码任务定位为 Flash 主力场景,并将其设为 gemini-flash-latest 的默认模型。
DeepSeek 发布 V3.2
DeepSeek 在 2025 年底发布 V3.2,采用更激进的稀疏注意力与 MoE 架构,在保持能力的同时把推理成本进一步压低,继续推动开源模型的效率革命。
Anthropic 发布 Claude Opus 4.5
Anthropic 发布 Claude Opus 4.5,在深度推理、长任务执行与代码能力上进一步压榨上限,被视为与 GPT-5 系列、Gemini 3 并列的旗舰之一。
Google 发布 Gemini 3 Pro
谷歌发布 Gemini 3 Pro,在推理、多模态与长上下文上全面对标并部分反超 OpenAI 的 GPT-5 系列。它让谷歌在旗舰竞争里重回前排,也标志着 2025 年底「推理旗舰」之争进入白热化。
OpenAI 发布 GPT-5.1
OpenAI 发布 GPT-5.1,作为 GPT-5 系列的稳定升级,重点优化推理速度、API 成本与工具调用稳定性。它是「旗舰模型按季迭代」节奏里的关键一环。
Anthropic 发布 Claude Sonnet 4.5
Anthropic 发布 Claude Sonnet 4.5,在代码与 Agent 能力上比肩甚至超过更大尺寸的旗舰,同时保持更低成本。它把「尺寸不是一切」的竞争逻辑推向极致。
DeepSeek 发布 V3.1
DeepSeek 发布 V3.1,把上下文窗口大幅扩展并强化工具调用能力,延续「高性价比开源旗舰」路线。它巩固了 DeepSeek 在中国开源模型中的领先位置。
GPT-5 发布
OpenAI 发布 GPT-5。ChatGPT 以路由系统在快速模型与深度推理模型之间选择;API 则提供 GPT-5、mini 和 nano 三档独立模型及可配置的推理强度,而不是照搬 ChatGPT 路由。
月之暗面开源 Kimi K2
月之暗面发布 Kimi K2,约 1T 总参数、32B 激活的开放 MoE,编码与 Agent 基准表现突出,把 Kimi 从长上下文聊天产品扩展为全球可下载的旗舰权重。
xAI 发布 Grok 4
xAI 发布 Grok 4,首次把旗舰能力拉到推理模型的头部阵营,与 GPT、Claude、Gemini 正面竞争。它让 xAI 从「马斯克的另类项目」变成真正的第三极竞争者。
Anthropic 发布 Claude 4
Anthropic 发布 Claude 4 家族:Opus 4 作为旗舰,Sonnet 4 主打速度与 Agent 任务,并推出支持工具调用的版本。Claude 4 将「长任务自主执行」确立为产品主线,与代码与 Agent 生态深度绑定。
Gemini 2.5 引入思维过程
谷歌发布 Gemini 2.5,以「思考模型」为核心:模型在回答前进行内部推理,强调编码、数学与长任务能力。Gemini 2.5 让谷歌在推理模型竞赛中重新回到第一梯队。
百度发布文心 4.5 与 X1
百度同日上线文心 4.5(原生多模态)与文心 X1(深度思考),并在文心一言免费开放,随后承诺开源 4.5 系列,把搜索大厂重新拉回模型军备第一排。
GPT-4.5 发布
OpenAI 发布 GPT-4.5,宣称这是其最后一个不基于推理的旗舰模型,强化世界知识、自然对话与模式识别。发布后市场反应分化,凸显「纯规模路线 vs 推理路线」的分歧。
微软曝光自研大模型 MAI-1
微软公开自研大模型 MAI-1,由 Inflection 前团队主导开发,被定位为与 OpenAI 合作之外的自主底座。它标志着微软开始摆脱「单一大模型供应商依赖」。
Anthropic 发布 Claude 3.7 Sonnet
Anthropic 发布 Claude 3.7 Sonnet,首创「混合推理」模式:同一模型既可在标准模式下快速回答,也可在扩展思维模式下长时间推理。它让推理能力从「特殊模型」变成「默认开关」。
xAI 发布 Grok 3
xAI 发布 Grok 3,宣称由 Colossus 超算(约 10 万张 GPU)训练,主打推理与数学能力,在发布前后声称某些基准领先。它把 xAI 从追赶者带进前沿竞争的核心圈。
DeepSeek-R1 发布
DeepSeek 发布开放推理模型 DeepSeek-R1,以强化学习驱动的推理能力和开放权重迅速引发全球关注。
月之暗面发布 Kimi K1.5
月之暗面发布 Kimi K1.5,用强化学习训练出具备长上下文推理能力的模型,多项基准对齐或超越当时的国际头部推理模型,成为国产推理模型的代表作品。
DeepSeek-V3 发布
DeepSeek 发布 DeepSeek-V3,以开放权重和显著的训练效率引发行业关注,并让前沿模型的成本结构成为公开讨论的焦点。
亚马逊发布 Nova 模型家族
亚马逊在 re:Invent 发布 Nova 系列基础模型,覆盖文本、多模态与视频生成,通过 Bedrock 提供给企业。Nova 让亚马逊补上自研大模型拼图,与 Anthropic 合作并行推进。
Claude Computer Use 公测:模型操作图形界面
Anthropic 在 2024 年 10 月 22 日将 computer use 以公测形式接入 API:模型根据屏幕截图决定移动光标、点击与键入等动作,在实验性条件下用人类方式操作计算机。
OpenAI o1 发布
OpenAI 发布 o1-preview,把更多计算放到回答前的推理过程,在数学、科学和编程任务上显著提高复杂问题求解能力。
xAI 发布 Grok-2
xAI 发布 Grok-2,支持图像理解与生成,能力进入全球第一梯队。马斯克的「叛逆」人设与 X 平台数据形成独特打法,也引发关于 AI 约束与安全的持续讨论。
Meta 发布 Llama 3.1 405B
Meta 发布 Llama 3.1,其中 405B 版本在多项基准上逼近 GPT-4o,是首个与闭源旗舰同场竞技的开源模型。扎克伯格同时发表长文,公开为开源 AI 辩护。
OpenAI 发布 GPT-4o mini
OpenAI 发布 GPT-4o mini,以极低的价格提供接近 GPT-4o 的能力,把「小模型 + 低价」变成主流选择,引发开发者大规模迁移与行业价格跟进。
华为云发布盘古大模型 5.0
华为在 HDC 2024 发布盘古 5.0,覆盖 NLP、多模态、视觉、预测与科学计算等分支与多档参数,强调昇腾部署与行业场景,把“硬件+模型+云”绑成一条国产全栈叙事。
Claude 3.5 Sonnet 发布
Anthropic 发布 Claude 3.5 Sonnet,以更低的价格和更快的速度达到接近或超过上一代旗舰的代码、视觉和推理表现。
昆仑万维推进天工 / Skywork 大模型
昆仑万维以天工产品与 Skywork 模型系列推进搜索增强对话、多模态与后续开放权重,成为中国互联网第二梯队中坚持全栈模型品牌的代表之一。
GPT-4o 发布
OpenAI 发布 GPT-4o,以同一神经网络处理文本、视觉与音频,让实时语音和视觉交互第一次成为通用模型的原生能力。
商汤发布日日新 SenseNova 5.0
商汤在技术日发布 SenseNova 5.0,强调知识、数学、推理与代码,并推出云到端全栈产品矩阵,把 CV 起家的公司更明确地绑在通用大模型战线上。
Meta 发布 Llama 3
Meta 发布 Llama 3 家族(8B 与 70B),性能大幅提升并随后推出 405B 旗舰。它让开源模型的水平首次逼近闭源前沿模型,也把「开源与闭源之争」推向全球大模型竞争的中心。
AI21 发布 Jamba 混合架构模型
AI21 Labs 发布 Jamba,首个将 Mamba 状态空间模型与 Transformer 结合的大规模混合架构,在长上下文与吞吐上展示效率优势。
Kimi 凭超长上下文破圈
月之暗面把 Kimi 的长文本能力推到 200 万字级别,能一次读完几十本书或整份招股书。这一能力让 Kimi 在国产大模型里脱颖而出,成为 2024 年初最出圈的 AI 应用之一。
Cohere 发布 Command R
Cohere 发布 Command R 系列,专为企业场景优化,强化检索增强生成(RAG)与多语言能力,走「开源可用、企业友好」的差异化路线。
Anthropic 发布 Claude 3 家族
Anthropic 发布 Claude 3 家族:旗舰 Opus、均衡 Sonnet、轻量 Haiku。Opus 在多项基准上超越 GPT-4,首次支持 20 万 token 上下文。三档齐发的策略让大模型进入「按需选档」时代。
Google 开源 Gemma
Google 发布开源模型 Gemma,提供 2B 与 7B 两种规模。这是谷歌首次向社区开放自家大模型权重,标志着开源与闭源双线作战成为巨头标配。
Google 发布 Gemini 1.5
Google 发布 Gemini 1.5 Pro,首次将上下文窗口推向 100 万 token,可在一次推理中处理数小时视频、整本书籍与超长代码库。它把「长上下文」从演示变成可用的产品能力。
智谱发布 GLM-4
智谱发布 GLM-4,性能对标同期 GPT-4,同时延续开源策略。GLM 系列成为国产大模型中「学术出身、开源与商业并进」路线的代表。
Mistral 发布 Mixtral 8x7B 混合专家模型
Mistral AI 以 Apache 2.0 发布 Mixtral 8x7B 稀疏混合专家模型:每层 8 组专家、每 token 路由 2 个,总参数约 46.7B、每 token 约 12.9B 激活。厂商报告在多数基准上超过 Llama 2 70B、推理更快,并匹配或超过 GPT-3.5;这些比较由发布方给出。
Google 发布 Gemini 1.0
Google DeepMind 发布 Gemini 1.0,以 Ultra、Pro、Nano 三个规模覆盖数据中心、通用产品和端侧设备。发布当日 Bard 接入 Pro,Nano 登上 Pixel 8 Pro;Ultra 则等到 2024 年才面向用户开放。
阶跃星辰发布 Step 系列
阶跃星辰由姜大昕创立,发布 Step 系列大模型,主打万亿参数与多模态能力,成为「大模型六小龙」中的代表之一,其 Step 系列持续迭代并开源部分版本。
xAI 发布 Grok
埃隆·马斯克创立的 xAI 发布 Grok-1 及配套产品,主打「实时接入 X(推特)」与少约束的幽默风格,向 ChatGPT 发起差异化竞争。
零一万物发布 Yi 系列
零一万物由李开复创立,发布 Yi 系列大模型,其中 Yi-34B 以较强的中英文综合能力进入开源模型第一梯队,成为「大模型六小龙」中的代表。
百度发布文心大模型 4.0
百度在 2023 百度世界大会上发布文心大模型 4.0,宣称综合能力与 GPT-4 相当,并接入搜索、地图、网盘等全线产品。它被视为国产大模型对标国际旗舰的标志性一役。
月之暗面发布 Kimi
月之暗面(Moonshot AI)发布 Kimi 智能助手,以长上下文与中文长文本处理为差异化卖点。它在国产对话产品中以「能读长文档、多轮长对话」快速出圈。
Mistral 7B 以小模型进入开放生态
Mistral AI 以 Apache 2.0 许可证发布 Mistral 7B 权重。模型采用分组查询注意力和 4096 token 滑动窗口;发布方报告它在多项基准上超过 Llama 2 13B,但这属于厂商基准比较。
腾讯混元大模型发布
腾讯正式发布混元大模型,覆盖文本、代码、图像等多模态能力,并接入微信、腾讯云等业务。至此,国内互联网巨头全部站上自研大模型的牌桌。
MiniMax 发布大模型与海螺 AI
MiniMax 发布自研大模型并推出 AI 对话应用海螺 AI,主打多模态与效率。2025 年其 MiniMax-01 系列以新型 MoE 架构与 400 万上下文引发关注,成为国产模型的技术派代表。
字节发布豆包
字节跳动推出 AI 对话助手豆包,依托火山引擎的云雀大模型。豆包随后凭借字节的流量分发与免费策略迅速成长,成为中国用户规模领先的 AI 应用之一。
通义千问开放 Qwen 权重
阿里云发布 Qwen-7B 与 Qwen-7B-Chat 的代码和权重;基础模型以超过 2.2 万亿 token 预训练,覆盖中文、英文、代码和多语言文本。许可允许研究使用,月活用户低于一亿的商业主体可直接使用,更大规模须另行申请。
Meta 发布 Llama 2 开放权重
Meta 发布 Llama 2 预训练与对话微调权重,参数规模 7B、13B、70B,并宣布研究与商业用途免费可用。许可为 Llama 2 社区许可(含可接受使用政策与月活门槛等附加条款),不是无限制的 OSI 开源软件许可;微软为优先云合作方。
上海 AI 实验室开源 InternLM
上海人工智能实验室发布并开源书生 InternLM 系列大模型,这是中国科研机构主导的国产开源大模型代表,后续迭代出 InternLM2、InternLM3 等版本,并配套开源工具链。
vLLM 与 PagedAttention 重塑 LLM 服务吞吐
UC Berkeley 等研究者开源 vLLM,并以 PagedAttention 把 KV 缓存拆成可非连续映射的页,降低显存碎片与预留浪费,显著提高大模型服务吞吐。
百川智能发布 Baichuan 开源大模型
王小川创立的百川智能发布 Baichuan-7B,首个版本即开源,随后推出 Baichuan-13B 与 53B。公司以「开源+商业双轨」切入,成为国产开源大模型的重要参与者。
OpenAI API 加入函数调用
OpenAI 在 0613 版 GPT-4 与 GPT-3.5 Turbo 中加入函数调用。开发者用 JSON Schema 声明函数,模型返回函数名与参数;应用仍须校验参数、执行函数并把结果送回模型。
智谱开源 ChatGLM
智谱 AI 发布并开源 ChatGLM 系列,其中包括中文场景优化的对话模型,成为国产开源大模型的重要代表,随后迭代出 ChatGLM2、ChatGLM3 与 GLM-4。
讯飞星火发布
科大讯飞发布讯飞星火认知大模型,展示文本生成、知识问答、数学推理与多语种能力,并把大模型与自身语音与教育优势结合。
阿里通义千问正式发布
阿里云宣布通义千问正式开启测试,这是阿里自研大语言模型向公众开放的关键节点。此后通义千问通过 API 与开源(Qwen 系列)两条路扩展,成为国际开源模型格局中的中国代表。
文心一言开启中国大模型浪潮
百度发布文心一言,以录播演示的方式推出对话模型产品,成为 ChatGPT 后中国主要科技公司里首个正式发布的大模型。发布会当日百度港股一度下跌,也引来对「AI 抢跑 vs 实力」的争论。
Anthropic 发布 Claude
Anthropic 发布 Claude,并通过 API 及 Slack、Notion 等合作入口提供访问。公司把可预测性、减少有害输出和长文本处理列为产品重点;这些是发布方定位,不是对准确性或安全性的独立认证。
GPT-4 发布
OpenAI 发布 GPT-4,并报告其在模拟律师资格考试中达到约前 10%,而 GPT-3.5 约在后 10%。图像输入最初仅限合作方测试;技术报告未披露参数量、训练数据构成、架构或训练算力。
Meta 发布 LLaMA
Meta 发布 7B、13B、33B 和 65B 参数的 LLaMA 论文,并向获批研究者提供非商业许可权重;其中 65B 模型用 1.4 万亿 token 训练。权重随后外泄,社区迅速开发量化、微调和本地推理工具。
微软把 ChatGPT 放进必应搜索
微软发布新版必应,把 OpenAI 的模型与搜索索引结合,允许用户用自然语言提问并查看带引用的回答。搜索引擎开始从「结果列表」转向「对话加引用」。
Constitutional AI:用原则与 AI 反馈训练无害性
Anthropic 提出 Constitutional AI:用人类写定的原则列表让模型批评与改写自身输出,再以 AI 反馈做强化学习(RLAIF),在减少有害性人工标签的同时训练更少回避、更能解释拒绝的助手。
ChatGPT 发布
OpenAI 以免费“研究预览”发布基于 GPT-3.5 的 ChatGPT,把经过人工反馈训练的模型放进保留上下文的网页对话界面。它能连续追问、改写文本和解释代码,也会自信地给出错误答案。
FlashAttention 用 IO 感知重写精确注意力
Tri Dao 等人提出 FlashAttention:在 GPU 上按块计算精确 softmax 注意力,减少高带宽内存(HBM)读写,从而在不近似注意力数学的前提下加速并节省显存。
Chinchilla 修正算力最优缩放配比
DeepMind 在 arXiv 发表《Training Compute-Optimal Large Language Models》,训练 400 余个规模从约 7000 万到逾 160 亿参数的模型。结论是算力最优时模型大小与训练 token 应近似等比放大;同算力的 70B Chinchilla(约 1.4T token)全面超过 280B Gopher。
InstructGPT 用人类反馈对齐指令
OpenAI 公开 InstructGPT 的三阶段训练方法:监督示范微调、人工偏好奖励模型、再用 PPO 强化学习。标注员在成对比较中更常选择 1.3B InstructGPT,而不是大约大 100 倍的 175B GPT-3,但该结果只代表这套任务和标注规范。
OpenAI Codex 把 GPT-3 适配到代码
OpenAI 发布 Codex API 私有测试版。Codex 由 GPT-3 继续在公开代码上训练,早期 12B 版本在 HumanEval 单次采样中解出 28.8% 的题目,并为 GitHub Copilot 提供模型能力。
LoRA 提出大模型低秩适配
微软研究者提出 LoRA:冻结预训练权重,在 Transformer 层注入可训练的低秩分解矩阵。相对全量微调 GPT-3 175B,论文报告可训练参数约降一万倍、显存约降三倍,合并后不增加推理延迟。
华为发布盘古大模型
华为在华为云开发者大会上发布盘古系列大模型,覆盖 NLP、视觉、多模态等方向,主打行业场景落地。它是中国早期由科技巨头主导的大模型尝试之一。
EleutherAI 开源 GPT-Neo
EleutherAI 发布 GPT-Neo 1.3B 与 2.7B,证明没有科技巨头预算的独立社区也能训练出可用的语言大模型,为开源 AI 的后续繁荣埋下伏笔。
CLIP 用自然语言监督连接图文
OpenAI 发布 CLIP:在大规模图文对上对比训练图像编码器与文本编码器,使模型可用自然语言描述做零样本图像分类,并开放代码与权重示例。
GPT-3 发布
OpenAI 训练 1750 亿参数 GPT-3,并以零样本、单样本和少样本提示评估它。模型无需更新权重即可尝试翻译、问答、文本生成和简单代码,但不同任务的结果差异很大。
RAG 检索增强生成论文
Facebook AI 提出 RAG:用稠密检索从文档库取出相关段落,再与预训练序列到序列模型一起条件生成答案,在开放域问答等任务上验证有效。
神经语言模型缩放规律被量化
OpenAI 研究者在跨越七个数量级的计算规模上拟合经验幂律,测量语言模型交叉熵损失随参数量、数据量和训练计算量的变化,并提出当时的计算预算分配公式。
GPT-2 展示零样本任务迁移
OpenAI 公布在约 800 万个网页文档上训练的 15 亿参数 GPT-2,并演示模型在不做任务微调时完成基础问答、摘要和翻译。公司起初只发布较小版本,随后于 2019 年 11 月放出完整模型。
Hugging Face Transformers 库成型
Hugging Face 推出并扩展 Transformers 库,把 BERT 等预训练模型的加载、分词与微调收成统一 API,降低复现与迁移成本。
BERT 发布
Google 发布 BERT,以掩码语言建模和下一句预测预训练双向 Transformer 编码器。3.4 亿参数的 BERT-Large 只增加小型输出层,便在 GLUE、SQuAD 等 11 项任务上刷新当时最佳结果。
GPT-1 验证生成式预训练
OpenAI 在 BooksCorpus 上预训练 1.17 亿参数、12 层的 Transformer 解码器,再分别微调到 12 个有监督任务;论文报告其中 9 项刷新当时最佳结果。
Transformer 架构论文发表
Google 研究者在机器翻译论文中提出 Transformer,用自注意力、前馈网络和位置编码构成编码器—解码器,去掉循环和卷积。