AI LANGUAGE

AI 术语专栏

一张卡讲清一个词:它是什么、你会在哪碰到它、又最容易被怎样误读。

  • 按链路分卡:模型 → 训练 → 推理 → 提示 → 安全 → Agent
  • 封面区分类别,释义压到日常能读懂的长度
  • 有坑的词会单独标「注意」

92 张卡片 · 持续更新

模型与能力

19
模型与能力

SOTA

当前最优State of the Art

在某一明确任务、数据集和评测设定下,目前公开记录里最好的那一档成绩。它描述的是“在这场考试里第一名”,不是“处处都最强”。

注意离开任务、指标和成本约束谈 SOTA,多半是营销话术。换一套数据或换一个延迟预算,排名经常整个翻盘。

模型与能力

LLM

大语言模型Large Language Model

用海量文本训练出来、能读懂并写出自然语言的大型模型。你今天用的聊天助手、写代码助手,底座多半就是它。

模型与能力

SLM

小语言模型Small Language Model

参数更少、更省算力的语言模型。常见于手机端、公司内网私有部署,或边界很清楚的单一任务。

模型与能力

Foundation Model

基础模型Foundation Model

先在广泛数据上练出通用能力的底座模型。下游产品很少从零训练,多半是在这个底座上继续改、继续接。

模型与能力

Transformer

Transformer 架构Transformer Architecture

2017 年提出的神经网络骨架,靠注意力机制处理序列。今天绝大多数大语言模型,骨子里都是它的变体。

模型与能力

Attention

注意力机制Attention Mechanism

让模型在处理当前位置时,能“看向”输入里更相关的其他位置,而不是一视同仁扫一遍。Self-Attention 是其中最常见的形态。

模型与能力

MoE

混合专家Mixture of Experts

把模型拆成许多“专家”子网络,每次只叫醒其中几位干活。总参数可以很大,单次计算却不必全开,是扩容常用的路子。

模型与能力

Multimodal

多模态Multimodal Model

不只吃文字,还能看图、听声、理解视频,有的还能反过来生成这些内容。一句话:多种“感官”共用一套脑子。

模型与能力

Reasoning Model

推理模型Reasoning Model

专门为多步思考、数学、代码和复杂规划加强过的模型。回答前往往会先在内部“打草稿”,而不只是脱口而出。

模型与能力

Diffusion

扩散模型Diffusion Model

生成图像、视频时常用的技术路线:先从噪声开始,一步步“洗”成清晰内容。Stable Diffusion、许多文生图工具都走这条路。

模型与能力

Embedding

向量嵌入Vector Embedding

把一段文字、一张图变成一串数字(向量)。语义接近的内容,在数字空间里距离也会更近,所以能拿来做搜索和推荐。

模型与能力

Open Weight

开放权重Open-Weight Model

模型权重可以下载、部署、再训练的发布形态。不等于完全开源:许可证、训练数据、代码是否公开,往往还得分开看。

注意“开源模型”口语里常被混用。严格说,开放权重只保证你能拿到参数,不保证训练配方也公开。

模型与能力

Parameters

参数量Model Parameters

模型里可学习的权重个数,常写成 7B、70B。它粗略反映容量上限,但不直接等于“更聪明”——架构、数据与训练同样关键。

模型与能力

Autoregressive

自回归生成Autoregressive Generation

一个词(Token)接一个词往外写:每次只预测下一步,再把刚写出的内容喂回自己。ChatGPT 式对话,底层多半是这种生成方式。

模型与能力

World Model

世界模型World Model

试图在内部模拟“世界如何运转”的模型思路:不只背答案,还要预测行动会带来什么结果。在机器人、自动驾驶和部分 Agent 研究里常被提起。

模型与能力

VLM

视觉语言模型Vision-Language Model

能同时理解图像和文字的模型:看图说话、读截图答题、根据界面描述下一步操作。多模态里最常见、也最先产品化的一支。

模型与能力

TTS / ASR

语音合成 / 语音识别Text-to-Speech / Automatic Speech Recognition

TTS 把文字念成语音,ASR 把说话转成文字。语音助手、会议纪要、有声内容,都靠这一对“耳朵和嘴巴”。

模型与能力

Tokenizer

分词器Tokenizer

把自然语言切成模型能吃的 Token 的规则组件。同一段中文,不同分词器切法不同,直接关系到上下文够不够用、API 账单贵不贵。

模型与能力

Latency-Quality Tradeoff

速度与质量权衡Latency-Quality Tradeoff

更大更强的模型通常更慢更贵。产品选型不是只看榜一,而是在延迟、成本、准确率之间找能上线的那一档。

训练与对齐

17
训练与对齐

Pre-training

预训练Pre-training

用海量通用数据先把模型“喂大”的阶段。目标是学会语言规律和广谱知识,产品味还没调,像一块生好的面团。

训练与对齐

Post-training

后训练Post-training

预训练之后的一揽子加工:指令微调、偏好对齐、工具使用训练等。用户真正感觉到的“好不好用”,很多是这一阶段做出来的。

训练与对齐

Fine-tuning

微调Fine-tuning

在现成底座上继续训练,让它更懂某个行业、某种口吻或某类任务。不必重训整座山,只需把方向拧准一点。

训练与对齐

SFT

监督微调Supervised Fine-Tuning

用人工写好或精选的问答对示范“该怎么答”。这是把只会续写的底座,变成愿意按指令办事的助手,最常见的一步。

训练与对齐

RLHF

人类反馈强化学习Reinforcement Learning from Human Feedback

让人给多个回答打分或排序,再把这些偏好变成训练信号,用强化学习推着模型往“更受欢迎”的方向走。ChatGPT 早期好用,它是关键一环。

训练与对齐

DPO

直接偏好优化Direct Preference Optimization

直接用“哪个回答更好”的对比数据来优化模型,省掉 RLHF 里单独训练奖励模型、再跑强化学习的那套重流程。很多团队拿它当更省事的对齐路径。

训练与对齐

Reward Model

奖励模型Reward Model

专门学“人更喜欢哪种回答”的打分模型。在经典 RLHF 流程里,它代替真人实时打分,给主模型提供优化方向。

训练与对齐

Distillation

知识蒸馏Knowledge Distillation

让小模型模仿大模型的输出或思路,用更低成本换接近的能力。像请学霸带学渣刷题——学渣变强,学费却更便宜。

训练与对齐

LoRA

低秩适配Low-Rank Adaptation

微调时不改动全部参数,只训练很小一块“补丁”。显存和存储都更省,适合给同一个底座挂很多行业专用版本。

训练与对齐

Scaling Law

缩放定律Scaling Law

描述模型规模、数据量、算力与效果之间经验关系的规律。它解释了“为什么大家一直在堆更大模型”,也提醒你:堆到某一档之后,回报会变钝。

训练与对齐

Synthetic Data

合成数据Synthetic Data

由模型或程序生成、再经筛选后用于训练的数据。能补稀缺场景,也可能把错误和偏见放大——关键在过滤与校验,不在“能不能造”。

训练与对齐

Alignment

对齐AI Alignment

让模型行为更符合人类意图、价值观和安全边界的一整套目标与方法。它既是技术活(SFT、RLHF),也是产品与政策选择。

训练与对齐

PEFT

参数高效微调Parameter-Efficient Fine-Tuning

只训练模型里很小一部分参数(或外挂补丁)就能适配新任务的方法总称。LoRA 是其中最出名的代表,省显存、好分发。

训练与对齐

GRPO

组相对策略优化Group Relative Policy Optimization

一种用组内相对打分来优化策略的强化学习算法,DeepSeek 等推理模型训练里常被提起。目标仍是:让更好的推理轨迹更常出现。

训练与对齐

PPO

近端策略优化Proximal Policy Optimization

经典的强化学习算法,早期 RLHF 流水线里很常见。它一步步小幅更新策略,避免模型“学飞了”突然崩掉。

训练与对齐

Catastrophic Forgetting

灾难性遗忘Catastrophic Forgetting

模型学新任务时,把旧能力忘得一干二净。微调领域数据时很常见,所以才有回放数据、约束更新、多任务混合等补救手段。

训练与对齐

Curriculum Learning

课程学习Curriculum Learning

像给人排课一样,先易后难地安排训练样本或任务。用得好能稳住训练、加快收敛;用得差只是多了一层花活。

推理与部署

16
推理与部署

Token

词元Token

模型读写文字时切出来的最小计费与计算单位,可能是一个词、半个词或几个字符。上下文长度、速度、API 账单,都围着它转。

推理与部署

Context Window

上下文窗口Context Window

模型一次能同时“看见”的最大信息量,通常用 Token 数衡量。窗口越大,越能塞长文档,但成本和延迟也常跟着涨。

推理与部署

Inference

推理 / 推断Inference

模型参数已经训好,只根据输入生成回答或预测的阶段。你日常点发送、等回复,用的就是推理,不是训练。

注意这里的“推理”指运行模型出结果,和 Reasoning Model 里那种“深度思考能力”不是同一件事。

推理与部署

KV Cache

键值缓存Key-Value Cache

把已经算过的上下文中间结果存起来,生成下一个词时不必从头重算。对话越长、越依赖它省时间,也越吃显存。

推理与部署

Quantization

量化Quantization

用更低精度(如 8 位、4 位)表示权重或计算,换更少显存、更快速度和更低成本。常会牺牲一点点精度,但很多场景里完全划算。

推理与部署

vLLM

高效推理引擎vLLM

面向大模型在线服务的开源推理引擎,以高吞吐和显存利用见长。名字本身不是缩写,业内常把它当作“把模型真正跑起来”的默认选项之一。

注意不要把 vLLM 展开成 Virtual Large Language Model——那是常见误传。

推理与部署

Latency

延迟Latency / TTFT

从发出请求到看到结果要等多久。对话场景里常拆成 TTFT(首字延迟)和整段生成时间;体感卡不卡,往往先看首字。

推理与部署

Throughput

吞吐量Throughput

系统单位时间内能处理多少请求或生成多少 Token。个人觉得“快”,和服务端能同时扛住多少人,是两本账。

推理与部署

Speculative Decoding

推测解码Speculative Decoding

先让小模型快速草拟几个后续 Token,再由大模型一次性验收。猜对了就省时间,猜错了再改正——用并行换延迟。

推理与部署

Streaming

流式输出Streaming Output

模型边生成边把内容推到界面,而不是等整段写完再一次性弹出。体感更跟手,也是多数聊天产品的默认交互。

推理与部署

Continuous Batching

连续批处理Continuous Batching

推理服务里动态拼车:谁先生成完就先下车,新请求马上补位,显卡尽量不空转。高并发场景下,它是吞吐的关键杠杆。

推理与部署

Serving

模型服务化Model Serving

把训好的模型挂成可调用服务:鉴权、限流、批处理、监控、扩缩容全包。研究里的 checkpoint,离产品可用的 API 还隔着这一层。

推理与部署

Edge AI

端侧 AIEdge AI / On-device Inference

模型直接跑在手机、电脑、车机等本地设备上,少依赖云端。省网络延迟、更利于隐私,但受制于芯片和电池。

推理与部署

Prefill / Decode

预填充 / 解码Prefill and Decode

生成可拆成两段:Prefill 先吞完整段输入,Decode 再一个个往外吐 Token。优化服务时,这两段的瓶颈往往不一样。

推理与部署

Tensor Parallelism

张量 / 流水线并行Tensor / Pipeline Parallelism

单卡塞不下大模型时,把计算拆到多卡:张量并行切一层内部的矩阵,流水线并行把不同层分给不同卡。训练和推理都会用到。

推理与部署

Observability

可观测性LLM Observability

把提示、检索结果、工具调用、延迟、费用和失败原因记下来,方便排查“它为什么这样答”。没有观测,线上 AI 只能靠玄学修。

提示与交互

12
提示与交互

Prompt

提示词Prompt

你交给模型的输入:问题、指令、背景材料、示例都可以算。同一模型,提示写得好不好,输出差距经常大得离谱。

提示与交互

System Prompt

系统提示System Prompt

开发者预设的“人设与规矩”,通常用户看不见或不好改:你是谁、能做什么、不能越哪些线。产品性格很大程度写在这里。

提示与交互

Temperature

温度Sampling Temperature

控制生成随机性的旋钮。偏低更稳、更像在考试;偏高更跳、更像在头脑风暴。不是越高越聪明,只是越敢乱发挥。

提示与交互

Chain of Thought

思维链Chain of Thought

让模型把推理步骤显式写出来(或在内部展开),而不是直接甩结论。复杂算术、逻辑题上,这一招常常明显提分。

提示与交互

Few-shot

少样本Few-shot Learning

在提示里塞几个示例,让模型照葫芦画瓢。不用改参数,当场教它格式和风格;例子为 0 时就叫 Zero-shot。

提示与交互

In-Context Learning

上下文学习In-Context Learning

不更新权重,只靠当前对话窗口里的说明和例子临时学会新任务。大模型让人惊讶的地方之一,就是它很会“现学现用”。

提示与交互

Grounding

落地 / 依据锚定Grounding

把回答拴在可核对的材料上:文档、检索结果、工具返回值,而不是凭模型记忆自由发挥。减少一本正经胡说八道的常用手段。

提示与交互

Context Engineering

上下文工程Context Engineering

不只写一句漂亮提示,而是设计模型此刻能看到的全部信息:系统规则、检索片段、工具结果、对话摘要、格式约束。窗口有限,塞什么、丢什么都是产品决策。

提示与交互

Structured Output

结构化输出Structured Output

要求模型按 JSON、表格或既定 schema 吐结果,方便程序直接解析。做工作流、填表单、接 API 时,比“写一段散文”可靠得多。

提示与交互

Top-p

核采样Nucleus Sampling (Top-p)

生成时只在概率累计达到 p 的那一小撮候选词里抽样。和 Temperature 常一起调:一个管“多野”,一个管“从多宽的词表里挑”。

提示与交互

Stop Sequence

停止序列Stop Sequence

告诉模型:一生成到这些字符就收工。用来截断废话、模仿对话轮次,或防止它把示例格式继续往下编。

提示与交互

Prompt Caching

提示缓存Prompt Caching

把反复出现的长前缀(系统提示、大文档)缓存下来,下次少算一遍。长上下文应用里,这是控成本和降延迟的实用杠杆。

评测与安全

13
评测与安全

Benchmark

基准测试Benchmark

固定的题目、数据和打分规则,用来横向比较模型在某类能力上的表现。它像公开考试,方便排名,也容易被针对性刷分。

评测与安全

Evals

评测Evaluations

系统化检验模型或 AI 产品好不好用、安不安全的过程。可以是公开榜单,也可以是上线前的内部考卷和回归测试。

评测与安全

Hallucination

幻觉Hallucination

模型编得像真的、其实没依据或与事实不符。语气越自信,越容易骗过你——这不是“故意撒谎”,是生成机制本身就会补全缺口。

评测与安全

Jailbreak

越狱Jailbreak

用特殊提示绕过模型的安全限制,诱导它输出本不该给的内容。安全团队会主动研究它,产品侧也要持续修补。

评测与安全

Prompt Injection

提示注入Prompt Injection

把恶意指令藏进网页、文档或工具返回里,企图覆盖开发者设定的系统规则。Agent 越能读外部内容,这项风险越现实。

评测与安全

Red Teaming

红队测试Red Teaming

故意扮演攻击者或刁钻用户,去抠系统的越权、误用和安全漏洞。上线前找疼点,比上线后公关便宜得多。

评测与安全

Guardrails

护栏Guardrails

套在模型外围的约束:输入过滤、输出审核、工具权限、速率与范围限制。模型本身不一定听话,护栏负责兜底。

评测与安全

Contamination

数据污染Data Contamination

评测题或答案在训练阶段就泄露进数据,导致分数虚高。榜好看,不代表模型真会做没见过的题。

评测与安全

Eval Harness

评测框架Evaluation Harness

把题目加载、模型调用、打分、汇总跑成一条流水线的工具集。团队要持续对比版本,离不开可重复的 harness,而不是手工贴结果。

评测与安全

Human Eval

人工评测Human Evaluation

让真人按量表给回答打分或两两比较。自动指标够不着的地方——语气、有用性、是否越界——最终还得人说了算。

评测与安全

Refusal

拒答Model Refusal

模型识别到敏感或越权请求后选择不回答或只给安全替代。拒答过多会像复读机,过少又危险,边界本身就是产品策略。

评测与安全

PII

个人身份信息Personally Identifiable Information

能定位到具体个人的信息:姓名、手机、证件号、住址等。训练、日志和回答里一旦乱泄,法律和信任成本都很高。

评测与安全

Model Spec

模型行为规范Model Spec / Behavior Spec

把“模型该怎么做人”写成可执行的规范:何时帮助、何时拒绝、如何处理冲突指令。对齐不再只靠感觉,而有一份可对照的说明书。

Agent 与协议

15
Agent 与协议

RAG

检索增强生成Retrieval-Augmented Generation

先去知识库里把相关材料找出来,再让模型据此回答。适合公司文档、政策条文这类“必须有出处”的场景。

Agent 与协议

Agent

智能体AI Agent

不只聊天,还能拆目标、调工具、看结果、再决定下一步的系统。从“回答问题”变成“替你把事推进一段”。

注意叫 Agent 不等于真能自主打工。没有可靠工具、记忆和权限设计,它只是套了循环的聊天机器人。

Agent 与协议

Tool Calling

工具调用Tool / Function Calling

让模型按约定格式发起外部调用:搜网页、查数据库、跑代码、改日历。模型负责“想调什么”,真正执行通常在你的后端。

Agent 与协议

MCP

模型上下文协议Model Context Protocol

一套让 AI 应用连接外部工具和数据源的开放协议,目标是少写一次性集成、多复用标准接口。像给 Agent 世界准备的 USB。

Agent 与协议

A2A

智能体互联Agent-to-Agent

让不同 Agent 彼此发现能力、交接任务、协同完成工作的协议方向。重点从“人和一个助手对话”,扩展到“助手之间怎么协作”。

Agent 与协议

Computer Use

计算机操控Computer Use

让模型看屏幕、点鼠标、敲键盘,像人一样操作电脑完成任务。门槛高、风险也大,是 Agent 能力的前沿形态之一。

Agent 与协议

Multi-agent

多智能体Multi-agent System

多个 Agent 分工协作:有的负责规划,有的负责写代码,有的负责检查。做对了是流水线,做砸了是互相甩锅的群聊。

Agent 与协议

Memory

记忆Agent Memory

让系统在多轮任务里记住用户偏好、项目事实和历史决策。可以是对话摘要,也可以是外部数据库;没有记忆,Agent 每次都像失忆上岗。

Agent 与协议

Orchestration

编排Orchestration

把提示、模型、工具、检索和人工审批串成可运行流程的那一层。单点模型很强,真正能上线的产品往往赢在编排。

Agent 与协议

ReAct

推理—行动循环Reason + Act

一种经典 Agent 写法:先想一步(Reason),再调用工具(Act),看观察结果,再想下一步。很多“会动手”的助手骨架都长这样。

Agent 与协议

Human-in-the-loop

人在回路Human-in-the-Loop

关键步骤必须人点头:发邮件前确认、改生产库前审批、高风险操作停一停。全自动很酷,可回滚的半自动往往更适合上线。

Agent 与协议

Chunking

文档分块Document Chunking

做 RAG 前,先把长文档切成合适大小的片段再向量化。切太碎丢语境,切太长检索不准——分块策略常常比换嵌入模型更管用。

Agent 与协议

Rerank

重排序Reranking

检索先粗召回一批候选,再用更精的模型重新打分排序。两段式常见于搜索和 RAG:便宜模型撒网,贵一点的模型精挑。

Agent 与协议

Skills

技能Agent Skills

把某类可复用能力打包成技能:何时触发、用哪些工具、遵守什么流程。比让模型每次从零即兴发挥,更稳、也好维护。

试试搜索