SOTA
在某一明确任务、数据集和评测设定下,目前公开记录里最好的那一档成绩。它描述的是“在这场考试里第一名”,不是“处处都最强”。
注意离开任务、指标和成本约束谈 SOTA,多半是营销话术。换一套数据或换一个延迟预算,排名经常整个翻盘。
一张卡讲清一个词:它是什么、你会在哪碰到它、又最容易被怎样误读。
在某一明确任务、数据集和评测设定下,目前公开记录里最好的那一档成绩。它描述的是“在这场考试里第一名”,不是“处处都最强”。
注意离开任务、指标和成本约束谈 SOTA,多半是营销话术。换一套数据或换一个延迟预算,排名经常整个翻盘。
用海量文本训练出来、能读懂并写出自然语言的大型模型。你今天用的聊天助手、写代码助手,底座多半就是它。
参数更少、更省算力的语言模型。常见于手机端、公司内网私有部署,或边界很清楚的单一任务。
先在广泛数据上练出通用能力的底座模型。下游产品很少从零训练,多半是在这个底座上继续改、继续接。
2017 年提出的神经网络骨架,靠注意力机制处理序列。今天绝大多数大语言模型,骨子里都是它的变体。
让模型在处理当前位置时,能“看向”输入里更相关的其他位置,而不是一视同仁扫一遍。Self-Attention 是其中最常见的形态。
把模型拆成许多“专家”子网络,每次只叫醒其中几位干活。总参数可以很大,单次计算却不必全开,是扩容常用的路子。
不只吃文字,还能看图、听声、理解视频,有的还能反过来生成这些内容。一句话:多种“感官”共用一套脑子。
专门为多步思考、数学、代码和复杂规划加强过的模型。回答前往往会先在内部“打草稿”,而不只是脱口而出。
生成图像、视频时常用的技术路线:先从噪声开始,一步步“洗”成清晰内容。Stable Diffusion、许多文生图工具都走这条路。
把一段文字、一张图变成一串数字(向量)。语义接近的内容,在数字空间里距离也会更近,所以能拿来做搜索和推荐。
模型权重可以下载、部署、再训练的发布形态。不等于完全开源:许可证、训练数据、代码是否公开,往往还得分开看。
注意“开源模型”口语里常被混用。严格说,开放权重只保证你能拿到参数,不保证训练配方也公开。
模型里可学习的权重个数,常写成 7B、70B。它粗略反映容量上限,但不直接等于“更聪明”——架构、数据与训练同样关键。
一个词(Token)接一个词往外写:每次只预测下一步,再把刚写出的内容喂回自己。ChatGPT 式对话,底层多半是这种生成方式。
试图在内部模拟“世界如何运转”的模型思路:不只背答案,还要预测行动会带来什么结果。在机器人、自动驾驶和部分 Agent 研究里常被提起。
能同时理解图像和文字的模型:看图说话、读截图答题、根据界面描述下一步操作。多模态里最常见、也最先产品化的一支。
TTS 把文字念成语音,ASR 把说话转成文字。语音助手、会议纪要、有声内容,都靠这一对“耳朵和嘴巴”。
把自然语言切成模型能吃的 Token 的规则组件。同一段中文,不同分词器切法不同,直接关系到上下文够不够用、API 账单贵不贵。
更大更强的模型通常更慢更贵。产品选型不是只看榜一,而是在延迟、成本、准确率之间找能上线的那一档。
用海量通用数据先把模型“喂大”的阶段。目标是学会语言规律和广谱知识,产品味还没调,像一块生好的面团。
预训练之后的一揽子加工:指令微调、偏好对齐、工具使用训练等。用户真正感觉到的“好不好用”,很多是这一阶段做出来的。
在现成底座上继续训练,让它更懂某个行业、某种口吻或某类任务。不必重训整座山,只需把方向拧准一点。
用人工写好或精选的问答对示范“该怎么答”。这是把只会续写的底座,变成愿意按指令办事的助手,最常见的一步。
让人给多个回答打分或排序,再把这些偏好变成训练信号,用强化学习推着模型往“更受欢迎”的方向走。ChatGPT 早期好用,它是关键一环。
直接用“哪个回答更好”的对比数据来优化模型,省掉 RLHF 里单独训练奖励模型、再跑强化学习的那套重流程。很多团队拿它当更省事的对齐路径。
专门学“人更喜欢哪种回答”的打分模型。在经典 RLHF 流程里,它代替真人实时打分,给主模型提供优化方向。
让小模型模仿大模型的输出或思路,用更低成本换接近的能力。像请学霸带学渣刷题——学渣变强,学费却更便宜。
微调时不改动全部参数,只训练很小一块“补丁”。显存和存储都更省,适合给同一个底座挂很多行业专用版本。
描述模型规模、数据量、算力与效果之间经验关系的规律。它解释了“为什么大家一直在堆更大模型”,也提醒你:堆到某一档之后,回报会变钝。
由模型或程序生成、再经筛选后用于训练的数据。能补稀缺场景,也可能把错误和偏见放大——关键在过滤与校验,不在“能不能造”。
让模型行为更符合人类意图、价值观和安全边界的一整套目标与方法。它既是技术活(SFT、RLHF),也是产品与政策选择。
只训练模型里很小一部分参数(或外挂补丁)就能适配新任务的方法总称。LoRA 是其中最出名的代表,省显存、好分发。
一种用组内相对打分来优化策略的强化学习算法,DeepSeek 等推理模型训练里常被提起。目标仍是:让更好的推理轨迹更常出现。
经典的强化学习算法,早期 RLHF 流水线里很常见。它一步步小幅更新策略,避免模型“学飞了”突然崩掉。
模型学新任务时,把旧能力忘得一干二净。微调领域数据时很常见,所以才有回放数据、约束更新、多任务混合等补救手段。
像给人排课一样,先易后难地安排训练样本或任务。用得好能稳住训练、加快收敛;用得差只是多了一层花活。
模型读写文字时切出来的最小计费与计算单位,可能是一个词、半个词或几个字符。上下文长度、速度、API 账单,都围着它转。
模型一次能同时“看见”的最大信息量,通常用 Token 数衡量。窗口越大,越能塞长文档,但成本和延迟也常跟着涨。
模型参数已经训好,只根据输入生成回答或预测的阶段。你日常点发送、等回复,用的就是推理,不是训练。
注意这里的“推理”指运行模型出结果,和 Reasoning Model 里那种“深度思考能力”不是同一件事。
把已经算过的上下文中间结果存起来,生成下一个词时不必从头重算。对话越长、越依赖它省时间,也越吃显存。
用更低精度(如 8 位、4 位)表示权重或计算,换更少显存、更快速度和更低成本。常会牺牲一点点精度,但很多场景里完全划算。
面向大模型在线服务的开源推理引擎,以高吞吐和显存利用见长。名字本身不是缩写,业内常把它当作“把模型真正跑起来”的默认选项之一。
注意不要把 vLLM 展开成 Virtual Large Language Model——那是常见误传。
从发出请求到看到结果要等多久。对话场景里常拆成 TTFT(首字延迟)和整段生成时间;体感卡不卡,往往先看首字。
系统单位时间内能处理多少请求或生成多少 Token。个人觉得“快”,和服务端能同时扛住多少人,是两本账。
先让小模型快速草拟几个后续 Token,再由大模型一次性验收。猜对了就省时间,猜错了再改正——用并行换延迟。
模型边生成边把内容推到界面,而不是等整段写完再一次性弹出。体感更跟手,也是多数聊天产品的默认交互。
推理服务里动态拼车:谁先生成完就先下车,新请求马上补位,显卡尽量不空转。高并发场景下,它是吞吐的关键杠杆。
把训好的模型挂成可调用服务:鉴权、限流、批处理、监控、扩缩容全包。研究里的 checkpoint,离产品可用的 API 还隔着这一层。
模型直接跑在手机、电脑、车机等本地设备上,少依赖云端。省网络延迟、更利于隐私,但受制于芯片和电池。
生成可拆成两段:Prefill 先吞完整段输入,Decode 再一个个往外吐 Token。优化服务时,这两段的瓶颈往往不一样。
单卡塞不下大模型时,把计算拆到多卡:张量并行切一层内部的矩阵,流水线并行把不同层分给不同卡。训练和推理都会用到。
把提示、检索结果、工具调用、延迟、费用和失败原因记下来,方便排查“它为什么这样答”。没有观测,线上 AI 只能靠玄学修。
你交给模型的输入:问题、指令、背景材料、示例都可以算。同一模型,提示写得好不好,输出差距经常大得离谱。
开发者预设的“人设与规矩”,通常用户看不见或不好改:你是谁、能做什么、不能越哪些线。产品性格很大程度写在这里。
控制生成随机性的旋钮。偏低更稳、更像在考试;偏高更跳、更像在头脑风暴。不是越高越聪明,只是越敢乱发挥。
让模型把推理步骤显式写出来(或在内部展开),而不是直接甩结论。复杂算术、逻辑题上,这一招常常明显提分。
在提示里塞几个示例,让模型照葫芦画瓢。不用改参数,当场教它格式和风格;例子为 0 时就叫 Zero-shot。
不更新权重,只靠当前对话窗口里的说明和例子临时学会新任务。大模型让人惊讶的地方之一,就是它很会“现学现用”。
把回答拴在可核对的材料上:文档、检索结果、工具返回值,而不是凭模型记忆自由发挥。减少一本正经胡说八道的常用手段。
不只写一句漂亮提示,而是设计模型此刻能看到的全部信息:系统规则、检索片段、工具结果、对话摘要、格式约束。窗口有限,塞什么、丢什么都是产品决策。
要求模型按 JSON、表格或既定 schema 吐结果,方便程序直接解析。做工作流、填表单、接 API 时,比“写一段散文”可靠得多。
生成时只在概率累计达到 p 的那一小撮候选词里抽样。和 Temperature 常一起调:一个管“多野”,一个管“从多宽的词表里挑”。
告诉模型:一生成到这些字符就收工。用来截断废话、模仿对话轮次,或防止它把示例格式继续往下编。
把反复出现的长前缀(系统提示、大文档)缓存下来,下次少算一遍。长上下文应用里,这是控成本和降延迟的实用杠杆。
固定的题目、数据和打分规则,用来横向比较模型在某类能力上的表现。它像公开考试,方便排名,也容易被针对性刷分。
系统化检验模型或 AI 产品好不好用、安不安全的过程。可以是公开榜单,也可以是上线前的内部考卷和回归测试。
模型编得像真的、其实没依据或与事实不符。语气越自信,越容易骗过你——这不是“故意撒谎”,是生成机制本身就会补全缺口。
用特殊提示绕过模型的安全限制,诱导它输出本不该给的内容。安全团队会主动研究它,产品侧也要持续修补。
把恶意指令藏进网页、文档或工具返回里,企图覆盖开发者设定的系统规则。Agent 越能读外部内容,这项风险越现实。
故意扮演攻击者或刁钻用户,去抠系统的越权、误用和安全漏洞。上线前找疼点,比上线后公关便宜得多。
套在模型外围的约束:输入过滤、输出审核、工具权限、速率与范围限制。模型本身不一定听话,护栏负责兜底。
评测题或答案在训练阶段就泄露进数据,导致分数虚高。榜好看,不代表模型真会做没见过的题。
把题目加载、模型调用、打分、汇总跑成一条流水线的工具集。团队要持续对比版本,离不开可重复的 harness,而不是手工贴结果。
让真人按量表给回答打分或两两比较。自动指标够不着的地方——语气、有用性、是否越界——最终还得人说了算。
模型识别到敏感或越权请求后选择不回答或只给安全替代。拒答过多会像复读机,过少又危险,边界本身就是产品策略。
能定位到具体个人的信息:姓名、手机、证件号、住址等。训练、日志和回答里一旦乱泄,法律和信任成本都很高。
把“模型该怎么做人”写成可执行的规范:何时帮助、何时拒绝、如何处理冲突指令。对齐不再只靠感觉,而有一份可对照的说明书。
先去知识库里把相关材料找出来,再让模型据此回答。适合公司文档、政策条文这类“必须有出处”的场景。
不只聊天,还能拆目标、调工具、看结果、再决定下一步的系统。从“回答问题”变成“替你把事推进一段”。
注意叫 Agent 不等于真能自主打工。没有可靠工具、记忆和权限设计,它只是套了循环的聊天机器人。
让模型按约定格式发起外部调用:搜网页、查数据库、跑代码、改日历。模型负责“想调什么”,真正执行通常在你的后端。
一套让 AI 应用连接外部工具和数据源的开放协议,目标是少写一次性集成、多复用标准接口。像给 Agent 世界准备的 USB。
让不同 Agent 彼此发现能力、交接任务、协同完成工作的协议方向。重点从“人和一个助手对话”,扩展到“助手之间怎么协作”。
让模型看屏幕、点鼠标、敲键盘,像人一样操作电脑完成任务。门槛高、风险也大,是 Agent 能力的前沿形态之一。
多个 Agent 分工协作:有的负责规划,有的负责写代码,有的负责检查。做对了是流水线,做砸了是互相甩锅的群聊。
让系统在多轮任务里记住用户偏好、项目事实和历史决策。可以是对话摘要,也可以是外部数据库;没有记忆,Agent 每次都像失忆上岗。
把提示、模型、工具、检索和人工审批串成可运行流程的那一层。单点模型很强,真正能上线的产品往往赢在编排。
一种经典 Agent 写法:先想一步(Reason),再调用工具(Act),看观察结果,再想下一步。很多“会动手”的助手骨架都长这样。
关键步骤必须人点头:发邮件前确认、改生产库前审批、高风险操作停一停。全自动很酷,可回滚的半自动往往更适合上线。
做 RAG 前,先把长文档切成合适大小的片段再向量化。切太碎丢语境,切太长检索不准——分块策略常常比换嵌入模型更管用。
检索先粗召回一批候选,再用更精的模型重新打分排序。两段式常见于搜索和 RAG:便宜模型撒网,贵一点的模型精挑。
关键词检索和向量语义检索一起用,再融合排序。专有名词、编号、口语换说法混在一起时,单靠一种检索经常漏。
把某类可复用能力打包成技能:何时触发、用哪些工具、遵守什么流程。比让模型每次从零即兴发挥,更稳、也好维护。
没有找到对应术语。试试英文缩写、完整英文、中文名,或更短的关键词。