AI 术语词典
从底层原理到前沿技术,快速读懂 AI 大模型领域的核心概念。
A
应用程序接口
API(Application Programming Interface,应用程序接口)是一组定义软件组件之间交互方式的协议、工具和定义,用于让不同系统之间能够互相调用功能。
智能体
智能体(Agent)是具备自主感知、规划、决策和执行能力的 AI 系统,它以大语言模型为大脑,通过调用工具来完成复杂任务。
注意力机制
注意力机制(Attention Mechanism)是一种让模型在处理序列数据时,动态地给不同位置分配不同权重的计算方法,是 Transformer 架构的核心组件。
AI 对齐
AI 对齐(AI Alignment)是确保 AI 系统的行为与人类意图、价值观和长远利益保持一致的研究领域,是大模型安全研究的核心议题。
API 密钥
API Key(API 密钥)是一串用于鉴权的字符串,每次调用 API 时放在 Authorization: Bearer 请求头中,是计费、速率限制、权限隔离的核心凭证。
B
批大小
批大小(Batch Size)是指在模型训练或推理时,一次性送入模型的样本数量,是深度学习最重要的超参数之一。
批量接口
批量接口指离线异步处理大量请求的专用 API,相比同步接口通常享受 30%–75% 折扣,但延迟从秒级升到分钟/小时级,适合非实时批处理。
字节对编码
BPE(Byte Pair Encoding,字节对编码)是一种数据压缩算法,被广泛用于大语言模型的分词器(Tokenizer),用于将文本切分成高频子词单元。
API 基础地址
Base URL 是调用大模型 API 时请求路径的公共前缀部分,所有接口端点都挂在其下;典型值如 https://api.weimeta.cn/v1 或 https://api.openai.com/v1,漏写 /v1 是接入时最常见的 404 原因。
C
并发请求数
并发请求数指同一时刻正在等待响应、尚未完成的 API 请求总数(在飞请求),是 DeepSeek 等厂商采用的替代 RPM 的核心限流维度。
缓存命中
缓存命中指 Prompt 前缀与近期请求完全一致时,服务商直接复用已计算好的 KV 缓存,大幅降低输入 Token 成本并减少延迟。
缓存未命中
缓存未命中指 Prompt 前缀与服务端缓存记录匹配失败,模型需要从头重新计算所有输入 Token 的 KV 张量,无法享受折扣价格和加速。
检查点
Checkpoint(检查点)是模型训练过程中定期保存的模型权重快照,可用于断点续训、模型评估或版本回滚。
内容审核(安全过滤)
内容审核(安全过滤)是 API 服务端或客户端对输入 Prompt 和输出文本进行自动合规审查的机制,命中违规分类会拒绝请求或打安全标签,是大模型上线的必选项。
熔断器
熔断器(Circuit Breaker)是微服务稳定性设计模式:当某上游错误率/延迟持续超阈值时,自动在一段时间内直接失败,停止继续向坏上游投递请求,避免雪崩。
上下文窗口
上下文窗口(Context Window)是指大语言模型在一次交互中能够记住和处理的最大文本长度,通常以 Token 数量来衡量。
思维链
Chain-of-Thought 思维链是一种提示工程技巧:通过在 Prompt 中展示「问题→详细推理步骤→答案」的少样本示例,或直接写一句「请一步步思考」,显著提升大模型在数学、逻辑、多跳推理任务上的准确率。
余弦相似度
余弦相似度(Cosine Similarity)是通过计算两个向量夹角的余弦值来衡量它们相似程度的指标,取值范围 [-1, 1],是 Embedding 检索的核心度量。
D
解码阶段
Decode(解码)是大模型推理的第二阶段:基于 Prefill 产出的 KV Cache,逐 Token 自回归生成输出,每步只新增 1 个 Token,主要瓶颈是显存带宽而非算力。
扩散模型
扩散模型(Diffusion Model)是一类通过「逐步加噪-去噪」过程生成图像、音频或视频的生成式 AI 模型,是 Stable Diffusion、Sora 等明星产品的底层架构。
深度学习
深度学习(Deep Learning)是机器学习的一个分支,通过构建具有多层「人工神经网络」的模型,从海量数据中自动学习特征表示,是大语言模型的理论基础。
E
F
故障转移(回退)
Fallback(故障转移/回退)指当主模型、主厂商或主上游不可用时,API 网关自动切换到备用模型/备用厂商的高可用策略,是生产级多模型接入的必备能力。
函数调用
函数调用(Function Calling)是指大语言模型能够理解外部工具(API/函数)的功能,并在需要时智能地输出参数,让程序去执行真实动作的能力。
免费额度
免费额度(免费档)指厂商新注册账号可免费试用的赠金或配额,通常有严格的 RPM/TPM/RPD 限制与有效期,用于新手体验与技术选型验证。
频率惩罚
Frequency Penalty 频率惩罚是 OpenAI 兼容 API 的采样参数(-2.0 ~ +2.0),对每个已出现 Token 的惩罚量与其出现次数成正比,专门抑制说话结巴、同一段文字无限复制粘贴、代码中 print(1) 连打等现象。
少样本学习
少样本学习(Few-Shot Learning)是指模型仅通过少量示例(通常 1-10 个)就能学会新任务的能力,是大模型 In-Context Learning 的核心表现。
G
H
I
J
K
L
大语言模型
大语言模型(LLM)是基于深度学习(特别是 Transformer 架构)训练的、拥有数十亿甚至上万亿参数的自然语言处理模型。
低秩自适应
LoRA(Low-Rank Adaptation,低秩自适应)是一种参数高效微调技术,通过冻结原模型权重、仅训练低秩分解矩阵,实现以极低显存/成本完成大模型微调。
端到端延迟
Latency(端到端延迟)指从用户发出请求到接收到完整回答的总耗时,由网络、排队、Prefill、Decode 四部分相加组成,是评估 API 真实体验的黄金指标。
对数概率
Logprobs 是大模型对每个候选 Token 分配的概率的对数值(通常以 e 或 2 为底);API 暴露 logprobs 字段允许你拿到模型对「最可能的 Top-K 个 Token」各自打分,用于备选答案、置信度估计、困惑度计算、红队检测。
负载均衡
负载均衡指将请求按策略分发到多个上游(多厂商、多密钥、多区域、多模型)以聚合容量、降低延迟、避免单点过载,是高并发 AI 应用的基础架构能力。
M
多模态大模型
Multimodal 多模态指一类能同时理解和生成多种模态数据的大模型:不仅处理文本(Text),还能理解图片、音频、视频、3D、PDF 版式等;典型接口如 vision chat、speech-to-text、text-to-image、video understanding。
混合专家架构
混合专家 MoE 是一种大模型稀疏激活架构:将一个巨大的前馈网络拆成 N 个并行专家子网络,每次推理只由 Router 选出 Top-K 个专家参与计算,同等参数量下速度翻倍。
每分钟 Token 数
TPM 是每分钟 Token 数的缩写,指 API 在 60 秒窗口内允许处理的 Token 总量,通常包含输入和输出 Token,是长上下文场景最关键的速率限制。
每分钟请求数
RPM 是每分钟请求数的缩写,指 API 接口在 60 秒滑动窗口内允许的最大调用次数,是大模型服务商最常用的速率限制指标。
每分钟输出 Token 数
OTPM 是每分钟输出 Token 数的缩写,指模型在 60 秒窗口内允许生成的输出 Token 总量,是长文本生成、代码补全场景的关键速率指标。
每分钟输入 Token 数
ITPM 是每分钟输入 Token 数的缩写,指 API 在 60 秒窗口内允许接收的输入 Token 总量(含 Prompt、System Message、文档上下文),是 RAG 与长对话场景的关键瓶颈。
模型卡片
Model Card 模型卡片是一份标准化文档(一般由模型发布方维护),公开披露一个大模型的基本信息:大小、架构、训练数据范围、评估分数、已知偏见/风险、推荐用法与禁用场景;便于消费方选型与合规。
最大输出 Token 数
最大输出 Token 数(max_tokens / max_completion_tokens)指单次 API 请求允许模型生成的输出 Token 上限,防止输出过长或控制成本。
N
O
P
存在惩罚
Presence Penalty 存在惩罚是 OpenAI 兼容 API 的一个采样参数(-2.0 ~ +2.0),正数值会给**本轮对话中已经出现过一次以上的 Token** 额外加负对数偏置,鼓励模型聊新话题、不要原地打转。
困惑度
PPL 困惑度是衡量语言模型「对一段文本预测得有多准」的经典指标:数值越低越好,PPL=10 表示模型下一步平均在 10 个等概率候选中做选择;PPL 与平均负对数似然成指数关系。
每百万 Token 计价
每百万 Token($/M、元/M)是大模型 API 的标准报价单位,按实际消耗的 Token 数乘以每百万单价计费。
提示词
提示词(Prompt)是用户输入给大语言模型的文本指令,可以是问题、任务描述、上下文或示例,是 LLM 时代最核心的「编程语言」。
提示词工程
提示词工程(Prompt Engineering)是指通过设计、优化和迭代输入给大语言模型的文本(Prompt),来引导模型输出更高质量、更符合预期的结果的一门技术。
提示词缓存
提示词缓存是服务商在服务端保存 Prompt 前缀的 KV 张量缓存机制,匹配时直接复用已计算结果,降低成本并显著缩短首Token延迟。
提示词注入攻击
提示词注入 Prompt Injection 是一类针对 LLM 的攻击手法:攻击者在用户输入中嵌入恶意指令,诱使模型绕过 System Prompt 执行越权操作(泄露提示词、调用危险函数、输出违规内容)。
预填充阶段
Prefill(预填充)是大模型推理的第一阶段:并行处理全部输入 Prompt,计算出所有输入 Token 的 KV 缓存和第一个输出 Token 的概率分布,决定了首 Token 延迟(TTFT)。
Q
R
基于人类反馈的强化学习
RLHF(Reinforcement Learning from Human Feedback)是利用人类对模型输出的偏好排序训练奖励模型,再通过强化学习优化大模型的技术,是 ChatGPT 引爆的关键。
检索增强生成
检索增强生成(RAG)是一种结合了信息检索和文本生成的技术,旨在让大语言模型基于外部知识库给出准确回答,从而减少幻觉。
每秒请求数
RPS 每秒请求数衡量 API 系统实际吞吐能力:1 秒内成功处理的请求(非 Token)数量;和 RPM 的关系是 RPS = RPM ÷ 60。RPS 是 API 网关容量规划、SLA 承诺、压测的核心指标。
每日请求数
RPD 是每日请求数的缩写,指 API 在 24 小时滚动或日切窗口内允许的总调用次数,是免费档、低档位账号最常见的硬性日配额天花板。
速率限制
速率限制是 API 服务商为防止滥用、保障公平性对单位时间内调用量或 Token 量设置的硬性上限,超限通常返回 HTTP 429。
S
服务等级协议
SLA 服务等级协议是 AI API 供应商与客户之间的正式承诺:一般以月度可用性百分比(如 99.9%)、首字延迟 P95、错误率为核心指标,未达标时按比例退款或抵扣下月账单。
结构化输出
结构化输出指一类 API 能力:通过 response_format、JSON Schema 等参数约束模型 100% 返回合法 JSON/指定格式,避免空白字符、语法错误、字段缺失。
流式输出
流式输出是 API 按 Server-Sent Events(SSE)协议逐 Token 返回结果的响应方式,让用户能边生成边阅读,显著改善交互体感。
每秒 Token 数
TPS 是每秒 Token 数的缩写,指模型生成输出的实时速度,直接决定聊天界面流式输出的流畅度与用户体验。
随机种子
Seed(随机种子)是 API 整数参数,指定后模型采样过程将尽量保持确定性,相同的 seed + 相同参数 + 相同输入理论上返回相同输出,用于测试、A/B、可复现流程。
停止序列
Stop Sequence(停止序列)是字符串数组,作为生成终止信号;模型一旦命中其中任何一个字符串就立刻停输,常用于 JSON 收尾、对话段结束,避免无限续写。
投机解码
投机解码 Speculative Decoding 是一种推理加速方法:先用一个小而快的草稿模型猜测未来 K 个 Token,再用大模型一次性并行验证,猜对了就整段跳过,实测 TPS 提升 2–4 倍不损失输出分布。
系统提示词
System Prompt(系统提示词)是在对话消息列表里 role=system 的消息,用于设定模型人设、能力边界、输出格式、规则约束,位于 Prompt 最开头且通常跨多轮保持不变。
系统指纹
System Fingerprint 是 OpenAI 2024 年引入的响应字段(形如 fp_abc123),用于标识当前请求实际使用的底层模型检查点/配置快照;同模型名不同 fp 意味着输出分布有漂移,可复现性受影响。
消费上限
消费上限指 API 账号每月可花费的最大金额限制,分为服务商强制的层级消费上限和用户自设预算,防止意外超支。
T
变换器
Transformer 是一种基于自注意力机制的深度学习架构,由 Google 在 2017 年论文《Attention Is All You Need》中提出,是所有现代大语言模型(GPT、Claude、Qwen、GLM)的核心架构。
采样温度
Temperature(采样温度)是 API 参数,用于控制模型生成 Token 时的随机性/创造性:值越低越确定和重复,值越高越发散和多样,典型取值 0 到 2 之间。
词元
词元(Token)是模型处理文本的最小语义单元,可以是一个汉字、一个英文单词,或一个字符片段。
分词器
Tokenizer(分词器)是把人类可读文本映射成模型能理解的整数 Token ID 的组件,是大模型 API 计费和输入处理的最前端,它决定了 1 个汉字等于多少 Token、1 段代码如何切分。
核采样概率阈值
Top-P(核采样)是控制采样范围的参数:只保留累计概率达到 P 的最可能 Token 集合作为候选,从集合内按相对概率采样,典型值 0.1 ~ 0.95,是 Temperature 的常见替代方案。
令牌桶算法
令牌桶算法是 API 限流最常用的实现方式:按恒定速率向桶中补充令牌,请求需要消耗对应数量的令牌才允许通过,支持合理的流量突发。
每日 Token 数
TPD 是每日 Token 数的缩写,指 API 在 24 小时窗口内允许处理的输入+输出 Token 总量,是免费版和低配额账号的日级 Token 天花板。
首 Token 延迟
首 Token 延迟(TTFT)指从 API 请求发出到收到模型返回的第一个 Token 之间的时长,是衡量聊天交互流畅度的关键指标。
Top-K 采样
Top-K 采样是大模型生成的一种解码策略:每一步只从概率最高的前 K 个候选 Token 里做随机采样,过滤掉长尾低概率选项,减少输出胡说八道同时保留多样性。