AI 术语词典

从底层原理到前沿技术,快速读懂 AI 大模型领域的核心概念。

A

B

C

并发请求数

Concurrent Requests / In-Flight Requests

并发请求数指同一时刻正在等待响应、尚未完成的 API 请求总数(在飞请求),是 DeepSeek 等厂商采用的替代 RPM 的核心限流维度。

缓存命中

Cache Hit

缓存命中指 Prompt 前缀与近期请求完全一致时,服务商直接复用已计算好的 KV 缓存,大幅降低输入 Token 成本并减少延迟。

缓存未命中

Cache Miss

缓存未命中指 Prompt 前缀与服务端缓存记录匹配失败,模型需要从头重新计算所有输入 Token 的 KV 张量,无法享受折扣价格和加速。

检查点

Checkpoint

Checkpoint(检查点)是模型训练过程中定期保存的模型权重快照,可用于断点续训、模型评估或版本回滚。

内容审核(安全过滤)

Content Moderation / Safety Filter

内容审核(安全过滤)是 API 服务端或客户端对输入 Prompt 和输出文本进行自动合规审查的机制,命中违规分类会拒绝请求或打安全标签,是大模型上线的必选项。

熔断器

Circuit Breaker

熔断器(Circuit Breaker)是微服务稳定性设计模式:当某上游错误率/延迟持续超阈值时,自动在一段时间内直接失败,停止继续向坏上游投递请求,避免雪崩。

上下文窗口

Context Window

上下文窗口(Context Window)是指大语言模型在一次交互中能够记住和处理的最大文本长度,通常以 Token 数量来衡量。

思维链

Chain-of-Thought (CoT)

Chain-of-Thought 思维链是一种提示工程技巧:通过在 Prompt 中展示「问题→详细推理步骤→答案」的少样本示例,或直接写一句「请一步步思考」,显著提升大模型在数学、逻辑、多跳推理任务上的准确率。

余弦相似度

Cosine Similarity

余弦相似度(Cosine Similarity)是通过计算两个向量夹角的余弦值来衡量它们相似程度的指标,取值范围 [-1, 1],是 Embedding 检索的核心度量。

D

E

F

G

H

I

J

K

L

M

多模态大模型

Multimodal LLM

Multimodal 多模态指一类能同时理解和生成多种模态数据的大模型:不仅处理文本(Text),还能理解图片、音频、视频、3D、PDF 版式等;典型接口如 vision chat、speech-to-text、text-to-image、video understanding。

混合专家架构

MoE (Mixture of Experts)

混合专家 MoE 是一种大模型稀疏激活架构:将一个巨大的前馈网络拆成 N 个并行专家子网络,每次推理只由 Router 选出 Top-K 个专家参与计算,同等参数量下速度翻倍。

每分钟 Token 数

TPM (Tokens Per Minute)

TPM 是每分钟 Token 数的缩写,指 API 在 60 秒窗口内允许处理的 Token 总量,通常包含输入和输出 Token,是长上下文场景最关键的速率限制。

每分钟请求数

RPM (Requests Per Minute)

RPM 是每分钟请求数的缩写,指 API 接口在 60 秒滑动窗口内允许的最大调用次数,是大模型服务商最常用的速率限制指标。

每分钟输出 Token 数

OTPM (Output Tokens Per Minute)

OTPM 是每分钟输出 Token 数的缩写,指模型在 60 秒窗口内允许生成的输出 Token 总量,是长文本生成、代码补全场景的关键速率指标。

每分钟输入 Token 数

ITPM (Input Tokens Per Minute)

ITPM 是每分钟输入 Token 数的缩写,指 API 在 60 秒窗口内允许接收的输入 Token 总量(含 Prompt、System Message、文档上下文),是 RAG 与长对话场景的关键瓶颈。

模型卡片

Model Card

Model Card 模型卡片是一份标准化文档(一般由模型发布方维护),公开披露一个大模型的基本信息:大小、架构、训练数据范围、评估分数、已知偏见/风险、推荐用法与禁用场景;便于消费方选型与合规。

最大输出 Token 数

Max Output Tokens

最大输出 Token 数(max_tokens / max_completion_tokens)指单次 API 请求允许模型生成的输出 Token 上限,防止输出过长或控制成本。

N

O

P

存在惩罚

Presence Penalty

Presence Penalty 存在惩罚是 OpenAI 兼容 API 的一个采样参数(-2.0 ~ +2.0),正数值会给**本轮对话中已经出现过一次以上的 Token** 额外加负对数偏置,鼓励模型聊新话题、不要原地打转。

困惑度

PPL (Perplexity)

PPL 困惑度是衡量语言模型「对一段文本预测得有多准」的经典指标:数值越低越好,PPL=10 表示模型下一步平均在 10 个等概率候选中做选择;PPL 与平均负对数似然成指数关系。

每百万 Token 计价

Per-Million-Tokens Pricing

每百万 Token($/M、元/M)是大模型 API 的标准报价单位,按实际消耗的 Token 数乘以每百万单价计费。

提示词

Prompt

提示词(Prompt)是用户输入给大语言模型的文本指令,可以是问题、任务描述、上下文或示例,是 LLM 时代最核心的「编程语言」。

提示词工程

Prompt Engineering

提示词工程(Prompt Engineering)是指通过设计、优化和迭代输入给大语言模型的文本(Prompt),来引导模型输出更高质量、更符合预期的结果的一门技术。

提示词缓存

Prompt Caching

提示词缓存是服务商在服务端保存 Prompt 前缀的 KV 张量缓存机制,匹配时直接复用已计算结果,降低成本并显著缩短首Token延迟。

提示词注入攻击

Prompt Injection

提示词注入 Prompt Injection 是一类针对 LLM 的攻击手法:攻击者在用户输入中嵌入恶意指令,诱使模型绕过 System Prompt 执行越权操作(泄露提示词、调用危险函数、输出违规内容)。

预填充阶段

Prefill Phase

Prefill(预填充)是大模型推理的第一阶段:并行处理全部输入 Prompt,计算出所有输入 Token 的 KV 缓存和第一个输出 Token 的概率分布,决定了首 Token 延迟(TTFT)。

Q

R

S

服务等级协议

SLA (Service Level Agreement)

SLA 服务等级协议是 AI API 供应商与客户之间的正式承诺:一般以月度可用性百分比(如 99.9%)、首字延迟 P95、错误率为核心指标,未达标时按比例退款或抵扣下月账单。

结构化输出

Structured Outputs (JSON Mode)

结构化输出指一类 API 能力:通过 response_format、JSON Schema 等参数约束模型 100% 返回合法 JSON/指定格式,避免空白字符、语法错误、字段缺失。

流式输出

Streaming Output (SSE)

流式输出是 API 按 Server-Sent Events(SSE)协议逐 Token 返回结果的响应方式,让用户能边生成边阅读,显著改善交互体感。

每秒 Token 数

TPS (Tokens Per Second)

TPS 是每秒 Token 数的缩写,指模型生成输出的实时速度,直接决定聊天界面流式输出的流畅度与用户体验。

随机种子

Seed Parameter

Seed(随机种子)是 API 整数参数,指定后模型采样过程将尽量保持确定性,相同的 seed + 相同参数 + 相同输入理论上返回相同输出,用于测试、A/B、可复现流程。

停止序列

Stop Sequence / Stop

Stop Sequence(停止序列)是字符串数组,作为生成终止信号;模型一旦命中其中任何一个字符串就立刻停输,常用于 JSON 收尾、对话段结束,避免无限续写。

投机解码

Speculative Decoding

投机解码 Speculative Decoding 是一种推理加速方法:先用一个小而快的草稿模型猜测未来 K 个 Token,再用大模型一次性并行验证,猜对了就整段跳过,实测 TPS 提升 2–4 倍不损失输出分布。

系统提示词

System Prompt

System Prompt(系统提示词)是在对话消息列表里 role=system 的消息,用于设定模型人设、能力边界、输出格式、规则约束,位于 Prompt 最开头且通常跨多轮保持不变。

系统指纹

System Fingerprint

System Fingerprint 是 OpenAI 2024 年引入的响应字段(形如 fp_abc123),用于标识当前请求实际使用的底层模型检查点/配置快照;同模型名不同 fp 意味着输出分布有漂移,可复现性受影响。

消费上限

Spend Limit / Monthly Budget

消费上限指 API 账号每月可花费的最大金额限制,分为服务商强制的层级消费上限和用户自设预算,防止意外超支。

T

变换器

Transformer

Transformer 是一种基于自注意力机制的深度学习架构,由 Google 在 2017 年论文《Attention Is All You Need》中提出,是所有现代大语言模型(GPT、Claude、Qwen、GLM)的核心架构。

采样温度

Temperature

Temperature(采样温度)是 API 参数,用于控制模型生成 Token 时的随机性/创造性:值越低越确定和重复,值越高越发散和多样,典型取值 0 到 2 之间。

词元

Token

词元(Token)是模型处理文本的最小语义单元,可以是一个汉字、一个英文单词,或一个字符片段。

分词器

Tokenizer

Tokenizer(分词器)是把人类可读文本映射成模型能理解的整数 Token ID 的组件,是大模型 API 计费和输入处理的最前端,它决定了 1 个汉字等于多少 Token、1 段代码如何切分。

核采样概率阈值

Top-P (Nucleus Sampling)

Top-P(核采样)是控制采样范围的参数:只保留累计概率达到 P 的最可能 Token 集合作为候选,从集合内按相对概率采样,典型值 0.1 ~ 0.95,是 Temperature 的常见替代方案。

令牌桶算法

Token Bucket Algorithm

令牌桶算法是 API 限流最常用的实现方式:按恒定速率向桶中补充令牌,请求需要消耗对应数量的令牌才允许通过,支持合理的流量突发。

每日 Token 数

TPD (Tokens Per Day)

TPD 是每日 Token 数的缩写,指 API 在 24 小时窗口内允许处理的输入+输出 Token 总量,是免费版和低配额账号的日级 Token 天花板。

首 Token 延迟

TTFT (Time To First Token)

首 Token 延迟(TTFT)指从 API 请求发出到收到模型返回的第一个 Token 之间的时长,是衡量聊天交互流畅度的关键指标。

Top-K 采样

Top-K Sampling

Top-K 采样是大模型生成的一种解码策略:每一步只从概率最高的前 K 个候选 Token 里做随机采样,过滤掉长尾低概率选项,减少输出胡说八道同时保留多样性。

U

V