变换器
Transformer
Transformer 是一种基于自注意力机制的深度学习架构,由 Google 在 2017 年论文《Attention Is All You Need》中提出,是所有现代大语言模型(GPT、Claude、Qwen、GLM)的核心架构。
详细解释
Transformer 是深度学习史上最伟大的架构创新之一。2017 年,Google 团队 Vaswani 等人在论文《Attention Is All You Need》中提出 Transformer,完全抛弃了 RNN 的循环结构,纯靠自注意力机制处理序列数据,一举解决了 RNN 的两个致命问题:
- 无法并行:RNN 必须按时间步串行计算,GPU 算力浪费
- 长距离依赖丢失:相隔 100 步的两个词,梯度传到中间已几乎消失
Transformer 的整体架构
输入 token → Embedding → 位置编码 (Positional Encoding)
↓
┌─────────────────────────────┐
│ N × Encoder Block │
│ ┌───────────────────────┐ │
│ │ Multi-Head Attention │ │
│ │ + Add & Norm │ │
│ │ Feed-Forward Network │ │
│ │ + Add & Norm │ │
│ └───────────────────────┘ │
└─────────────────────────────┘
↓
输出(logits)
每个 Block 包含两个核心子层:
- Multi-Head Self-Attention:让每个 token 看到序列中所有其他 token
- Position-wise Feed-Forward:对每个位置独立做非线性变换
关键概念
| 概念 | 作用 |
|---|---|
| 位置编码(Positional Encoding) | 让模型感知「词序」信息 |
| Multi-Head Attention | 多个注意力头并行,捕获不同子空间 |
| 残差连接(Residual Connection) | 缓解梯度消失 |
| Layer Normalization | 稳定训练过程 |
| KV Cache | 推理时缓存已计算的 K/V,加速生成 |
| Masked Attention | 因果语言模型中遮蔽未来 token |
三大主流变体
| 变体 | 结构 | 代表模型 | 特点 |
|---|---|---|---|
| Encoder-Only | 仅 Encoder | BERT、RoBERTa | 适合理解任务(分类、NER) |
| Decoder-Only | 仅 Decoder | GPT、LLaMA、Qwen、GLM | 适合生成任务,对话 |
| Encoder-Decoder | 两者都有 | T5、BART、Flan-T5 | 适合翻译、摘要 |
当前 LLM 几乎都是 Decoder-Only 路线。
唯元智创支持的 Transformer 家族
| 模型 | 参数量 | 上下文 | 特色 |
|---|---|---|---|
| DeepSeek-V4-Pro | 671B (MoE) | 128K | 代码、数学 SOTA |
| GLM-5.2 | 110B | 1M | 双推理模式 |
| Qwen3.7-Max | 480B (MoE) | 256K | 多语言王者 |
| Kimi-K3 | 2.8T (MoE) | 1M | 长文本之王 |
常见问题
为什么 Transformer 能并行而 RNN 不能?
Transformer 的自注意力机制一次性计算所有 token 两两之间的关系,矩阵乘法天然适合 GPU 并行;RNN 必须 t=1,2,3… 顺序计算,无法并行。
Transformer 的计算复杂度是多少?
自注意力复杂度是 O(n²·d),其中 n 是序列长度,d 是 hidden dim。n=128K 时计算量巨大,这就是为什么 MoE / 线性注意力 / 状态空间模型(SSM)成为研究热点。