变换器

Transformer

Transformer 是一种基于自注意力机制的深度学习架构,由 Google 在 2017 年论文《Attention Is All You Need》中提出,是所有现代大语言模型(GPT、Claude、Qwen、GLM)的核心架构。

详细解释

Transformer 是深度学习史上最伟大的架构创新之一。2017 年,Google 团队 Vaswani 等人在论文《Attention Is All You Need》中提出 Transformer,完全抛弃了 RNN 的循环结构,纯靠自注意力机制处理序列数据,一举解决了 RNN 的两个致命问题:

  1. 无法并行:RNN 必须按时间步串行计算,GPU 算力浪费
  2. 长距离依赖丢失:相隔 100 步的两个词,梯度传到中间已几乎消失

Transformer 的整体架构

输入 token → Embedding → 位置编码 (Positional Encoding)

        ┌─────────────────────────────┐
        │  N ×  Encoder Block         │
        │  ┌───────────────────────┐  │
        │  │ Multi-Head Attention  │  │
        │  │  + Add & Norm         │  │
        │  │ Feed-Forward Network  │  │
        │  │  + Add & Norm         │  │
        │  └───────────────────────┘  │
        └─────────────────────────────┘

                        输出(logits)

每个 Block 包含两个核心子层:

  • Multi-Head Self-Attention:让每个 token 看到序列中所有其他 token
  • Position-wise Feed-Forward:对每个位置独立做非线性变换

关键概念

概念作用
位置编码(Positional Encoding)让模型感知「词序」信息
Multi-Head Attention多个注意力头并行,捕获不同子空间
残差连接(Residual Connection)缓解梯度消失
Layer Normalization稳定训练过程
KV Cache推理时缓存已计算的 K/V,加速生成
Masked Attention因果语言模型中遮蔽未来 token

三大主流变体

变体结构代表模型特点
Encoder-Only仅 EncoderBERT、RoBERTa适合理解任务(分类、NER)
Decoder-Only仅 DecoderGPT、LLaMA、Qwen、GLM适合生成任务,对话
Encoder-Decoder两者都有T5、BART、Flan-T5适合翻译、摘要

当前 LLM 几乎都是 Decoder-Only 路线。

唯元智创支持的 Transformer 家族

模型参数量上下文特色
DeepSeek-V4-Pro671B (MoE)128K代码、数学 SOTA
GLM-5.2110B1M双推理模式
Qwen3.7-Max480B (MoE)256K多语言王者
Kimi-K32.8T (MoE)1M长文本之王

常见问题

为什么 Transformer 能并行而 RNN 不能?
Transformer 的自注意力机制一次性计算所有 token 两两之间的关系,矩阵乘法天然适合 GPU 并行;RNN 必须 t=1,2,3… 顺序计算,无法并行。
Transformer 的计算复杂度是多少?
自注意力复杂度是 O(n²·d),其中 n 是序列长度,d 是 hidden dim。n=128K 时计算量巨大,这就是为什么 MoE / 线性注意力 / 状态空间模型(SSM)成为研究热点。