少样本学习
Few-Shot Learning
少样本学习(Few-Shot Learning)是指模型仅通过少量示例(通常 1-10 个)就能学会新任务的能力,是大模型 In-Context Learning 的核心表现。
详细解释
少样本学习(Few-Shot Learning)是一种「不更新模型参数、仅靠 Prompt 中的示例就能让模型学会新任务」的能力。GPT-3 论文《Language Models are Few-Shot Learners》正是这种现象的命名来源。
在工程上,Few-Shot 通常通过 In-Context Learning(ICL)实现——在 Prompt 里给模型几个问答对,模型在「读完示例」后能直接模仿回答新问题。
三种学习范式对比
| 范式 | 所需样本 | 是否更新参数 | 适用模型 |
|---|---|---|---|
| Zero-Shot | 0 个 | 否 | GPT-4、Claude、Qwen3 |
| One-Shot | 1 个 | 否 | 所有 LLM |
| Few-Shot | 2-10 个 | 否 | 所有 LLM(推荐 ≥ 6B) |
| Fine-Tuning | 100+ 个 | 是 | 全量或 LoRA 微调 |
| RLHF | 万级人类标注 | 是 | 模型对齐训练 |
实战示例
Zero-Shot(直接提问):
把下面的句子翻译成英文:我爱 AI。
Few-Shot(给 3 个示例):
把中文翻译成英文:
苹果 → Apple
香蕉 → Banana
猫 → Cat
我爱 AI →
模型会输出:I love AI.
注意事项
- 示例选择要多样化:覆盖不同 edge case。
- 示例顺序很重要:相关示例放前面,模型更准。
- 示例太多会挤占 token:4-8 个是性价比甜点。
- 示例必须格式一致:否则模型会困惑。
常见问题
Few-Shot 越多越好吗?
不一定。超过 8-16 个示例,模型提升趋于饱和,且消耗大量 token 增加成本。一般 3-5 个精心设计的示例就足够。
Few-Shot 和微调怎么选?
Few-Shot 适合快速验证、任务多变;微调适合任务稳定、要求高准确率/低延迟/低成本(推理时省 Prompt token)。