详细解释
Emergent Abilities(涌现能力 / 突现能力) 一句话定义:同样一个任务(比如 3 位数乘法、说一句笑话、用 CoT 解复杂推理、看懂高级抽象类比),你拿 1B 参数小模型做正确率 5%(和瞎猜差不多),3B 模型 8%,7B 模型 15%,13B 模型 20%,看起来线性慢慢涨没啥意思——但参数量一把拉到 70B,正确率从 20% 猛地跳涨到 60%+,拉到 175B+ 直接冲到 85%;而且这种能力不是你把小模型的线性外推,是到了某个 magic threshold 突然跳出来的,就像「量变引起质变」**。
这个现象是 2022 年谷歌 Brain 团队在论文《Emergent Abilities of Large Language Models》里首次系统定义和量化的,是整个 LLM 时代最核心的信仰来源——因为它证明了「只要继续把模型做大,会突然自动拥有你想都不敢想的新能力」,也是 OpenAI 从 GPT-3 (175B) 到 GPT-4 一直死磕 scaling 的根本信念支撑。
典型的已被广泛证实的涌现能力包括但不限于:(1) **Chain-of-Thought 推理(给出中间步骤后数学题正确率暴涨);(2) **Few-shot Learning(给 3-5 个示例就能学新任务,小模型 few-shot 根本没用);(3) **Instruction Following(听懂人类自然语言指令做没见过的新任务);(4) **多步组合推理(工具调用 + 规划 + 子问题分解);(5) **Theory of Mind(理解他人信念意图的心理理论能力);(6) **In-context Learning(上下文内学习,不需要梯度更新)。
唯元智创 控制台内置了「各模型涌现能力覆盖矩阵」可视化面板:你选一个具体业务任务(比如「从合同里抽取 10 个字段做信息抽取」),平台自动跑 7B / 14B / 32B / 70B / 128B 五个档位模型的实际任务正确率曲线,告诉你:你这个任务的「涌现阈值」在多少亿参数——如果是 32B 就够用,就别多花钱上 128B 模型了。
已证实的涌现能力对应涌现阈值参考表(公开 Benchmark 测得)
| 涌现能力 | 涌现阈值参数量(密集 Transformer) | 小模型 (<13B) 正确率 | 大模型 (>=70B) 正确率 | 代表任务示例 |
|---|---|---|---|---|
| **CoT 多步数学推理 (GSM8K) | ~60B+ | 5-10% | 70-85% | 有 13 个苹果,吃了 5 个,给了朋友 3 个,妈妈又买了 8 个,现在几个? |
| **3 位数 × 3 位数乘法 | ~100B+ | <10% | 40-70% | 387 × 542 = 209,754 心算 |
| **Instruction Following (MMLU 5-shot) | ~30B+ | 30-40% | 70-86% | 新任务只给 instruction 不给示例完成 |
| **Contextual 上下文阅读理解 (HellaSwag) | ~20B+ | 40-50% | 85-95% | 完形填空选择最合理的下一句 |
| **自生成事实核查 (TruthfulQA) | ~70B+ | 30% | 60-75% | 常识问答中区分真事实和常见错误说法 |
| **代码生成 (HumanEval Pass@1) | ~15B+ | 10-20% | 50-70% | 给定 docstring 写 Python 函数实现 |
| **高级类比推理 (BIG-bench) | ~60B+ | 20% | 60-80% | 医生之于医院,相当于教师之于什么 |
关于涌现的三个主流解释假说(2025 年学术界进展)
虽然现象板上钉钉,但「为什么会涌现」至今没有统一理论,三派假说:
假说 1:能力其实并没有真正的「突现」,只是评价指标的非线性导致的假象(2023 年斯坦福论文观点)。 这一派说:你用的是「最终错误率(0/1 二分类)指标,所以小模型 51% 的 token 生成错了一整题 0 分,大模型 95% 的 token 对了 100 分,曲线看起来就像跳变;如果用每个 token 的交叉熵损失(平滑的连续指标),损失是线性可预测的没有突变。反驳:但用户只关心「最终对不对」不关心 token 级损失,所以即使本质是指标非线性导致,对用户来说依然有意义,它叫涌现仍然真实存在。
假说 2:涌现是「组合式泛化的相变——小模型学会了 A 能力和 B 能力,大模型时 A 和 B 突然能组合起来解决需要 A+B 的任务的新能力(比如先学了加法 + 学了乘法,大到突然能解需要乘法和加法组合的应用题)。MoE 模型因为专家路由机制天然容易出现「专家分工更容易出涌现阈值更低。OpenAI 的一些内部实证派。
**假说 3:涌现是「任务内隐规划」时出现高阶模式」——小模型在下游任务没有显式地把学到的大量事实和规则隐藏在参数里,需要模型被合适的 Prompt 技巧(比如 CoT、Step-Back)帮它把这些隐性知识掏出来。2024 年的 Grok 1 模型 314B MoE 模型实验发现,用合适的 CoT Prompt 能把「涌现阈值」拉低到更低参数量级。
工程上不管哪个解释对,不重要;实操真理只有一条:**你把模型做任务模型时你任务正确率时你要给足够参数量级做 scaling,别在 做你的任务时测实际试试,不要信外推,实测为准。