涌现能力 Emergent Abilities

Emergent Abilities

大语言模型在参数量、训练数据量、计算量三个维度同步缩放越过某个阈值后,突然获得的预训练时并未显式教授的、无法从小模型表现预测的全新复杂能力,是当代大模型最具革命性的核心现象。

详细解释

Emergent Abilities(涌现能力 / 突现能力) 一句话定义:同样一个任务(比如 3 位数乘法、说一句笑话、用 CoT 解复杂推理、看懂高级抽象类比),你拿 1B 参数小模型做正确率 5%(和瞎猜差不多),3B 模型 8%,7B 模型 15%,13B 模型 20%,看起来线性慢慢涨没啥意思——但参数量一把拉到 70B,正确率从 20% 猛地跳涨到 60%+,拉到 175B+ 直接冲到 85%;而且这种能力不是你把小模型的线性外推,是到了某个 magic threshold 突然跳出来的,就像「量变引起质变」**。

这个现象是 2022 年谷歌 Brain 团队在论文《Emergent Abilities of Large Language Models》里首次系统定义和量化的,是整个 LLM 时代最核心的信仰来源——因为它证明了「只要继续把模型做大,会突然自动拥有你想都不敢想的新能力」,也是 OpenAI 从 GPT-3 (175B) 到 GPT-4 一直死磕 scaling 的根本信念支撑。

典型的已被广泛证实的涌现能力包括但不限于:(1) **Chain-of-Thought 推理(给出中间步骤后数学题正确率暴涨);(2) **Few-shot Learning(给 3-5 个示例就能学新任务,小模型 few-shot 根本没用);(3) **Instruction Following(听懂人类自然语言指令做没见过的新任务);(4) **多步组合推理(工具调用 + 规划 + 子问题分解);(5) **Theory of Mind(理解他人信念意图的心理理论能力);(6) **In-context Learning(上下文内学习,不需要梯度更新)。

唯元智创 控制台内置了「各模型涌现能力覆盖矩阵」可视化面板:你选一个具体业务任务(比如「从合同里抽取 10 个字段做信息抽取」),平台自动跑 7B / 14B / 32B / 70B / 128B 五个档位模型的实际任务正确率曲线,告诉你:你这个任务的「涌现阈值」在多少亿参数——如果是 32B 就够用,就别多花钱上 128B 模型了。

已证实的涌现能力对应涌现阈值参考表(公开 Benchmark 测得)

涌现能力涌现阈值参数量(密集 Transformer)小模型 (<13B) 正确率大模型 (>=70B) 正确率代表任务示例
**CoT 多步数学推理 (GSM8K)~60B+5-10%70-85%有 13 个苹果,吃了 5 个,给了朋友 3 个,妈妈又买了 8 个,现在几个?
**3 位数 × 3 位数乘法~100B+<10%40-70%387 × 542 = 209,754 心算
**Instruction Following (MMLU 5-shot)~30B+30-40%70-86%新任务只给 instruction 不给示例完成
**Contextual 上下文阅读理解 (HellaSwag)~20B+40-50%85-95%完形填空选择最合理的下一句
**自生成事实核查 (TruthfulQA)~70B+30%60-75%常识问答中区分真事实和常见错误说法
**代码生成 (HumanEval Pass@1)~15B+10-20%50-70%给定 docstring 写 Python 函数实现
**高级类比推理 (BIG-bench)~60B+20%60-80%医生之于医院,相当于教师之于什么

关于涌现的三个主流解释假说(2025 年学术界进展)

虽然现象板上钉钉,但「为什么会涌现」至今没有统一理论,三派假说:

假说 1:能力其实并没有真正的「突现」,只是评价指标的非线性导致的假象(2023 年斯坦福论文观点)。 这一派说:你用的是「最终错误率(0/1 二分类)指标,所以小模型 51% 的 token 生成错了一整题 0 分,大模型 95% 的 token 对了 100 分,曲线看起来就像跳变;如果用每个 token 的交叉熵损失(平滑的连续指标),损失是线性可预测的没有突变。反驳:但用户只关心「最终对不对」不关心 token 级损失,所以即使本质是指标非线性导致,对用户来说依然有意义,它叫涌现仍然真实存在。

假说 2:涌现是「组合式泛化的相变——小模型学会了 A 能力和 B 能力,大模型时 A 和 B 突然能组合起来解决需要 A+B 的任务的新能力(比如先学了加法 + 学了乘法,大到突然能解需要乘法和加法组合的应用题)。MoE 模型因为专家路由机制天然容易出现「专家分工更容易出涌现阈值更低。OpenAI 的一些内部实证派。

**假说 3:涌现是「任务内隐规划」时出现高阶模式」——小模型在下游任务没有显式地把学到的大量事实和规则隐藏在参数里,需要模型被合适的 Prompt 技巧(比如 CoT、Step-Back)帮它把这些隐性知识掏出来。2024 年的 Grok 1 模型 314B MoE 模型实验发现,用合适的 CoT Prompt 能把「涌现阈值」拉低到更低参数量级。

工程上不管哪个解释对,不重要;实操真理只有一条:**你把模型做任务模型时你任务正确率时你要给足够参数量级做 scaling,别在 做你的任务时测实际试试,不要信外推,实测为准。

常见问题

MoE(混合专家)模型的涌现阈值和密集模型一样吗?是不是 MoE 能让涌现来得更早?
MoE 的涌现阈值确实来得更早、阈值更低,但前提是「有效激活参数量(active parameters」足够大、总参数量。2024 年的多个公开实验(Mixtral 8x7B vs Llama 2 70B、GPT-4 推测 MoE 结构)证实了一个经验规律:MoE 模型的涌现阈值约等于「2-3 倍专家总数 × 单个专家参数量」。具体对比:密集模型 70B 才出 CoT 推理涌现,Mixtral 8x7B(每个 token 激活 2 个专家 = 14B 激活参数,总参数 47B)在 GSM8K 上表现和 Llama 2 70B 几乎一样,涌现来的早了。但注意一个坑:MoE 模型「总参数量看起来很大(比如 8x22B = 141B 总参数),但每个 token 实际激活只有 2x22B=44B。所以衡量 MoE 涌现阈值不能看总参数要看 activated params,通常 activated params = 总参数 / (专家数 / top_k),激活的才算数。所以:Mixtral 8x7B activated=14B ≈ 密集 30B+水平;Grok 1 8x70B activated=140B≈密集 60B+水平。你要达到密集 70B 的涌现水平,MoE 总参数只要 47B 就够,训练成本是密集的 1/3 左右,所以 2024 年之后新出的大模型 70% 以上都采用了 MoE,核心原因就是「用更少的训练成本拿到涌现能力。
有没有办法「拉低某个特定任务的涌现阈值?让小模型也能拥有大模型才有的涌现能力?
能,2023-2024 两年的研究已经攒出了「让 4 个拉低涌现阈值的组合拳」,用在 7B-13B 小模型上,能把特定任务的涌现表现从大模型的 30% 拉到大模型的 80% 左右,成本是零额外训练:(1)Prompt 工程层——给小模型「喂完整的 CoT 推理示例,不是 1 个,而是 8 个 diverse 推理链示例(8-shot CoT),再加上 Step-Back Prompting 退一步提问,能把 7B 的数学正确率从 15% 拉到 40%;(2)解码策略层——用 Self-Consistency 投票,同一个问题生成 40 条不同的推理链,取最终答案多数投票,7B 从 40% 再拉到 55%;(3)蒸馏层——拿大模型(GPT-4o 写 1 万条带详细推理链的合成数据,对 7B 做 CoT-SFT 专项微调,55% 再拉到 70%;(4)检索增强层——做 RAG,把小模型没见过的事实知识检索出来放上下文里,事实类任务正确率再加 10%,最终 7B 特定任务 80% 接近 70B 原始水平。实测 13B + 这套组合拳 + 业务特定 CoT-SFT,在 GSM8K(数学)上能做到 75%,已经追平 Llama 1 70B 原始模型水平,这就是涌现的「蒸馏迁移」——把大模型涌现出来的能力,通过合成数据蒸馏给小模型,拉低小模型的涌现阈值。
涌现会不会有上限?会不会模型继续大到 10 万亿参数继续不停涌现出新能力?
目前(2025 年)学术界共识:一定会有上限;Scaling Law 继续大到 10 万亿参数一定会涌现出新的能力层次,但「每翻一倍参数量新增的涌现能力」边际效益是递减的——从 1B→7B 你感觉从 10%→40%(+30%),7B→70B 你感觉从 40%→80%(+40%),70B→1.4T(万亿)你可能只从 80%→92%(+12%),1.4T→28T 可能只+3%。三个核心限制因素:(1)数据墙——高质量人类语料(书籍+网页+代码)总量是有限的,预计 2027 年左右训练数据会耗尽,合成数据质量还不够顶不上;(2)算力墙——训练一次模型的算力需求指数增长,训练一次 10T 参数模型的电费是几十亿美金,经济上不划算,投资回报比递减;(3)能力天花板——很多 Benchmark 上 MMLU 90%+ 再往上增长到 95% 之后,人类已经很难区分 95% 和 98% 的差别了,业务指标上 98% 的正确率和 99% 的正确率差距可能只差客诉率只差 0.2%,不值得再花 10 倍成本。所以 2024 年之后行业的主流趋势已经从「做更大模型」(OpenAI/Google)转向「同样 70B-128B 级别模型更强的对齐 + 更强的数据 + MoE 结构创新 + RAG/Agent 工具调用增强」,而不是盲目堆参数了。不过即使这样,接下来 3-5 年仍然会有新的层次涌现——比如「能自己写 10 万行代码项目的工程能力、能做 PhD 级别的原始科学研究能力、多模态长期理解视频并操作能力,这些还在涌现曲线上爆发点,拭目以待。