详细解释
LLM 评测(LLM Evaluation / Benchmarking) 一句话定义:用一套固定的、可复现的问题集 + 一套固定的打分规则,给不同模型 / 不同 prompt / 不同 SFT 版本打出可比较的分数,知道这次迭代到底是变好还是变坏了。没有评测就做 LLM 迭代 = 闭着眼睛开车。“我觉得这个 SFT 之后效果好一点了”是所有初学者的幻觉——90% 的情况是”因为你改了两个你会用的 sample,碰巧这次对了,而整体 2000 个 test case 的平均分其实降了”。
主流公开 Benchmark 图谱(2025 年仍然被广泛引用的那些)
先把每个基准”考什么”说清楚,再看榜单:
| 基准名 | 发布 | 维度 | 题目数 | 打分方式 | 容易刷榜 / 容易 Data Contamination 吗? |
|---|---|---|---|---|---|
| MMLU | 2020 UC Berkeley | 57 学科选择题(中文=CMMLU,C-Eval 国内高考题版) | 14K | 5-shot 准确率 | 严重 —— 几乎所有 7B+ 模型训练数据都混入过 MMLU,分数 80%+ 不稀奇 |
| GSM8K | 2021 OpenAI | 小学级数学应用题,要求给出推理链 | 8.5K | 最终数字对不对 | 中度 —— CoT 推理风格被训烂了,但真正新变体(GSM-Plus)能防 |
| HumanEval | 2021 OpenAI | Python 函数级代码补全,给 docstring 写实现 | 164 | 单测通过率 Pass@1 / Pass@10 | 中高 —— 代码题容易重复,但 MBPP / LiveCodeBench 已补 |
| MATH / AIME 2024 | 2022 Princeton + 竞赛原题 | 高中竞赛数学,分 5 难度 7 学科 | 5K / 100+ | 答案正确性 + 证明严格性 | 低 —— 每年放新题,Data Leak 少 |
| MT-Bench | 2023 LMSYS(Chatbot Arena) | 多轮 8 场景 160 题,GPT-4 当裁判打 1-10 分 | 160 | GPT-4 裁判平均分 | 中 —— GPT-4 裁判有偏(喜欢长回答),但对对话能力很准 |
| MMMU | 2024 UIUC 等 | 多模态(图+文)6 学科大学级考试 | 11.5K | 准确率 | 低 —— 新基准,真能测出多模态水平 |
| Arena-Hard | 2024 LMSYS | 500 条真实用户难问题,Elo 两两对战 | 500 | 匿名盲审对战胜场 Elo | 低 —— 动态题目,没法过拟合 |
企业内部不用盲信公开榜单:你要自建 3 套评测集
公开 Benchmark 的分数只能作为”买模型前的初筛参考”,上线自己业务前,必须内部建立这三套评测集(合起来 2000 条就能覆盖 95% 的问题):
| 内部评测 | 规模 | 出题来源 | 评分方式 | 用途 |
|---|---|---|---|---|
| ① 回归测试集(Regression) | 500-1000 条 | 历史真实用户对话(每 2 周增量 + 最近线上客诉 Top-100 必加) | 固定期望输出 + 规则校验 / 关键字匹配 / LLM-as-Judge 语义判对 | SFT / Prompt 变更必跑,防止”改好一个点,崩了 10 个旧点” |
| ② 黄金问答集(Golden QA) | 200-500 条 | 产品经理 + 业务专家手写”硬骨头”典型难问题(RAG 里跨文档、多跳推理、歧义客服工单) | 人类 1-5 分人工标 + 自动化二次打分 | 季度大模型版本升级必跑,判断这次换模型要不要切流 |
| ③ 红队安全集(Red Team) | 200-500 条 | OWASP LLM Top10 每条 30 种变形 + 历史攻击尝试 100 条 | 命中即不通过(过即 100,不过即 0) | 每次发布必跑,过不了直接回滚 |
唯元智创 控制台内置了这三类评测的流水线:你把评测集 JSONL 传上去 → 每 10 分钟自动对最新版本模型跑全量 → 结果按维度雷达图 + 对比前版本折线图可视化,出”是否可以发布”建议(红队必须 0 命中才放行)。
两种主流打分方法:规则 vs LLM-as-Judge
- 规则 / 程序化打分(Deterministic):最终答案是否为特定字符串 / JSON schema 是否合法 / 数字是否在误差范围 ±1%。适合:信息抽取、分类、代码单测、数学答案。优点:快、100% 可复现、零成本;缺点:覆盖不了”回答得好不好、礼不礼貌、语气象不像人”。
- LLM 当裁判(LLM-as-Judge,PaLM / GPT-4o-mini 级别就够):把模型生成的回答连同 Ground Truth(可能没有)和 Rubric 评分细则,一起发给一个”裁判模型”,让它按 1-5 分打分并给理由。适合:对话自然度、礼貌、摘要质量、RAG 是否忠实。优点:覆盖所有主观维度;缺点:裁判本身有偏(喜欢长回答)、有费用、要做 Kappa 一致性校验(两个裁判打分一致率 ≥ 0.7 才是靠谱维度)。
经验推荐:对同一个企业评测集,70% 题用规则判,30% 主观题用 Judge;成本最低,分数方差最小。
常见问题
怎么避免模型在公开 Benchmark 上过拟合 / 刷榜?
两个手段结合用:(1)用”动态基准”替代静态题库——LiveCodeBench(代码)每月更新、Arena Hard 每周从真实对战里抽新题,过拟合几乎没法做;(2)训练时做”污染检测”把公开 Benchmark 题目从 SFT/预训练数据里过滤掉,做法:n-gram 重叠率,任何一条 SFT 数据和 Test 集的 13-gram 重合 ≥ 3 个就整段删除。再硬核点可以做”反事实扰动”——同样数学题把数字 123 换成 456,如果模型分数暴跌 15 分以上,证明它之前是背了原题而不是会了。
小公司人手不够,做不到 2000 条内部评测,最小可行版本怎么做?
最小可行版本(MVP)只要 100 条就能用,成本一个下午。做法三步:(1)拉最近 1 个月线上真实用户对话 TOP 50 高频问题,人工出标准答案 → 50 条;(2)产品经理把”我们最怕答错的敏感/合规/退款类问题”挑 30 条 → 30 条;(3)把历史上 LLM 回答翻车的实锤 case 全部记下来,每一条都当评测题 → 20 条。共 100 条。评分:70 条用规则判(提取 JSON、意图分类、退款流程是否对),30 条用 GPT-4o-mini 当裁判(1-5 分),成本约每次评测 ¥0.15,每周跑一次 ¥6。之后每月 +20 条新 case,六个月就积累到 220 条,够用了。
模型 A 评测分比 B 高 2 分,应该立即切吗?
先做三件事再切:(1)统计显著性——1000 题级别的评测 2 分差才显著;200 题以下 2 分差可能只是随机波动,用配对 t 检验或 bootstrap 置信区间算一下(95% CI 不重叠才算真的好)。(2)线上 5% A/B 灰度跑一周,看真实用户 CTR / 转付费 / 客诉率——评测分高不等于产品指标高,很多模型 Benchmark 赢了 1 分,线上 TTFT 慢 200ms 导致用户停留时长反而降。(3)失败 case 人工抽样 50 条:看看这次 A 好是在”哪些我们关心的题目”上好了,是真的能力提升还是过拟合了评测集。三件事都过了,再从 5% → 20% → 50% → 100% 灰度切流,别一步到位。