详细解释
模型卡片(Model Card) 概念最早由 Google 2018 年论文《Model Cards for Model Reporting》提出,类比食品包装上的”营养成分表”——你买牛奶要知道蛋白质含量、保质期、致敏源,用大模型也一样要知道它”会什么不会什么、在哪里表现好在哪里会翻车”。
2023 年之后 OpenAI、Meta、Anthropic、Mistral、百度、阿里、腾讯、Qwen 等主流厂商在发布新模型时都会附带一份 Model Card(有的叫 Model Card,有的叫 System Card、Technical Report、Model Documentation)。一份合格的模型卡片至少覆盖这 8 大块:
| 章节 | 典型内容 | 你应该关心什么 |
|---|---|---|
| 基本信息 | 模型名、版本号、发布日期、许可证(商用是否收费)、联系方式 | 许可证能不能商用?Apache 2.0 最放心 |
| 模型架构 | 参数规模、Decoder-only / Encoder-Decoder、MoE / Dense、GQA / MHA、Context Length | 参数规模 + Context Length 直接决定部署成本与上限 |
| 训练数据 | 数据来源、截止日期(Knowledge Cutoff)、语言占比、清洗规则 | Knowledge Cutoff 是哪天决定了它能不能知道最新事 |
| 评估结果(Benchmarks) | MMLU、HumanEval、GSM8K、MT-Bench、MMMU 等公开榜分数 | 关注你自己领域相关的:代码场景只看 HumanEval/MBPP,别只看总分 |
| 已知局限 / 偏见 | 幻觉率、对特定群体的偏见倾向、在哪些语言上表现差 | 提前知道它会在什么场景翻车,不要在生产踩坑 |
| 对齐与安全 | 对齐方法(RLHF / DPO / Constitutional AI)、安全评估项目、红队情况 | 对齐做得怎么样,越狱 成功率多高 |
| 推荐用法 / 禁用 | 适合做什么、明确禁止做什么(如禁止医疗/金融高风险决策) | 合规红线,违反了 SLA 不赔 |
| 硬件 & 性能建议 | 推荐显存、推理框架、量化建议(仅开源模型) | 自己部署的时候用 |
典型 Model Card 链接(2025 年公开档,方便你直接查)
| 模型 | 模型卡 / 技术报告链接 |
|---|---|
| Llama 3.x 系列 | Meta Llama Models |
| Qwen2.5 / Qwen3 系列 | Qwen Technical Report |
| Mistral / Mixtral 系列 | Mistral Docs - Models |
| GPT-4o / GPT-4o mini | OpenAI System Cards |
| Claude 3.5 系列 | Anthropic Model Card |
| DeepSeek-V3 / V3-MoE | DeepSeek Blog |
通过 唯元智创 控制台的”模型中心”可以一键查看所有接入模型的 Model Card 要点(Context、Price、MMLU、许可证、是否多模态),不用去每个厂商官网逐个翻。
看 Model Card 时的 3 个常见误区
- “MMLU 分数高 = 一定好用”:错。MMLU 衡量”知识面广不广”,但你的业务可能是”代码写得对不对”(HumanEval/MBPP)、“数学行不行”(GSM8K/MATH)。拿和你业务最相关的那 1–2 个榜对比,不要被总分骗。
- “License = MIT 就一定能商用”:要区分模型权重 license 和训练数据 license。有的模型权重 Apache 2.0,但训练数据里有未经授权的版权内容——你商用了照样被起诉。合规场景建议直接选明确声明训练数据合规的厂商。
- “Context 越长越好”:上下文越长,KV Cache 越大、越贵、TPM 消耗越高、长上下文的事实一致性(“大海捞针”)反而可能下降。选你业务实际需要的最短 Context 对应的模型规格即可。
常见问题
Model Card 里写的”仅供研究使用”我商用了会怎样?
看具体许可证和你公司体量。早期 Llama 1 是”非商用研究许可”,Meta 实际上对小体量公司没追究,但大公司一定会收到律师函。合规做法是:所有你在生产用的模型逐一保存许可证截图 + Model Card 页作为合规证据,审计时拿得出手。
闭源 API 模型(我不能下载权重)我还要看 Model Card 吗?
更要看。闭源 API 你连模型具体多大都不知道,更依赖 Model Card 里的”已知局限”和”禁用场景”章节来规避合规风险。比如某个模型的 Card 里明确写了”不能用于医疗诊断”——你用了,出事了责任全在你。
我自己用开源模型微调,应该自己写一份 Model Card 吗?
如果这个微调后的模型会对外提供服务(给客户、给公众、给监管能查到的系统),强烈建议自己写一份 1 页 Model Card(至少包含:基模型名 + 你的微调数据来源 + 你自己在业务测试集上的 5 个典型分数 + 已知失败案例)。EU AI Act、中国《生成式 AI 服务管理暂行办法》都要求对外提供生成式服务时保存并可提供模型说明文档。