详细解释
每百万 Token 计价(常写作 price per 1M tokens、$X/M、¥Y/M) 是所有主流大模型统一的计费语言。之前行业最早用的是 “每 1K Token”,由于价格快速下降,2024 年下半年起全部改成每百万 Token 为标准报价单位。
为什么换单位
GPT-3.5 刚发布时 $0.002 / 1K tokens = $2 / M;现在最便宜的 Flash 模型已经到 ¥0.1/M–¥0.2/M,用 “每千个” 报价小数点太碍眼,于是行业统一换成百万。
换算公式
实际费用 =(实际 Token 数 ÷ 1,000,000)× 每百万单价
示例:
- 使用 DeepSeek V3 输入价 ¥1.0/M、输出 ¥2.0/M;
- 你一个月跑了 50M 输入、20M 输出;
- 费用 = 50 × 1.0 + 20 × 2.0 = ¥90 元。
唯元智创(Weimeta)的账单页按每一笔请求均按每百万单价显示,并把输入、输出、缓存命中三类分开行展示,并支持导出 CSV 自己二次分析。
常见问题
为什么输出比输入贵?
输出是”自回归生成”——模型一步一输出,每个 Token 都要跑一次完整的注意力计算,GPU 占用时间长;输入是一次性并行 Prefill,算力成本低很多。因此输出单价通常是输入的 2–10 倍(旗舰模型差距更大)。