我们很高兴地宣布:智谱 GLM-5.3-Flash 已正式接入唯元智创平台,即日起所有用户可通过统一 API 调用。GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,支持图像、视频与文件输入,同时保持 GLM-5.3 的 1M 超长上下文能力,API 定价与智谱官方完全对齐。
模型概览
GLM-5.3-Flash 于 2026 年 8 月 26 日由智谱正式发布,采用稀疏注意力与线性注意力混合架构,以更低成本提供超越 GLM-5.2 的智能水平。
| 项目 | 规格 |
|---|---|
| 模型全称 | GLM-5.3-Flash |
| 总参数量 | 320B(MoE 混合专家) |
| 激活参数 | 18B |
| 上下文窗口 | 1,000,000 tokens |
| 最大输出长度 | 128K tokens |
| 输入模态 | 文本、图像、视频、文件 |
| 输出模态 | 文本 |
| 思考模式 | 默认开启,不可关闭;支持 reasoning_effort |
| 开放权重 | ✅ MIT 协议(Hugging Face: zai-org/GLM-5.3-Flash) |
核心亮点
1. 原生多模态:图像、视频、文件统一输入
GLM-5.3-Flash 是 GLM-5 系列首个原生多模态版本,支持:
- 图像理解:截图分析、图表解读、OCR 增强
- 视频理解:长视频摘要、关键帧提取、动作识别
- 文件解析:PDF、Word、Excel 等文档直接输入
所有模态共享同一套 OpenAI 兼容接口,无需额外转换。
2. 1M 超长上下文 + 混合注意力架构
GLM-5.3-Flash 采用稀疏注意力(Sparse Attention)与线性注意力(Linear Attention)混合架构,在 1M 上下文场景下:
- 长上下文算力消耗约为 GLM-5.3 的 1/3
- KV 缓存占用降至 1/4 以下
- 支持 128K tokens 最大输出
这使得整本长篇小说、完整代码仓库、多文档合并分析等场景在长上下文下依然可用且成本可控。
3. 思考模式默认开启,能力全面超越 GLM-5.2
GLM-5.3-Flash 的 thinking 模式默认开启且不可关闭,通过 reasoning_effort 调节推理深度:
| 档位 | 适用场景 | 延迟特点 |
|---|---|---|
low | 简单问答、格式转换 | 接近无思考,快速直出 |
high | 复杂推理、Agent 决策 | 完整思维链,延迟较高 |
max | 竞赛级代码、深度分析 | 最长思考预算,最高准确率 |
官方公布的 DeepSWE v1.1 基准中,GLM-5.3-Flash 通过率 63.4%,较 GLM-5.2 的 46.2% 提升显著,逼近 Claude Opus 4.8 水平。
API 定价(对齐智谱官方)
唯元智创平台 GLM-5.3-Flash 定价与智谱官方完全对齐,按量计费,随用随付:
GLM-5.3-Flash
NEW由 智谱 提供 · 1M 上下文窗口
| 计费项 | 价格(¥/百万 tokens) |
|---|---|
| 输入 | 0.8 |
| 输出 | 2.8 |
| 输入(缓存命中) | 0.23 |
缓存命中场景输入仅 ¥0.23/百万 tokens,对于知识库问答、固定模板生成等重复上下文场景,成本近乎可以忽略。
快速开始
通过唯元智创的 OpenAI 兼容协议,一行代码即可调用:
from openai import OpenAI
client = OpenAI(
api_key="sk-your-api-key",
base_url="https://api.weimeta.cn/v1"
)
# 文本模式:快速直出
response = client.chat.completions.create(
model="glm-5.3-flash",
messages=[
{"role": "system", "content": "你是专业助手,回答简洁准确"},
{"role": "user", "content": "总结这份技术文档的核心要点"}
],
temperature=0.7,
max_tokens=8192
)
print(response.choices[0].message.content)
多模态输入(图像 + 文本):
# 图像理解:传入图片 URL 或 Base64
response = client.chat.completions.create(
model="glm-5.3-flash",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "分析这张架构图的核心组件"},
{"type": "image_url", "image_url": {"url": "https://example.com/arch.png"}}
]
}
],
max_tokens=16384
)
print(response.choices[0].message.content)
调节推理强度:
# 低推理开销:简单任务快速响应
response = client.chat.completions.create(
model="glm-5.3-flash",
messages=[{"role": "user", "content": "把这段话翻译成英文"}],
extra_body={"reasoning_effort": "low"}
)
# 高推理强度:复杂 Agent 任务
response = client.chat.completions.create(
model="glm-5.3-flash",
messages=[{"role": "user", "content": "分析这个项目的架构并设计重构方案"}],
extra_body={"reasoning_effort": "high"}
)
与 GLM-5.3 的选型建议
| 场景 | 推荐模型 | 理由 |
|---|---|---|
| 纯文本高频任务(摘要、分类、问答) | GLM-5.3-Flash | 价格仅为 GLM-5.3 的 1/10,能力足够 |
| 图像/视频/文件输入 | GLM-5.3-Flash | GLM-5.3 为纯文本模型,不支持多模态 |
| 复杂软件工程、长程 Agent | GLM-5.3 | 旗舰级推理深度,DeepSWE 分数更高 |
| 预算敏感型批量任务 | GLM-5.3-Flash | 输入 ¥0.8、输出 ¥2.8,相比旗舰版更具性价比 |
GLM-5.3-Flash 现已加入唯元智创统一模型网关,与 DeepSeek-V4-Flash、Kimi-K3、Qwen3.7-Max 等 30+ 模型共享同一个 API Key,可随时根据任务复杂度与模态需求无缝切换,无需分别对接厂商。
下一步
我们将持续接入更多顶尖模型。GLM-5.3(纯文本旗舰版)已同步上线,与 GLM-5.3-Flash 共享同一 API Key,欢迎体验。
如有任何问题或模型接入需求,欢迎通过官网 weimeta.cn 联系我们的技术团队。