唯元智创上线 GLM-5.3-Flash:320B MoE + 原生多模态,输入 ¥0.8/M 起

作者:唯元智创 平台公告

我们很高兴地宣布:智谱 GLM-5.3-Flash 已正式接入唯元智创平台,即日起所有用户可通过统一 API 调用。GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,支持图像、视频与文件输入,同时保持 GLM-5.3 的 1M 超长上下文能力,API 定价与智谱官方完全对齐。

模型概览

GLM-5.3-Flash 于 2026 年 8 月 26 日由智谱正式发布,采用稀疏注意力与线性注意力混合架构,以更低成本提供超越 GLM-5.2 的智能水平。

项目规格
模型全称GLM-5.3-Flash
总参数量320B(MoE 混合专家)
激活参数18B
上下文窗口1,000,000 tokens
最大输出长度128K tokens
输入模态文本、图像、视频、文件
输出模态文本
思考模式默认开启,不可关闭;支持 reasoning_effort
开放权重✅ MIT 协议(Hugging Face: zai-org/GLM-5.3-Flash

核心亮点

1. 原生多模态:图像、视频、文件统一输入

GLM-5.3-Flash 是 GLM-5 系列首个原生多模态版本,支持:

  • 图像理解:截图分析、图表解读、OCR 增强
  • 视频理解:长视频摘要、关键帧提取、动作识别
  • 文件解析:PDF、Word、Excel 等文档直接输入

所有模态共享同一套 OpenAI 兼容接口,无需额外转换。

2. 1M 超长上下文 + 混合注意力架构

GLM-5.3-Flash 采用稀疏注意力(Sparse Attention)与线性注意力(Linear Attention)混合架构,在 1M 上下文场景下:

  • 长上下文算力消耗约为 GLM-5.3 的 1/3
  • KV 缓存占用降至 1/4 以下
  • 支持 128K tokens 最大输出

这使得整本长篇小说、完整代码仓库、多文档合并分析等场景在长上下文下依然可用且成本可控。

3. 思考模式默认开启,能力全面超越 GLM-5.2

GLM-5.3-Flash 的 thinking 模式默认开启且不可关闭,通过 reasoning_effort 调节推理深度:

档位适用场景延迟特点
low简单问答、格式转换接近无思考,快速直出
high复杂推理、Agent 决策完整思维链,延迟较高
max竞赛级代码、深度分析最长思考预算,最高准确率

官方公布的 DeepSWE v1.1 基准中,GLM-5.3-Flash 通过率 63.4%,较 GLM-5.2 的 46.2% 提升显著,逼近 Claude Opus 4.8 水平。

API 定价(对齐智谱官方)

唯元智创平台 GLM-5.3-Flash 定价与智谱官方完全对齐,按量计费,随用随付:

GLM-5.3-Flash

NEW

由 智谱 提供 · 1M 上下文窗口

输入价格
¥0.8 / M tokens(缓存命中 ¥0.23)
输出价格
¥2.8 / M tokens
计费项价格(¥/百万 tokens)
输入0.8
输出2.8
输入(缓存命中)0.23

缓存命中场景输入仅 ¥0.23/百万 tokens,对于知识库问答、固定模板生成等重复上下文场景,成本近乎可以忽略。

快速开始

通过唯元智创的 OpenAI 兼容协议,一行代码即可调用:

from openai import OpenAI

client = OpenAI(
    api_key="sk-your-api-key",
    base_url="https://api.weimeta.cn/v1"
)

# 文本模式:快速直出
response = client.chat.completions.create(
    model="glm-5.3-flash",
    messages=[
        {"role": "system", "content": "你是专业助手,回答简洁准确"},
        {"role": "user", "content": "总结这份技术文档的核心要点"}
    ],
    temperature=0.7,
    max_tokens=8192
)
print(response.choices[0].message.content)

多模态输入(图像 + 文本):

# 图像理解:传入图片 URL 或 Base64
response = client.chat.completions.create(
    model="glm-5.3-flash",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "分析这张架构图的核心组件"},
                {"type": "image_url", "image_url": {"url": "https://example.com/arch.png"}}
            ]
        }
    ],
    max_tokens=16384
)
print(response.choices[0].message.content)

调节推理强度:

# 低推理开销:简单任务快速响应
response = client.chat.completions.create(
    model="glm-5.3-flash",
    messages=[{"role": "user", "content": "把这段话翻译成英文"}],
    extra_body={"reasoning_effort": "low"}
)

# 高推理强度:复杂 Agent 任务
response = client.chat.completions.create(
    model="glm-5.3-flash",
    messages=[{"role": "user", "content": "分析这个项目的架构并设计重构方案"}],
    extra_body={"reasoning_effort": "high"}
)

与 GLM-5.3 的选型建议

场景推荐模型理由
纯文本高频任务(摘要、分类、问答)GLM-5.3-Flash价格仅为 GLM-5.3 的 1/10,能力足够
图像/视频/文件输入GLM-5.3-FlashGLM-5.3 为纯文本模型,不支持多模态
复杂软件工程、长程 AgentGLM-5.3旗舰级推理深度,DeepSWE 分数更高
预算敏感型批量任务GLM-5.3-Flash输入 ¥0.8、输出 ¥2.8,相比旗舰版更具性价比

GLM-5.3-Flash 现已加入唯元智创统一模型网关,与 DeepSeek-V4-Flash、Kimi-K3、Qwen3.7-Max 等 30+ 模型共享同一个 API Key,可随时根据任务复杂度与模态需求无缝切换,无需分别对接厂商。

下一步

我们将持续接入更多顶尖模型。GLM-5.3(纯文本旗舰版)已同步上线,与 GLM-5.3-Flash 共享同一 API Key,欢迎体验。

如有任何问题或模型接入需求,欢迎通过官网 weimeta.cn 联系我们的技术团队。