详细解释
多模态(Multimodal) 的”模态(Modality)“指”信息的存在形式”:人类有眼(视觉)、耳(听觉)、手(触觉)、嘴(语言)等多种感知渠道,所以叫多模态。对应到 AI 上就是——一个模型不止处理文字,还能处理 2 种及以上的输入/输出模态。
2023 年之前主流 LLM 都是文本-only(纯文本进、纯文本出)。2023 年 3 月 GPT-4(首版多模态)、9 月 GPT-4V(Vision 版)发布后,多模态成为旗舰模型的标配。到 2025 年”多模态”通常至少包含下面这几种能力(可以组合):
| 输入模态 | 输出模态 | 典型场景 |
|---|---|---|
| 文本 + 图片(Vision) | 文本 | 发票/病历 OCR + 理解、UI 截图转代码、图表解读、试卷批改 |
| 文本 + 图片 | 结构化 JSON | 商品图抽属性、报表里抽数字 + 结构化输出 |
| 文本 + 音频(Audio) | 文本 | ASR 语音识别 + 语义理解(开会纪要) |
| 文本 | 语音 / 音频(TTS) | 朗读、数字人配音、播客生成 |
| 文本 + 视频(Video) | 文本 | 1 分钟短视频解读发生了什么、长视频关键帧抽摘要 |
| 文本 | 图像(Image Gen) | 文生图(Stable Diffusion / Seedream 家族) |
| 文本 + 图像 | 视频(Video Gen) | 图文生视频(Seedance、Sora 家族) |
参考:GPT-4o 技术介绍。
多模态调用示例(图文问答,OpenAI 兼容格式)
# 以 [唯元智创](https://weimeta.cn) 兼容层为例,model 选 gpt-4o 或其他 vision 模型
from openai import OpenAI
client = OpenAI(api_key="wm-xxxx", base_url="https://api.weimeta.cn/v1")
resp = client.chat.completions.create(
model="gpt-4o-mini",
messages=[
{"role": "user", "content": [
{"type": "text", "text": "这张发票的总金额是多少?输出 JSON 格式:{\"total\": xxx, \"date\": \"YYYY-MM-DD\"}"},
{"type": "image_url", "image_url": {"url": "https://example.com/invoice.jpg"}}
]}
],
response_format={"type": "json_object"} # 配合结构化输出
)
print(resp.choices[0].message.content)
关键点:image_url 支持 URL、base64 内联两种方式,单条请求一般最多塞 10–20 张图,超限会触发 TPM 暴涨(每张图 = 几个百到几千 Token 的视觉 Patch 代价)。
多模态 API 的计费常识(必须知道,避免账单爆炸)
| 计费项 | 典型数值区间(2025 公开档) | 注意点 |
|---|---|---|
| 图像理解输入 | 每张图 ~ 500–4000 输入 Token,按分辨率阶梯收 | 4K 分辨率 = 2304 Tokens(OpenAI 标准算法),一次传 10 张就是 2 万输入 Token,别不小心循环里传图 |
| 图像生成(文生图) | 每张图 ¥0.02 – ¥0.5 / 张,按分辨率、风格、是否 HD 加价 | SDXL 1024×1024 一般是最低价;人像写真、超分、LoRA 定制加价 |
| 音频 ASR 输入 | ¥0.15 – ¥1.5 / 分钟 | 通常 1 分钟音频 ≈ 处理 1 分钟时长,不按 Token 数 |
| TTS 音频输出 | ¥0.15 – ¥1 / 千字符文本 | 字符数以输入文本长度计,中文每个字按 2 字符算 |
| 视频理解输入 | 按秒数 × 采样帧率算 Token,¥5 – ¥25 / 分钟视频 | 非常贵!短摘要视频先做抽帧 → 传图像更划算 |
唯元智创 控制台支持”模态维度拆分账单”——你可以按”Vision / TTS / ASR / Text”四大类单独拉当月消耗,避免”不知道钱花哪里了”。
常见问题
多模态模型就是”LLM + 图像模型拼在一起”吗?
历史上第一代是(把图像用 ViT 编码器编码成 N 个视觉 Token,拼接到文本 Token 序列前面,后面是标准 LLM)。2025 年最新一代(GPT-4o、Claude 3.5 Sonnet、Qwen-VL-Max)已经是”原生多模态架构”:每个注意力层同时接受文本 Patch 与视觉 Patch,不同模态是联合训练的而不是事后嫁接,效果上对”图文交错推理”、文字区域 OCR、复杂图表理解明显更强。
图生图、文生视频也算 Multimodal 吗?
算。但行业语境里大家说一个模型是”多模态 LLM”一般特指”能把非文本输入当成上下文理解并给出文本回答”的(Vision/Video/Audio 输入)。纯文生图(如 Stable Diffusion 系列)大家通常叫它”生成模型/扩散模型”,不归类为 Multimodal LLM——但两者正在融合。
多模态理解比纯文本更贵,我什么时候必须用它?
两个简单判断:① 信息源头本身就不是纯文本(图片、PDF 扫描版、录音、视频)——必须用,否则 OCR/ASR 单独跑再拼文本会丢失大量版式/空间信息(发票表格、流程箭头关系、语气停顿)。② 已经是纯文本但你想”视觉化检查”——比如写了前端代码让模型看截图有没有对齐问题、生成的海报有没有错别字——这种场景只有多模态能做。其他纯文本生成就别多花钱了。