多模态大模型

Multimodal LLM

Multimodal 多模态指一类能同时理解和生成多种模态数据的大模型:不仅处理文本(Text),还能理解图片、音频、视频、3D、PDF 版式等;典型接口如 vision chat、speech-to-text、text-to-image、video understanding。

详细解释

多模态(Multimodal) 的”模态(Modality)“指”信息的存在形式”:人类有眼(视觉)、耳(听觉)、手(触觉)、嘴(语言)等多种感知渠道,所以叫多模态。对应到 AI 上就是——一个模型不止处理文字,还能处理 2 种及以上的输入/输出模态

2023 年之前主流 LLM 都是文本-only(纯文本进、纯文本出)。2023 年 3 月 GPT-4(首版多模态)、9 月 GPT-4V(Vision 版)发布后,多模态成为旗舰模型的标配。到 2025 年”多模态”通常至少包含下面这几种能力(可以组合):

输入模态输出模态典型场景
文本 + 图片(Vision)文本发票/病历 OCR + 理解、UI 截图转代码、图表解读、试卷批改
文本 + 图片结构化 JSON商品图抽属性、报表里抽数字 + 结构化输出
文本 + 音频(Audio)文本ASR 语音识别 + 语义理解(开会纪要)
文本语音 / 音频(TTS)朗读、数字人配音、播客生成
文本 + 视频(Video)文本1 分钟短视频解读发生了什么、长视频关键帧抽摘要
文本图像(Image Gen)文生图(Stable Diffusion / Seedream 家族)
文本 + 图像视频(Video Gen)图文生视频(Seedance、Sora 家族)

参考:GPT-4o 技术介绍

多模态调用示例(图文问答,OpenAI 兼容格式)

# 以 [唯元智创](https://weimeta.cn) 兼容层为例,model 选 gpt-4o 或其他 vision 模型
from openai import OpenAI
client = OpenAI(api_key="wm-xxxx", base_url="https://api.weimeta.cn/v1")

resp = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[
      {"role": "user", "content": [
          {"type": "text", "text": "这张发票的总金额是多少?输出 JSON 格式:{\"total\": xxx, \"date\": \"YYYY-MM-DD\"}"},
          {"type": "image_url", "image_url": {"url": "https://example.com/invoice.jpg"}}
      ]}
    ],
    response_format={"type": "json_object"}  # 配合结构化输出
)
print(resp.choices[0].message.content)

关键点:image_url 支持 URL、base64 内联两种方式,单条请求一般最多塞 10–20 张图,超限会触发 TPM 暴涨(每张图 = 几个百到几千 Token 的视觉 Patch 代价)。

多模态 API 的计费常识(必须知道,避免账单爆炸)

计费项典型数值区间(2025 公开档)注意点
图像理解输入每张图 ~ 500–4000 输入 Token,按分辨率阶梯收4K 分辨率 = 2304 Tokens(OpenAI 标准算法),一次传 10 张就是 2 万输入 Token,别不小心循环里传图
图像生成(文生图)每张图 ¥0.02 – ¥0.5 / 张,按分辨率、风格、是否 HD 加价SDXL 1024×1024 一般是最低价;人像写真、超分、LoRA 定制加价
音频 ASR 输入¥0.15 – ¥1.5 / 分钟通常 1 分钟音频 ≈ 处理 1 分钟时长,不按 Token 数
TTS 音频输出¥0.15 – ¥1 / 千字符文本字符数以输入文本长度计,中文每个字按 2 字符算
视频理解输入按秒数 × 采样帧率算 Token,¥5 – ¥25 / 分钟视频非常贵!短摘要视频先做抽帧 → 传图像更划算

唯元智创 控制台支持”模态维度拆分账单”——你可以按”Vision / TTS / ASR / Text”四大类单独拉当月消耗,避免”不知道钱花哪里了”。

常见问题

多模态模型就是”LLM + 图像模型拼在一起”吗?
历史上第一代是(把图像用 ViT 编码器编码成 N 个视觉 Token,拼接到文本 Token 序列前面,后面是标准 LLM)。2025 年最新一代(GPT-4o、Claude 3.5 Sonnet、Qwen-VL-Max)已经是”原生多模态架构”:每个注意力层同时接受文本 Patch 与视觉 Patch,不同模态是联合训练的而不是事后嫁接,效果上对”图文交错推理”、文字区域 OCR、复杂图表理解明显更强。
图生图、文生视频也算 Multimodal 吗?
算。但行业语境里大家说一个模型是”多模态 LLM”一般特指”能把非文本输入当成上下文理解并给出文本回答”的(Vision/Video/Audio 输入)。纯文生图(如 Stable Diffusion 系列)大家通常叫它”生成模型/扩散模型”,不归类为 Multimodal LLM——但两者正在融合。
多模态理解比纯文本更贵,我什么时候必须用它?
两个简单判断:① 信息源头本身就不是纯文本(图片、PDF 扫描版、录音、视频)——必须用,否则 OCR/ASR 单独跑再拼文本会丢失大量版式/空间信息(发票表格、流程箭头关系、语气停顿)。② 已经是纯文本但你想”视觉化检查”——比如写了前端代码让模型看截图有没有对齐问题、生成的海报有没有错别字——这种场景只有多模态能做。其他纯文本生成就别多花钱了。