大语言模型

LLM (Large Language Model)

大语言模型(LLM)是基于深度学习(特别是 Transformer 架构)训练的、拥有数十亿甚至上万亿参数的自然语言处理模型。

详细解释

大语言模型(Large Language Model, LLM)通过在海量互联网文本上进行预训练(Pre-training),学习到了人类语言的语法、逻辑、事实和推理能力。之后,再通过指令微调(Instruction Tuning)和人类反馈强化学习(RLHF),使其能够理解用户的指令,并给出安全、有用的回答。

著名的 LLM 包括 OpenAI 的 GPT 系列、Google 的 Gemini、Anthropic 的 Claude,以及国内的 DeepSeek、智谱 GLM、通义千问(Qwen)等。

核心能力

  • 文本生成:撰写文章、代码、邮件。
  • 阅读理解:长文档总结、信息提取。
  • 逻辑推理:解答数学题、代码 Debug、多步推理(如思维链 CoT)。
  • 工具调用:通过 Function Calling 操作外部 API。

常见问题

参数量越大,模型就越聪明吗?
一般来说,参数量越大的模型容量越高,上限越高。但现代模型也注重数据质量和训练方法的优化,较小的模型(如 7B/8B)在高质量数据训练下,也能媲美过去的大模型。
唯元智创支持哪些 LLM?
我们支持全球 40+ 顶尖模型,包括 DeepSeek-V4、GLM-5.2、Qwen3.7、Kimi-K3 等,全部可通过统一 API 调用。