大语言模型
LLM (Large Language Model)
大语言模型(LLM)是基于深度学习(特别是 Transformer 架构)训练的、拥有数十亿甚至上万亿参数的自然语言处理模型。
详细解释
大语言模型(Large Language Model, LLM)通过在海量互联网文本上进行预训练(Pre-training),学习到了人类语言的语法、逻辑、事实和推理能力。之后,再通过指令微调(Instruction Tuning)和人类反馈强化学习(RLHF),使其能够理解用户的指令,并给出安全、有用的回答。
著名的 LLM 包括 OpenAI 的 GPT 系列、Google 的 Gemini、Anthropic 的 Claude,以及国内的 DeepSeek、智谱 GLM、通义千问(Qwen)等。
核心能力
- 文本生成:撰写文章、代码、邮件。
- 阅读理解:长文档总结、信息提取。
- 逻辑推理:解答数学题、代码 Debug、多步推理(如思维链 CoT)。
- 工具调用:通过 Function Calling 操作外部 API。
常见问题
参数量越大,模型就越聪明吗?
一般来说,参数量越大的模型容量越高,上限越高。但现代模型也注重数据质量和训练方法的优化,较小的模型(如 7B/8B)在高质量数据训练下,也能媲美过去的大模型。
唯元智创支持哪些 LLM?
我们支持全球 40+ 顶尖模型,包括 DeepSeek-V4、GLM-5.2、Qwen3.7、Kimi-K3 等,全部可通过统一 API 调用。