图形处理单元
GPU (Graphics Processing Unit)
GPU(Graphics Processing Unit,图形处理单元)是一种专门为并行计算设计的处理器,是训练和推理大语言模型的核心硬件。
详细解释
GPU(图形处理单元)最初是为游戏渲染而设计——要在 1/60 秒内并行计算数百万个像素的着色。但人们很快发现,神经网络的前向/反向传播本质上也是大规模矩阵乘法,与 GPU 的并行架构天然契合。2007 年 NVIDIA 推出 CUDA 框架后,GPU 正式成为 AI 计算的「标配套餐」。
GPU vs CPU
| 维度 | CPU | GPU |
|---|---|---|
| 核心数 | 8-128 核 | 数千-数万个 CUDA 核心 |
| 擅长任务 | 串行逻辑、分支预测 | 并行矩阵运算 |
| 内存 | 大容量 DDR | 高带宽 HBM(如 H100 3TB/s) |
| 典型应用 | 数据库、操作系统 | 训练 LLM、推理、科学计算 |
AI 训练常用 GPU
| 型号 | 显存 | FP16 算力 | 适用场景 |
|---|---|---|---|
| NVIDIA H100 | 80GB HBM3 | 989 TFLOPS | 7B+ 模型训练 |
| NVIDIA A100 | 40/80GB HBM2e | 312 TFLOPS | 7B 模型训练/推理 |
| NVIDIA RTX 4090 | 24GB GDDR6X | 165 TFLOPS | 消费级微调、推理 |
| NVIDIA L40S | 48GB | 362 TFLOPS | 推理主力 |
| 华为昇腾 910B | 64GB HBM | 320 TFLOPS | 国产替代方案 |
唯元智创与 GPU
唯元智创采用自建 GPU 集群 + 公有云混合调度,已部署 200+ 张 H100/A100 算力卡。用户无需关心硬件,通过 API 即可获得:
- 训练:按卡时计费(H100 ¥32/卡时)
- 推理:按 token 计费,¥1-8/M tokens
- 微调:LoRA 训练 ¥0.5/千 token 起
常见问题
消费级 GPU 能跑 7B 模型吗?
可以。用 GPTQ/AWQ 4-bit 量化后,7B 模型只需 6GB 显存,RTX 3060 12G 即可。13B 模型建议 RTX 4090 24G。
国产 GPU 能替代 NVIDIA 吗?
华为昇腾 910B、寒武纪 MLU370 在推理侧已可替代;训练侧生态(CUDA 兼容性)尚有差距,国产模型厂商如 DeepSeek 已做适配。