深度学习
Deep Learning
深度学习(Deep Learning)是机器学习的一个分支,通过构建具有多层「人工神经网络」的模型,从海量数据中自动学习特征表示,是大语言模型的理论基础。
详细解释
深度学习(Deep Learning)的核心是「深度神经网络」——由输入层、多个隐藏层、输出层组成,每层对前一层的结果做非线性变换。层数越深,模型能学到的特征就越抽象。
以图像识别为例:
- 第 1 层学习边缘、颜色
- 第 2 层学习纹理、角点
- 第 3 层学习局部形状(眼睛、鼻子)
- 第 4+ 层学习整体概念(人脸、汽车)
深度学习 vs 传统机器学习
| 维度 | 传统机器学习 | 深度学习 |
|---|---|---|
| 特征工程 | 人工设计 | 自动学习 |
| 数据量 | 千-万级 | 万-亿级 |
| 算力需求 | CPU 即可 | 需要 GPU 集群 |
| 可解释性 | 较强 | 较弱(黑盒) |
| 代表算法 | XGBoost、SVM | Transformer、CNN、RNN |
深度学习的关键突破
| 年份 | 事件 | 影响 |
|---|---|---|
| 2012 | AlexNet 在 ImageNet 一举夺冠 | CNN 复兴 |
| 2014 | GAN 提出 | 生成式 AI 起步 |
| 2017 | Transformer 论文《Attention Is All You Need》 | 奠定 LLM 基础 |
| 2020 | GPT-3 发布(175B 参数) | Few-Shot 能力涌现 |
| 2023 | ChatGPT 引爆 AIGC | 大模型应用元年 |
| 2024-2026 | 国产模型 DeepSeek/GLM/Qwen 崛起 | 多极化竞争 |
主流深度学习框架
- PyTorch:Meta 出品,研究界主流,唯元智创训练侧默认框架
- TensorFlow:Google 出品,工业部署成熟
- JAX:Google 出品,面向高性能计算
- MindSpore:华为出品,昇腾 NPU 优化
常见问题
深度学习必须用 GPU 吗?
训练侧几乎必须 GPU(NVIDIA A100/H100 为主流)。推理侧可以用 CPU、量化后用消费级显卡,或调用云端 API(唯元智创即此类方案,无需自购硬件)。
深度学习能做什么?
图像识别、语音合成、机器翻译、代码生成、对话系统、蛋白质结构预测(AlphaFold)、自动驾驶等几乎所有 AI 任务。