深度学习

Deep Learning

深度学习(Deep Learning)是机器学习的一个分支,通过构建具有多层「人工神经网络」的模型,从海量数据中自动学习特征表示,是大语言模型的理论基础。

详细解释

深度学习(Deep Learning)的核心是「深度神经网络」——由输入层、多个隐藏层、输出层组成,每层对前一层的结果做非线性变换。层数越深,模型能学到的特征就越抽象。

以图像识别为例:

  • 第 1 层学习边缘、颜色
  • 第 2 层学习纹理、角点
  • 第 3 层学习局部形状(眼睛、鼻子)
  • 第 4+ 层学习整体概念(人脸、汽车)

深度学习 vs 传统机器学习

维度传统机器学习深度学习
特征工程人工设计自动学习
数据量千-万级万-亿级
算力需求CPU 即可需要 GPU 集群
可解释性较强较弱(黑盒)
代表算法XGBoost、SVMTransformer、CNN、RNN

深度学习的关键突破

年份事件影响
2012AlexNet 在 ImageNet 一举夺冠CNN 复兴
2014GAN 提出生成式 AI 起步
2017Transformer 论文《Attention Is All You Need》奠定 LLM 基础
2020GPT-3 发布(175B 参数)Few-Shot 能力涌现
2023ChatGPT 引爆 AIGC大模型应用元年
2024-2026国产模型 DeepSeek/GLM/Qwen 崛起多极化竞争

主流深度学习框架

  • PyTorch:Meta 出品,研究界主流,唯元智创训练侧默认框架
  • TensorFlow:Google 出品,工业部署成熟
  • JAX:Google 出品,面向高性能计算
  • MindSpore:华为出品,昇腾 NPU 优化

常见问题

深度学习必须用 GPU 吗?
训练侧几乎必须 GPU(NVIDIA A100/H100 为主流)。推理侧可以用 CPU、量化后用消费级显卡,或调用云端 API(唯元智创即此类方案,无需自购硬件)。
深度学习能做什么?
图像识别、语音合成、机器翻译、代码生成、对话系统、蛋白质结构预测(AlphaFold)、自动驾驶等几乎所有 AI 任务。