AI、机器学习与深度学习到底在讲什么 欢迎拜访雾里看山-CSDN博客本篇主题AI、机器学习与深度学习到底在讲什么发布时间2026.8.25隶属专栏AI进化之路目录先从一个问题开始一句话区分三个概念AI我们要让机器“像人一样思考”AI 在讲什么AI 不是一个独立学科机器学习让机器自己从数据里学规律为什么需要 ML三类基本范式ML 的典型工作流深度学习把“特征工程”自动化掉DL 在解决什么问题神经网络是什么DL 为什么这几年才爆发大模型DL 的规模化产物LLM 是什么大模型和传统 DL 的差别画一张总览图易错点与常见误区误区 1把 AI 等同于深度学习误区 2把大模型等同于 AGI误区 3以为学 AI 必须先学高数误区 4忽略数据和工程这一篇到底要记住什么给后续几篇打个底先从一个问题开始最近几年几乎每隔一段时间就会冒出一个新词今天叫大模型明天叫生成式 AI后天又叫AGI。如果你刚准备系统学习 AI第一反应大概率是——这些词到底是不是一回事到底应该从哪一层开始看。这一篇不写公式也不急着上手Python。先把三个最容易混淆的概念放在一张图里讲清楚AIArtificial Intelligence人工智能MLMachine Learning机器学习DLDeep Learning深度学习以及它们和最近两年最火的LLMLarge Language Model大语言模型到底是什么关系。一句话区分三个概念如果你只想记一句话可以这样记AI是一个目标ML是达成目标的主流方法DL是ML里效果最好的一类算法而大模型是DL在数据和参数规模放大之后的产物。AI我们要让机器“像人一样思考”AI 在讲什么人工智能这个概念最早可以追溯到 1956 年的达特茅斯会议。它的目标其实非常朴素让机器表现出通常需要人类智慧才能完成的能力比如推理、规划、理解语言、识别图像、做决策。从这个角度看AI不是一个具体技术而是一个研究方向。它里面既包括今天的深度学习也包括很多传统方法比如基于规则的专家系统例如早期医疗诊断系统MYCIN搜索算法例如围棋 AIAlphaGo中的蒙特卡洛树搜索概率图模型、规划算法、知识图谱以及今天主流的机器学习所以看到AI这个词时先把它理解成“问题域”再往下看是用什么方法去解决。AI 不是一个独立学科AI本质上是计算机科学、数学、心理学、语言学等学科的交叉。这种交叉属性也决定了学 AI 时只盯着一类算法看是不行的必须同时理解问题、模型、数据和工程。机器学习让机器自己从数据里学规律为什么需要 ML传统程序是“人写规则机器执行”比如if 邮件包含 免费 and 中奖: 标记为垃圾邮件但现实中很多问题写不出明确规则比如图片里有没有猫、句子表达的是不是讽刺。机器学习的核心思路换了一个角度人不写规则而是给机器一堆“输入 正确答案”的样本让它自己拟合出规律。这就是MLMachine Learning。它把“写规则”这件事从程序员手里转移到了算法和数据上。三类基本范式ML主要分三类学习方式写代码、写博客、面试都会反复出现范式数据长什么样经典任务典型算法监督学习Supervised Learning有标签(输入, 正确答案)分类、回归线性回归、决策树、SVM无监督学习Unsupervised Learning没有标签只有输入聚类、降维K-Means、PCA强化学习Reinforcement Learning通过“行动 奖励”反馈学习游戏、机器人、自动驾驶Q-Learning、PPO题外话还有“自监督学习Self-Supervised Learning”它是今天大模型训练的核心范式本质是把“没有标签的数据”想办法变成“有伪标签的数据”比如让模型预测下一个词。ML 的典型工作流一个标准的ML项目大致长这样收集数据清洗、采样、划分训练集/验证集/测试集。特征工程把原始数据变成模型能吃的特征。选模型根据任务选LR、XGBoost、Transformer等。训练用训练集拟合参数用验证集调超参。评估用测试集看泛化效果避免过拟合。部署上线把模型变成可调用的服务。深度学习把“特征工程”自动化掉DL 在解决什么问题传统ML有个很麻烦的环节——特征工程。比如做图像识别需要人肉设计“边缘检测算子”、“HOG 特征”做 NLP需要设计TF-IDF、词袋模型。这一步非常依赖专家经验。深度学习的核心贡献是让神经网络自己学特征。它用多层“深”的人工神经元堆叠自动从原始数据中提取从简单到复杂的特征表示。举一个直观的例子浅层神经元可能学到“边缘”、“颜色块”。中间层神经元可能学到“眼睛”、“车轮”。深层神经元可能学到“人脸”、“汽车”。整个过程不需要人肉告诉模型“什么是边缘”只要给它足够多的数据和合适的网络结构就行。神经网络是什么神经网络Neural Network是最基本的DL模型单元。它的设计灵感来自生物神经元本质上是一连串可学习的线性变换 非线性激活函数的组合。常见的基本网络结构包括MLP多层感知机最朴素的“全连接”网络。CNN卷积神经网络擅长图像、视频。RNN循环神经网络擅长序列数据早期 NLP、语音。Transformer今天几乎所有大模型的基石后续会单独拆一篇讲。DL 为什么这几年才爆发DL的基础结构在 1980 年代就有了但真正爆发是 2012 年之后。背后有三个关键条件同时成熟数据互联网和移动设备带来了海量标注和未标注数据。算力GPU尤其是CUDA生态让训练大规模网络变得现实。算法ReLU、Dropout、BatchNorm、Transformer 等新结构让训练更稳定。可以理解为DL不是突然发明出来的而是“数据 算力 算法”三件事同时具备后的必然结果。大模型DL 的规模化产物LLM 是什么LLMLarge Language Model大语言模型指的是参数规模和训练数据规模都达到非常大数量级的语言模型。一个粗略的参考尺度阶段参数量级典型代表早期预训练模型几亿到几亿1BBERT-Base、GPT-1中型预训练模型几十亿~10BGPT-2、T5现代大模型几百亿到几千亿100BGPT-3、LLaMA-3、Qwen-2、DeepSeek-V3注意“大模型”并不严格等于“大语言模型”。今天也有视觉大模型、多模态大模型、代码大模型等。但因为LLM是最出圈、最通用的一类所以大家平时说的大模型多数时候指的就是LLM。大模型和传统 DL 的差别虽然LLM底层依然是DL但它有几个明显不同的特征规模大参数量、训练数据量、训练算力都比传统模型高几个数量级。通用性强同一个模型能做问答、写作、翻译、写代码、做数学题。涌现能力在规模突破某个阈值后模型会突然具备一些在小模型上看不到的能力比如复杂推理。新范式训练阶段用自监督学习预测下一个词微调阶段用SFT监督微调RLHF基于人类反馈的强化学习。后面几篇会逐一拆开讲这里先建立印象。画一张总览图把这四层概念放在一张图里看关系会更清楚可以理解为四层同心圆最外层是目标向内逐层是更具体的方法最里层是当前最火的应用形态。易错点与常见误区误区 1把 AI 等同于深度学习很多人一提AI就想到神经网络其实AI还包括符号主义、贝叶斯方法、进化计算等。今天DL之所以占主导是因为它效果好而不是它“唯一正确”。误区 2把大模型等同于 AGILLM很强但本质上依然是“在大量文本上学下一个词的概率分布”。它没有真正的理解、意识和持续学习能力。把它直接当成AGI通用人工智能会高估它的能力边界。误区 3以为学 AI 必须先学高数数学确实要补但不是上来就啃《PRML》。更现实的路径是先会用Python和PyTorch跑通一个最小例子。再补线性代数、概率、微积分中最核心的子集。最后再回头看推导才不会半路放弃。误区 4忽略数据和工程很多初学者把精力全花在“模型结构”上但工业界 80% 的精力其实在数据清洗、特征工程、评测体系、部署工程上。这一条在后续RAG、Agent、微调几篇里会反复出现。这一篇到底要记住什么用一段话把这一篇压成 5 个要点AI是研究目标ML是让机器从数据中学规律的方法DL是ML中效果最好的一类算法。ML主要分监督、无监督、强化学习三类今天的大模型多用自监督学习。DL的核心是用多层神经网络自动学特征而不是依赖人肉特征工程。大模型是DL的规模化产物参数规模和数据规模都比传统模型高几个数量级。学 AI 不要只追热点模型要同时理解问题、数据、算法、工程四件事。给后续几篇打个底这一篇把概念层面的“地图”画完了。从下一篇开始会沿着这条主线继续往下走第 02 篇会专门讲大模型的演进脉络从GPT到开源大模型看看每一代模型到底解决了什么问题。第 03 篇会讲大模型能做什么、不能做什么避免在工程上踩到不切实际的预期。第 04 篇开始进入工程侧先讲最朴素的概念——Token。⚠️ 写在最后以上内容是我在系统整理 AI 知识体系时的一些总结和概括重在把概念边界画清楚。如果你觉得哪一层概念还是模糊的可以从评论区或者私信和我交流后续我会按这个分层继续往下拆。