尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
线性代数怎么学才通透?MIT 18.06与3Blue1Brown的互补学习笔记
说实话我在接触 MIT 18.06 和 3Blue1Brown 之前已经啃过好几遍线性代数的教材。同济版、David Lay 版、甚至 Gilbert Strang 的《Introduction to Linear Algebra》英文原版我都翻过。但每次学完感觉就是记住了公式、会算几道题一碰到实际问题就懵了。直到我把 Strang 教授的 MIT 18.06 课程录像和 3Blue1Brown 的《Essence of Linear Algebra》系列搭配着看才真正体会到什么叫“通了”那种感觉就像打通了任督二脉。这套组合拳一个是代数计算的大师课一个是几何直觉的启发课。它们一个告诉你“怎么算”一个告诉你“算的是什么”。对于正在学线性代数、准备考研数学、或者工作中要接触数据分析、机器学习的人来说这个搭配简直是无价之宝。这篇文章我想把我自己边看边记的核心笔记、踩过的坑、以及把两者融合起来的理解方式完整地整理出来分享给你。1. 为什么把 MIT 18.06 和 3Blue1Brown 放一起学先说结论单独学任何一门都会有明显的短板。这也是我反复对比实践后最深的感触。1.1 两条互补的学习路径MIT 18.06 是 Gilbert Strang 教授在麻省理工开设的线性代数核心课程。这门课厉害的地方在于Strang 的眼睛始终盯着“真实的应用”——电路、力学、图论、数据拟合他会用大量的实例告诉你行列式、特征值、奇异值这些抽象概念到底是在解决什么实际问题。课程的核心是矩阵分解从消元法的 LU 分解到正交化的 QR 分解再到对称矩阵的对角化和最终的 SVD整条线走得非常清晰。这门课能帮你建立扎实的代数基本功熟练处理Axb、检验矩阵是否可逆、理解向量空间和子空间。3Blue1Brown下文简称34B1B的《线性代数的本质》则完全是另一个路子。它不谈复杂计算而是把所有概念都放到坐标系里可视化。向量不再是一列数字而是空间里的一个箭头矩阵不再是一张表格而是对空间的一种线性变换——拉伸、旋转、剪切。它的核心问题只有一个这个变换对空间做了什么行列式变成面积体积缩放比例特征向量变成变换中方向不变的向量矩阵乘法变成变换的复合。这门课建立的是几何直觉。你光看 Strang容易陷入公式推导知道怎么算但不知道为什么。你光看 3B1B虽然有直觉但缺乏计算能力遇到具体的矩阵手算不出来。把两门课对照着学左边的代数和右边的几何互相印证才能真正把线性代数变成自己的工具。1.2 从我的实际经历说说这种“化学效应”我举一个最直观的例子——特征值。在没有配合 3B1B 之前我知道特征值和特征向量满足 Avλv会解特征方程 |A-λI|0也能算出来。但“特征向量是变换中方向不变的向量”这个几何意义我是看了 3B1B 第 10 集才真正懂的。镜头里一个矩阵代表的变换作用在空间上绝大多数向量的方向都改变了只有少数一些矢量只是被拉长了或者缩短了、反向这些就在自己的轨道上被抓着不动的向量就是特征向量λ 就是拉伸的倍数。再回头听 Strang 讲“为什么要找谱分解”一切就顺理成章了——因为我们要搞清楚一个变换最重要的方向在哪。后来我又用这个几何视角去理解 Markov 矩阵Strang 课里的第六章一个种群分布的状态转移矩阵它的稳态分布其实就是特征值 1 对应的特征向量。这不就是几何直觉在应用里的直接体现吗所以我的建议是一定要两门课交叉着看先看 3B1B 建立几何直觉再上 MIT 18.06 补充计算和理论第二轮复习时再回头看 3B1B 巩固几何意义。2. 线性代数核心概念的几何意义拆解我把自己整理的 3Blue1Brown 笔记做了一个深度总结配合 MIT 18.06 的知识点逐个拆解给你看。这些笔记当时花了我大量时间截图、停顿、回放现在浓缩成人话版。2.1 向量的几何本质不是那排数字是那个箭头教材里向量就是一个列向量 (a, b)是坐标点。但在 3B1B 的坐标系里向量的本质是“空间中的一个箭头”这个箭头的头部在 (a, b) 处尾部落在一个默认的坐标原点。这个视角转换非常重要因为后面所有的线性变换都是在这个“箭头所处的空间”里进行的。同时Strang 在 18.06 第 1 讲强调的是 Linear Combination线性组合和 Span张成的空间。坐标系里的两个基向量 i (1,0) 和 j (0,1) 是描述空间的坐标基础但你完全可以换一组基比方说 v1(1,1), v2(2,1)。这时候任何一个向量 x (3,2) 都可以写成 x -1 * v1 2 * v2 这样的线性组合(-1, 2) 就是向量 x 在新的基下的坐标。把 3B1B 的“箭头”和 Strang 的“基与线性组合”联合起来你会意识到坐标是相对的它依赖于你选择了哪一组基向量。这个观念对后续理解相似矩阵 A 与 BP⁻¹AP 至关重要。2.2 矩阵乘法的几何意义变换的复合3B1B 最精彩的一集我认为是讲矩阵是“线性变换”的这一集。一个矩阵 M左乘一个向量 v几何上就是对 v 所在的空间做一次线性变换把它移动到 Mv 的位置。这种变换保持网格线平行且等距分布原点不变。所以矩阵第二列就代表 j 向量变换后的落点第一列代表 i 向量变换后的落点。那么矩阵乘法 AB 的意义就是先做 B 变换再做 A 变换。注意方向很重要对我来说最早学矩阵乘法的时候老犯错就是因为没抓住这个“复合变换”顺序。AB ≠ BA 在几何上也很好理解了——先旋转再剪切和先剪切再旋转结果当然不同。Strang 在课程中反复强调 Linear Transformation 和 Matrix Multiplication 的等价性他和 3B1B 的叙述在这里殊途同归。明白了这一点你会很容易理解为什么矩阵乘法如此定义行乘列而不是逐元素相乘——因为它本质上是两个变换的复合这种定义才能保持变换的结合律。2.3 行列式不只是那个行列式是面积缩放比例在学校里行列式就是一套计算方法3B1B 给了它一个惊人的直观解释行列式的绝对值是行列式所代表的矩阵做变换后对单位面积或单位体积产生的缩放倍数。行列式为负数代表空间的定向发生了翻转——就像把一只手套从里到外翻了过来。如果行列式为 0意味着把空间压缩到一个更低的维度上比如平面被压成一条线或者一个点。回到 Strang 的课堂上行列式为 0 直接对应矩阵不可逆对应 Axb 没有唯一解。以前我只能死记矩阵奇异则行列式为0。现在我在脑海里浮现的是一个高维空间拍扁成低维空间的暴力几何过程这是因为变换把信息丢失了当然没办法“反转”回去。类似的为什么 det(AB) det(A)det(B)如果用面积缩放的语言解释起来就像喝水一样轻松——先放大 A 倍再放大 B 倍总效果自然等于乘积。可以说行列式这一块是我觉得几何意义对本课程帮助最大的地方也是我强烈建议每一个学到这里都卡住的人先去看 3B1B 的原因。2.4 特征向量与特征值矩阵的“稳定主轴”还是那句话矩阵的几何意义是线性变换变换会产生拉伸、旋转和剪切。3B1B 解释特征向量时有一个绝佳的视角我们想找一些特殊的箭头它们经过变换后虽然长度发生了改变但方向仍然保持在同一条直线上。这些箭头就是特征向量改变的长度倍数就是特征值。如果把矩阵看成是描述动态过程的算子那么这些特征向量就是过程的“稳定主轴”是你分析问题需要重点盯住的方向。MIT 18.06 里Strang 用矩阵对角化来解释解耦的系统说白了一个耦合的系统通过在特征向量的基底下会变成多个互不干扰的独立子系统。我当时在学弹簧震动模型、马尔可夫过程的时候直觉上总差一点后来回到 3B1B 的视角脑海里想象一个弹簧它震动的主要方向就是它的两个特征模态特征值根号(k/m)则是它的频率。这样再回看 Strang 的微分方程组那节课真的豁然开朗。2.5 向量空间与子空间从直线到平面再到高维空间MIT 18.06 里向量空间和子空间是第 5 讲的主题Strang 花了很大的精力来定义什么是 “subspace”。很多初次学习的同学觉得这部分抽象得不得了。但如果你结合 3B1B 的几何画面会非常容易理解。直线通过原点是一个一维子空间平面通过原点是一个二维子空间。空间里过原点的所有向量构成了一个向量空间而它内部那根过原点的直线、那个过原点的平面都是它的子空间。关键在于“过原点”这三个字。Strang 反复强调子空间必须对加法和数乘封闭。这在几何上就是要求子空间是过原点的低维平面或直线。你想象一下如果一个子空间不过原点那它里的向量加起来就跑到外面去了数学上根本说不通。所以当你看到 “N(A) 是零空间C(A) 是列空间” 时你要在脑海中意识到这两个都是空间里的平面或直线并且都过原点。零空间是被矩阵变换压成零点的那些向量组成的空间列空间是矩阵所有可能到达的向量组成的空间。它们一个是从输入空间看的“沉没方向”一个是从输出空间看的“可达位置”两者维度之和刚好是 n这就是秩定理的几何翻译。3. MIT 18.06 核心章节笔记与理解如果只有几何直觉做题和写工程代码还是会缺工具所以 MIT 18.06 的代数计算部分是不可或缺的。我的笔记按照课程顺序整理了三块基石内容每一块我努力把“公式”和“几何直觉”挂上钩。3.1 消元法从高斯消元到矩阵分解 LUStrang 的第 1、2 讲都离不开消元法。这似乎是中学就学过的方法但当成矩阵的语言来写就是 A LU即一个矩阵可以被分解成下三角矩阵 L记录消元过程中每步所用的乘数和上三角矩阵 U消元完成后的阶梯矩阵。几何上这相当于把原来的矩阵变换拆成两个连续的变换——先完成行向组合下的上三角化变换 U再做一个下三角反向调整 L两步合起来得到我们原来变换 A。在实操上我强烈建议跟着 Strang 自己动手算给定矩阵A先做行交换或者乘法消元把下面元消掉记录乘数放在L里。我当时最大的误区是觉得 U 才是关键但后来发现 L 里面包含着大量的敏感信息而且是求解后续方程组和做数值稳定性的一个重要窗口。每次做完消元最好把 L 对角线上的 1 加上去再乘一下验证 A LU 是否成立这是个好习惯。3.2 四个基本子空间线性代数的“核心地图”紧接着第 5~7 讲Strang 高屋建瓴地提出了四个基本子空间的概念。这是 MIT 18.06 的一个重要主线也是我笔记中篇幅最多的部分列空间 C(A)所有 Ax 可能的取值对应变换后到达的空间零空间 N(A)所有满足 Ax0 的向量 x变换后被压到原点的方向行空间 C(Aᵀ)矩阵行的所有线性组合等于转置后的列空间即 A 这个矩阵最重要的“投影方向”左零空间 N(Aᵀ)所有满足 Aᵀ y0 的向量 y输出空间有关约束的方向这四个空间在几何上是两两正交的。行空间和零空间在 R^n 里正交互补列空间和左零空间在 R^m 里正交互补。我用 3B1B 的方式来理解树状网格线的行空间方向就是变换中充满弹性的那些方向零空间方向就是变换过程中压扁丢失的方向。正交补意味着无论你怎么在这些方向之间加加减减它们始终互不干扰各占一个维度。为什么这四个子空间如此重要因为整个线性代数的核心结构都写在它们之中。积分中曲线长度、面积、体积结构都能通过它们去分析。在数据科学里最小二乘问题的解空间分析离不开这四个子空间的正交分解。我当时为了把这个结构画成图在黑板上推导了不下五遍从 R^n 空间映射到 R^m 空间每条线对应的子空间都标注清楚这才建立起对矩阵世界的整体感。3.3 投影与最小二乘超定方程组的最优解当方程 Axb 无解方程数比未知数多并且 b 不在列空间里时线性代数的下一个问题是找一个“最接近”的解。这里的关键是把 b 投影到列空间 C(A) 里用投影后的向量 b_hat 去代替 b再解 Ax_hat b_hat。这个 x_hat 的距离残差最小二乘解。几何上看投影就是把向量分解成两部分一部分在列空间里可表示的部分另一部分在左零空间里误差部分两者相互垂直。由此推导出的投影矩阵 P A(AᵀA)⁻¹Aᵀ投影到列空间。3B1B 没有系统讲投影但它的直观框架帮了我很大忙——所谓垂直就是“正交”。实际使用时我遇到过多重共线性问题特征矩阵列之间高度相关导致 AᵀA 接近奇异投影结果非常不稳定。这时候结合正则化比如岭回归本质上就是给投影加一个“阻尼”在几何上是在对角线方向给矩阵增加了一些“厚度”保证反演稳定。Strang 课堂上讲了最小二乘推导公式但没有过多展开多重共线性这种病态问题这部分是基于自己实践工程经验补充的。无论如何理解投影就是在高维空间里做“向量竖直下落找影子”这件事很多困扰你的模型拟合问题都会变得清晰。3.4 对称矩阵与正定性工程稳定性的保障第 6 章对称矩阵一节是 Strang 的重点。对称矩阵 AAᵀ它最重要的性质是它的特征值都是实数并且特征向量可以两两正交。这在矩阵分解之中至关重要因为正定矩阵 A所有特征值皆为正做分解时不会出现负的特征值导致“反向拉伸”这种不稳定行为。几何上对称矩阵代表的是纯净的、沿坐标轴特征向量方向拉伸的变换没有剪切。正定代表沿每个特征向量的方向拉伸倍数为正这意味着单位球在变换后仍然是一个椭球不会有什么方向被翻转。我第一次应用正定性的概念是在判断一个多元函数的极值点Hessian 矩阵正定就是曲面在该点附近像一个碗底向上凸负定就是像个倒扣的碗不定则像一个马鞍。用 3B1B 的视觉语言这就像你在一座山谷里各方向都向上走正定还是某个方向向上、某个方向向下不定的问题一下子就把多元微积分里的“黑箱”参数变成了几何直觉。4. 实操路线与常见误区排雷纸上得来终觉浅下面是我整理的具体学习路线和方法还有踩过的坑希望能让你少走弯路。4.1 建议的学习顺序与时间节奏第一轮先用 3B1B 建直觉。花一周每天看 2-3 集共 12-16 集。看的时候不用记笔记就盯着画面感受矩阵是把空间扭曲拉伸。对他讲到的概念有个印象哪怕说不出定义也不怕。这轮的核心目标是让你对“矩阵 线性变换”这件事有肌肉记忆。第二轮逐集对照 MIT 18.06。我建议每看完 3B1B 的一集或者两集就打开对应的 18.06 课程录像。具体对照顺序可以这样看完 3B1B 的“向量/线性组合/张成空间”去听 Strang 第 1-2 讲向量、消元。看完“矩阵是对空间的线性变换”和“矩阵乘法与复合变换”去听第 3 讲矩阵乘法和第 4 讲LU分解。看完“行列式”去听第 18-20 讲行列式公式与性质。看完“特征向量与特征值”去听第 21-23 讲特征值、对角化。这一轮是主体节奏可以是每周 3 次课每次大约 1 小时看课程0.5 小时看 3B1B 对应部分。第三轮刷题巩固。18.06 课程主页有作业题包括家庭作业和考试题可以挑着做。做题时我会刻意闭上眼睛回想相关的几何画面想不起来的再回去看课件。这轮持续两到三周做完几套题基本就稳了。4.2 最常见的三个学习误区误区一上来就死啃 MIT 18.06 公式推导。如果从未看过 3B1B而直接进入 Strang 的消元法、行最简阶梯形、逆矩阵的解释前期会非常痛苦因为你缺少“为什么消元可以这样玩”的直观动机。我见很多人因为这个第一堂课就被击退实在可惜。误区二只看 3B1B 不做题。3B1B 对概念直观很有帮助但它不训练你计算能力和解决问题能力。特征值问题看完很爽但让你手算一个 3x3 矩阵的特征多项式自己对角化一个矩阵还是会露怯。所以它只能是“配菜”不能当“主菜”。误区三不把四种子空间在脑海里画出来。如果一开始就硬记一些概念而不去想象四个子空间如何正交交织后续学 SVD 和各类分解会很痛苦。所以务必看完 18.06 的四个子空间那节课并花一周时间画图把 R^n、R^m 两个空间的关系整明白。4.3 事半功倍的笔记方法我的笔记不是抄板书而是“概念地图 几何注释”的模式。具体做法是每一个新概念左边写 Strang 的代数定义右边画 3B1B 的示意图截图或者手绘简图中间用一句话总结两者的共性。每个定理证明完之后我都会问自己一个问题如果把这个定理映射到二维平面它会是什么样这帮我记住并快速推断很多结论。笔记里专门留了一页 “概念类比表”矩阵 ↔ 线性变换行列式 ↔ 面积缩放特征向量 ↔ 拉伸方向零空间 ↔ 压缩消失方向行空间 ↔ 变换的响应方向左零空间 ↔ 输出不可达分量。用颜色区分概念之间的关联。比如所有与“正交”有关的地方标蓝色所有与“维度/秩”相关的地方标红色。4.4 配套工具与资源推荐除了两门主课我想额外分享几个实测下来很有用的配套资源一是 MIT OpenCourseWare 官网上的课程主页里面有全部课程视频YouTube 和国内平台都能找到、板书 PDF、作业题和学习指南。网上的字幕文件也基本都有中英文对照配合字幕看效率更高。二是 Strang 的教材《Introduction to Linear Algebra》第五版。我建议作为参考书而不是第一遍的阅读材料配合课程视频使用。三是符号计算工具。我推荐用 Python 的 SymPy 库验证你手算的矩阵操作是否正确。比如一个 3x3 矩阵特征值算出来不敢确信时A.eigenvals()能给你可靠答案同时你能在 NumPy 里用np.linalg.svd()验证 SVD 分解结果的形状。建议在做计算题时手动在草稿纸上算一遍再用这些工具快速验证结果这样能把“数值手感”和“工具高效”结合起来。四是其他可视化资源比如 Ethan 的 Anki 卡片记忆卡片以及一些在线的矩阵可视化站点它们也能帮你做空间变换的交互式演示。不过主力还是 3B1B 和 MIT 18.06 这一对组合。5. 从学到用这套笔记怎么转化为实战能力学了知识最终是为了用。你可能会问掌握了几何直觉和代数计算具体能干什么我在工作和深入研究中有几处深刻的体会。5.1 理解机器学习里的 PCA 与 SVDSVD奇异值分解是线性代数的高潮也是机器学习和数据压缩的基石。Strang 在课的后半部分专门讲 SVD3B1B 虽然没有完整展开 SVD但“矩阵是变换”的几何直觉直接帮我把 SVD 想成任何线性变换先做一个旋转由 V 完成接着沿坐标轴拉伸由 Σ 完成最后再做一次旋转由 U 完成。这一步一步“分解动作”像拆解一个一台复杂机器的齿轮系统。PCA主成分分析本质上就是找数据协方差矩阵的特征向量。你脑补一下一堆数据点在高维空间形成一团云PCA 就是在找这团云整体拉伸的方向方差最大的方向这些方向就是协方差矩阵的特征向量对应特征值就是该方向上的方差规模。这种理解方式对做特征工程和降维很有帮助。5.2 信号处理与控制系统里的状态空间控制理论里面的状态转移矩阵 e^{At}本质就是对系统的状态做线性变换并求解微分方程。如果你理解了特征值你会明白系统怎么随时间演化特征值为负会让系统收敛到零稳定特征值为正会导致发散不稳定复数特征值则带来振荡。这个直觉让我在理解和调试滤波器时如鱼得水因为本质上是矩阵特征结构在支配时间域的响应。学习信号与系统时这部分曾经是死记硬背的现在彻底清晰了。5.3 计算机图形学里的坐标系变换你在游戏引擎或者三维渲染工具里看到的每一个旋转、平移、缩放背后都是矩阵乘法在做线性变换。3B1B 里画出来的那套坐标系变换几乎是图形学教材的直接蓝图。你在编辑器中拖动一个物体坐标变换矩阵把默认原点空间映射到世界空间相机的视角方向、投影矩阵排版时无不体现四个子空间和特征值的思想。学完这套组合再看图形学相关的代码会有种“原来如此”的畅快感。最后分享两个我反复迭代后的小技巧如果你没有大量整块时间跟课我特别建议你抓住这两个高效杠杆。第一个技巧是倍速播放。MIT 18.06 的视频是课堂实录节奏偏慢我一般用 1.5 倍速听遇到关键的地方再切回正常速度。3B1B 的视频语速适中但密度高我通常 1.0-1.25 倍速并且一定开字幕。配合暂停和回放一个十几分钟的视频我能看四十分钟这才是学习常态。第二个技巧是写一个“一句
RELATED

相关推荐

DeepSeek本地部署实战:Ollama+知识库RAG搭建指南

DeepSeek本地部署实战:Ollama+知识库RAG搭建指南

把 DeepSeek 跑到本地这件事,我前后折腾了一个多星期,最后稳定下来的方案是:Ollama 做模型引擎,外面套一个开源知识库系统,既解决了数据不出内网的需求,也把云端 API 的按量费用彻底省了下来。这篇文章不聊…

📅 2026/10/1 12:08:05
论文AI率检测高?4个指令+3个技巧,从80%降到10%

论文AI率检测高?4个指令+3个技巧,从80%降到10%

说实话,第一次看到自己论文的AI率检测报告显示80%的时候,我是有点懵的。写的时候明明查了很多文献、改了好几轮,怎么一检测就全是"AI痕迹"?后来才搞明白,AI检测看的不只是"你有没有抄AI"&#xff…

📅 2026/10/1 12:08:05
VSCode配置ESP-IDF头文件路径与智能提示全指南

VSCode配置ESP-IDF头文件路径与智能提示全指南

1. 这不是代码错了,是VSCode“看不懂”你的ESP-IDF项目 刚在VSCode里打开一个全新的ESP32工程,满屏红色波浪线—— #include "freertos/FreeRTOS.h" 、 #include "esp_system.h" 、 #include "driver/gpio.h" 全部标…

📅 2026/10/1 12:03:05
MORE NEWS

更多资讯

📰

Python爬虫实战:从豆瓣短评到中文词云生成保姆级教程

前两天帮朋友处理了一个小需求:把一部电影在豆瓣上的最新短评爬下来,生成一张词云图看看观众都在聊什么。当时顺手写了个Python脚本,从requests爬评论,到jieba分词,再到wordcloud生成词云,前后加起来不到两…

📰

Vue + Electron 入门:从主进程IPC通信到打包避坑指南

Vue Electron 开发入门教程 如果你是一个Web前端开发者,想用自己熟悉的Vue技术栈做一款桌面应用,Electron几乎是最省事的路径。不用学新的UI框架,不用重新啃原生API,HTML、CSS、JavaScript 那套理论直接搬过来,再加上…

📰

前端Web组态软件选型实战:图元、协议、渲染与国产化深度解析

1. 为什么前端 Web 组态软件正在成为工业数字化落地的关键支点最近半年,我连续参与了三个中型制造企业的可视化监控平台升级项目,从最初被要求“做个大屏看数据”,到客户主动提出“要能拖拽改画面、连PLC不用写代码、运维人员自己就能调参数”…

📰

HER强化学习目标重标记:破解稀疏奖励难题的实用指南

1. 先搞清楚 hindsight 到底在解决什么问题 先别急着看代码,我需要先讲清楚为什么会有 hindsight 这个东西。如果你是刚接触强化学习不久的读者,大概率遇到过这种场景:写了个 DDPG 或者 PPO,在 Gym 的拿物体、推箱子这类任务上训练…

📰

连续时间傅里叶变换直觉指南:从波形到频谱的工程思维

这一章题目看着是教科书里的标准章节,但“连续时间傅里叶变换”这东西,恰恰是我见过最容易“背了一堆公式却不知道在干嘛”的内容。当年我学到这里,变换对、性质、收敛条件背得滚瓜烂熟,考试也没问题。直到工作后参与一个音频处理…

📰

普通显卡可训练的自研神经网络Waver-SNN-SSM

1. 项目概述:为什么一个“普通显卡可训练”的自研神经网络值得认真对待 “个人开源自研神经网络!普通显卡可训练!!”——这个标题乍看像极了技术社区里常见的流量型口号,但拆开来看,每个词都踩在当下AI开发…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬