☰
结合MIT 18.06与3Blue1Brown:几何视角重构线性代数核心概念
2026/10/2 16:04:57 网站建设 项目流程

最近把 MIT 18.06(Gilbert Strang 的线性代数公开课)和 3Blue1Brown 的 Essence of Linear Algebra 系列从头到尾各刷了两遍,边看边做了一份把两条线拧成一股绳的笔记。这份笔记不是课程内容的复述,而是站在这两套经典材料肩膀上,重新整理自己对「线性代数的几何意义」的理解。如果你学过线代但总觉得知识是散的,或者只看过 3Blue1Brown 的动画觉得「好美但不会做题」,又或者正准备重新刷一遍线性代数,这篇文章应该能帮你少走很多弯路。

先说结论:18.06 和 3Blue1Brown 的关系,不是「二选一」,而是「左眼」和「右眼」。一个人用两只眼睛看东西才有深度,线性代数也一样。Strang 给你代数骨架、公式推导、考试题怎么算;3Blue1Brown 给你空间直觉、变换画面、概念背后的 why。单独看任何一边,都很容易在「会算但不懂」和「懂了但不会算」之间反复横跳。这篇笔记的每一节,我都尽量同时写上「代数的说法」和「几何的画面」,再补一个能落地的例子或实验。

1. 为什么我要把 18.06 和 3Blue1Brown 放在一起刷

1.1 18.06 解决的是「怎么算、如何证」

Gilbert Strang 在 MIT 18.06 里的讲法非常特殊,他很少一上来就甩定义,而是从「解方程组」这个最朴素的问题长出一整棵知识树。第一节课他就反复强调:线性代数不是关于单个数字的算术,而是关于向量、矩阵和线性组合的学问。整个课程的主线可以概括成一句话:研究 Ax=b 的一切。

围绕这个目标,18.06 搭建了一套非常完整的代数体系:

  • 用消元法把矩阵化为行阶梯形,判断解的情况。
  • 定义列空间、零空间、行空间、左零空间,并证明四个基本子空间的正交关系。
  • 用秩把解空间的结构说清楚,得到「秩-零化度定理」。
  • 把特征值、行列式、相似矩阵这些概念全部作为分析矩阵性质的工具。
  • 最后用力学、图论、马尔可夫矩阵、最小二乘这些应用收尾,让学生知道学完有什么用。

所以 18.06 更准确的定位是「工程师与科学家的线性代数基础」:它服务的是后续要用的矩阵计算能力。你从这门课里学会的是:给一个具体矩阵,我能在有限时间内判断它是否可逆、特征值范围、能否对角化、解方程组用什么方法最稳。

不过,也正因为太强调计算与证明,很多初学者会陷入一个典型困惑:课听懂了,作业也做了,公式背下来了,但遇到一个新矩阵时,脑子里完全没有画面。矩阵乘以向量到底是什么?为什么特征值那么重要?这个困惑在 Strang 的课里不会得到完美解答,因为他的课堂本来就不是「可视化」导向的。

1.2 3Blue1Brown 解决的是「它到底在干什么」

3Blue1Brown 的 Essence of Linear Algebra 系列完全是另一条路线。Grant Sanderson 的出发点是:线性代数里的对象不是死板的方格数字,而是空间中的变换。他把矩阵看成一个线性映射,矩阵的每一列是基向量被变换后的落点;矩阵乘法就是连续执行两次变换;行列式就是面积缩放比例;特征向量就是那些在变换中「只被拉伸、不改变方向」的特殊向量。

这种讲法几乎不涉及具体计算,但能瞬间点亮大脑回路。我第一次看「行列式的几何意义」那一集时,脑子里积了好几天的问号直接消失:为什么行列式为零矩阵就一定不可逆?因为变换把整个平面压成一条线或一个点了,面积变成 0,就像你把一张纸揉成一根线以后,没办法靠信息还原。这个「几何版因果链」比任何代数推导都容易记住。

3Blue1Brown 给我的第二个大启发是「对偶向量」那一集:点积的几何解释不只是投影,它背后可以看成把一个向量变成「乘法函数」,再从高维映射识别出来。这套观点放到最小二乘、傅里叶级数甚至量子力学里都通用,是用几何直觉连接现代数学的桥梁。

但它有个明显的局限:视频几乎不给你做计算训练。看完以后你会觉得「好有道理」,但让你上手用消元法求一个 4×4 矩阵的逆,还是要老实回去按 Strang 的办法一步步算。所以如果你只用 3Blue1Brown 来学线代,最后会变成「视觉上的巨人,计算上的矮子」。

1.3 把两套坐标系焊在一起

我自己第一次学线代时只用教科书,结果就是会算矩阵乘法,会说「矩阵是数的方阵」,但完全不懂为什么要这样定义。后来先看了 3Blue1Brown,感觉眼前一亮;可真正做课后题时发现,一旦题目变成「证明两个子空间正交」,动画帮不上忙,脑子又空白了。

直到把 18.06 和 3Blue1Brown 按章节对照着看,我才体会到什么叫「互补」:

  • 3B1B 负责在概念出现之前,先给你一个直觉预期:比如「哦,原来特征向量是变换中的不动方向」。
  • 18.06 负责在直觉建立之后,立刻给出严谨定义、计算方法和典型例题:比如「特征向量就是满足 Ax=λx 的非零向量,怎么求特征值和特征向量」。

所以我的建议是:不要问「哪套更好」,而是先看 3B1B 建立地图,再进入 18.06 填充里程碑,遇到抽象章节(对偶空间、子空间正交、相似矩阵)再回 3B1B 温习。整个过程里,笔记的核心不是抄定义,而是用自己的话把「几何画面」和「代数公式」互相翻译。

2. 我整理的核心几何意义笔记

2.1 向量:先别把「箭头」和「数组」分家

线性代数的一切都从向量开始。课本会说向量是 n 个数组成的有序数组;几何课上会说向量是空间里有方向和长度的箭头。两个说法都没错,但它们表达的是同一个对象在不同场景下的用法。

我自己的理解是:把向量看成「从一个起点到另一个位置的位移」。在二维平面里,向量 v=(2,1) 既是坐标点,也是从原点到 (2,1) 的箭头。这两种视角可以随时互相切换。点视角用于思考集合,比如「所有满足 x+y=0 的点组成一条直线」;箭头视角用于思考变换,比如「矩阵把箭头 v 映射成另一个箭头 Av」。

初学者最容易犯的错误是「只用一个视角」。只看数组,你会觉得向量的加法是「对应位置相加」的练习;只看箭头,你会忘记向量其实是一组数,计算机里存储的就是数组。建立起双重视角之后,后面所有概念都顺很多:线性组合就是「把箭头进行缩放再拼接」;张成空间就是「所有能被这些箭头组合出来的落点」。

这里可以做一个基础实验:随手在纸上画两个不平行的有向线段,然后把它们各乘上不同倍数再相加,你会得到平面上任何一个点。这就是「两个向量张成整个二维平面」的最直接含义。如果两个箭头恰好重合在同一条直线上,再怎么组合也只能画出一条线,这就是线性相关的通俗解释。

2.2 线性组合与张成空间:列空间的第一印象

「张成空间」的代数定义是:向量组 v₁, v₂, …, vk 的所有线性组合 c₁v₁+…+ckvk 构成的集合。几何直觉上,它就是一个点、一条直线、一个平面、一个三维空间……取决于这些向量覆盖的「维度」。

这个概念的真正威力,在于和矩阵乘法挂钩。把矩阵 A 的每一列看成向量,Ax 就是对 A 的列向量做线性组合,组合的权重就是 x 的分量。 Strang 在 18.06 里把这件事命名为「列图像」,他说:解 Ax=b,说白了就是在问:能不能用 A 的列向量拼出 b 来?

几何上这句话超级直观:如果 A 的列向量只张成一条过原点的直线,那么 b 不在这条线上,方程组就无解;b 在这条线上,就有无数组解。如果 A 的列向量张成整个空间,那对任意 b 都能找到至少一个 x。这就是「列空间」的第一印象:列空间就是所有 Ax 可能取到的目标点集合。

一旦接受这个画面,很多「奇怪」的结论就变自然了。比如为什么矩阵的列空间维度等于秩?秩就是「列向量张成的子空间维度」;为什么非齐次方程组 Ax=b 有解当且仅当 b 在列空间?因为 Ax 的取值已经限定了。你甚至可以拿它去理解「超定方程的最小二乘解」:当 b 不在列空间里,我们只能在列空间里找一个离 b 最近的向量来冒充右边。

2.3 线性变换与矩阵乘法:顺序比想象中更重要

3Blue1Brown 最经典的概念是把矩阵当作「线性变换」:它把整个空间的网格保持直线、保持平行、保持等距分布地进行移动。在线性代数里,我们通常只关注过原点的变换,原因很简单:如果变换不过原点,那它就不再满足线性性,坐标也能偏移,线性组合的公式会全面失效。

矩阵的每一列,等于基向量(通常默认是 e₁, e₂)被变换后的位置。比如矩阵 [[0,-1],[1,0]],第一列表示 e₁=(1,0) 被送到 (0,1),第二列表示 e₂=(0,1) 被送到 (-1,0),整个画面就是逆时针旋转 90 度。这是「矩阵列空间」的降维版:不用管抽象的列空间,先看它把两个基向量搬到了哪里。

矩阵乘法为什么这样定义?因为它是「变换的复合」。AB 表示「先做 B 变换,再做 A 变换」。这个顺序极其重要:先旋转再剪切,和先剪切再旋转,结果通常不同,所以 AB 和 BA 一般不相等。很多初学者问「为什么矩阵乘法不满足交换律」,答案其实非常几何:现实世界的操作顺序本来就是不可交换的,比如「先穿袜子再穿鞋」和「先穿鞋再穿袜子」完全是两种状态。

我这里做过一个特别直观的验证:取旋转矩阵 R 和缩放矩阵 S,一个把图形转 90°,一个把横坐标放大 2 倍。先转再放大,和一个方向放大后再转,得到的长方形方向完全不同。矩阵乘法不交换一点都不是「代数怪癖」,而是继承了操作的物理本质。

2.4 行列式:面积缩放因子带来的四个推论

行列式在 18.06 里是一套复杂的递推公式,但它的几何意义只有一句话:方阵 A 的行列式,等于这个线性变换对空间「面积」的缩放倍数。二维里是面积,三维里是体积,更高维则是对应的测度缩放。

为什么行列式可以判断矩阵是否可逆?因为如果行列式为 0,说明变换把空间的面积压成了 0,也就是把多个不同的点压到了同一个点,信息发生了折叠。这种变换显然不可能完美还原,所以矩阵不可逆。反过来,行列式不为 0,说明变换保持「体积不为 0」,是一对一的映射,逆变换就存在。

行列式为负也不难理解:它表示变换过程中发生了「定向翻转」。你可以用左手和右手来想象:右手坐标系经过一次镜像变换后,变成了左手坐标系的取向。面积的大小可能是 3,方向却反了,于是行列式记为 -3。这个符号不是数学家的洁癖,它直接影响流形积分、物理里的右手定则等非常实际的问题。

行列式的乘法性质 det(AB)=det(A)det(B) 也能从几何上看:先做 B 变换把面积放缩 det(B) 倍,再做 A 变换在这个基础上放缩 det(A) 倍,总的缩放自然是两者相乘。我建议初学者在做行列式习题前,先在 2×2 情形下做几个可视化:比如矩阵 [[2,1],[1,2]] 把单位正方形变成平行四边形,它的面积正好是 3,也就是行列式的值。这个验证做完,行列式就再也不是「六个式子」了。

2.5 秩与零空间:降维攻击的两个出口

秩(rank)这个词在课本里有很多等价定义:行阶梯形中非零行的个数、列空间的维度、矩阵行空间的维度。但几何上最本质的解释是:秩就是变换后空间的维度。一个 3×3 矩阵如果秩为 2,表示它把一个三维空间压缩成了一个平面;秩为 1,则压成一条直线;秩为 0,就是映射到原点的零变换。

和秩伴随出现的「零空间」也特别容易几何化:零空间是所有被矩阵「压扁到原点」的向量集合。为什么它叫「零空间」?因为对这些向量 x,变换的结果是 Ax=0。用降维的思路看,一个三维空间被压成一个平面时,沿着被压掉的那条直线方向上的所有向量,全都会落到原点,这条直线就是零空间。

18.06 里最重要的维度公式是:rank(A) + nullity(A) = n,其中 n 是矩阵的列数。Strang 称之为「秩-零化度定理」。几何证明只有一句话:一个变换把 n 维空间映射到 rank 维空间,被压缩掉的维度就是 nullity。这个公式我后来在无数场景里用过,比如判断微分方程解空间维度、理解约束的数量等,它几乎是「维度守恒定律」。

从列空间和零空间可以立刻推出 Ax=b 解的结构:假如 x₀ 是 Ax=b 的一个特解,任何零空间里的向量 x_null 加上 x₀ 之后,依然满足 A(x₀+x_null)=b。所以通解 = 特解 + 零空间。几何上,如果你在一个平面上看,Ax=b 的解不是单独一个点,而是「特解那个点沿着零空间方向整体平移」形成的一条直线或平面。这就是为什么解集的维度恰好等于零空间的维度。

2.6 特征值与特征向量:坐标系里的定海神针

特征值与特征向量的几何故事很动人:矩阵作为一种线性变换,通常会把空间里的每个向量都「掰来掰去」,但总有一些特别的向量方向,在变换中保持方向不变,仅仅被拉伸或缩短了 λ 倍。这些向量就是特征向量,对应拉伸倍数就是特征值 λ。

用公式写就是 A v = λ v。几何意义非常直接:对特征向量来说,矩阵乘法的效果「退化成数乘」。这个性质太重要了,因为数乘好理解、好计算,如果一个复杂变换可以被一组特征向量「分解」,那我们就可以在特征向量组成的坐标系里把它看成纯缩放。

这也是为什么 Strang 在讲对角化之前,一定会先讲基变换。A 的特征向量如果能凑出一组基,那么在这组基下,A 的作用就变成一个对角矩阵 Λ,对角线上的元素就是特征值。而原来的 A 可以写作 A=QΛQ⁻¹,其中 Q 的列是特征向量。这个分解式的几何动作是:先用 Q⁻¹ 把坐标切换到特征基,接着用 Λ 做各方向的独立缩放,最后用 Q 把结果切回标准基。三个步骤合成一个变换。

我用过一个特别经典的例子来理解:矩阵 [[1,1],[0,2]],它有特征向量 [-1,1](对应 λ=1)和 [1,0](对应 λ=2)。如果无视标准网格,只在特征方向上观察,这个 2×2 矩阵就是「一个方向不动,另一个方向拉长 2 倍」。这种洞见在微分方程稳定性分析、马尔可夫链收敛速度里都有直接应用。

2.7 点积与对偶向量:从「投影」升级到「线性映射」

点积是大多数线代课最早引入的运算,但很少有人把它讲得足够深刻。通常的几何解释是:v·w 等于 w 在 v 方向上的投影长度乘以 v 的长度。这个解释在二维平面里很容易理解,也很好用。

3Blue1Brown 更进一步:把点积看成「对偶向量」。思路是这样:固定的向量 w 可以定义一个线性函数 f(v)=w·v,把任何一个向量 v 映射成一个实数。由于 f 是线性的、取值到数轴,它对应的「变换矩阵」就是一个 1×n 的行向量。而这个行向量恰好就是 w。换句话说,一个向量和一个线性函数之间存在一对一的对应关系,这就是「对偶」。

这个观点厉害在哪里?它能让你把「点积是投影」从定义变成结论。数轴上的线性变换完全可以由空间某个方向的「等间距投影」来可视化;所以向量 w 存在的意义,就是描述「一个把任意向量投影到 w 所在方向的线性函数」。投影不是点积的本质,而是一系列线性函数在空间里的几何化身。

理解了对偶,再看 3D 叉积、梯度算子、傅里叶变换里的内积,思路会宽很多。我在笔记里只写了一句话总结:「点积不是两个几何箭头的偶然夹角公式,而是线性映射在对偶空间的漂亮实现。」这句话配合 18.06 里「正交向量点积为零」的性质,能解决很多概念题。

3. Strang 的算法,用几何眼光重新看一遍

3.1 为什么坚持「列图像」思考

18.06 的前几节课在讲 Ax=b 时,Strang 反复在「行图像」和「列图像」之间切换。行图像是画出方程组的每一条直线,然后看交点;列图像是把方程组看成列向量的线性组合,看能否组合出 b。

他的态度非常明确:低维时行图像有助于理解「解是什么」,但到了高维、到了理论推导,列图像才更有生命力。原因是:行图像依赖我们熟悉的三维几何直觉,而高维空间的超平面是完全不可画的;列图像则直接表达「哪些向量能被矩阵张成」,这套语言可以无缝迁移到高维、无穷维,甚至函数空间。

所以我在做题时的习惯也调整成:拿到 Ax=b,先下意识问三个问题。第一,A 的列向量落在一个什么空间?第二,b 是否在这个空间里?第三,解是唯一还是无穷多?这三个问题的答案分别对应「秩是否等于行数」「b 是否在列空间」「零空间是否只有零向量」。把这三个问题想清楚,很多题目不用真正全消元就能判断结构。

3.2 消元法的真实身份:保持解集的坐标整理

消元法(高斯消元)是线性代数最基础的计算工具,但很多教材只教操作流程,很少讲它的几何本质。我重看 18.06 后意识到:消元其实是「在解集不变的前提下,对变量和方程做一个有序的重排与线性组合」。

行变换中的「某行加上另一行的倍数」非常像在几何上把两个平面方程进行操作,但两个平面的交线并不会改变——因为你只是在用两个方程的组合信息替换掉其中一个描述,真实交点集合还是同一条线。反复消元得到的行阶梯形矩阵,其实是一种特殊坐标下的等价描述:它让每个主元变量「独当一面」,方便从最后一个方程开始逐个回代。

回代的过程也能几何化:方程组被整理成「上三角」后,最后一个方程只包含最后一个变量,所以可以直接解出;倒数第二个方程包含两个变量,但一个已知了,照解不误。这是把一个高维联立问题,拆成一串低维问题。这个过程和「把一个复合变换反着拆解」在数学上是同构的:先解出最深的自由度,再嵌套回去。

3.3 逆矩阵:逆变换与「无法还原」的几何铁证

A 的逆矩阵 A⁻¹ 在代数上是「相乘等于单位矩阵的矩阵」,但在几何上是「撤销 A 变换的操作」。如果 A 把空间旋转了 90 度,A⁻¹ 就把它转回来;如果 A 把横坐标放大了 2 倍,A⁻¹ 就把它缩回原来的长度。

可逆性的几何判据因此极其清晰:一个变换必须是一对一的,才能谈「撤销」。如果变换把平面压成一条线,那么线上所有点对应的原像有无数个,你无法判断当初是哪一个点被压过来的,所以逆矩阵不存在。这与「行列式不为零」完全等价:行列式为零,面积缩放因子是 0,变换必然出现信息合并。

我在理解逆矩阵时,特意做了一个「两步映射」的思维实验:假设 A 把空间压成一条线,b 恰好落在这条线上,那么 Ax=b 有解但不止一个,因为整条零空间直线都被压到 b。只要零空间里有非零向量,A 就不可能拥有「撤销」能力。这个角度比单纯背「奇异矩阵不可逆」要牢固很多。

3.4 通解结构:特解 + 零空间的仿射空间

前面提过 Ax=b 的通解是「特解 + 零空间」。很多人只把这个当公式记,却忽略了一个重要事实:如果零空间只有零向量,那么解是唯一的;如果零空间有非零向量,那么解集是一个「平移的向量空间」,也叫仿射空间。

它的几何长相就是:不经过原点的直线/平面/超平面。为什么不过原点?因为特解通常不是零向量,而零空间自身是过原点的子空间,把零空间平移后自然不再过原点。这解释了为什么非齐次方程组的解集不是线性空间:它不包含零向量,所以不是子空间。解题时可以先求一个特解,再求零空间的一组基,两者拼起来就是完整解集。

这整套思路在后面学微分方程时常遇到:非齐次微分方程的通解 = 齐次通解 + 非齐次特解,结构完全一样。根本原因就是线性算子的性质和矩阵完全相同。我觉得这是「几何意义」反向给我的礼物:一个看似纯代数的结论,其实是所有线性系统的通病。

3.5 Gram-Schmidt 与最小二乘:投影不是锦上添花,而是本质

Gram-Schmidt 正交化把一组向量变成一组标准正交向量,算法流程是:取第一个向量直接作为第一个方向,然后把第二个向量投影到第一个方向并减去,剩余的部分就是与第一个方向正交的分量;以此类推。几何上,它做的事情是「每次把一个向量拆成沿已定方向的分量 + 垂直补充分量」。

这个算法真正重要的原因是:在正交基下,系数计算变得极其简单。因为正交意味着点积为零,所以一个向量在某标准正交基下的坐标,直接等于它与对应基向量的点积。这比解一个联立线性方程组简单得多。这个观点也是 3B1B 里「点积是对偶向量」的延续。

最小二乘问题是 18.06 后半程的重头戏:当 Ax=b 无解时,我们退而求其次找一个 x,让 Ax 与 b 的距离最小。几何上,Ax 的取值全在列空间里,所以问题变成「在列空间里找一个离 b 最近的向量」。这个最近向量的关键特征是:残差 b-Ax 必须垂直于列空间,因为只有垂直时长度才最小。于是把 b 投影到列空间上,就得到了正规方程。这里如果你没有几何直觉,很难理解为什么偏偏要乘 Aᵀ;有了投影画面后,Aᵀ 的作用一目了然:它用于描述「什么方向与列空间正交」。

3.6 对角化:旋转、缩放、再转回来的三步舞

当一个 n×n 矩阵 A 有 n 个线性无关的特征向量时,它可以写成 A=QΛQ⁻¹。这个式子经常被学生当成「记忆负担」,其实它是一支三步舞曲:Q⁻¹ 的作用是把坐标切换到「特征向量坐标系」(相当于旋转到一组新坐标轴),Λ 在这个坐标系里只做沿各个方向的独立缩放,最后 Q 把结果置换回原来的坐标。

几何上极其痛快:如果三个特征值都是正的标量,那 A 的效果就是「把空间沿三个互相独立的方向进行不同比例的拉伸」。许多复杂的矩阵变换,说穿了就是「换了个观察坐标系之后的缩放」而已。

为了让这个理解落地,我手算过一个 2×2 矩阵 [[2,1],[1,2]],它的特征值是 3 和 1,对应特征向量分别是 [1,1] 和 [1,-1]。在特征坐标下,这个矩阵把 [1,1] 方向拉伸 3 倍,把 [1,-1] 方向保持不动。你如果在标准坐标系里看会觉得它是一个「有剪切感的斜变换」,但把纸面旋转 45 度再观察,它就是两个方向的纯拉伸。这种「换坐标系变简单」的思维方式,后面学主成分分析、马尔可夫链时都是核心。

4. 学习中最容易踩的坑和排查方法

4.1 几何讲得通,但算错数:把几何当「检查器」

很多同学看完 3B1B 后的第一反应是:感觉全懂,做题全废。我也不例外。踩过几次坑后,我总结出一个「分工原则」:几何负责判断方向,代数负责算准数字。

比如求特征值,你再怎么可视化矩阵,也无法避免手算特征多项式。这时候不要蠢到去画图验证每一步消元,否则效率太低。正确的用法是:算完后把特征向量代回去验证 Av=λv;如果是 2×2,可以用几何检查特征向量方向是否符合变换下的「不动方向」。

我有个小习惯:每道题算完,先不看答案,而是问自己几个「几何合理性」问题——这个矩阵的列向量大致往哪个方向偏?它会不会把面积放大很多?零空间大概是线还是面?这些快速粗略的估计能拦截掉 80% 的粗心错误,不需要画精确图也能生效。

4.2 特征值的复数场景:几何直觉需要升级

几何化特征向量时,默认情况是在实空间里寻找「方向不变」的向量。但很多矩阵在实数范围内根本没有特征向量,比如二维旋转矩阵 [[0,-1],[1,0]],它把每个非零向量都转 90 度,显然没有一个方向是保持不动的。但它在复数域里有两个纯虚数特征值 ±i。

这曾让我很困惑:几何直觉难道只能处理实数特征值吗?后来我理解到,不是几何直觉错了,而是我们需要的坐标系从实数平面升级成了复空间。复数特征值对应的特征向量有复数坐标,在几何上看它们对应的是「旋转 + 缩放」的螺旋运动。如果强行走实二维可视化,反而会限制理解。

所以遇到特征值为复数,别慌,第一时间提醒自己:这不是「没有特征向量」,而是它不存在实特征向量;需要把空间延拓到复数域,或者在二维实空间中接受一个旋转因子。18.06 里讲到微分方程时需要复数特征值来判断稳定性和振荡频率,这里的几何意义其实是「绕圈还是收缩」。

4.3 矩阵乘法顺序的认知误区

我见过很多人把 AB 记成「A 乘 B」,然后下意识认为和 BA 差不多。但实际上,矩阵乘法顺序几乎是线性代数里最容易踩的陷阱之一。几何上,AB 是「先 B 后 A」的复合变换,顺序一旦颠倒,等于操作先后关系完全改变。

我自己用来永久记忆的方法是「衬衫和外套」类比:先穿衬衫再穿外套,最后的视觉效果和先穿外套再穿衬衫完全不同。矩阵乘法不交换,不是矩阵本身有问题,而是我们面对的现实操作大多数就是不可交换的。这个类比简单到不会忘。

不过要注意别矫枉过正。虽然 AB≠BA 一般成立,但在某些特殊情况下它们也能交换,比如两个矩阵都是对角矩阵、或者是同一矩阵的多项式时。考试里经常用「AB=BA」作为额外条件推出特殊结构,此时不要被「不交换」的泛化结论误导。判断的出发点永远是「这两个变换到底能不能交换顺序」。

4.4 四张高频「概念题」自查卡

我整理了一份概念题自查卡,用来检验自己是否真正理解了几何意义。它不是公式默写,而是每道题都要能用「一句话几何解释 + 一个代数式子」双重回答。这里挑四张高频卡分享:

第一张:为什么方阵可逆等价于行列式不为零?答:行列式是面积/体积缩放因子,为零说明变换发生了维度折叠,无法一一还原;不为零才能有逆变换。

第二张:为什么 rank(A)+nullity(A)=n?答:n 维空间经过变换,输出空间是 rank 维,被压扁消失的方向有 nullity 个维度;维度守恒。

第三张:为什么 Ax=b 的通解是特解 + 零空间?答:先找一个能到达 b 的路径(特解),再沿零空间方向随便移动都不会改变终点的 b 位置;于是解集是特解平移零空间。

第四张:为什么实对称矩阵一定可正交对角化?答:对它的几何直觉可以来自谱定理:在拉伸之前,可以先旋转到一个没有「剪切」的坐标系;而剪切是导致非对称、不可正交化的原因。

这四张卡如果能不看答案秒答,说明两套课程的融合已经起到了作用。我还建议每个概念都自己写一张卡,因为书写过程比背诵更有助于建立连接。

5. 我的学习路线、工具与笔记模板

5.1 推荐顺序与时间分配

如果你时间充裕,我的建议顺序是「三遍法」:第一遍,快速看 3Blue1Brown 的核心集数,建立直觉地图,大概花 2 小时;第二遍,按 18.06 的课程顺序系统学习,每一讲后做对应的课后习题;第三遍,回头重看 3B1B 的相应集数,把动画、几何画面与刚才学的代数公式做对应,同时整理成笔记。

18.06 本身是 35 讲左右的本科课程,每讲约 50 分钟,全部看完并消化大约需要 40 到 60 小时。如果时间紧张,至少认真看前 20 讲,覆盖:矩阵与消元、四个子空间、正交性、行列式、特征值。后面几讲的应用(力学、金融、图论)可以快速带过。

我第一遍刷的时候贪多,一个周末把 3B1B 全看完,结果兴奋过后什么公式都写不出。第二遍改成「两三集 + 三讲 18.06 + 一组习题」的节奏,反而扎实很多。关键是别让「观看」代替「练习」,刷视频永远只是输入,做题和自述才是输出。

5.2 用 NumPy 做「几何实验」的两个小脚本

我强烈建议在学几何意义时配合一点代码,不用多,能改参数、看输出就够。我自己最常用的是 NumPy 写 2×2 矩阵实验。

第一个脚本:输入一个 2×2 矩阵,打印行列式、秩、特征值和特征向量,并画出它作用在单位正方形四个顶点上的结果。这个脚本能快速验证「行列式是面积缩放因子」。你把矩阵改成 [[2,1],[1,2]],会看到单位正方形变成平行四边形,面积等于 3;改成 [[1,2],[2,4]],输出会显示秩为 1,行列式为 0,图形被压成一条直线。

import numpy as np import matplotlib.pyplot as plt def visualize_2x2(A): square = np.array([[0,0],[1,0],[1,1],[0,1],[0,0]]) transformed = square @ A.T plt.plot(square[:,0], square[:,1], 'b--', label='original') plt.plot(transformed[:,0], transformed[:,1], 'r-', label='transformed') plt.axis('equal'); plt.legend(); plt.grid(True); plt.show() print("det =", np.linalg.det(A)) print("rank =", np.linalg.matrix_rank(A)) print("eigvalues =", np.linalg.eigvals(A))

第二个脚本:观察矩阵乘法顺序。取旋转矩阵 R 和剪切矩阵 S,分别计算 R@S 和 S@R 作用于图形的效果,立刻能看到两种顺序结果不同。这比任何一句「矩阵乘法不可交换」都有说服力。代码非常短,但每次给学生演示都效果极好。

5.3 三栏卡片式笔记法

我不喜欢抄课件,因为那只是把别人的排版搬进自己的笔记。我的做法是为每个核心概念做一张「三栏卡片」:一栏写一句话几何解释,一栏写一句代数定义,一栏写一个最小计算实例。

举个例子,「零空间」卡片:几何栏写「被矩阵压到原点的向量集合」;代数栏写「{x | Ax=0} 是 R^n 中的子空间」;计算栏写「对 2×2 矩阵 [[1,2],[2,4]],零空间由向量 [-2,1] 张成」。每张卡片字数控制在三五句话内,不要长篇大论。

开始时可以先做 10 张:向量、线性组合、张成空间、矩阵乘法、行列式、零空间、列空间、秩、特征向量、对偶向量。后面每学一个新概念就补一张。这套卡片配合 Anki 复习也很好用,间隔重复能让几何直觉长期保鲜。

5.4 如果时间不够:最小必看清单

如果实在抽不出 60 小时,我会给你一个最小必看清单,保证建立不破的直觉框架。3B1B 必须看这四集:向量与线性组合、矩阵作为线性变换、行列式、特征向量与特征值。18.06 至少看前七讲:矩阵与消元、行图像与列图像、乘法和逆矩阵、A 的 LU 分解、转置与置换、向量空间与子空间、列空间与零空间。

这套组合拳打完之后,你已经能回答「矩阵是什么」「方程有解的条件」「行列式和可逆性的关系」「特征向量有什么用」这几个最核心的问题。剩下的概念,比如奇异值分解、伪逆、傅里叶,都是这个框架上的延伸,到时候再按需补齐也不迟。别为了追求「看完所有视频」而放弃练习,学习线代和健身一样,重量要自己举起来才算数。

我在实际学习里还有一个很深的体会:几何意义不是用来替代公式的,而是用来给公式「配记忆钩子」的。每次啃下一个抽象概念,我都会问自己一句:「如果把它画成动画,应该是什么样子?」如果脑子里能浮现画面,这个知识点基本就长在自己身上了。希望这份笔记也能帮你在矩阵和空间之间搭起一座桥。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询