上一节课我们学完了矩阵定义、矩阵加法、标量乘法。
我们建立了核心认知:
向量是状态,矩阵是规则;向量是单个特征,矩阵是批量特征与变换权重。
但真正让神经网络“能计算、能推理、能提取特征”的核心操作,只有一个:
矩阵 × 向量 乘法
一句话点明本节课的AI地位:
所有全连接层、所有Embedding计算、所有特征变换、所有Transformer前向传播,本质全部是 矩阵 × 向量。
不会矩阵乘向量,你永远只是调包侠;
看懂这一步,你才算真正看懂神经网络的底层数据流。
一、大白话核心模型(贯穿所有AI)
先记住这一句终身受用的公式逻辑:
权重矩阵 × 输入向量 = 输出新特征向量
输入向量:原始数据、文字向量、图像特征
权重矩阵:模型学出来的“变换规则、知识、参数”
输出向量:经过模型加工后的高级语义特征
神经网络训练,本质就是:
不断更新矩阵参数,让矩阵变换出来的向量越来越接近标准答案。
二、矩阵 × 向量 运算规则(从零讲透)
1、运算前提(硬性规则)
设:
矩阵是 m \times n
向量必须是 n 维列向量
核心口诀:矩阵列数 = 向量维度,才能相乘。
输出结果一定是:m维新向量
人话:
矩阵有多少行,输出特征就有多少维。
2、计算逻辑(逐行点积,超级好懂)
矩阵每一行,和输入向量做一次内积(点积),得到一个新数字。
一行出一个值,m行就拼成一个m维新向量。
3、完整举例(手把手演算)
矩阵(权重规则):
W=
\begin{bmatrix}
1 & 2
3 & 4
5 & 6
\end{bmatrix}
输入向量(2维特征):
x=
\begin{bmatrix}
7\8
\end{bmatrix}
第一行点积:1×7 + 2×8 = 23
第二行点积:3×7 + 4×8 = 53
第三行点积:5×7 + 6×8 = 83
输出新向量:
Wx=
\begin{bmatrix}
23\53\83
\end{bmatrix}
完美看懂:
2维输入 → 经过3×2矩阵变换 → 变成3维高级特征
这就是 AI 的「特征升维」底层!
三、几何意义(非常重要)
结合我们前面课程的统一世界观:
- 向量是空间里的一个状态点
- 矩阵是空间变换规则
矩阵乘向量 = 对状态做一次完整空间变换
包含:
拉伸特征
旋转方向
维度升降
特征重组
神经网络没有魔法,就是不停对向量做矩阵变换。
四、绑定AI:为什么全连接层就是矩阵乘向量?
1、全连接层公式
y = Wx + b
W:权重矩阵
x:输入向量
b:偏置向量(矩阵加法)
流程:
原始向量 → 矩阵变换提取特征 → 加偏置微调 → 输出高级特征
这就是每一层神经网络的完整工作流程。
2、升维、降维全部靠它
3\times2 矩阵:2维 → 3维(升维、提取更多特征)
2\times3 矩阵:3维 → 2维(降维、压缩特征)
大模型Embedding、特征压缩、维度映射,全是这套数学。
五、和之前知识点完美串联(全书闭环)
1、第62课内积
矩阵乘向量,本质就是批量内积。
每一行就是一组匹配权重,和输入向量做相似度融合。
2、第63课矩阵基础
矩阵加法对应残差连接
标量乘法对应学习率缩放、注意力缩放
3、微积分联动
前向传播:矩阵 × 向量 做特征变换
反向传播:求梯度、更新矩阵参数
梯度下降:不断微调矩阵,让变换结果越来越准
微积分负责“怎么更新”,线性代数负责“怎么运算”。
至此,AI数学体系彻底咬合!
六、NumPy实战代码(可直接运行)
python
import numpy as np
权重矩阵 3行2列
W = np.array([
[1, 2],
[3, 4],
[5, 6]
])
2维输入向量
x = np.array([[7], [8]])
矩阵 × 向量
y = W @ x
print(“输出特征向量:”)
print(y)
运行结果就是我们手算的:23、53、83
七、本节课核心总结
- 矩阵 × 向量 = 神经网络最底层核心运算
- 本质:矩阵每行与输入向量批量做内积,重组特征
- 作用:实现升维、降维、特征提取、空间变换
- 全连接层公式 Wx+b 完全建立在本节课基础上
- 大模型所有前向传播,都是连续多次矩阵向量变换
八、随堂思考题(检验真懂)
1、矩阵乘向量,为什么可以实现维度升降?
2、神经网络全连接层 Wx+b 分别对应什么数学操作?
3、矩阵乘向量的本质,是我们第62课学的什么运算?
本专栏《AI大模型与数学》微积分→线性代数逐课递进,
不讲应试、只讲AI底层,每一课都是神经网络、Transformer的前置地基。
弄懂本节课,你终于看懂了:
神经网络不是黑盒,就是向量在矩阵规则下的层层变换。
👉 评论区打卡作答
🌟 收藏、关注专栏,下一课精讲:矩阵×矩阵乘法(Transformer批量运算核心)
彻底打通大模型全部矩阵流!