第一条给出模型函数hw(x)=wTx+bh_w(x)=w^Tx+bhw(x)=wTx+b,说明模型如何根据样本xxx算出预测值;第二条给出预测与真实值的关系y=wTx+b+εy=w^Tx+b+\varepsilony=wTx+b+ε,引入误差项ε\varepsilonε来刻画“模型解释不了的那部分现实”;第三条在“误差服从正态分布”的假设下,借助最大似然估计导出损失函数J(w)=12m∑(hw(x)−y)2J(w)=\frac{1}{2m}\sum\left(h_w(x)-y\right)^2J(w)=2m1∑(hw(x)−y)2;第四条点明目标与手段——希望预测值与真实值尽量接近,即让损失最小,并用梯度下降求出使损失最小的权重参数www,从而完成模型构建。
不要小看这四行字。它们恰好构成了现代机器学习通用的“三段式”范式:模型(用什么函数去拟合)、损失(用什么标准衡量好坏)、优化(用什么算法找到最好的参数)。今天无论是最简单的房价预测,还是动辄千亿参数的深度神经网络,骨子里都是这三件事的变体。可以说,读懂了这张幻灯片,就读懂了机器学习的一半方法论:另一半,不过是把“直线”换成更复杂的函数、把“梯度下降”换成更精细的算法而已。
线性回归的重要性还体现在它的“可解释性”上。权重www的每个分量都直接回答一个业务问题:“这个输入每增加一个单位,输出平均变化多少?”这在医疗、金融、政策评估等需要说清理由的领域,是许多复杂黑箱模型难以替代的优势。下文将从历史背景、公式剖析、数值实验、实际应用四个层面,把这张幻灯片彻底读透。
背景信息
一、两条历史源流:最小二乘与“回归”之名
线性回归的历史比“机器学习”这个词早了一个多世纪,它有两条独立的源流。
第一条源流是最小二乘法。19 世纪初,天文学家需要依据有限的观测数据推算彗星与小行星的轨道,观测总有误差,方程个数又多于未知数个数,于是产生了“如何在矛盾的数据中求一个最优解”的问题。1805 年,法国数学家勒让德(Adrien-Marie Legendre)在其著作中首次公开发表了最小二乘法:让所有观测残差的平方和最小。德国数学家高斯(Carl Friedrich Gauss)则声称自己早在 1795 年就已使用该方法,并于 1809 年在《天体运动论》中给出了更完整的概率论表述——他假设观测误差服从一种钟形分布(即后世所称的正态分布或高斯分布),并证明在此假设下,最小二乘估计恰好就是最大似然估计。这正是幻灯片中“根据正态分布函数与最大似然估计,可以求出线性回归的损失函数”一句的历史出处:平方误差损失不是某人拍脑袋规定的,而是在正态误差假设下被推导出来的。
第二条源流是“回归”这个名称本身。1886 年,英国学者高尔顿(Francis Galton)在研究人类身高的遗传规律时发现:高个子父母的孩子平均比父母矮一点,矮个子父母的孩子平均比父母高一点,子代身高有向人群平均水平“回退”的趋势。他把这种现象称为“向平庸回归”(regression toward mediocrity)。后来人们发现,他用来刻画这种趋势的统计方法——用一条直线描述一个变量随另一个变量变化的平均规律——具有普遍价值,于是“回归”一词脱离了最初的遗传学含义,成为一整类建模方法的统称。
此外还有一条容易被忽略的线索:梯度下降法。1847 年,法国数学家柯西(Augustin-Louis Cauchy)在研究如何求解大规模非线性方程组时,提出了“沿负梯度方向前进以使函数值下降”的思想。当时它只是纯数学中的数值技巧;一百年后,当计算机需要自动地、反复地调整成千上万个参数时,人们发现柯西的思想正是最合适的引擎。幻灯片最后一句“使用梯度下降的方法求出损失函数达到最小时的权重参数”,背后站着的正是柯西。
二、读懂这张图所需的基本概念
在进入公式之前,先统一几个术语。监督学习指从“带答案的样例”中学习:每个样本xxx(如一套房子的面积、楼层等特征)都配有真实值yyy(实际成交价)。特征是输入的各项信息;权重www表示每项特征对结果的影响强度;偏置bbb是所有特征都取零时的基础输出。训练就是不断调整www和bbb,使模型在训练样本上的预测尽量接近真实值;而衡量“接近程度”的函数就是损失函数。理解了这几个词,幻灯片上的每个符号就都有了着落。
数据分析:逐条拆解幻灯片上的信息
一、模型函数hw(x)=wTx+bh_w(x)=w^Tx+bhw(x)=wTx+b:一条(超)直线
这个公式说的是:预测值等于“各特征乘以各自权重后求和,再加偏置”。符号wTw^TwT中的TTT表示转置,即把竖写的列向量横过来,以便与样本列向量按“对应位置相乘再求和”的方式相乘。例如权重w=(52)w=\begin{pmatrix}5\\2\end{pmatrix}w=(52)、样本x=(310)x=\begin{pmatrix}3\\10\end{pmatrix}x=(310)(学习 3 小时、做题 10 道),则wTx=5×3+2×10=35w^Tx=5\times3+2\times10=35wTx=5×3+2×10=35,再加偏置 40 得预测成绩 75 分。转置本身不产生任何新信息,它只是让“一一配对相乘”这件事能用矩阵语言简洁地书写。
几何上,当特征只有一个时,hw(x)h_w(x)hw(x)是平面上的一条直线,www是斜率、bbb是截距;特征有两个时是一张平面;特征有ddd个时是ddd维空间中的一个超平面。所谓“线性回归”,就是假设目标与特征之间的关系可以用这样一个平直的几何对象近似。注意“线性”指的是对参数线性:即使把x2x^2x2作为一个新特征放进去,模型对参数而言仍然是线性的,这为后文的扩展埋下伏笔。
二、误差方程y=wTx+b+εy=w^Tx+b+\varepsilony=wTx+b+ε:把现实拆成“可解释”与“不可解释”两部分
第二个公式把真实值拆成两块:wTx+bw^Tx+bwTx+b是模型能够解释的系统性部分,ε\varepsilonε是解释不了的残差——它吸收了所有未纳入模型的因素(测量噪声、个体差异、偶然事件等)。幻灯片指出“误差受到众多因素独立影响”,并假设ε\varepsilonε服从正态分布。需要强调:这是一个建模假设而非自然定律,其合理性在于——大量微小、独立、方向随机的扰动叠加后,其总和的分布往往近似钟形;钟形的含义是“小误差常见、大误差罕见、正负大致对称”。
在这个假设下(并设各误差独立、均值为 0、方差同为σ2\sigma^2σ2),单个误差出现的概率密度正比于exp(−ε22σ2)\exp\left(-\frac{\varepsilon^2}{2\sigma^2}\right)exp(−2σ2ε2)。把所有样本的误差概率相乘得到似然函数,取对数后,与参数有关的部分只剩−12σ2∑(hw(x)−y)2-\frac{1}{2\sigma^2}\sum\left(h_w(x)-y\right)^2−2σ21∑(hw(x)−y)2。于是“让观测数据出现的可能性最大”(最大似然)就等价于“让平方误差之和最小”。这就是幻灯片第三行公式的由来:平方损失是正态误差假设的数学后果。
三、损失函数J(w)=12m∑(hw(x)−y)2J(w)=\frac{1}{2m}\sum\left(h_w(x)-y\right)^2J(w)=2m1∑(hw(x)−y)2:每个零件都有用途
把这个公式拆成五个零件看:括号内是残差(预测减真实);平方使正负误差不互相抵消、且对大错误施加更重的惩罚,同时保证函数处处光滑可导;求和把所有样本的误差汇总;除以mmm(样本数)使损失不随样本量增大而虚高,具有“平均”尺度;最前面的12\frac{1}{2}21则纯粹是计算便利——平方求导会带出系数 2,与12\frac{1}{2}21恰好抵消,使梯度表达式干净。它不改变最优解的位置:把所有损失统一缩放一半,最小值在哪里仍然在哪里。
更重要的是损失的形状。JJJ是参数的二次函数,图像是开口向上的抛物线(多参数时为抛物面),因此只有唯一一个全局最低点,不存在“假低谷”迷惑优化算法。我们用一组小数据直观验证:样本为(1,2),(2,4),(3,6)(1,2),(2,4),(3,6)(1,2),(2,4),(3,6),固定b=0b=0b=0,只变动www,可算得J(w)=73(w−2)2J(w)=\frac{7}{3}(w-2)^2J(w)=37(w−2)2,于是有下表这组“数据点”:
| www | 0 | 1 | 2 | 3 | 4 |
|---|---|---|---|---|---|
| J(w)J(w)J(w) | 9.33 | 2.33 | 0 | 2.33 | 9.33 |
趋势一目了然:损失先降后升、关于w=2w=2w=2对称,最低点恰在真实规律y=2xy=2xy=2x处。这张小表就是“抛物线形损失曲面”的一个切片。
四、梯度下降:把“求最小”变成“一步步走”
有了损失函数,剩下的问题是找到最低点。梯度下降的策略是:计算损失对每个参数的梯度(即“参数微增时损失变化多快”),然后朝梯度的反方向迈一步:
w←w−α∂J∂ww \leftarrow w-\alpha\frac{\partial J}{\partial w}w←w−α∂w∂J
其中α\alphaα是学习率,控制步长。沿用上例(此时梯度为143(w−2)\frac{14}{3}(w-2)314(w−2)),取α=0.1\alpha=0.1α=0.1、从w=0w=0w=0出发,迭代轨迹为:
| 迭代轮数 | 0 | 1 | 2 | 3 | 4 | 5 |
|---|---|---|---|---|---|---|
| www | 0 | 0.933 | 1.431 | 1.697 | 1.838 | 1.914 |
| J(w)J(w)J(w) | 9.33 | 2.66 | 0.76 | 0.21 | 0.06 | 0.02 |
可以看到两条清晰的趋势:参数单调逼近最优值 2,损失单调逼近 0,且越接近谷底步子越小的效果越明显(因为梯度本身在变小)。反之,若把学习率放大到α=0.8\alpha=0.8α=0.8,迭代将变成0→7.47→−12.9→⋯0\to7.47\to-12.9\to\cdots0→7.47→−12.9→⋯的剧烈振荡并迅速发散——步子太大,每一步都跨过谷底且越跨越远。这组对比解释了工程实践中“学习率是最重要的超参数之一”的经验:它直接决定这条收敛曲线是平稳下滑还是失控震荡。幻灯片末句“求出损失函数达到最小时的权重参数www,继而完成模型构建”,描述的正是这条收敛过程的终点。(附带说明:幻灯片中损失记作J(w)J(w)J(w)是简写,实际训练时偏置bbb与所有权重一起被更新。)
应用实例
房价评估。以最简单的形式,设总价=w×面积+b\text{总价}=w\times\text{面积}+b总价=w×面积+b。用某小区历史成交数据拟合出w=3.2w=3.2w=3.2万元/平方米、b=15b=15b=15万元后,一套 90 平方米的房子估价约为 303 万元。银行抵押评估、税务基准价、中介挂牌参考,背后常有此类模型的影子。
零售与营销。以广告投入为特征、销售额为标签做回归,权重www直接回答“每多投 1 万元广告,平均多带来多少销售额”,从而为预算分配提供量化依据。
医学与公共卫生。剂量—反应关系(如某药物剂量与血压下降幅度)、体重指数与血压的平均关系,常用回归直线刻画;权重即“每单位暴露带来的平均效应”,是流行病学风险评估的基本语言。
电力调度。在一定区间内,气温与电网负荷近似线性相关(越热空调用电越多)。调度部门用回归模型由天气预报预测次日负荷,安排发电计划。
教育与自我改进。延续前文的例子:用学习时长与做题量预测成绩,拟合出的权重告诉学生“当前阶段,多学一小时与多做十道题,哪个对成绩的边际贡献更大”。
同时也要看到边界:线性假设只在局部成立,外推到范围之外会失真(施肥量与作物产量绝非永远线性);个别极端样本会显著拉歪直线;相关不等于因果。这些局限正是后文扩展方向的出发点。此外,线性回归在工业界还常作为基线模型:任何复杂模型上线前,先与一条“直线”比一比,是防止“用大炮打蚊子”的朴素智慧;神经网络中的每一个“全连接层”,本质上也仍是wTx+bw^Tx+bwTx+b再加一个非线性变换。
结论
这张幻灯片用四行文字完成了一个完整的闭环:先用hw(x)=wTx+bh_w(x)=w^Tx+bhw(x)=wTx+b作出“世界近似平直”的模型假设;再用y=wTx+b+εy=w^Tx+b+\varepsilony=wTx+b+ε承认现实的残余波动,并假设其服从正态分布;继而由最大似然导出平方误差损失J(w)J(w)J(w),使“好坏”有了可计算的统一标尺;最后用梯度下降把“求最小”化为可重复执行的迭代,收敛之日即模型建成之时。本文的数值实验进一步展示了三条关键趋势:损失关于参数呈凸的抛物线形、存在唯一全局最优;在合适学习率下迭代损失单调收敛;学习率过大则振荡发散。
面向未来,这张幻灯片留下的每个“假设”都生长出一个研究方向:嫌直线太简单,便有 polynomial 特征、广义线性模型、核方法直至深度神经网络;嫌正态假设怕离群点,便有 Huber 稳健回归与分位数回归;嫌全量梯度太慢,便有随机梯度下降、动量法与 Adam 等自适应算法;怕过拟合,便有岭回归与 Lasso 等正则化技术;而要把“权重”解释为因果效应,则需与因果推断结合。一条直线虽简,却是通向这一切的起点。
参考文献
- Legendre, A. M. (1805).Nouvelles méthodes pour la détermination des orbites des comètes. Paris: Courcier.
- Gauss, C. F. (1809).Theoria motus corporum coelestium in sectionibus conicis solem ambientium. Hamburg: Perthes.
- Cauchy, A. (1847). Méthode générale pour la résolution des systèmes d’équations simultanées.Comptes Rendus de l’Académie des Sciences, 25, 536–538.
- Galton, F. (1886). Regression towards mediocrity in hereditary stature.Journal of the Anthropological Institute of Great Britain and Ireland, 15, 246–263.
- Fisher, R. A. (1922). On the mathematical foundations of theoretical statistics.Philosophical Transactions of the Royal Society A, 222, 309–368.
- Hoerl, A. E., & Kennard, R. W. (1970). Ridge regression: Biased estimation for nonorthogonal problems.Technometrics, 12(1), 55–67.
- Tibshirani, R. (1996). Regression shrinkage and selection via the lasso.Journal of the Royal Statistical Society: Series B, 58(1), 267–288.
- Kingma, D. P., & Ba, J. (2015). Adam: A method for stochastic optimization.Proceedings of ICLR 2015.
- Hastie, T., Tibshirani, R., & Friedman, J. (2009).The Elements of Statistical Learning(2nd ed.). Springer.
- Bishop, C. M. (2006).Pattern Recognition and Machine Learning. Springer.
- Goodfellow, I., Bengio, Y., & Courville, A. (2016).Deep Learning. MIT Press.
- 周志华. (2016). 《机器学习》. 清华大学出版社.
- 李航. (2019). 《统计学习方法》(第 2 版). 清华大学出版社.
- 华为技术有限公司. HCIA-AI 培训教材(本文所解读幻灯片之来源).