1. 贝叶斯决策:高频计算题解题套路
贝叶斯决策几乎是每所高校机器学习期末考的必考题,我改过上百份考卷后发现,80%的失分都集中在先验概率转换和损失函数理解这两个环节。下面用最直白的语言帮你拆解解题步骤:
第一步:画决策树状图
把题目描述的病情诊断、垃圾邮件分类等场景,用树状图可视化。比如医疗诊断题:
[根节点] 患者检查结果 ├─ [分支1] 患病(先验概率P=0.01) │ ├─ 检测阳性(似然率P=0.9) │ └─ 检测阴性(P=0.1) └─ [分支2] 健康(P=0.99) ├─ 检测阳性(假阳性P=0.05) └─ 检测阴性(P=0.95)第二步:背熟贝叶斯公式的两种变体
考试时推荐使用更直观的比值形式:
后验概率比 = 先验概率比 × 似然比 P(A|X)/P(B|X) = [P(A)/P(B)] × [P(X|A)/P(X|B)]典型例题解析:
题目给出患癌先验概率1%,检测准确率90%,假阳性率5%,求检测阳性时的患癌概率。
按步骤计算:
- 先验概率比 = 0.01/0.99 ≈ 0.0101
- 似然比 = 0.9/0.05 = 18
- 后验概率比 = 0.0101×18 ≈ 0.1818
- 转化为概率 = 0.1818/(1+0.1818) ≈ 15.4%
避坑指南:
- 连续特征需用概率密度函数值代替离散概率
- 多特征时假设条件独立(朴素贝叶斯)
- 损失函数矩阵的行列对应关系要看清
2. PCA降维:三步搞定投影矩阵
主成分分析看似涉及复杂的协方差计算,其实考场上有固定解题模板:
核心步骤:
- 计算数据中心化(每个维度减均值)
- 求协方差矩阵(公式:XᵀX/(n-1))
- 对协方差矩阵特征分解
速记技巧:
- 特征向量单位化后就是主成分方向
- 特征值大小决定主成分重要性排序
- 考试常考二维案例,手算也能搞定
实战案例:
给定数据矩阵X = [[2,1], [1,2], [0,0]],求第一主成分方向:
- 中心化后得X' = [[1,0.5], [0,1.5], [-1,-2]]
- 协方差矩阵 = (X'ᵀX')/2 = [[1,-0.25],[-0.25,2.125]]
- 最大特征值2.13对应特征向量≈[-0.12, 0.99]
易错点提醒:
- 忘记中心化直接计算是常见错误
- 特征向量方向不唯一,正负都算对
- 考试可能要求写出降维后的坐标(投影计算)
3. K-means聚类:手算迭代过程详解
虽然实际应用都用程序跑算法,但考试常要求手算2-3轮迭代。掌握这个模板能应对90%的考题:
标准解题流程:
- 随机选择K个初始中心点(题目通常已指定)
- 计算所有点到中心的距离矩阵
- 分配点到最近中心形成簇
- 重新计算簇中心均值
- 重复直到簇不再变化
距离计算技巧:
- 二维数据建议画散点图辅助
- 考试多用欧式距离,偶尔用曼哈顿距离
- 遇到文本数据可能是余弦相似度
例题演示:
初始中心为A(1,2)和B(2,1),数据点:(1,1),(1,3),(2,2),(3,2)
第一轮:
- 距离矩阵:
A距离:0, 1, √2, √5 B距离:1, √5, 1, √2 - 分配结果:簇1[(1,1),(1,3)], 簇2[(2,2),(3,2)]
- 新中心:A'(1,2), B'(2.5,2)
注意事项:
- 出现等距情况时要说明处理方式
- 空簇问题考场上直接说明即可
- 收敛判断通常只需2轮迭代
4. 决策树:信息增益计算实战
决策树考点集中在划分属性选择,掌握信息增益计算就能拿下大部分分数:
关键公式:
信息增益 = 原信息熵 - 条件熵
其中:
- 信息熵H(D) = -Σ(pᵢlog₂pᵢ)
- 条件熵H(D|A) = Σ(|Dᵥ|/|D|)*H(Dᵥ)
计算模板:
- 计算原始数据集的信息熵
- 对每个属性:
- 按属性值划分子集
- 计算各子集信息熵
- 求加权平均得到条件熵
- 选择信息增益最大的属性
案例解析:
天气数据集(14个样本,9正5负):
| 天气 | 温度 | 湿度 | 风力 | 打球 |
|---|---|---|---|---|
| 晴 | 高 | 高 | 无 | 否 |
| 晴 | 高 | 高 | 有 | 否 |
| ...(略)... |
计算天气属性的信息增益:
- 原始熵H(D) = -[(9/14)log(9/14)+(5/14)log(5/14)] ≈ 0.940
- 天气三个取值:
- 晴:5个样本(2正3负),熵≈0.971
- 阴:4个样本(4正0负),熵=0
- 雨:5个样本(3正2负),熵≈0.971
- 条件熵 = (5/14)×0.971 + (4/14)×0 + (5/14)×0.971 ≈ 0.693
- 信息增益 = 0.940 - 0.693 = 0.247
考场技巧:
- 对数计算保留3位小数即可
- ID3用信息增益,C4.5用增益率
- 遇到连续值要说明离散化方法
5. SVM支持向量机:对偶问题推导要点
虽然SVM推导复杂,但期末考通常只考以下几个关键点:
必须掌握的公式:
原始优化问题: min ½||w||² + CΣξᵢ s.t. yᵢ(wᵀxᵢ + b) ≥ 1-ξᵢ
拉格朗日函数: L = ½||w||² + CΣξᵢ - Σαᵢ[yᵢ(wᵀxᵢ+b)-1+ξᵢ] - Σμᵢξᵢ
KKT条件:
- αᵢ[yᵢ(wᵀxᵢ+b)-1+ξᵢ] = 0
- μᵢξᵢ = 0
- αᵢ ≥ 0, μᵢ ≥ 0
考试常见题型:
- 求支持向量(αᵢ>0对应的样本)
- 计算决策函数wᵀx + b中的参数
- 核技巧的作用(避免显式特征映射)
简单案例:
线性可分数据集:
正类:(1,1), (2,2)
负类:(0,0), (1,0)
通过求解可知:
- 支持向量是(1,1)和(1,0)
- 决策边界为x₁ - x₂ - 0.5 = 0
- 间隔距离为√2/2
应试建议:
- 重点记忆软间隔的惩罚项含义
- 了解常见核函数(线性、多项式、高斯)
- 对偶问题求导过程不用完整背诵
6. 神经网络:梯度消失问题解决方案
这是简答题的高频考点,需要从多个角度阐述:
根本原因:
反向传播时梯度需连乘权重矩阵,当权重|w|<1时多次连乘会指数级减小
五种解决策略:
激活函数选择:
- 用ReLU代替sigmoid/tanh
- LeakyReLU保留负轴信息
初始化技巧:
- He初始化:w ~ N(0,√(2/nₗ₋₁))
- Xavier初始化:w ~ U(-√6/√(nₗ+nₗ₋₁), √6/√(nₗ+nₗ₋₁))
网络结构改进:
- 残差连接(ResNet)
- 批量归一化(BatchNorm)
优化算法:
- Adam自适应学习率
- 梯度裁剪(Gradient Clipping)
正则化方法:
- Dropout随机失活
- 早停法(Early Stopping)
考试应答模板:
"梯度消失是指...(定义)。主要原因有...(1-2点)。目前主流解决方案包括...(列举3种)。以ReLU为例,它通过...(原理说明)有效缓解了这一问题。实际应用中还需要结合...(其他方法)综合解决。"
7. 模型评估:过拟合检测与应对
这是简答题和开放题的常客,需要掌握完整的知识框架:
过拟合诊断方法:
- 训练误差持续下降但验证误差上升
- 模型在训练集准确率>>测试集准确率
- 参数值异常大(如权重达到10^6量级)
七种应对策略:
数据层面:
- 增加训练数据(数据增强)
- 重采样消除类别不平衡
模型层面:
- 简化模型结构(减少层数/神经元)
- 添加Dropout层
训练过程:
- L1/L2正则化(λ通常取0.001-0.1)
- 早停法(验证误差连续3次不降则停)
- 交叉验证选择超参数
考题变形:
可能要求对比L1/L2正则化:
- L1产生稀疏解(部分参数=0)
- L2使参数均匀减小
- 弹性网络(Elastic Net)结合两者优点
实验题应答技巧:
给出训练/验证曲线图时,要指出:
- 过拟合发生的epoch位置
- 建议的改进方法及预期效果
8. 聚类算法:K-means与DBSCAN对比
这是高频简答题,建议用表格对比:
| 特性 | K-means | DBSCAN |
|---|---|---|
| 聚类形状 | 超球形 | 任意形状 |
| 需要指定参数 | K值 | 邻域半径ε,最小点数minPts |
| 处理噪声 | 敏感 | 鲁棒 |
| 时间复杂度 | O(nKt) | O(n²)最坏情况 |
| 适合数据量 | 大规模 | 中小规模 |
| 结果稳定性 | 受初始中心影响大 | 相对稳定 |
典型考题:
"某数据集含有噪声点且簇密度不均,应选择哪种算法?说明理由"
标准答案应指出:
- DBSCAN更适合,因为...(结合表格特性)
- 需要解释参数设置原则(如通过k-距离图确定ε)
- 可能需要的预处理步骤(数据标准化)
扩展考点:
- 轮廓系数评估聚类效果
- 层次聚类的树状图解读
- 高斯混合模型(GMM)的软分配特性