出声回答二十个机器学习与深度学习常见口试问题,对照要点自查;小欧 AI 口试陪练按课程要点反馈并追问一层。属于结课后的可选复习,不计入课程完成条件。
建议做法:先不看要点,出声说出你的回答;再对照要点补充遗漏。要点旁的链接指向讲解该知识点的学习单元。
01 / 二十问自查
1.什么是过拟合?常用的缓解方法有哪些?
过拟合是模型在训练集上表现很好、在新样本上表现明显下降。常用缓解方法有三类:L2 正则化(惩罚过大的权重)、限制树深度并剪枝、随机失活(dropout)与早停。
追问:L2 正则化为什么有助于缓解过拟合?
复习 模块 6 · 第 5 课 →2.训练集、验证集和测试集分别有什么作用?
3.什么是数据泄漏?
数据泄漏指评估阶段才应获得的信息提前进入了训练过程。例如在划分数据集之前用全量数据计算最小值和最大值,被评估的样本参与了确定变换参数。
追问:请举例说明归一化过程中如何发生数据泄漏。
复习 模块 6 · 第 3 课 →4.什么时候需要特征缩放?
距离类模型通常要求特征尺度可比,如 K-Means、KNN;用梯度优化的线性模型和神经网络,缩放后也更容易训练;树模型按列比大小,一般不要求统一缩放。
追问:不缩放对梯度下降有什么影响?
复习 模块 6 · 第 5 课 →5.如何根据训练集和验证集的表现区分欠拟合与过拟合?
训练集和验证集表现都较差,通常是欠拟合,模型过于简单;训练集表现很好而验证集或新样本表现明显下降,通常是过拟合,模型复杂度过高。模型深度和正则化强度就是在两者之间进行调整。
追问:训练集和验证集表现都较差时,应优先检查和调整哪些因素?
复习 模块 6 · 第 5 课 →6.K-Means 的计算流程是什么?如何处理空簇?
将每个样本分配到最近的中心、按簇求均值更新中心、重复直到收敛;出现空簇时沿用旧中心。分配与更新两步都不会使簇内平方和增大。
追问:为什么均值这一步不会让簇内平方和增大?
复习 模块 6 · 第 3 课 →7.逻辑回归为什么用交叉熵?
与 sigmoid 组合时,均方误差(MSE)的梯度会被额外的 p(1−p) 因子压小,预测偏差很大的区域反而更新缓慢;交叉熵与 sigmoid 组合后,对权重的梯度为 (p−y)·x(p 为预测概率、y 为真实标签、x 为输入),预测偏差越大更新信号越强。
追问:交叉熵与 sigmoid 组合时,梯度的表达式是什么?
复习 模块 6 · 第 2 课 →8.随机森林与 XGBoost 有哪些主要区别?
随机森林并行训练多棵相对独立的树并对结果平均或投票,以降低方差;XGBoost 串行拟合上一轮损失的负梯度(平方误差下即残差),通过逐步纠错降低偏差。
追问:为什么随机森林要给每棵树不同的数据子集?
复习 模块 6 · 第 5 课 →9.线性回归应选择正规方程(也称法方程)还是梯度下降?
低维、矩阵规模可控时可用正规方程(也称法方程)一次求解;样本数或特征数很大时常用迭代优化;深度网络一般没有闭式解,使用 SGD、Adam 这类梯度优化器。
追问:正规方程在什么规模下会面临计算或存储瓶颈?
复习 模块 6 · 第 4 课 →10.如何选择 K-Means 的聚类数 k?
11.为什么需要激活函数?
没有激活函数时,无论叠加多少线性层,整体仍等价于单层线性变换;非线性激活函数使网络能够表示非线性关系。
追问:如何用一个数值示例说明两层线性变换可以合并为一层?
复习 模块 6 · 第 4 课 →12.反向传播如何利用链式法则计算参数梯度?
13.什么是梯度消失?常用的缓解方法有哪些?
仅考虑激活函数导数这一项:sigmoid 导数最大为 0.25,连续十层相乘后约为百万分之一;实际梯度还要乘以各层权重。常用缓解方法包括改用 ReLU 和加入残差连接。
追问:ReLU 为什么能缓解梯度消失?
复习 模块 6 · 第 4 课 →14.学习率过大或过小时会产生哪些影响?
15.权重为什么不能全零初始化?
16.哪些情况下准确率不能充分反映模型效果?
类别不平衡时。例如负样本占 99%,把所有样本都预测为负类也能得到 99% 的准确率。此时应查看混淆矩阵,以及精确率(P)、召回率(R)和 F1 分数。
追问:类别不平衡时,应优先查看哪些评估指标?
复习 模块 6 · 第 5 课 →17.如何在精确率(precision)与召回率(recall)之间取舍?
阈值上移时召回率往往下降,精确率常会上升但不保证逐点单调。应根据误报和漏报的实际代价确定优先指标:例如安全审核通常召回率优先,推荐展示通常精确率优先。
追问:F1 为什么用调和平均而不是算术平均?
复习 模块 6 · 第 5 课 →18.如何稳定地计算 softmax?
19.KV 缓存为什么能加速生成过程?
生成每个新令牌(token)时不再重新计算历史令牌的 K 和 V,而是缓存后复用;但每步仍要与缓存中的历史 K、V 做注意力计算。节省的是投影计算,代价是显存占用。
追问:KV 缓存的主要代价是什么?
复习 模块 7 · 第 1 课 →20.温度参数与 Top-K 采样分别如何影响生成结果?
温度参数对打分进行缩放,改变概率分布的集中程度;Top-K 采样只在概率最高的 k 个候选里采样,k=1 时等价于每次选择最高概率候选(贪心)。
追问:降低温度参数后,概率分布会如何变化?
复习 模块 7 · 第 1 课 →02 / 小欧 AI 口试陪练
选择一组问题,小欧 AI 口试陪练会逐题提问。请把口头回答的内容输入文本框,小欧按课程要点给出反馈:要点完整记为通过,遗漏的要点一句话指出,然后追问一层。追问用于补充练习,不计入主问题通过数。
AI 反馈仅供自我检查;关键结论请以课程内容和题目要求为准。