ML · 学习方向
研究系统如何从数据中学习规律,并对未见样本作出可靠预测。
机器学习从历史数据中学习参数或规则,再对未见数据产生可评价预测。
Python 示例
从带标签样本中学习输入到目标的映射。
Python 示例
分类预测离散类别或类别概率,回归预测连续数值。
Python 示例
在没有人工标签的数据中发现结构、分组或低维表示。
NumPy 示例
半监督结合少量标签和大量无标签数据,自监督从数据本身构造训练目标。
Python 示例
X 的行对应样本、列对应特征,y 的第 i 项必须与 X 的第 i 行保持配对。
NumPy 示例
fit 学习状态,predict 使用已学状态;泛化衡量模型对未见数据的有效性。
Python 示例
训练集学习参数,验证过程选择方案,测试集只在选择完成后评价一次。
Python 示例
从问题与数据到训练、评价、保存、部署和漂移监控的完整闭环。
Python 示例
训练与验证表现共同决定模型是能力不足、记住噪声还是具备合理泛化。
Python 示例
标量表示单值,向量表示一个样本或参数集合,矩阵按行组织多个样本。
NumPy 示例
线性模型用特征与权重的点积加偏置计算分数。
NumPy 示例
均值描述中心,方差和标准差描述围绕中心的分散程度。
NumPy 示例
模型概率表示类别倾向,最终类别由 argmax 或阈值规则产生。
NumPy 示例
条件概率在已知信息后更新事件可能性,贝叶斯公式结合先验与似然得到后验。
NumPy 示例
欧氏距离度量坐标差平方和的平方根,对特征尺度与高维无关特征敏感。
NumPy 示例
梯度汇集损失对所有参数的局部变化率,梯度下降沿反方向更新参数。
NumPy 示例
MSE 平均平方误差并强调大错误,RMSE 开方后恢复目标原单位。
NumPy 示例
交叉熵惩罚模型给真实类别分配过低概率,尤其惩罚自信但错误的预测。
Python 示例
基尼不纯度衡量节点类别混杂,决策树选择降低加权不纯度最多的划分。
NumPy 示例
高偏差表现为训练验证都差,高方差表现为训练好而验证落后;学习曲线观察数据量增加时二者变化。
Python 示例
掌握形状、切片、按列统计、布尔筛选和广播,才能可靠检查模型输入。
NumPy 示例
先划分数据,只在训练数据上学习预处理参数,再把同一规则应用到验证、测试和未来数据。
Python 示例
在训练前系统检查形状、类型、缺失、重复、异常单位、标签和采集来源。
Python 示例
根据特征类型、缺失机制和业务语义,在训练集内学习填补规则并保留必要的缺失信息。
Python 示例
把类别值转换为模型可处理的数值,同时避免给无序类别强加不存在的大小关系。
Python 示例
使用训练集均值和标准差把不同量纲的数值特征转换到均值约为 0、标准差约为 1 的尺度。
NumPy 示例
使用训练集最小值与最大值把特征线性映射到指定范围,典型为 [0,1]。
Python 示例
先划分数据,再只用训练集拟合填补、缩放和编码参数。
Python 示例
用向量、矩阵、统计量、概率、距离和梯度描述数据与学习过程。
NumPy 示例
用中位数和四分位距降低极端值对缩放参数的影响,并先区分错误数据与真实稀有事件。
Python 示例
学习率决定每次沿负梯度方向移动的距离,应在特征缩放后按对数尺度比较。
NumPy 示例
结合损失趋势、相对变化、梯度范数、耐心轮数和最大轮数判断优化是否稳定。
Python 示例
少数类任务中准确率可能严重误导,需要合适指标、阈值、权重和严格的折内重采样。
Python 示例
把原始字段组合为更贴近任务机制的特征,让简单模型也能表达有意义的非线性关系。
Python 示例
用 log1p 缓和非负长尾分布,用正弦/余弦保留小时、星期等周期相邻关系。
NumPy 示例
输入包含预测时尚未发生的信息,会制造无法上线复现的虚高离线效果。
Python 示例
删除低价值、冗余或不稳定特征,降低方差、成本与解释负担,并把选择过程限制在训练折内。
Python 示例
用 Pipeline 固化步骤顺序,用 ColumnTransformer 为不同列类型建立独立处理分支。
Python 示例
把原始字段转换为更能表达任务规律、且预测时确实可获得的特征。
Python 示例
用特征加权和预测连续数值,通过最小化平方误差学习权重与偏置。
Python 示例
先计算线性分数,再用 Sigmoid 或 Softmax 得到类别概率。
Python 示例
在数据损失上加入权重惩罚,控制复杂度并改善未见数据稳定性。
Python 示例
权重描述控制其他特征后,特征变化与模型分数之间的统计关系。
Python 示例
线性模型快速稳定且适合稀疏高维,但复杂非线性需特征构造或其他模型。
Python 示例
保存训练样本,预测时按标准化后的距离寻找 K 个邻居并投票或平均。
Python 示例
学习各类别先验与每个连续特征的类别条件高斯分布,在对数空间比较后验。
Python 示例
寻找最大间隔分类边界,软间隔允许错误,核函数表达非线性。
Python 示例
三类模型分别依赖邻居、概率假设和最大间隔,应在同一验证协议下公平比较。
Python 示例
递归枚举特征与阈值,选择不纯度下降最大的划分,叶节点输出多数类别或均值。
Python 示例
对多个自助采样子集并行训练高方差模型,再投票或平均降低不稳定性。
Python 示例
在 Bagging 基础上让每个节点只看随机特征子集,降低树间相关性。
Python 示例
顺序训练弱学习器,提高误分类样本权重,并按学习器表现加权投票。
Python 示例
按顺序添加树,拟合当前损失的负梯度方向,逐步修正已有模型。
Python 示例
Bagging 独立训练并平均以降低方差,Boosting 顺序纠错以降低偏差。
Python 示例
不纯度重要性统计特征为树划分带来的累计改善,但不能解释因果。
Python 示例
交替把样本分给最近中心并更新均值,最小化簇内平方距离;轮廓系数辅助评价 K。
Python 示例
凝聚式方法从单样本簇开始按 linkage 逐步合并,形成可切割的树状层级。
Python 示例
从核心点扩展高密度区域,识别任意形状簇并把孤立样本标为噪声。
Python 示例
寻找互相正交、依次最大化投影方差的线性方向,用更少维度保留主要变化。
Python 示例
从内部结构、稳定性、外部标签、下游价值和领域解释多角度评价无标签结果。
Python 示例
PCA 寻找方差最大的正交方向,常用于压缩和观察聚类结构。
Python 示例
数据划分必须模拟未来来源、时间、群组和预测时可用信息。
Python 示例
按真实类别与预测类别统计正确、误报和漏报,是分类错误分析的基础。
Python 示例
指标分别衡量总体正确、误报、漏报、二者平衡及阈值无关的排序能力。
Python 示例
MAE 易解释且相对稳健,RMSE 更惩罚大误差,R² 衡量相对均值基线的改善。
Python 示例
用最常见类别或训练均值建立最低参照,复杂模型必须证明真正超过简单策略。
Python 示例
在训练部分交叉验证候选超参数;网格枚举组合,随机搜索按分布抽样。
Python 示例
训练或选择流程获得真实预测时不可用的信息,使离线评价虚高。
Python 示例
从混淆类别、样本质量、人群来源、极端区域和置信度定位模型失败机制。
Python 示例
评价指标必须匹配真实使用方式、类别分布和错误成本。
Python 示例
以权重绝对值之和惩罚复杂度,几何尖角与软阈值使部分权重精确变为零。
Python 示例
先对光滑数据损失做梯度步,再用软阈值处理 L1,使小权重精确归零。
NumPy 示例
在线性回归 MSE 上加入 L1,用 alpha 控制稀疏度,并在训练部分交叉验证选择。
Python 示例
在交叉熵上加入 L1,使部分分类权重归零;C 越小正则越强。
Python 示例
混合 L1 稀疏性和 L2 稳定收缩,适合相关特征较多的场景。
Python 示例
先排除欠拟合、泄漏和分布变化,再用训练/验证差距、折间波动与学习曲线确认过拟合。
Python 示例
过多簇、成分或噪声方向会让无监督模型追随训练细节,需要稳定性和独立价值验证。
Python 示例
过拟合是记住训练噪声;正则化通过约束复杂度改善泛化。
Python 示例
K 折让每条训练部分样本轮流验证,报告平均分和折间波动,并保留最终测试集。
Python 示例
回归常用 KFold,分类用分层折保持类别比例,重复 CV 检查随机划分敏感性。
Python 示例
保证同一患者、用户或设备的全部记录只出现在训练侧或验证侧。
Python 示例
训练窗口始终早于验证窗口,可设置 gap 模拟标签延迟或隔离边界。
Python 示例
填补、标准化、PCA、特征选择、词表和重采样都必须在当前训练折内部学习。
Python 示例
cross_validate 可同时返回多指标、训练分数和耗时;scoring 必须匹配任务与错误成本。
Python 示例
内层选择超参数,外层估计整个选择流程的泛化,减少最佳 CV 分数的选择乐观。
Python 示例
为每条样本产生其不在训练折时的预测,适合诊断和严格堆叠特征。
Python 示例
报告划分器、折数、种子、群组/时间定义、指标、每折结果、均值波动、搜索范围和独立测试。
Python 示例
保存完整 Pipeline,确保预处理和模型一起交付;只加载自己生成或可信来源的 joblib。
Python 示例
预测输入必须与训练时的列名、顺序、单位、类型、缺失约定和二维形状一致。
Python 示例
上线后持续监控输入质量、分布、预测比例、真实效果、延迟和版本。
Python 示例
集成学习组合多棵树,利用差异降低方差或逐步修正错误。
Python 示例
从 Wine 数据审计、固定测试集、Pipeline、交叉验证与搜索走到最终评价、保存、预测和监控。
Python 示例
使用 1797 张 8×8 灰度数字图、64 个像素特征完成十分类传统机器学习项目。
Python 示例
统一比较 Dummy、标准化逻辑回归、标准化 KNN、决策树以及随机森林或 SVM。
Python 示例
生成样本、分布、模型比较、混淆矩阵和错误样本五类图,并解释主要数字混淆。
Python 示例
按分级验收完成代码、依赖、五张图、模型、报告、预测程序和风险说明。
Python 示例
用结构化报告记录任务、环境、数据、协议、基线、候选、搜索、测试、错误、交付与限制。
Python 示例