机器学习入门文档深度页
机器学习必备 NumPy 操作
掌握形状、切片、按列统计、布尔筛选和广播,才能可靠检查模型输入。
学习前需要掌握
背景与问题
标准化、距离、损失和手写算法都依赖正确的索引与广播。
概念定义
NumPy 用 ndarray 表示同类型多维数据;axis=0 沿样本聚合,axis=1 沿特征聚合。
直观理解
先把数组每个轴标上含义,再读每次切片和统计。
核心原理
shape 是接口契约;布尔 mask 必须与被筛选轴长度一致;广播前要确认结果形状。
数学表达
核心表达
shape 是接口契约;布尔 mask 必须与被筛选轴长度一致;广播前要确认结果形状。
变量含义
变量定义与本页概念定义一致,代码中的同名变量保持相同语义。
计算步骤
- 1查看 shape/dtype
- 2使用行列切片
- 3按正确 axis 统计
- 4构造布尔 mask
代码对应位置
示例 1机器学习必备 NumPy 操作:最小可验证示例:把正文原理映射为可检查的代码行为。
计算与实现步骤
- 1
查看 shape/dtype
- 2
使用行列切片
- 3
按正确 axis 统计
- 4
构造布尔 mask
- 5
检查广播结果
代码实现
示例 1
机器学习必备 NumPy 操作:最小可验证示例
机器学习必备 NumPy 操作:最小可验证示例
NumPy
example_01.py用途:把正文原理映射为可检查的代码行为。
import numpy as np
X=np.array([[1.,10.],[2.,20.],[3.,30.]])
print(X.shape, X[0], X[:,0])
print(X.mean(0), X.std(0))
print(X[X[:,0] <= 2])代码解析
解析始终位于完整代码下方,并按实际代码段逐项对应。
输入数据与任务
把正文原理映射为可检查的代码行为。
X- 完整特征矩阵,每行一个样本、每列一个特征。
mean- 训练特征逐列均值。
std- 训练特征逐列标准差。
Step 1 · 1–5 行
导入当前步骤需要的数值计算、预处理、模型或评价工具。依赖集中写在代码开头,便于复现。
import numpy as np
X=np.array([[1.,10.],[2.,20.],[3.,30.]])
print(X.shape, X[0], X[:,0])
print(X.mean(0), X.std(0))
print(X[X[:,0] <= 2])代码与数学原理
减去训练均值并除以训练标准差,对应代码中的 mean/std 或 StandardScaler。
预期输出或运行结果
输出形状、第一行、第一列、逐列均值/标准差和前两行。
常见错误 · 5 条
- 不要在测试集上调用 fit 或 fit_transform;测试集只能复用训练参数。
- axis 理解反
- mask 长度错
- 无意改变维度
- 确认样本轴、特征轴以及 X 与 y 的第一维完全对应。
实际应用
- 数据审计
- 手写算法
常见错误
axis 理解反
mask 长度错
无意改变维度
文档来源
01|数学与数据基础原始文档
学习资料/learning_tech/01_math_data_foundations.md- §9 必备 Python 与 NumPy 操作
推荐学习资料
暂未收录相关资料
参考库不会生成虚假资源或无效外部链接。