【深度学习笔记】数据预处理全流程:从 Pandas 读取到 PyTorch 张量

发布时间:2026/8/5 8:27:14
【深度学习笔记】数据预处理全流程:从 Pandas 读取到 PyTorch 张量 前言在深度学习的实际项目中数据通常不是“喂到嘴边”的完美张量Tensor。现实世界的数据往往是包含缺失值、离散文本的原始 CSV 或 Excel 文件。数据预处理是训练模型的第一步也是决定模型上限的关键环节。本文基于《动手学深度学习》的数据预处理章节结合在真实工程中的应用经验梳理从原始数据到机器学习可用张量的完整流程及核心避坑点。一、 准备工作原始数据集在正式处理前我们模拟现实场景先通过 Python 内置的os模块手动生成一份包含缺失值NA的房屋数据并保存为house_tiny.csv文件。import os # 创建文件夹 os.makedirs(os.path.join(.., data), exist_okTrue) data_file os.path.join(.., data, house_tiny.csv) # 写入模拟数据 with open(data_file, w) as f: f.write(NumRooms,Alley,Price\n) # 列名房间数巷子类型价格 f.write(NA,Pave,127500\n) # 缺失房间数 f.write(2,NA,106000\n) # 缺失巷子类型 f.write(4,NA,178100\n) # 缺失巷子类型 f.write(NA,NA,140000\n) # 房间数和巷子类型都缺失文件中的NA代表缺失值Not Available这是原始数据中最常见的“脏数据”形式。二、数据读取使用pandas加载csvimport pandas as pd # 读取刚才生成的 CSV 文件 data pd.read_csv(data_file) print(原始数据预览) print(data)输出预览textNumRooms Alley Price 0 NaN Pave 127500 1 2.0 NaN 106000 2 4.0 NaN 178100 3 NaN NaN 140000三、数据清洗处理缺失值# 1. 拆分为输入特征 (inputs) 和 输出标签 (outputs) inputs, outputs data.iloc[:, 0:2], data.iloc[:, 2] # 2. 处理连续数值列的缺失值用该列的均值填补 # 注意这里的 numeric_onlyTrue 是为了防止后续 Pandas 版本报错 inputs inputs.fillna(inputs.mean(numeric_onlyTrue)) print(\n数值列填补均值后) print(inputs) # 3. 处理类别列的缺失值使用独热编码 (One-Hot Encoding) # 将 Alley 列拆解为 Alley_Pave 和 Alley_nan 两列 inputs pd.get_dummies(inputs, dummy_naTrue) print(\n类别列进行独热编码后) print(inputs)四、张量转换可用于深度学习模型import torch # 将 Pandas 数据转换为 PyTorch 张量 X torch.tensor(inputs.values, dtypetorch.float32) y torch.tensor(outputs.values, dtypetorch.float32) print(\n转换后的输入张量 X\n, X) print(转换后的输出张量 y\n, y)五、实战指南⭐1.数据切分from sklearn.model_selection import train_test_split # 切分为 80% 训练集 和 20% 测试集 X_train, X_test, y_train, y_test train_test_split(X, y, test_size0.2, random_state42)2. 独热编码One-Hot的问题使用 Pandas 的get_dummies处理类别特征时如果测试集中出现了一个训练集中从未见过的类别比如巷子是“砖块”Pandas 会在测试集自动多出一列Alley_Brick导致训练集和测试集的特征列数不匹配PyTorch 模型会直接报错。这个情况下我们会再来一部分的代码# 如果测试集有训练集没有的新列直接舍弃 # 如果测试集缺少训练集有的列即新类别没出现自动用 0 填补对齐 test_encoded test_encoded.reindex(columnstrain_encoded.columns, fill_value0)✅ 可以使用sklearn.preprocessing.OneHotEncoder(handle_unknownignore)当遇到未知类别时它不会报错而是直接全部标为 0。学习中遇到的问题总结1、问为什么Alley列被转换成了Alley_Pave和Alley_nan两列而NumRooms列却依然保持原样3.0, 2.0, 4.0, 3.0没有对其进行转换答pandas.get_dummies()的机制get_dummies的默认行为是将分类变量categorical variables即字符串/文本类型或对象类型转换成独热编码one-hot encoding。会忽略数值型的列在inputsDataFrame 中NumRooms是浮点数float 类型而Alley是字符串/对象object 类型。因为使用了dummy_naTrue它也会将缺失值NaN无论该列是数值型还是类别型当作一个类别来处理。不过对于NumRooms列虽然它包含 NaN在填充均值后变成了 3.0所以这里已经没有了 NaN就算有 NaN在默认行为下也不会把它作为分类列进行独热编码。注意如果有两列不是数值的列就会把两列都转换成独热编码2、在第四步张量转换中遇到这个问题我们需要确保的是y这个numpy 数组得是数值类