Python数据处理入门:掌握DataFrame与Series的核心操作与实战技巧

发布时间:2026/7/29 9:27:29
Python数据处理入门:掌握DataFrame与Series的核心操作与实战技巧 1. 项目缘起为什么“数据框”和“序列”是Python数据处理的第一道坎如果你刚开始用Python处理数据大概率会听到两个词“DataFrame”和“Series”。很多教程会直接告诉你这是pandas库里的两个核心数据结构然后就开始甩代码。但为什么是它们为什么不是直接用Python的列表或者字典这个“头歌”实验闯关表面上是让你熟悉语法深层目的是帮你建立一种思维模型——一种用“带标签的表格”和“带标签的数组”来思考数据的模型。我见过太多新手数据导进来就是一通for循环代码又慢又长根本原因就是没跨过“序列化思维”这道坎。这个实验的“闯关”设计很巧妙它模拟了一个真实的数据处理流程从无到有地创建数据、从各种混乱的源头读取数据、然后才是清洗、计算和导出。每一步卡住的地方往往就是实践中最容易栽跟头的地方。比如你知道怎么创建一个包含学生成绩的DataFrame但知道怎么在创建时就指定“学号”为索引让后续的查询快上十倍吗你知道怎么从CSV读数据但遇到文件编码是gbk或者里面混着非法字符时该怎么优雅地处理而不报错这些细节就是“会”与“精通”的区别。接下来我不会按部就班地复述实验步骤而是结合我踩过的坑和总结的经验带你重新走一遍这个数据处理的核心路径。我们会聚焦在三个最关键的环节构建、获取和转换。你会发现一旦用对了数据框DataFrame和序列Series很多复杂操作会变得异常简单。2. 核心基石亲手“铸造”你的第一个DataFrame与Series很多教程一上来就教pd.read_csv但我强烈建议你反过来先学会从零开始创建DataFrame和Series。这就像学木工你得先认识木材和工具而不是直接去看怎么组装一个柜子。自己“铸造”数据的过程能让你最深刻地理解它们的结构和特性。2.1 创建Series不只是“高级列表”Series常被简单理解为“带索引的列表”这低估了它。它本质上是一个一维的、标签化的数组。这个“标签”索引是它的灵魂。import pandas as pd # 方法1从列表创建默认整数索引 s1 pd.Series([90, 85, 78, 92], name语文成绩) print(s1) # 输出 # 0 90 # 1 85 # 2 78 # 3 92 # Name: 语文成绩, dtype: int64 # 看它自动生成了0,1,2,3作为索引。 # 方法2从列表创建并指定自定义索引标签 s2 pd.Series([90, 85, 78, 92], index[张三, 李四, 王五, 赵六], name语文成绩) print(s2) # 输出 # 张三 90 # 李四 85 # 王五 78 # 赵六 92 # Name: 语文成绩, dtype: int64关键理解s2的索引现在是[‘张三’ ‘李四’ ‘王五’ ‘赵六’]。这意味着你可以用‘张三’这个标签直接获取他的成绩s2[‘张三’]返回90。这种通过标签而非位置下标的访问方式是pandas高效查询的基础。索引可以是数字、字符串甚至是时间戳非常灵活。踩坑点索引不需要唯一但重复索引会导致某些操作如.loc精确标签选取行为复杂化初学者建议先保持索引唯一。2.2 创建DataFrame理解“列”的集合DataFrame是一个二维的、表格型的数据结构你可以把它想象成一个Excel工作表。它由多个Series组成这些Series共享同一个索引。# 方法1从字典创建最直观 data { 姓名: [张三, 李四, 王五, 赵六], 语文: [90, 85, 78, 92], 数学: [88, 92, 85, 90], 英语: [85, 88, 90, 87] } df_from_dict pd.DataFrame(data) print(df_from_dict)输出结果是一个整齐的表格姓名 语文 数学 英语 0 张三 90 88 85 1 李四 85 92 88 2 王五 78 85 90 3 赵六 92 90 87注意字典的key自动变成了列名姓名语文数学英语。字典的value列表长度必须一致。行索引依然是默认的0,1,2,3。方法2从Series的字典创建更体现DataFrame的本质s_math pd.Series([88, 92, 85, 90], index[张三, 李四, 王五, 赵六], name数学) s_english pd.Series([85, 88, 90, 87], index[张三, 李四, 王五, 赵六], name英语) df_from_series pd.DataFrame({数学: s_math, 英语: s_english}) print(df_from_series)输出数学 英语 张三 88 85 李四 92 88 王五 85 90 赵六 90 87这里有一个至关重要的细节当我们用两个Series构建DataFrame时pandas会自动按照索引对齐数据。如果两个Series的索引不完全一致结果会怎样这是数据处理中常见的“坑”。s_math_partial pd.Series([88, 92, 85], index[张三, 李四, 王五], name数学) s_english pd.Series([85, 88, 90, 87], index[张三, 李四, 王五, 赵六], name英语) df_mismatch pd.DataFrame({数学: s_math_partial, 英语: s_english}) print(df_mismatch)输出数学 英语 张三 88.0 85 李四 92.0 88 王五 85.0 90 赵六 NaN 87看到了吗‘赵六’在数学Series里不存在所以在合并后的DataFrame中他的数学成绩是NaNNot a Number pandas中表示缺失值。而‘张三’、‘李四’、‘王五’的索引在两个Series中都存在数据成功对齐。这种自动对齐的特性既是pandas强大之处也是数据合并时产生大量NaN的常见原因。理解这一点对后续的数据清洗至关重要。提示在创建DataFrame时使用pd.DataFrame(data, index…)参数可以显式指定行索引覆盖默认的整数索引或Series自带的索引。这在整合不同来源的数据时非常有用。3. 数据获取实战从混乱源头到整洁DataFrame创建数据是理想情况现实中99%的数据来自外部。pd.read_*系列函数是你的入口但这里遍布陷阱。3.1 读取CSV/Excel编码、分隔符与类型推断问题1编码错误UnicodeDecodeError这是中文用户第一道鬼门关。尤其当你拿到从Windows系统导出的CSV文件时。# 错误示范很可能报错 # df pd.read_csv(data.csv) # 正确姿势尝试常见编码 try: df pd.read_csv(data.csv, encodingutf-8) except UnicodeDecodeError: try: df pd.read_csv(data.csv, encodinggbk) # 中文Windows常用 except UnicodeDecodeError: df pd.read_csv(data.csv, encodinggb18030) # 更全面的中文编码 # 或者使用 errorsignore 忽略非法字符不推荐会丢失数据一个更专业的做法是先用chardet库检测编码但这需要额外安装。问题2非标准分隔符或多余行CSV并不总是用逗号分隔。# 文件使用分号分隔且前三行是文件说明非表头 df pd.read_csv(data.txt, sep;, header0, skiprows3) # sep; 指定分隔符 # header0 表示第一行跳过skiprows后是列名 # skiprows3 跳过文件开头3行问题3数字里的千分位逗号“1234”会被读成字符串“1234”而不是数字1234。df pd.read_csv(financial_data.csv, thousands,) # thousands, 参数会自动去除数字中的千分位逗号问题4读取Excel时的表单选# 读取名为‘Sheet2’的工作表跳过前两行只读取A到E列 df pd.read_excel(report.xlsx, sheet_nameSheet2, skiprows2, usecolsA:E) # usecols 参数非常高效避免读入不需要的列节省内存。3.2 处理缺失值与异常值读入时的初步清洗数据读进来经常发现有些单元格是空的、写着“NULL”、“NA”或“-”。pandas的read_csv提供了参数在源头处理。df pd.read_csv(dirty_data.csv, na_values[NA, N/A, NULL, -, ], # 将这些字符串识别为NaN keep_default_naTrue) # 同时保持默认的NaN识别如空字符串这样做的好处是所有缺失值在内存中统一用NaN表示便于后续用df.isna()、df.fillna()等方法集中处理。3.3 设定正确的索引为高效查询打下基础默认的整数索引012…通常没有业务意义。我们经常把具有唯一性的列如学号、订单ID、时间戳设为索引。# 方法1读取时指定 df pd.read_csv(students.csv, index_col学号) # 此时‘学号’列不再是普通列而是行索引。 # 方法2读取后修改 df.set_index(学号, inplaceTrue) # inplaceTrue表示直接修改原df为什么这么做将具有唯一性的业务ID设为索引后基于标签的查询.loc[‘S001’]会非常快因为pandas内部使用了哈希表进行优化。这比用df[df[‘学号’]‘S001’]这种布尔索引要高效得多尤其是在数据量大的时候。4. 核心数据处理操作像玩积木一样操作DataFrame数据读进来了真正的游戏才开始。数据处理无非就是“增删改查”四个字但pandas提供了极其优雅的表达方式。4.1 数据选取.loc与.iloc的哲学这是最重要的两个方法必须彻底分清。.loc[]基于标签label的选取。你传入的是索引和列的名称。.iloc[]基于整数位置integer location的选取。你传入的是行和列的下标从0开始。df pd.DataFrame({语文:[90,85,78], 数学:[88,92,85]}, index[张三,李四,王五]) # .loc 示例 print(df.loc[李四, 数学]) # 输出92 选取单个值 print(df.loc[张三:王五, 语文:数学]) # 输出张三到王五语文到数学的所有行和列注意切片是闭区间 print(df.loc[[张三, 王五], [语文]]) # 输出张三和王五的语文成绩列表选择 # .iloc 示例 print(df.iloc[1, 1]) # 输出92 第1行第1列对应‘李四’‘数学’ print(df.iloc[0:2, 0:2]) # 输出第0行到第1行第0列到第1列注意切片是前闭后开区间核心区别与记忆口诀.loc是“名字”.iloc是“号数”。用名字找用.loc用第几个找用.iloc。.loc的切片‘A’:‘C’包含C而.iloc的切片0:2不包含2。这个区别千万不能混。4.2 条件筛选用布尔数组代替循环这是pandas向量化运算的威力体现。你想找出所有语文成绩大于85分的学生不需要写for循环。# 创建一个布尔序列 mask df[语文] 85 print(mask) # 输出 # 张三 True # 李四 False # 王五 False # Name: 语文, dtype: bool # 将这个布尔序列传入df即可完成筛选 good_chinese df[mask] print(good_chinese)复杂条件组合使用与、|或、~非时每个条件必须用括号括起来这是新手常犯的错误。# 找出语文85 且 数学90的学生 condition (df[语文] 85) (df[数学] 90) result df[condition] # 找出语文85 或 英语88的学生 condition2 (df[语文] 85) | (df[英语] 88) result2 df[condition2]4.3 增删改列直接赋值与apply方法新增/修改列像操作字典一样简单。df[总分] df[语文] df[数学] df[英语] # 新增‘总分’列 df[语文] df[语文] 5 # 给所有学生语文成绩加5分修改列更复杂的列运算使用apply方法。比如想根据总分划分等级。def get_grade(total): if total 270: return A elif total 240: return B else: return C df[等级] df[总分].apply(get_grade) # 将函数应用到‘总分’列的每一个元素上apply非常强大但对于简单的数值运算优先使用pandas内置的向量化函数如df[‘col’].mean()df[‘col’].str.upper()因为它们的速度比apply快得多。apply相当于在Python层面循环而向量化函数是在C语言层面优化的。删除列df.drop(columns[等级], inplaceTrue) # 删除‘等级’列 # 或者 del df[等级]4.4 处理缺失值识别、删除与填充现实数据没有完美的。NaN是我们的“老朋友”。# 1. 识别缺失值 print(df.isna()) # 返回一个布尔DataFrame显示每个单元格是否为NaN print(df.isna().sum()) # 统计每列有多少个NaN非常实用 # 2. 删除缺失值 df_dropped df.dropna() # 默认删除任何包含NaN的行 df_dropped_col df.dropna(axis1) # 删除任何包含NaN的列 df_dropped_subset df.dropna(subset[语文, 数学]) # 只在‘语文’和‘数学’列同时为NaN时才删除该行 # 3. 填充缺失值 df_filled df.fillna(0) # 用0填充所有NaN df_filled_mean df.fillna(df.mean()) # 用各列的均值填充该列的NaN # 更精细的填充向前填充用上一个有效值 df_filled_ffill df.fillna(methodffill)经验之谈不要一上来就dropna()这可能会丢失大量数据。先看df.isna().sum()了解缺失情况。对于时间序列数据ffill或bfill向后填充通常是合理的选择。对于数值列用均值/中位数填充是常见做法。分类数据则可以考虑用众数填充。5. 闯关进阶聚合、分组与多表合并当基本操作熟练后你会遇到更复杂的任务如何统计各班的平均分如何将学生信息和成绩表合并5.1 分组聚合GroupBy数据分析的“灵魂”groupby是SQL中GROUP BY的pandas实现理解它才算入门数据分析。# 假设df有一个‘班级’列 df[班级] [一班, 一班, 二班, 二班] # 按‘班级’分组并计算各科平均分 grouped df.groupby(班级) print(grouped.mean()) # 输出 # 语文 数学 英语 总分 # 班级 # 一班 87.5 90.0 86.5 264.0 # 二班 85.0 87.5 88.5 261.0 # 一次进行多种聚合 print(grouped.agg({ 语文: [mean, max, min], 数学: sum, 英语: lambda x: x.std() # 使用自定义函数计算标准差 }))groupby的过程是“拆分-应用-合并”。它本身并不立即计算而是创建一个DataFrameGroupBy对象。只有当你调用聚合函数meansumagg等时计算才会发生。这种“惰性求值”的设计是为了高效。5.2 数据合并Merge/Concat像拼图一样整合数据数据很少存在于单个表中。pd.merge()是主要的表连接工具其逻辑与SQL的JOIN一致。# 学生信息表 df_info pd.DataFrame({学号: [S001, S002, S003], 姓名: [张三, 李四, 王五], 班级: [一班, 一班, 二班]}) # 成绩表 df_score pd.DataFrame({学号: [S001, S002, S003, S004], 语文: [90, 85, 78, 92], 数学: [88, 92, 85, 90]}) # 内连接默认只保留两个表都有的学号 df_inner pd.merge(df_info, df_score, on学号) print(df_inner) # 没有S004因为info表里没有 # 左连接以左表df_info为准右表没有的补NaN df_left pd.merge(df_info, df_score, on学号, howleft) print(df_left) # 有S001,S002,S003S004不在左表所以不出现 # 外连接保留所有学号 df_outer pd.merge(df_info, df_score, on学号, howouter) print(df_outer) # S001,S002,S003,S004都会出现缺失的信息为NaN关键参数on用于连接的列名。如果列名不同用left_on和right_on。how连接方式‘inner’‘left’‘right’‘outer’。suffixes当两个表有同名列非连接键时用于区分它们的后缀默认是(‘_x’ ‘_y’)。对于简单的纵向追加行或横向追加列拼接可以使用pd.concat。# 纵向拼接两个表结构相同 df_new_students pd.DataFrame({学号:[S005], 语文:[95], 数学:[96]}) df_all_scores pd.concat([df_score, df_new_students], ignore_indexTrue) # ignore_indexTrue会重置索引否则会保留原来的索引导致重复。 # 横向拼接按索引对齐 df_a pd.DataFrame({A: [1,2]}, index[x,y]) df_b pd.DataFrame({B: [3,4]}, index[x,y]) df_h pd.concat([df_a, df_b], axis1) # axis1 表示按列拼接6. 性能优化与常见“反模式”避坑当你处理的数据量从几百行变成几十万、上百万行时一些在“闯关”时看似没问题的写法可能会让程序慢到崩溃。反模式1在DataFrame上使用循环# 错误极其缓慢 for i in range(len(df)): df.loc[i, 新列] some_complex_function(df.loc[i, 某列]) # 正确使用向量化操作或apply df[新列] df[某列].apply(some_complex_function) # 或者如果函数可以向量化直接运算 df[新列] df[某列] * 2 10反模式2使用df[‘col’].values的链式赋值# 有时会看到这样的警告SettingWithCopyWarning # 这可能发生在你对一个DataFrame的切片进行赋值时 df_subset df[df[语文] 80] df_subset[等级] 优秀 # 这可能修改不了原始的df且会报警告 # 解决方案使用.loc明确赋值 df.loc[df[语文] 80, 等级] 优秀 # 或者如果你确实想操作一个副本就显式拷贝 df_subset df[df[语文] 80].copy() df_subset[等级] 优秀反模式3不注意数据类型object类型通常是字符串比int、float占用更多内存操作更慢。print(df.dtypes) # 查看每列数据类型 # 将可以转换的列转为更高效的类型 df[学号] df[学号].astype(category) # 如果学号是有限个重复值用category类型 df[数值列] pd.to_numeric(df[数值列], errorscoerce) # 将字符串转为数字错误转为NaN数据处理本身是一个螺旋上升的过程。从理解Series和DataFrame这两个核心容器的本质开始到熟练地从各种脏乱的数据源中提取信息再到运用向量化思维进行高效的数据操作与整合每一步都对应着实际工作中一个具体的场景。这个“头歌”实验闯关正是这条路径的缩影。我建议你在通过基础关卡后不妨自己找一些真实、杂乱的数据集比如Kaggle上的入门数据集用今天讨论的思路去从头到尾处理一遍把每个环节的坑都踩一踩这才是从“知道”到“会用”的关键一跃。