揭示pandas数据清洗的重要技巧！

PHPz

发布时间：2024-01-24 09:43:18

1350人浏览过

来源于php中文网

原创

pandas数据清洗技巧大揭秘！

导语：

在数据分析和机器学习中，数据清洗是一个非常重要的步骤，它涉及到对数据集进行预处理、转换和过滤，以便将数据整理为我们需要的格式和结构。而pandas是Python中最受欢迎和强大的数据分析库之一，它提供了丰富而灵活的数据清洗工具和操作方法。本文将揭秘一些pandas数据清洗的基本技巧，并提供具体的代码示例，帮助读者更好地理解和应用这些技巧。

一、导入pandas库和数据集

在开始之前，首先需要安装pandas库。安装完成后，可以使用以下代码导入pandas库，并加载需要进行清洗的数据集。

import pandas as pd

# 导入数据集
data = pd.read_csv('data.csv')

二、查看数据集

在进行数据清洗之前，首先需要了解数据集的结构和内容。pandas提供了几个常用的函数来查看数据集，包括head()、tail()、shape和info()等。

代码示例：

歌者PPT

歌者PPT，AI 写 PPT 永久免费

下载

# 查看前五行数据
print(data.head())

# 查看后五行数据
print(data.tail())

# 查看数据集的维度
print(data.shape)

# 查看数据集的基本信息
print(data.info())

三、处理缺失值

缺失值是数据集中经常遇到的问题之一，而且在真实的数据集中很常见。pandas提供了处理缺失值的多种方法。常见的处理缺失值的方法有删除、填充和插值。

删除缺失值

删除缺失值是最简单的处理方法之一，但需要慎重使用。在pandas中，可以使用dropna()函数来删除包含缺失值的行或列。

代码示例：

# 删除包含缺失值的行
data.dropna(axis=0, inplace=True)

# 删除包含缺失值的列
data.dropna(axis=1, inplace=True)

填充缺失值

填充缺失值是另一种常用的处理方法，它可以用一个常数或其他数据集中的值来填充缺失值。在pandas中，可以使用fillna()函数来填充缺失值。

代码示例：

# 使用0填充缺失值
data.fillna(0, inplace=True)

# 使用平均值填充缺失值
data.fillna(data.mean(), inplace=True)

插值缺失值

插值缺失值是一种更高级的处理方法，它可以根据已知数据的特征来推测缺失值。在pandas中，可以使用interpolate()函数来进行插值处理。

代码示例：

# 线性插值处理缺失值
data.interpolate(method='linear', inplace=True)

# 拟合插值处理缺失值
data.interpolate(method='quadratic', inplace=True)

四、处理重复值

重复值是另一个常见的数据集问题，它可能会导致数据分析和建模的偏差。pandas提供了几个函数来处理重复值，包括duplicated()和drop_duplicates()等。

查找重复值

可以使用duplicated()函数来查找数据集中的重复值。该函数返回一个布尔类型的Series对象，其中包含了每个元素是否重复的信息。

代码示例：

# 查找重复值
duplicated_data = data.duplicated()

# 打印重复值
print(duplicated_data)

删除重复值

可以使用drop_duplicates()函数来删除数据集中的重复值。该函数返回一个经过去重后的新数据集。

代码示例：

# 删除重复值
data.drop_duplicates(inplace=True)

五、处理异常值

异常值是数据集中的异常观测值，它可能会对数据分布和模型拟合产生不良影响。pandas提供了一些函数和方法来识别和处理异常值，包括箱线图、z-score和IQR等。

箱线图

箱线图是一种常用的异常值检测方法，它可以用来判断数据集中是否存在异常值。可以使用boxplot()函数来绘制箱线图，并通过观察箱线图中的离群点来识别异常值。

代码示例：

# 绘制箱线图
data.boxplot(column='value', figsize=(10, 6))

# 显示图像
plt.show()

z-score

z-score是一种统计概念，它可以用来标准化数据并判断观测值是否偏离了平均值。在pandas中，可以使用zscore()函数来计算z-score，并通过设定阈值来判断是否存在异常值。

代码示例：

# 计算z-score
z_scores = (data - data.mean()) / data.std()

# 判断是否存在异常值
outliers = z_scores[(z_scores > 3) | (z_scores < -3)]

# 显示异常值
print(outliers)

IQR(Inter-Quartile Range)是一种计算概念，它可以通过计算数据集的四分位差来确定异常值的范围。在pandas中，可以使用quantile()函数来计算四分位数，然后使用IQR公式来判断是否存在异常值。

代码示例：

# 计算四分位差
Q1 = data.quantile(0.25)
Q3 = data.quantile(0.75)
IQR = Q3 - Q1

# 判断是否存在异常值
outliers = data[((data < (Q1 - 1.5 * IQR)) | (data > (Q3 + 1.5 * IQR))).any(axis=1)]

# 显示异常值
print(outliers)

六、转换数据类型

数据类型是数据集中一个重要的属性，它涉及到数据的存储方式、计算方式和可视化方式等。在pandas中，可以使用astype()函数来转换数据类型。

代码示例：

# 将字符串类型转换为整数类型
data['column'] = data['column'].astype(int)

# 将浮点型转换为整数类型
data['column'] = data['column'].astype(int)

# 将字符串类型转换为日期类型
data['column'] = pd.to_datetime(data['column'])

七、其他常用操作

除了上述的数据清洗技巧外，pandas还提供了其他一些常用的数据清洗操作，包括重命名列、拆分列和合并列等。

重命名列

可以使用rename()函数来重命名数据集中的列。

代码示例：

# 重命名列
data.rename(columns={'old_name': 'new_name'}, inplace=True)

拆分列

可以使用str.split()函数来将含有多个值的列拆分成多个列。

代码示例：

# 拆分列
new_columns = data['column'].str.split(',', expand=True)

# 重新命名新列
new_columns.columns = ['column1', 'column2', 'column3']

# 合并新列到数据集
data = pd.concat([data, new_columns], axis=1)

合并列

可以使用pd.merge()函数来合并数据集中的多个列。

代码示例：

# 新数据集1
data1 = pd.DataFrame({'key': ['A', 'B', 'C'], 'value1': [1, 2, 3]})

# 新数据集2
data2 = pd.DataFrame({'key': ['A', 'B', 'C'], 'value2': [4, 5, 6]})

# 合并数据集
merged_data = pd.merge(data1, data2, on='key')

# 打印合并后的数据集
print(merged_data)

总结：

本文介绍了一些常用的pandas数据清洗技巧，并提供了具体的代码示例。这些技巧包括处理缺失值、处理重复值、处理异常值、转换数据类型和其他常用操作。通过学习和应用这些技巧，读者可以更好地处理和准备数据，为后续的数据分析和建模打下坚实的基础。当然，除了本文介绍的这些技巧外，pandas还有很多其他功能和方法，读者可以根据自己的需求和实际情况进一步深入学习和应用。

如何使用正则表达式精准匹配并清除 Pandas 列中「纯特殊字符」值

如何在 Pandas 中将带分隔符的索引拆分为新列

如何在 Pandas 中将索引按分隔符拆分并扩展为新列

Pandas 中高效对齐并迭代两个 DataFrame 的时间分组

Pandas 中如何将带分隔符的索引拆分为新列

相关专题

Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧，涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估，以及基于实际业务场景的时间序列项目实操，帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

2025.12.04

Python 数据清洗与预处理实战

本专题系统讲解 Python 在数据清洗与预处理中的核心技术，包括使用 Pandas 进行缺失值处理、异常值检测、数据格式化、特征工程与数据转换，结合 NumPy 高效处理大规模数据。通过实战案例，帮助学习者掌握如何处理混乱、不完整数据，为后续数据分析与机器学习模型训练打下坚实基础。

2026.01.31

数据类型有哪几种

数据类型有整型、浮点型、字符型、字符串型、布尔型、数组、结构体和枚举等。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

338

2023.10.31

php数据类型

本专题整合了php数据类型相关内容，阅读专题下面的文章了解更多详细内容。

225

2025.10.31

c语言数据类型

本专题整合了c语言数据类型相关内容，阅读专题下面的文章了解更多详细内容。

138

2026.02.12

TypeScript类型系统进阶与大型前端项目实践

本专题围绕 TypeScript 在大型前端项目中的应用展开，深入讲解类型系统设计与工程化开发方法。内容包括泛型与高级类型、类型推断机制、声明文件编写、模块化结构设计以及代码规范管理。通过真实项目案例分析，帮助开发者构建类型安全、结构清晰、易维护的前端工程体系，提高团队协作效率与代码质量。

2026.03.13

Python异步编程与Asyncio高并发应用实践

本专题围绕 Python 异步编程模型展开，深入讲解 Asyncio 框架的核心原理与应用实践。内容包括事件循环机制、协程任务调度、异步 IO 处理以及并发任务管理策略。通过构建高并发网络请求与异步数据处理案例，帮助开发者掌握 Python 在高并发场景中的高效开发方法，并提升系统资源利用率与整体运行性能。

2026.03.12

C# ASP.NET Core微服务架构与API网关实践

本专题围绕 C# 在现代后端架构中的微服务实践展开，系统讲解基于 ASP.NET Core 构建可扩展服务体系的核心方法。内容涵盖服务拆分策略、RESTful API 设计、服务间通信、API 网关统一入口管理以及服务治理机制。通过真实项目案例，帮助开发者掌握构建高可用微服务系统的关键技术，提高系统的可扩展性与维护效率。

174

2026.03.11

Go高并发任务调度与Goroutine池化实践

本专题围绕 Go 语言在高并发任务处理场景中的实践展开，系统讲解 Goroutine 调度模型、Channel 通信机制以及并发控制策略。内容包括任务队列设计、Goroutine 池化管理、资源限制控制以及并发任务的性能优化方法。通过实际案例演示，帮助开发者构建稳定高效的 Go 并发任务处理系统，提高系统在高负载环境下的处理能力与稳定性。

2026.03.10

热门下载

网站特效

网站源码

网站素材

前端模板