0

0

Pandas DataFrame:优化多列批量加减运算

心靈之曲

心靈之曲

发布时间:2025-11-23 12:56:16

|

869人浏览过

|

来源于php中文网

原创

Pandas DataFrame:优化多列批量加减运算

本教程详细介绍了在pandas dataframe中对多列执行批量加减运算的两种高效方法。我们将探讨如何利用`dataframe.eval()`进行多行表达式求值,以及如何通过链式调用`add()`和`sub()`方法结合向量化操作实现相同效果。文章将提供详细的代码示例和解释,帮助读者根据具体场景选择最合适的策略,从而提升数据处理效率和代码可读性

引言:DataFrame多列批量运算挑战

在数据分析和处理中,我们经常需要对Pandas DataFrame中的多个列执行相同的算术运算。例如,可能需要将某个基准列的值从一组目标列中减去,然后再加上另一个参考列的值。手动逐列编写这样的操作(如 df['C'] = df['C'] - df['B'] + df['A'],然后对 D 和 E 重复)不仅冗长,而且效率低下,尤其当涉及的列数很多时。本教程将介绍两种更优雅、更高效的解决方案,帮助您简化代码并提升性能。

方法一:使用 DataFrame.eval() 实现多行表达式求值

DataFrame.eval() 方法允许您使用字符串表达式对DataFrame进行计算,其语法更接近数学表达式,并且可以处理多行表达式,从而实现对多列的批量操作。对于复杂的、涉及多个列的运算,eval() 提供了一种简洁且可读性强的解决方案。

示例代码

假设我们有一个DataFrame df,需要将列 C, D, E 分别减去 B 列的值,然后加上 A 列的值。

import pandas as pd

data = {
  "A": [42, 38, 39, 23],
  "B": [45, 30, 15, 65],
  "C": [60, 50, 25, 43],
  "D": [12, 70, 35, 76],
  "E": [87, 90, 45, 43],
  "F": [40, 48, 55, 76],
  "G": [58, 42, 85, 10],
}
df = pd.DataFrame(data)

print("原始DataFrame:")
print(df)

# 使用eval()进行批量操作
df_eval = df.copy() # 创建副本以避免修改原始DataFrame
df_eval = df_eval.eval('''C = C - B + A
D = D - B + A
E = E - B + A
''')

print("\n使用eval()后的DataFrame:")
print(df_eval)

解释

eval() 方法接受一个多行字符串作为参数,其中每一行代表一个赋值表达式。在表达式中,您可以直接引用DataFrame的列名,eval() 会自动识别并将其视为Series对象进行计算。这种方法在内部利用NumExpr库进行优化,对于大型数据集可以提供显著的性能提升。它将多个独立的赋值操作合并为一个高效的内部计算过程。

方法二:利用链式 add() 和 sub() 进行向量化操作

Pandas的Series和DataFrame对象支持向量化操作,这意味着您可以对整个列或DataFrame执行算术运算,而无需编写显式的循环。通过链式调用 add() 和 sub() 等方法,我们可以构建出高效且表达力强的批量操作。这种方法特别适用于当多个目标列需要应用相同的偏移量或变换时。

Otter.ai
Otter.ai

一个自动的会议记录和笔记工具,会议内容生成和实时转录

下载

示例代码

我们将使用与上述相同的数据集,通过链式方法实现相同的运算。

import pandas as pd

data = {
  "A": [42, 38, 39, 23],
  "B": [45, 30, 15, 65],
  "C": [60, 50, 25, 43],
  "D": [12, 70, 35, 76],
  "E": [87, 90, 45, 43],
  "F": [40, 48, 55, 76],
  "G": [58, 42, 85, 10],
}
df = pd.DataFrame(data)

# print("原始DataFrame:") # 原始DataFrame已在eval示例中打印
# print(df)

# 使用链式add/sub进行批量操作
df_chained = df.copy() # 创建副本以避免修改原始DataFrame

# 计算共同的偏移量:A - B
# df['A'].sub(df['B']) 等同于 df['A'] - df['B']
offset = df_chained['A'].sub(df_chained['B'])

# 将偏移量加到目标列上
# df[['C', 'D', 'E']] 是一个包含目标列的子DataFrame
# .add(offset, axis=0) 将 Series 'offset' 按行(axis=0)广播到子DataFrame的每一列
df_chained[['C', 'D', 'E']] = df_chained[['C', 'D', 'E']].add(offset, axis=0)

print("\n使用链式add/sub后的DataFrame:")
print(df_chained)

解释

这种方法的核心在于利用Pandas的广播机制。首先,我们计算出所有目标列都需要共享的共同偏移量 A - B,这会得到一个Series对象 offset。然后,我们选择目标列 df_chained[['C', 'D', 'E']],并使用 .add() 方法将 offset Series 添加到这些列上。axis=0 参数确保 offset Series 的值按行与目标DataFrame的每一列对齐并相加。这种方式非常直观,且充分利用了Pandas底层的优化,提供了出色的性能。

两种方法的比较与选择

  • DataFrame.eval():
    • 优点: 语法简洁,更接近自然语言或数学表达式,尤其适合处理多行且逻辑复杂的表达式。对于大型DataFrame,它通常能提供更好的性能,因为它利用NumExpr库进行优化。
    • 缺点: 字符串表达式可能在某些情况下难以调试。此外,应避免在eval()中使用不受信任的用户输入,以防潜在的安全风险。
  • 链式 add()/sub():
    • 优点: 代码更具Pandas风格,显式调用方法使得操作流程清晰。对于本例中这种“对多列应用相同操作”的场景,通过计算一个公共偏移量并进行广播,代码简洁高效。易于理解其向量化原理。
    • 缺点: 对于非常复杂的、涉及不同运算逻辑的多列操作,可能需要更复杂的链式调用或分步操作。

性能考量: 对于大多数常见的数据集大小,这两种方法都比传统的Python循环快得多。在极大规模的数据集上,eval() 可能会因其底层的NumExpr优化而略胜一筹。然而,在实际应用中,选择哪种方法更多取决于代码的可读性、维护性以及个人或团队的偏好。

总结

Pandas为DataFrame中的批量算术运算提供了多种高效且灵活的工具。DataFrame.eval() 提供了一种简洁的字符串表达式方式,适用于复杂的多行逻辑。而链式调用 add() 和 sub() 等方法则通过向量化和广播机制,为重复的、结构化的运算提供了清晰高效的解决方案。掌握这两种方法,将使您能够更有效地处理数据,编写出更简洁、更专业的Pandas代码。在实际工作中,建议根据具体任务的复杂性、代码的可读性要求以及性能需求来选择最适合的方法。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

WorkBuddy
WorkBuddy

腾讯云推出的AI原生桌面智能体工作台

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
Python 时间序列分析与预测
Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧,涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估,以及基于实际业务场景的时间序列项目实操,帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

81

2025.12.04

Python 数据清洗与预处理实战
Python 数据清洗与预处理实战

本专题系统讲解 Python 在数据清洗与预处理中的核心技术,包括使用 Pandas 进行缺失值处理、异常值检测、数据格式化、特征工程与数据转换,结合 NumPy 高效处理大规模数据。通过实战案例,帮助学习者掌握 如何处理混乱、不完整数据,为后续数据分析与机器学习模型训练打下坚实基础。

33

2026.01.31

js 字符串转数组
js 字符串转数组

js字符串转数组的方法:1、使用“split()”方法;2、使用“Array.from()”方法;3、使用for循环遍历;4、使用“Array.split()”方法。本专题为大家提供js字符串转数组的相关的文章、下载、课程内容,供大家免费下载体验。

761

2023.08.03

js截取字符串的方法
js截取字符串的方法

js截取字符串的方法有substring()方法、substr()方法、slice()方法、split()方法和slice()方法。本专题为大家提供字符串相关的文章、下载、课程内容,供大家免费下载体验。

221

2023.09.04

java基础知识汇总
java基础知识汇总

java基础知识有Java的历史和特点、Java的开发环境、Java的基本数据类型、变量和常量、运算符和表达式、控制语句、数组和字符串等等知识点。想要知道更多关于java基础知识的朋友,请阅读本专题下面的的有关文章,欢迎大家来php中文网学习。

1569

2023.10.24

字符串介绍
字符串介绍

字符串是一种数据类型,它可以是任何文本,包括字母、数字、符号等。字符串可以由不同的字符组成,例如空格、标点符号、数字等。在编程中,字符串通常用引号括起来,如单引号、双引号或反引号。想了解更多字符串的相关内容,可以阅读本专题下面的文章。

651

2023.11.24

java读取文件转成字符串的方法
java读取文件转成字符串的方法

Java8引入了新的文件I/O API,使用java.nio.file.Files类读取文件内容更加方便。对于较旧版本的Java,可以使用java.io.FileReader和java.io.BufferedReader来读取文件。在这些方法中,你需要将文件路径替换为你的实际文件路径,并且可能需要处理可能的IOException异常。想了解更多java的相关内容,可以阅读本专题下面的文章。

1228

2024.03.22

php中定义字符串的方式
php中定义字符串的方式

php中定义字符串的方式:单引号;双引号;heredoc语法等等。想了解更多字符串的相关内容,可以阅读本专题下面的文章。

1205

2024.04.29

TypeScript类型系统进阶与大型前端项目实践
TypeScript类型系统进阶与大型前端项目实践

本专题围绕 TypeScript 在大型前端项目中的应用展开,深入讲解类型系统设计与工程化开发方法。内容包括泛型与高级类型、类型推断机制、声明文件编写、模块化结构设计以及代码规范管理。通过真实项目案例分析,帮助开发者构建类型安全、结构清晰、易维护的前端工程体系,提高团队协作效率与代码质量。

26

2026.03.13

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
最新Python教程 从入门到精通
最新Python教程 从入门到精通

共4课时 | 22.5万人学习

Django 教程
Django 教程

共28课时 | 5万人学习

SciPy 教程
SciPy 教程

共10课时 | 1.9万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号