0

0

Pandas教程:基于多列范围与条件动态创建新列

霞舞

霞舞

发布时间:2025-12-03 13:07:23

|

703人浏览过

|

来源于php中文网

原创

Pandas教程:基于多列范围与条件动态创建新列

本教程详细介绍了如何使用pandas库,根据dataframe中指定列范围内的值是否存在特定条件(例如大于0),来动态创建并填充一个新的列。文章将重点讲解如何利用`df.filter()`结合正则表达式进行灵活的列选择,并通过`any()`和`numpy.where()`实现复杂的条件逻辑判断,最终生成如“y/n”响应者标记的新列,提升数据处理效率与灵活性。

引言:Pandas中基于复杂条件创建新列的挑战

在数据分析实践中,我们经常需要根据现有数据生成新的特征列。当条件涉及DataFrame中多个列,且这些列需要根据某种模式(而非明确列表)进行选择时,这一任务会变得更具挑战性。例如,我们需要检查一系列“事件”列中是否有任何一个值满足特定标准(如大于0),然后据此标记一个“响应者”列。本教程将深入探讨如何利用Pandas的强大功能,高效且灵活地解决这类问题。

核心方法:动态列选择与条件逻辑

解决上述问题的关键在于两个方面:

  1. 动态选择列: 避免手动列出所有目标列,而是通过模式匹配(如正则表达式)来选取。
  2. 应用条件逻辑: 在选定的列上执行条件判断,并聚合结果以生成最终的布尔值,进而创建新列。

我们将使用df.filter()进行动态列选择,结合any(axis=1)进行行级别的条件判断,并最终通过numpy.where()将布尔结果转换为我们所需的值。

示例数据准备

首先,我们创建一个模拟的DataFrame来演示这个过程:

import pandas as pd
import numpy as np

# 示例DataFrame
data = {
    'Animal_ID': ['a1', 'a2', 'a3', 'a4'],
    'weight': [50, 52, 75, 53],
    'Project': ['p1', 'p2', 'p1', 'p2'],
    'Exp_type': ['Acute', 'chronic', 'Acute', 'chronic'],
    'researcher': ['alex', 'mat', 'alex', 'mat'],
    'events_d1': [0, 0, 1, 0],
    'events_d2': [0, 1, np.nan, np.nan],
    'events_d3': [0, 1, 2, np.nan],
    'events_d4': [4, 5, np.nan, 0]
}
df = pd.DataFrame(data)
print("原始DataFrame:")
print(df)

输出:

AI Web Designer
AI Web Designer

AI网页设计师,快速生成个性化的网站设计

下载
原始DataFrame:
  Animal_ID  weight Project Exp_type researcher  events_d1  events_d2  events_d3  events_d4
0        a1      50      p1    Acute       alex          0        0.0        0.0        4.0
1        a2      52      p2  chronic        mat          0        1.0        1.0        5.0
2        a3      75      p1    Acute       alex          1        NaN        2.0        NaN
3        a4      53      p2  chronic        mat          0        NaN        NaN        0.0

步骤一:使用 df.filter() 动态选择目标列

我们的目标是检查 events_d1、events_d2 和 events_d3 列,但不包括 events_d4。df.filter() 方法允许我们使用正则表达式来匹配列名。

为了排除 events_d4,我们可以使用正则表达式 events_d[^4]。这里的 [^4] 表示匹配除了数字 4 之外的任何字符。

# 筛选出不包含 'events_d4' 的 'events_d' 系列列
event_columns = df.filter(regex="events_d[^4]")
print("\n筛选出的事件列:")
print(event_columns)

输出:

筛选出的事件列:
   events_d1  events_d2  events_d3
0          0        0.0        0.0
1          0        1.0        1.0
2          1        NaN        2.0
3          0        NaN        NaN

步骤二:应用条件并聚合结果

现在我们已经得到了感兴趣的列,接下来需要检查每一行中这些列是否存在至少一个大于0的值。

  1. 条件判断: 对 event_columns 中的每个元素执行 > 0 的判断,这将返回一个布尔型DataFrame。
  2. 行级聚合: 使用 .any(axis=1) 方法检查每一行中是否有任何一个 True 值。axis=1 表示沿行方向操作。any() 会忽略 NaN 值,这对于我们的场景通常是期望的行为(即 NaN 不算作“存在事件”)。
# 检查筛选出的列中是否有任何值大于0
# .any(axis=1) 会在行级别进行判断,如果一行中至少有一个True,则返回True
m = event_columns.gt(0).any(axis=1)
print("\n条件判断结果 (布尔Series):")
print(m)

输出:

条件判断结果 (布尔Series):
0    False
1     True
2     True
3    False
dtype: bool

这里 gt(0) 是 > 的等价方法,可以更好地处理 NaN 值(NaN > 0 结果为 False)。

步骤三:使用 numpy.where() 创建新列

最后一步是根据布尔Series m 的结果,在原始DataFrame中创建新的 responder 列。numpy.where() 函数非常适合这种条件赋值:np.where(condition, value_if_true, value_if_false)。

# 根据布尔Series 'm' 创建 'responder' 列
df['responder'] = np.where(m, 'y', 'n')

print("\n最终DataFrame:")
print(df)

输出:

最终DataFrame:
  Animal_ID  weight Project Exp_type researcher  events_d1  events_d2  events_d3  events_d4 responder
0        a1      50      p1    Acute       alex          0        0.0        0.0        4.0         n
1        a2      52      p2  chronic        mat          0        1.0        1.0        5.0         y
2        a3      75      p1    Acute       alex          1        NaN        2.0        NaN         y
3        a4      53      p2  chronic        mat          0        NaN        NaN        0.0         n

完整代码示例

将上述步骤整合到一起,得到完整的解决方案:

import pandas as pd
import numpy as np

# 示例DataFrame
data = {
    'Animal_ID': ['a1', 'a2', 'a3', 'a4'],
    'weight': [50, 52, 75, 53],
    'Project': ['p1', 'p2', 'p1', 'p2'],
    'Exp_type': ['Acute', 'chronic', 'Acute', 'chronic'],
    'researcher': ['alex', 'mat', 'alex', 'mat'],
    'events_d1': [0, 0, 1, 0],
    'events_d2': [0, 1, np.nan, np.nan],
    'events_d3': [0, 1, 2, np.nan],
    'events_d4': [4, 5, np.nan, 0]
}
df = pd.DataFrame(data)

# 1. 动态选择目标列(排除 events_d4)
# regex="events_d[^4]" 匹配 'events_d' 后跟除了 '4' 之外的任何字符
event_columns_to_check = df.filter(regex="events_d[^4]")

# 2. 对选定列应用条件 (大于0),并进行行级聚合 (任意一个为True)
# .gt(0) 检查每个元素是否大于0
# .any(axis=1) 检查每行中是否有任何一个True值(即至少一个事件大于0)
condition_met = event_columns_to_check.gt(0).any(axis=1)

# 3. 使用 numpy.where 根据条件创建新的 'responder' 列
df['responder'] = np.where(condition_met, 'y', 'n')

print("最终生成的DataFrame:")
print(df)

注意事项与扩展

  1. 正则表达式的灵活性: df.filter(regex=...) 是一个非常强大的工具,可以根据复杂的模式匹配列名。例如,如果你想选择所有以 events_d 开头且数字在1到3之间的列,可以使用 regex="events_d[1-3]"。
  2. 处理 NaN 值: any() 和 all() 在处理布尔值时会默认忽略 NaN。这意味着如果一行的所有非 NaN 值都为 False,或者所有非 NaN 值都为 True,则 any() 或 all() 会返回相应的结果。如果所有值都是 NaN,any() 会返回 False,all() 会返回 True。在我们的场景中,event_columns.gt(0) 会将 NaN 转换为 False,因此 any(axis=1) 会正确地处理它们。
  3. 其他条件: 如果你需要检查其他条件(例如,所有值都大于0,或者特定值范围),可以替换 .gt(0) 为 .eq(value) (等于), .lt(value) (小于), .between(lower, upper) (在范围内) 等,并相应地调整聚合方法(例如使用 all(axis=1))。
  4. 性能考虑: 对于非常大的DataFrame,这种矢量化操作通常比使用 apply() 结合 lambda 函数或循环要高效得多。

总结

本教程展示了如何利用Pandas的filter()、any()以及numpy.where()组合,以一种高度灵活和高效的方式,根据多列范围内的复杂条件动态创建新列。这种方法不仅避免了手动列举列名的繁琐,还提供了强大的正则表达式匹配能力,使得在面对动态或模式化的列集时,数据清洗和特征工程变得更加便捷和可维护。掌握这些技巧将显著提升你在Python数据分析中的生产力。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

WorkBuddy
WorkBuddy

腾讯云推出的AI原生桌面智能体工作台

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
js正则表达式
js正则表达式

php中文网为大家提供各种js正则表达式语法大全以及各种js正则表达式使用的方法,还有更多js正则表达式的相关文章、相关下载、相关课程,供大家免费下载体验。

531

2023.06.20

正则表达式不包含
正则表达式不包含

正则表达式,又称规则表达式,,是一种文本模式,包括普通字符和特殊字符,是计算机科学的一个概念。正则表达式使用单个字符串来描述、匹配一系列匹配某个句法规则的字符串,通常被用来检索、替换那些符合某个模式的文本。php中文网给大家带来了有关正则表达式的相关教程以及文章,希望对大家能有所帮助。

258

2023.07.05

java正则表达式语法
java正则表达式语法

java正则表达式语法是一种模式匹配工具,它非常有用,可以在处理文本和字符串时快速地查找、替换、验证和提取特定的模式和数据。本专题提供java正则表达式语法的相关文章、下载和专题,供大家免费下载体验。

766

2023.07.05

java正则表达式匹配字符串
java正则表达式匹配字符串

在Java中,我们可以使用正则表达式来匹配字符串。本专题为大家带来java正则表达式匹配字符串的相关内容,帮助大家解决问题。

219

2023.08.11

正则表达式空格
正则表达式空格

正则表达式空格可以用“s”来表示,它是一个特殊的元字符,用于匹配任意空白字符,包括空格、制表符、换行符等。本专题为大家提供正则表达式相关的文章、下载、课程内容,供大家免费下载体验。

357

2023.08.31

Python爬虫获取数据的方法
Python爬虫获取数据的方法

Python爬虫可以通过请求库发送HTTP请求、解析库解析HTML、正则表达式提取数据,或使用数据抓取框架来获取数据。更多关于Python爬虫相关知识。详情阅读本专题下面的文章。php中文网欢迎大家前来学习。

293

2023.11.13

正则表达式空格如何表示
正则表达式空格如何表示

正则表达式空格可以用“s”来表示,它是一个特殊的元字符,用于匹配任意空白字符,包括空格、制表符、换行符等。想了解更多正则表达式空格怎么表示的内容,可以访问下面的文章。

245

2023.11.17

正则表达式中如何匹配数字
正则表达式中如何匹配数字

正则表达式中可以通过匹配单个数字、匹配多个数字、匹配固定长度的数字、匹配整数和小数、匹配负数和匹配科学计数法表示的数字的方法匹配数字。更多关于正则表达式的相关知识详情请看本专题下面的文章。php中文网欢迎大家前来学习。

547

2023.12.06

TypeScript类型系统进阶与大型前端项目实践
TypeScript类型系统进阶与大型前端项目实践

本专题围绕 TypeScript 在大型前端项目中的应用展开,深入讲解类型系统设计与工程化开发方法。内容包括泛型与高级类型、类型推断机制、声明文件编写、模块化结构设计以及代码规范管理。通过真实项目案例分析,帮助开发者构建类型安全、结构清晰、易维护的前端工程体系,提高团队协作效率与代码质量。

26

2026.03.13

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
最新Python教程 从入门到精通
最新Python教程 从入门到精通

共4课时 | 22.5万人学习

Django 教程
Django 教程

共28课时 | 5万人学习

SciPy 教程
SciPy 教程

共10课时 | 1.9万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号