Pandas DataFrame：高效将多列行数据聚合成键与值列表

DDD

发布时间：2025-12-04 12:18:17

777人浏览过

来源于php中文网

原创

Pandas DataFrame：高效将多列行数据聚合成键与值列表

本教程将详细介绍如何使用pandas库将dataframe中的多列数值数据高效地转换为以特定列为键，其余数值列聚合成一个列表的新dataframe结构。文章通过实例代码演示了如何利用iloc、apply和concat等pandas函数，避免了低效的循环操作，从而优化数据处理流程，提高性能。

引言：数据重塑的需求

在数据分析和处理过程中，我们经常会遇到需要将DataFrame中多个相关数值列合并成一个列表列的场景。这种重塑操作常见于简化数据结构、为后续的API调用准备数据，或是在某些数据库操作中将多维数据扁平化。例如，一个DataFrame可能包含一个标识符列（如id）、一个描述性列（如name），以及多个表示不同测量或属性的数值列。

考虑以下原始DataFrame结构：

import pandas as pd

data = {
    'id': [1, 2, 3],
    'name': ['AAA', 'BBB', 'CCC'],
    'value1': [1.0, 2.0, 3.0],
    'value2': [1.5, 2.3, 3.6],
    'value3': [1.8, 2.5, 3.7]
}
df = pd.DataFrame(data)
print("原始DataFrame:")
print(df)

输出：

原始DataFrame:
   id name  value1  value2  value3
0   1  AAA     1.0     1.5     1.8
1   2  BBB     2.0     2.3     2.5
2   3  CCC     3.0     3.6     3.7

我们的目标是将value1、value2、value3这三列的数据，在保持id和name列不变的基础上，聚合成一个名为value的列表列，形成如下所示的结构：

   id name            value
0   1  AAA  [1.0, 1.5, 1.8]
1   2  BBB  [2.0, 2.3, 2.5]
2   3  CCC  [3.0, 3.6, 3.7]

低效方法及其弊端

初学者可能会倾向于使用循环（如for循环）遍历DataFrame的每一行，手动构建列表并添加新列。然而，对于Pandas DataFrame而言，循环操作通常效率低下，尤其是在处理大型数据集时，会导致显著的性能瓶颈。Pandas提供了高度优化的向量化操作，能够以C语言级别的性能执行数据处理任务，因此应尽量避免显式循环。

Pandas高效解决方案

Pandas提供了一系列强大的函数，可以高效地完成这种数据重塑任务。核心思路是：首先，分离出作为键的列和需要聚合的数值列；然后，对数值列进行行级别的列表聚合；最后，将处理后的数值列与键列重新合并。

以下是实现这一目标的具体步骤和代码示例：

1. 分离DataFrame的键列和值列

我们可以使用iloc（基于整数位置的索引）来选择DataFrame的不同部分。

选择键列： df.iloc[:, :2] 会选择从第一列到第二列（不包括第三列），即id和name列。
选择值列： df.iloc[:, 2:] 会选择从第三列到最后一列，即value1、value2和value3列。

2. 对值列进行行级别聚合

对选定的值列（df.iloc[:, 2:]），我们可以使用.apply(list, axis=1)方法。

Sora

Sora是OpenAI发布的一种文生视频AI大模型，可以根据文本指令创建现实和富有想象力的场景。

下载

apply(list, axis=1)：这个方法会将list函数应用到DataFrame的每一行（axis=1表示按行操作）。对于每一行，它会将该行的所有列值收集到一个列表中。
.rename('value')：聚合后的结果是一个Series，我们需要给这个新的Series一个有意义的名字，例如'value'。

3. 合并结果

最后，使用pd.concat()函数将分离出的键列和新生成的列表列横向合并。

pd.concat([part1, part2], axis=1)：part1是原始的键列DataFrame，part2是新生成的列表Series。axis=1表示按列合并。

完整代码示例

import pandas as pd

# 原始DataFrame
data = {
    'id': [1, 2, 3],
    'name': ['AAA', 'BBB', 'CCC'],
    'value1': [1.0, 2.0, 3.0],
    'value2': [1.5, 2.3, 3.6],
    'value3': [1.8, 2.5, 3.7]
}
df = pd.DataFrame(data)

# 解决方案
result_df = pd.concat([
    df.iloc[:, :2],  # 选择前两列 (id, name)
    df.iloc[:, 2:].apply(list, axis=1).rename('value') # 选择后续值列，转换为列表，并命名为'value'
], axis=1) # 按列合并

print("\n转换后的DataFrame:")
print(result_df)

输出：

转换后的DataFrame:
   id name            value
0   1  AAA  [1.0, 1.5, 1.8]
1   2  BBB  [2.0, 2.3, 2.5]
2   3  CCC  [3.0, 3.6, 3.7]

注意事项与最佳实践

性能优势： 这种方法利用了Pandas的内置优化，避免了Python层面的循环，对于大数据集具有显著的性能优势。
列选择的灵活性：
- 如果键列和值列的位置不固定，或者需要通过名称选择，可以使用df[['col1', 'col2']]来选择特定列，或df.drop(columns=['col_to_drop'])来排除列。
- 例如，如果只想保留name和value列，可以将第一部分改为df[['name']]。
处理缺失值（NaN）： 在进行apply(list)操作之前，需要考虑值列中是否存在缺失值（NaN）。
- 如果希望列表只包含非NaN值，可以先使用dropna(axis=1, how='all')删除全为NaN的列，或者apply(lambda x: x.dropna().tolist(), axis=1)在行级别删除NaN。
- 如果希望NaN值保留在列表中，则无需额外处理。
- 如果希望用特定值填充NaN，可以使用df.fillna(value)。
```
# 示例：处理NaN
df_with_nan = pd.DataFrame({
'id': [1, 2], 'name': ['A', 'B'],
'v1': [1.0, 2.0], 'v2': [None, 2.5], 'v3': [3.0, None]
})
# 方法一：在行级别过滤NaN
result_filtered_nan = pd.concat([
df_with_nan.iloc[:, :2],
df_with_nan.iloc[:, 2:].apply(lambda x: x.dropna().tolist(), axis=1).rename('value')
], axis=1)
print("\n处理NaN（过滤）后的DataFrame:")
print(result_filtered_nan)
```
方法二：填充NaN

result_filled_nan = pd.concat([ df_with_nan.iloc[:, :2], df_with_nan.iloc[:, 2:].fillna(0).apply(list, axis=1).rename('value') ], axis=1) print("\n处理NaN（填充0）后的DataFrame:") print(result_filled_nan)

动态列选择： 如果值列的数量或名称不固定，可以通过编程方式确定它们。例如，可以通过排除非数值列来选择所有数值列：

value_cols = df.select_dtypes(include=['number']).columns.tolist()
key_cols = [col for col in df.columns if col not in value_cols]

result_dynamic = pd.concat([
    df[key_cols],
    df[value_cols].apply(list, axis=1).rename('value')
], axis=1)
print("\n动态选择列转换后的DataFrame:")
print(result_dynamic)

总结

本教程详细阐述了如何使用Pandas高效地将DataFrame的多列数值数据聚合成一个列表列。通过利用iloc进行列选择，apply(list, axis=1)进行行级聚合，以及pd.concat进行最终合并，我们能够以简洁且高性能的方式完成数据重塑。掌握这种技术对于处理复杂数据集和优化数据管道至关重要，它使得Pandas在数据清洗、特征工程和数据准备阶段更加强大和灵活。在实际应用中，务必根据具体需求考虑缺失值处理和列选择策略，以确保数据转换的准确性和健壮性。

Python KNN怎么写_K近邻算法核心原理与多种距离度量计算公式选择

Python防止命令注入_subprocess安全用法

Python virtualenv怎么用_virtualenv虚拟环境安装与激活方法

Python循环里的else怎么用_正常结束与被打断的逻辑处理

Python协程里的同步代码阻塞_异步函数中调用耗时同步函数导致整个事件循环卡死解决

相关专题

C语言变量命名

c语言变量名规则是：1、变量名以英文字母开头；2、变量名中的字母是区分大小写的；3、变量名不能是关键字；4、变量名中不能包含空格、标点符号和类型说明符。php中文网还提供c语言变量的相关下载、相关课程等内容，供大家免费下载使用。

410

2023.06.20

c语言入门自学零基础

C语言是当代人学习及生活中的必备基础知识，应用十分广泛，本专题为大家c语言入门自学零基础的相关文章，以及相关课程，感兴趣的朋友千万不要错过了。

638

2023.07.25

c语言运算符的优先级顺序

c语言运算符的优先级顺序是括号运算符 > 一元运算符 > 算术运算符 > 移位运算符 > 关系运算符 > 位运算符 > 逻辑运算符 > 赋值运算符 > 逗号运算符。本专题为大家提供c语言运算符相关的各种文章、以及下载和课程。

362

2023.08.02

c语言数据结构

数据结构是指将数据按照一定的方式组织和存储的方法。它是计算机科学中的重要概念，用来描述和解决实际问题中的数据组织和处理问题。数据结构可以分为线性结构和非线性结构。线性结构包括数组、链表、堆栈和队列等，而非线性结构包括树和图等。php中文网给大家带来了相关的教程以及文章，欢迎大家前来学习阅读。

263

2023.08.09

c语言random函数用法

c语言random函数用法：1、random.random，随机生成（0,1）之间的浮点数；2、random.randint，随机生成在范围之内的整数，两个参数分别表示上限和下限；3、random.randrange，在指定范围内，按指定基数递增的集合中获得一个随机数；4、random.choice，从序列中随机抽选一个数；5、random.shuffle，随机排序。

630

2023.09.05

c语言const用法

const是关键字，可以用于声明常量、函数参数中的const修饰符、const修饰函数返回值、const修饰指针。详细介绍：1、声明常量，const关键字可用于声明常量，常量的值在程序运行期间不可修改，常量可以是基本数据类型，如整数、浮点数、字符等，也可是自定义的数据类型；2、函数参数中的const修饰符，const关键字可用于函数的参数中，表示该参数在函数内部不可修改等等。

562

2023.09.20

c语言get函数的用法

get函数是一个用于从输入流中获取字符的函数。可以从键盘、文件或其他输入设备中读取字符，并将其存储在指定的变量中。本文介绍了get函数的用法以及一些相关的注意事项。希望这篇文章能够帮助你更好地理解和使用get函数。

670

2023.09.20

c数组初始化的方法

c语言数组初始化的方法有直接赋值法、不完全初始化法、省略数组长度法和二维数组初始化法。详细介绍：1、直接赋值法，这种方法可以直接将数组的值进行初始化；2、不完全初始化法，。这种方法可以在一定程度上节省内存空间；3、省略数组长度法，这种方法可以让编译器自动计算数组的长度；4、二维数组初始化法等等。

618

2023.09.22

C# ASP.NET Core微服务架构与API网关实践

本专题围绕 C# 在现代后端架构中的微服务实践展开，系统讲解基于 ASP.NET Core 构建可扩展服务体系的核心方法。内容涵盖服务拆分策略、RESTful API 设计、服务间通信、API 网关统一入口管理以及服务治理机制。通过真实项目案例，帮助开发者掌握构建高可用微服务系统的关键技术，提高系统的可扩展性与维护效率。

2026.03.11

热门下载

网站特效

网站源码

网站素材

前端模板