Pandas DataFrame 高效批量更新指定位置值教程

霞舞

发布时间：2025-12-04 13:38:22

906人浏览过

来源于php中文网

原创

Pandas DataFrame 高效批量更新指定位置值教程

本教程旨在解决pandas dataframe中批量更新特定单元格值时效率低下的问题。通过介绍迭代更新的性能瓶颈，并提出一种利用dataframe底层numpy数组和标签到位置映射的优化方法，实现对指定行/列标签对的快速批量赋值，显著提升大数据量操作的执行速度。

问题描述与传统方法的局限性

在处理Pandas DataFrame时，我们经常需要更新多个特定位置的单元格值。一种直观但效率低下的方法是使用循环逐个设置：

import pandas as pd
import numpy as np

# 模拟一个大型DataFrame
column_names = np.array(range(100))
np.random.shuffle(column_names)
row_names = np.array(range(100))
np.random.shuffle(row_names)
df = pd.DataFrame(columns=column_names, index=row_names)

# 待设置的行和列标签（这里使用整数作为标签）
ix = np.random.randint(0, 100, 1000)
iy = np.random.randint(0, 100, 1000)

# 迭代更新，耗时较长
# for k in range(len(ix)):
#     df.loc[ix[k], iy[k]] = 1

对于大型数据集和大量的更新操作，上述循环方式会非常慢。例如，在包含100x100个元素且更新1000个位置的场景下，循环可能需要0.35秒。

另一种尝试是利用Pandas的 .loc 索引器进行批量赋值：

# 尝试使用 df.loc[ix, iy] = 1
# df.loc[ix, iy] = 1

虽然这种方法速度极快（可能仅需0.035秒），但它并不能实现我们期望的“一对一”更新。df.loc[ix, iy] = 1 会将 ix 中所有行标签与 iy 中所有列标签的笛卡尔积所对应的所有单元格都设置为1，而不是仅仅更新 (ix[k], iy[k]) 这样的对应位置。因此，我们需要一种既快速又能准确更新指定位置的方法。

高效解决方案：利用NumPy数组进行矢量化更新

Pandas DataFrame的底层数据结构实际上是NumPy数组。直接操作NumPy数组通常比通过Pandas的标签索引器进行操作更快，因为它避免了额外的开销，并能充分利用NumPy的矢量化特性。然而，DataFrame通常使用非整数的标签（如字符串）作为行索引和列名，而NumPy数组只能通过整数位置进行索引。因此，关键在于将DataFrame的标签转换为对应的整数位置。

核心思想：

获取DataFrame行索引和列名的整数位置映射。
将需要更新的行标签和列标签列表转换为其对应的整数位置列表。
使用这些整数位置直接对DataFrame的底层NumPy数组进行批量赋值。

实现步骤

1. 构建标签到位置的映射 首先，我们需要创建两个 pd.Series，分别将DataFrame的行索引和列名映射到它们的整数位置。

# 假设df是我们的DataFrame
# cols = pd.Series(range(df.shape[1]), index=df.columns)
# idx = pd.Series(range(df.shape[0]), index=df.index)

这里，df.shape[1] 是列的数量，df.shape[0] 是行的数量。

MemFree

MemFree - 来自知识库和互联网的混合AI搜索，更快获取准确答案

下载

2. 获取目标标签对应的位置索引 接下来，使用 reindex 方法将我们想要更新的 ix（行标签列表）和 iy（列标签列表）转换为它们在DataFrame中的实际整数位置。

# ix_pos = idx.reindex(ix)
# iy_pos = cols.reindex(iy)

idx.reindex(ix) 会查找 ix 中每个标签在 idx Series中的值（即其对应的整数位置）。iy_pos 同理。

3. 直接更新底层NumPy数组 最后，利用得到的整数位置索引，直接对DataFrame的 .values 属性（即底层NumPy数组）进行赋值。

# df.values[ix_pos, iy_pos] = 1

这种高级索引操作在NumPy中是高度优化的，可以实现高效的批量更新。

示例代码

以下是一个完整的示例，演示如何高效地批量设置DataFrame中指定位置的值：

import pandas as pd
import numpy as np

# 1. 初始DataFrame（使用非整数标签以便更好地说明）
df = pd.DataFrame(index=['a', 'b', 'c', 'd', 'e'],
                  columns=['A', 'B', 'C', 'D', 'E'])

print("原始DataFrame:")
print(df)
print("-" * 30)

# 2. 定义需要更新的行标签和列标签列表
# 例如，我们想设置 (a, A), (b, C), (c, A), (d, E) 这几个位置的值为1
ix_labels = ['a', 'b', 'c', 'd']
iy_labels = ['A', 'C', 'A', 'E']

# 3. 构建标签到位置的映射
# map DataFrame's column labels to their integer positions
cols_map = pd.Series(range(df.shape[1]), index=df.columns)
# map DataFrame's index labels to their integer positions
idx_map = pd.Series(range(df.shape[0]), index=df.index)

# 4. 获取目标标签对应的位置索引
# Convert the list of row labels to their integer positions
target_row_pos = idx_map.reindex(ix_labels)
# Convert the list of column labels to their integer positions
target_col_pos = cols_map.reindex(iy_labels)

print("目标行标签对应的整数位置:", target_row_pos.tolist())
print("目标列标签对应的整数位置:", target_col_pos.tolist())
print("-" * 30)

# 5. 直接更新底层NumPy数组
# 使用NumPy的高级索引功能，对底层数组进行赋值
df.values[target_row_pos, target_col_pos] = 1

print("更新后的DataFrame:")
print(df)

输出结果:

原始DataFrame:
     A    B    C    D    E
a  NaN  NaN  NaN  NaN  NaN
b  NaN  NaN  NaN  NaN  NaN
c  NaN  NaN  NaN  NaN  NaN
d  NaN  NaN  NaN  NaN  NaN
e  NaN  NaN  NaN  NaN  NaN
------------------------------
目标行标签对应的整数位置: [0, 1, 2, 3]
目标列标签对应的整数位置: [0, 2, 0, 4]
------------------------------
更新后的DataFrame:
     A    B    C    D    E
a    1  NaN  NaN  NaN  NaN
b  NaN  NaN    1  NaN  NaN
c    1  NaN  NaN  NaN  NaN
d  NaN  NaN  NaN  NaN    1
e  NaN  NaN  NaN  NaN  NaN

性能优势分析

通过直接操作底层NumPy数组，我们充分利用了NumPy的C语言实现和矢量化操作，避免了Python循环的开销以及Pandas高级索引器的额外逻辑判断。相比于逐个元素迭代赋值，这种方法在处理大量更新时，通常能带来数量级的性能提升（例如，从0.35秒降至0.035秒，提速10倍）。这对于大数据分析和处理至关重要。

注意事项与最佳实践

标签一致性： 确保 ix_labels 和 iy_labels 列表的长度相同，并且它们之间的元素是一一对应的关系，即 (ix_labels[k], iy_labels[k]) 构成一个需要更新的单元格。
标签存在性： ix_labels 中的所有标签必须存在于DataFrame的行索引中，iy_labels 中的所有标签必须存在于DataFrame的列名中。如果存在不存在的标签，reindex 会返回 NaN，这在后续的NumPy索引中会导致错误。在实际应用中，可能需要预先检查标签的有效性。
直接修改： .values 返回的是底层NumPy数组的视图（在大多数情况下），直接对其修改会影响原始DataFrame。这是我们期望的行为，但需要在使用时明确这一点。
数据类型： 这种方法适用于更新单一类型的值。如果需要更新不同数据类型的值，Pandas会自动进行类型推断，但直接操作NumPy数组时，可能需要注意其统一的数据类型。

总结

当需要在Pandas DataFrame中高效地批量更新指定（行标签，列标签）对的单元格时，应避免使用Python循环。通过将DataFrame的行/列标签映射到其整数位置，然后利用这些位置直接对DataFrame的底层NumPy数组进行矢量化赋值，可以显著提升性能。这种方法是处理大数据量更新场景下的一个强大且高效的解决方案。

Python元组为什么比列表快_数据结构差异

Python游戏开发中Tkinter子弹渲染与输入响应问题的完整修复指南

Python正则替换回调_re.sub回调函数用法

Python模块与包的区别_import机制深入解析

Python实现比较运算符_富比较方法实践

相关专题

C语言变量命名

c语言变量名规则是：1、变量名以英文字母开头；2、变量名中的字母是区分大小写的；3、变量名不能是关键字；4、变量名中不能包含空格、标点符号和类型说明符。php中文网还提供c语言变量的相关下载、相关课程等内容，供大家免费下载使用。

410

2023.06.20

c语言入门自学零基础

C语言是当代人学习及生活中的必备基础知识，应用十分广泛，本专题为大家c语言入门自学零基础的相关文章，以及相关课程，感兴趣的朋友千万不要错过了。

636

2023.07.25

c语言运算符的优先级顺序

c语言运算符的优先级顺序是括号运算符 > 一元运算符 > 算术运算符 > 移位运算符 > 关系运算符 > 位运算符 > 逻辑运算符 > 赋值运算符 > 逗号运算符。本专题为大家提供c语言运算符相关的各种文章、以及下载和课程。

362

2023.08.02

c语言数据结构

数据结构是指将数据按照一定的方式组织和存储的方法。它是计算机科学中的重要概念，用来描述和解决实际问题中的数据组织和处理问题。数据结构可以分为线性结构和非线性结构。线性结构包括数组、链表、堆栈和队列等，而非线性结构包括树和图等。php中文网给大家带来了相关的教程以及文章，欢迎大家前来学习阅读。

263

2023.08.09

c语言random函数用法

c语言random函数用法：1、random.random，随机生成（0,1）之间的浮点数；2、random.randint，随机生成在范围之内的整数，两个参数分别表示上限和下限；3、random.randrange，在指定范围内，按指定基数递增的集合中获得一个随机数；4、random.choice，从序列中随机抽选一个数；5、random.shuffle，随机排序。

629

2023.09.05

c语言const用法

const是关键字，可以用于声明常量、函数参数中的const修饰符、const修饰函数返回值、const修饰指针。详细介绍：1、声明常量，const关键字可用于声明常量，常量的值在程序运行期间不可修改，常量可以是基本数据类型，如整数、浮点数、字符等，也可是自定义的数据类型；2、函数参数中的const修饰符，const关键字可用于函数的参数中，表示该参数在函数内部不可修改等等。

561

2023.09.20

c语言get函数的用法

get函数是一个用于从输入流中获取字符的函数。可以从键盘、文件或其他输入设备中读取字符，并将其存储在指定的变量中。本文介绍了get函数的用法以及一些相关的注意事项。希望这篇文章能够帮助你更好地理解和使用get函数。

668

2023.09.20

c数组初始化的方法

c语言数组初始化的方法有直接赋值法、不完全初始化法、省略数组长度法和二维数组初始化法。详细介绍：1、直接赋值法，这种方法可以直接将数组的值进行初始化；2、不完全初始化法，。这种方法可以在一定程度上节省内存空间；3、省略数组长度法，这种方法可以让编译器自动计算数组的长度；4、二维数组初始化法等等。

617

2023.09.22

Kotlin Android模块化架构与组件化开发实践

本专题围绕 Kotlin 在 Android 应用开发中的架构实践展开，重点讲解模块化设计与组件化开发的实现思路。内容包括项目模块拆分策略、公共组件封装、依赖管理优化、路由通信机制以及大型项目的工程化管理方法。通过真实项目案例分析，帮助开发者构建结构清晰、易扩展且维护成本低的 Android 应用架构体系，提升团队协作效率与项目迭代速度。

2026.03.09

热门下载

网站特效

网站源码

网站素材

前端模板