0

0

优化Pandas数据处理:告别慢速循环,拥抱高效Merge

心靈之曲

心靈之曲

发布时间:2025-08-27 12:48:01

|

1010人浏览过

|

来源于php中文网

原创

优化pandas数据处理:告别慢速循环,拥抱高效merge

本教程探讨了Pandas中常见的性能瓶颈:使用itertuples()和apply(axis=1)进行行级数据处理和数据查找。通过一个实际案例,我们将展示如何利用Pandas的向量化操作和merge()函数,将慢速的循环查找和数据整合过程,转换为高效、简洁且可扩展的数据处理方案,显著提升代码性能和可读性。

理解Pandas中的性能瓶颈:行级操作的陷阱

Pandas是一个强大的数据分析库,但其性能表现很大程度上取决于如何使用它。当处理大型数据集时,常见的性能瓶颈往往出现在尝试对DataFrame进行行级迭代和操作时。虽然Python的for循环和Pandas的apply(axis=1)提供了灵活性,但它们通常不是最高效的解决方案,因为它们本质上是基于Python解释器的循环,而非Pandas底层C语言实现的优化操作。

考虑以下场景:我们需要根据df_RoadSegments中的起点ID(RoadSegmentOrigin)从df_Stops中查找对应的经纬度信息,并将其整合到df_RoadSegments中。原始的实现方式可能如下:

import pandas as pd
import io

# 模拟数据加载
road_segments_data = """RoadSegmentOrigin,RoadSegmentDest,trip_id,planned_duration
AREI2,JD4,107_1_D_1,32
JD4,PNG4,107_1_D_1,55
"""
stops_data = """stop_id,stop_code,stop_name,stop_lat,stop_lon,zone_id,stop_url
AREI2,AREI2,AREIAS,41.1591084955401,-8.55577748652738,PRT3,http://www.stcp.pt/pt/viajar/paragens/?t=detalhe&paragem=AREI2
JD4,JD4,JOÃO DE DEUS,41.1578666104126,-8.55802717966919,PRT3,http://www.stcp.pt/pt/viajar/paragens/?t=detalhe&paragem=JD4
PNG4,PNG4,PORTO NORTE,41.1600000000000,-8.56000000000000,PRT3,http://www.stcp.pt/pt/viajar/paragens/?t=detalhe&paragem=PNG4
"""

df_RoadSegments = pd.read_csv(io.StringIO(road_segments_data))
df_Stops = pd.read_csv(io.StringIO(stops_data))

# 辅助函数:根据stop_id查找经纬度
def getstopscoordinates(df_stops, stop_id):
    df_stop_id = df_stops.loc[df_stops["stop_id"] == stop_id]
    if not df_stop_id.empty:
        stop_id_lat = str(df_stop_id["stop_lat"].values[0])
        stop_id_lon = str(df_stop_id["stop_lon"].values[0])
        stop_id_coord = stop_id_lat + "," + stop_id_lon
        return stop_id_coord
    return None # 如果找不到,返回None

# 原始的慢速处理方式
# 注意:此代码段仅用于说明问题,不建议在实际生产环境中使用
# for row in df_RoadSegments.head(2).itertuples():
#     # 这里的apply(axis=1)会在df_RoadSegments的每一行上重复调用getstopscoordinates
#     # 并且getstopscoordinates内部又进行了DataFrame查询,效率极低
#     df_RoadSegments["OriginCoordinates"] = df_RoadSegments.apply(
#         lambda x: getstopscoordinates(df_Stops, x["RoadSegmentOrigin"]), axis=1
#     )
# print(df_RoadSegments)

上述代码的性能问题在于:

  1. 外部循环与内部apply(axis=1)的冗余: 即使外部只迭代df_RoadSegments.head(2),内部的df_RoadSegments.apply(...)却会针对df_RoadSegments的所有行执行getstopscoordinates函数。这意味着在每次外部循环迭代中,整个df_RoadSegments都会被重新计算OriginCoordinates列。
  2. apply(axis=1)的低效: apply(axis=1)本质上是在DataFrame的每一行上执行一个Python函数。对于大型DataFrame,这会产生大量的Python函数调用开销,远不如Pandas的向量化操作高效。
  3. getstopscoordinates内部的DataFrame查询: 在getstopscoordinates函数内部,df_stops.loc[df_stops["stop_id"] == stop_id] 再次进行了一次DataFrame的条件查询,这在每次函数调用时都会发生,进一步加剧了性能问题。

解决方案:利用merge()进行高效数据整合

Pandas提供了强大的向量化操作,能够显著提升数据处理效率。对于这种跨DataFrame的数据查找和整合需求,merge()函数是远比循环和apply(axis=1)更优的选择。

核心思想是:

  1. 预处理查找表: 将需要查找的数据(df_Stops)预先处理成目标格式。
  2. 使用merge()进行高效连接: 利用共同的键(stop_id)将两个DataFrame连接起来。

步骤一:预处理df_Stops,生成目标坐标列

首先,我们可以在df_Stops中预先计算出所需的lat_long字符串。这样,在后续的合并操作中,我们直接使用这个预计算好的列,避免了在合并过程中重复进行字符串拼接。

# 预处理df_Stops,生成lat_long列
df_Stops["lat_long"] = df_Stops[["stop_lat", "stop_lon"]].apply(
    lambda x: ','.join(map(str, x)), axis=1
)

print("预处理后的df_Stops(部分列):")
print(df_Stops[["stop_id", "lat_long"]].head())

这里对df_Stops使用apply(axis=1)来拼接字符串,虽然也是行级操作,但它只在df_Stops这个相对较小的查找表上执行一次,并且只涉及两个列的简单操作,其性能开销远小于在主循环中反复对大DataFrame进行apply。

ChatDOC
ChatDOC

ChatDOC是一款基于chatgpt的文件阅读助手,可以快速从pdf中提取、定位和总结信息

下载

步骤二:使用merge()连接DataFrame

有了预处理好的df_Stops,我们可以使用pd.merge()函数将其与df_RoadSegments连接起来。merge()函数类似于SQL中的JOIN操作,它能够根据一个或多个共同的键将两个DataFrame的行进行匹配。

# 使用merge()连接df_RoadSegments和df_Stops
df_RoadSegments_merged = df_RoadSegments.merge(
    df_Stops[["stop_id", "lat_long"]],  # 只选择需要的列进行合并
    left_on="RoadSegmentOrigin",        # df_RoadSegments中用于匹配的列
    right_on="stop_id",                 # df_Stops中用于匹配的列
    how="left"                          # 左连接,保留df_RoadSegments的所有行
)

# 重命名合并后的列以更清晰地表示其含义
df_RoadSegments_merged = df_RoadSegments_merged.rename(columns={"lat_long": "OriginCoordinates"})

print("\n合并后的df_RoadSegments:")
print(df_RoadSegments_merged)

代码解析:

  • df_Stops[["stop_id", "lat_long"]]: 我们只选择df_Stops中需要合并的stop_id和lat_long列,以减少内存占用和提高效率。
  • left_on="RoadSegmentOrigin": 指定df_RoadSegments中作为连接键的列。
  • right_on="stop_id": 指定df_Stops中作为连接键的列。
  • how="left": 执行左连接。这意味着df_RoadSegments中的所有行都将被保留,如果RoadSegmentOrigin在df_Stops中没有匹配项,则OriginCoordinates列将填充NaN。
  • rename(columns={"lat_long": "OriginCoordinates"}): 将合并后得到的lat_long列重命名为更具描述性的OriginCoordinates,使其与原始需求保持一致。

性能优势与最佳实践

采用merge()而非循环和apply(axis=1)具有显著的优势:

  • 极高的性能: merge()操作在底层使用C语言实现,经过高度优化,能够以远超Python循环的速度处理大量数据。
  • 简洁的代码: 减少了代码量,提高了可读性。
  • 可扩展性: 随着数据量的增长,merge()的性能衰减远低于基于Python循环的方法。
  • Pandas惯用法: 遵循Pandas的“向量化优先”原则,是处理DataFrame数据整合的标准方法。

总结与注意事项:

  • 避免行级迭代: 在Pandas中,应尽量避免使用for循环、itertuples()或iterrows()来对DataFrame进行逐行处理,尤其是在循环内部又进行昂贵操作时。
  • 优先使用向量化操作: 尽可能利用Pandas内置的向量化函数(如sum(), mean(), 字符串方法str.contains(), 日期时间方法dt.day等)进行数据转换和计算。
  • 善用merge()和join(): 对于跨DataFrame的数据查找和整合,merge()和join()是最高效且推荐的方式。
  • 预处理和缓存: 对于频繁查找的数据,可以考虑预先处理并存储在一个高效的查找结构中(例如,将查找表设置为索引,或者如本例中预计算目标列)。

通过理解Pandas的底层机制并采纳向量化操作,我们可以编写出更高效、更易维护的数据处理代码,从而充分发挥Pandas的强大功能。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

WorkBuddy
WorkBuddy

腾讯云推出的AI原生桌面智能体工作台

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
C语言变量命名
C语言变量命名

c语言变量名规则是:1、变量名以英文字母开头;2、变量名中的字母是区分大小写的;3、变量名不能是关键字;4、变量名中不能包含空格、标点符号和类型说明符。php中文网还提供c语言变量的相关下载、相关课程等内容,供大家免费下载使用。

410

2023.06.20

c语言入门自学零基础
c语言入门自学零基础

C语言是当代人学习及生活中的必备基础知识,应用十分广泛,本专题为大家c语言入门自学零基础的相关文章,以及相关课程,感兴趣的朋友千万不要错过了。

639

2023.07.25

c语言运算符的优先级顺序
c语言运算符的优先级顺序

c语言运算符的优先级顺序是括号运算符 > 一元运算符 > 算术运算符 > 移位运算符 > 关系运算符 > 位运算符 > 逻辑运算符 > 赋值运算符 > 逗号运算符。本专题为大家提供c语言运算符相关的各种文章、以及下载和课程。

362

2023.08.02

c语言数据结构
c语言数据结构

数据结构是指将数据按照一定的方式组织和存储的方法。它是计算机科学中的重要概念,用来描述和解决实际问题中的数据组织和处理问题。数据结构可以分为线性结构和非线性结构。线性结构包括数组、链表、堆栈和队列等,而非线性结构包括树和图等。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

263

2023.08.09

c语言random函数用法
c语言random函数用法

c语言random函数用法:1、random.random,随机生成(0,1)之间的浮点数;2、random.randint,随机生成在范围之内的整数,两个参数分别表示上限和下限;3、random.randrange,在指定范围内,按指定基数递增的集合中获得一个随机数;4、random.choice,从序列中随机抽选一个数;5、random.shuffle,随机排序。

632

2023.09.05

c语言const用法
c语言const用法

const是关键字,可以用于声明常量、函数参数中的const修饰符、const修饰函数返回值、const修饰指针。详细介绍:1、声明常量,const关键字可用于声明常量,常量的值在程序运行期间不可修改,常量可以是基本数据类型,如整数、浮点数、字符等,也可是自定义的数据类型;2、函数参数中的const修饰符,const关键字可用于函数的参数中,表示该参数在函数内部不可修改等等。

564

2023.09.20

c语言get函数的用法
c语言get函数的用法

get函数是一个用于从输入流中获取字符的函数。可以从键盘、文件或其他输入设备中读取字符,并将其存储在指定的变量中。本文介绍了get函数的用法以及一些相关的注意事项。希望这篇文章能够帮助你更好地理解和使用get函数 。

671

2023.09.20

c数组初始化的方法
c数组初始化的方法

c语言数组初始化的方法有直接赋值法、不完全初始化法、省略数组长度法和二维数组初始化法。详细介绍:1、直接赋值法,这种方法可以直接将数组的值进行初始化;2、不完全初始化法,。这种方法可以在一定程度上节省内存空间;3、省略数组长度法,这种方法可以让编译器自动计算数组的长度;4、二维数组初始化法等等。

618

2023.09.22

TypeScript类型系统进阶与大型前端项目实践
TypeScript类型系统进阶与大型前端项目实践

本专题围绕 TypeScript 在大型前端项目中的应用展开,深入讲解类型系统设计与工程化开发方法。内容包括泛型与高级类型、类型推断机制、声明文件编写、模块化结构设计以及代码规范管理。通过真实项目案例分析,帮助开发者构建类型安全、结构清晰、易维护的前端工程体系,提高团队协作效率与代码质量。

69

2026.03.13

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
最新Python教程 从入门到精通
最新Python教程 从入门到精通

共4课时 | 22.5万人学习

Django 教程
Django 教程

共28课时 | 5万人学习

SciPy 教程
SciPy 教程

共10课时 | 1.9万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号