0

0

如何在 Pandas 中基于子字符串匹配实现 DataFrame 左连接

霞舞

霞舞

发布时间:2026-01-12 19:00:17

|

361人浏览过

|

来源于php中文网

原创

如何在 Pandas 中基于子字符串匹配实现 DataFrame 左连接

本文介绍一种高效、可靠的方法:通过正则提取子字符串构建临时键,再执行左连接,从而将 name 列(如 "dale")与包含该名称的 id 字符串(如 "dale-999999")精准关联。

在实际数据处理中,常遇到「一端为完整标识符、另一端仅为其中一部分」的关联需求——例如 a["Name"] 是人名("Dale"),而 b["ID"] 是带后缀的复合 ID("Dale-999999")。此时无法直接使用等值连接(merge),需借助字符串匹配逻辑构建映射关系。

核心思路是:先从 b["ID"] 中提取出与 a["Name"] 完全一致的子串,生成临时键 _name;再以此键与 a["Name"] 执行左连接(how='left')。这既满足“每个 b["ID"] 最多匹配一个 a["Name"]”的约束,也支持“一个 a["Name"] 对应多个 b["ID"]”的业务场景(如 "Bill" 匹配 "Bill-000" 和 "Bill-001")。

具体实现如下:

VisualizeAI
VisualizeAI

用AI把你的想法变成现实

下载
import pandas as pd

a = pd.DataFrame({"Name": ["Boomhaur", "Dale", "Bill", "Hank"]})
b = pd.DataFrame({"ID": ["Boomhaur-2345", "Dale-999999", "Bill-000", "Bill-001", "Peggy-420"]})

# 构建正则模式:(Boomhaur|Dale|Bill|Hank) → 确保精确单词匹配,避免 "Bill" 匹配 "Billy"
pat = r'(' + '|'.join(a['Name'].str.replace(r'[^ws]', r'\', regex=True)) + r')'
b['_name'] = b["ID"].str.extract(pat)

# 执行左连接:以 a["Name"] 为左键,b["_name"] 为右键
result = a.merge(b, how='left', left_on='Name', right_on='_name')

# 清理临时列(可选)
result = result.drop(columns=['_name']).reset_index(drop=True)
print(result)

输出结果为:

       Name             ID
0  Boomhaur  Boomhaur-2345
1      Dale    Dale-999999
2      Bill       Bill-000
3      Bill       Bill-001
4      Hank            NaN

⚠️ 注意事项

  • 正则中的 (词边界)至关重要,可防止误匹配(如 "Bill" 不会错误匹配 "Billy" 或 "ABill");
  • 若 a["Name"] 中含正则元字符(如 +, *, (),务必用 str.replace(..., regex=True) 转义,否则引发 re.error;
  • str.extract() 返回首个匹配项,符合“每个 ID 至多匹配一个 Name”的前提;
  • 若需保留 b 中未匹配的行,应改用 how='right' 或外连接,但本例明确要求以 a 为主表,故使用 how='left'。

该方法简洁、可读性强,且完全基于 Pandas 原生向量化操作,无需循环或 apply,性能优异,适用于中大型数据集。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
Python 时间序列分析与预测
Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧,涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估,以及基于实际业务场景的时间序列项目实操,帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

76

2025.12.04

Python 数据清洗与预处理实战
Python 数据清洗与预处理实战

本专题系统讲解 Python 在数据清洗与预处理中的核心技术,包括使用 Pandas 进行缺失值处理、异常值检测、数据格式化、特征工程与数据转换,结合 NumPy 高效处理大规模数据。通过实战案例,帮助学习者掌握 如何处理混乱、不完整数据,为后续数据分析与机器学习模型训练打下坚实基础。

12

2026.01.31

scripterror怎么解决
scripterror怎么解决

scripterror的解决办法有检查语法、文件路径、检查网络连接、浏览器兼容性、使用try-catch语句、使用开发者工具进行调试、更新浏览器和JavaScript库或寻求专业帮助等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

411

2023.10.18

500error怎么解决
500error怎么解决

500error的解决办法有检查服务器日志、检查代码、检查服务器配置、更新软件版本、重新启动服务、调试代码和寻求帮助等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

357

2023.10.25

mysql标识符无效错误怎么解决
mysql标识符无效错误怎么解决

mysql标识符无效错误的解决办法:1、检查标识符是否被其他表或数据库使用;2、检查标识符是否包含特殊字符;3、使用引号包裹标识符;4、使用反引号包裹标识符;5、检查MySQL的配置文件等等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

203

2023.12.04

Python标识符有哪些
Python标识符有哪些

Python标识符有变量标识符、函数标识符、类标识符、模块标识符、下划线开头的标识符、双下划线开头、双下划线结尾的标识符、整型标识符、浮点型标识符等等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

313

2024.02.23

java标识符合集
java标识符合集

本专题整合了java标识符相关内容,想了解更多详细内容,请阅读下面的文章。

290

2025.06.11

c++标识符介绍
c++标识符介绍

本专题整合了c++标识符相关内容,阅读专题下面的文章了解更多详细内容。

172

2025.08.07

Golang 测试体系与代码质量保障:工程级可靠性建设
Golang 测试体系与代码质量保障:工程级可靠性建设

Go语言测试体系与代码质量保障聚焦于构建工程级可靠性系统。本专题深入解析Go的测试工具链(如go test)、单元测试、集成测试及端到端测试实践,结合代码覆盖率分析、静态代码扫描(如go vet)和动态分析工具,建立全链路质量监控机制。通过自动化测试框架、持续集成(CI)流水线配置及代码审查规范,实现测试用例管理、缺陷追踪与质量门禁控制,确保代码健壮性与可维护性,为高可靠性工程系统提供质量保障。

48

2026.02.28

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Java 教程
Java 教程

共578课时 | 75.3万人学习

国外Web开发全栈课程全集
国外Web开发全栈课程全集

共12课时 | 1万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号