Pandas apply() 在列清洗中返回 NaN 的根本原因与解决方案

心靈之曲

发布时间：2026-02-27 11:20:01

247人浏览过

来源于php中文网

原创

Pandas apply() 在列清洗中返回 NaN 的根本原因与解决方案

本文揭示了使用 pandas.Series.str.extract() 配合 apply() 清洗字符串列时意外产生大量 NaN 的核心原因——正则表达式模式与实际数据格式不匹配，并提供可复现的诊断方法与健壮的修复方案。

本文揭示了使用 `pandas.series.str.extract()` 配合 `apply()` 清洗字符串列时意外产生大量 nan 的核心原因——正则表达式模式与实际数据格式不匹配，并提供可复现的诊断方法与健壮的修复方案。

在 Pandas 数据清洗实践中，一个常见但易被忽视的问题是：看似相同的清洗逻辑，在不同数据源（如 CSV 文件 vs 手动构造列表）上执行结果却大相径庭。正如问题所示，当对 df[['X', 'Y']] 直接应用正则提取 + 替换逻辑时，大量本应成功解析的数值却返回 NaN；而将相同逻辑应用于手动构造的 new_df 时却完全正常。这并非 apply() 或正则引擎的 Bug，而是数据底层格式差异触发了正则匹配失败。

关键线索藏在原始 CSV 与人工列表的第一行对比中：

# data.csv 第一行（逗号分隔，无小数点）：
0,1,573436862,3887259269

# thelist 第一行（含小数点）：
['1', '573436.862', '3887259.269']

原正则 r'([a-z\d]+\.[a-z\d]+)' 强制要求匹配一个字面量点号 .（因 \. 是转义字符）。而 CSV 中的数字（如 573436862）是整数格式、不含小数点，导致 str.extract() 完全无法匹配，返回 NaN；后续的 .str.replace(...) 对 NaN 无作用，最终结果仍是 NaN。

Getsound

基于当前天气条件生成个性化音景音乐

下载

✅ 正确做法是：使正则适配真实数据分布。若目标是提取任意浮点或整数形式的数字（无论是否带小数点），应改用更鲁棒的数字匹配模式：

import pandas as pd
import re

df = pd.read_csv('data.csv', index_col=[0])

# ✅ 推荐：匹配科学计数法/整数/小数（支持可选小数点及后续数字）
numeric_pattern = r'(-?\d+(?:\.\d+)?)'

out = df[['X', 'Y']].apply(lambda s: 
    s.str.extract(numeric_pattern, expand=False)
    .str.replace(r'[^\d.-]+', '', regex=True)  # 清理非数字、非小数点、非负号字符
    .replace('', pd.NA)  # 空字符串转为 NA，避免空字符串干扰
)

out.index += 1
print(out.head())

⚠️ 注意事项：

str.extract() 返回 NaN 表示无匹配，不是错误，需先确认数据是否真包含目标模式；
使用 expand=False 时，extract() 返回 Series；若需多组捕获，设 expand=True 并指定列名；
str.replace(..., regex=True) 对 NaN 安全，但对空字符串（''）无效——务必用 .replace('', pd.NA) 或 .str.strip().replace('', pd.NA) 预处理；
调试技巧：对单列运行 df['X'].str.contains(r'\.', na=False) 快速验证小数点覆盖率；
更优实践：优先使用 pd.to_numeric(..., errors='coerce') 处理纯数字列，它比正则更高效且自动处理常见异常格式。

总结：apply() 返回 NaN 往往是“数据未达预期”而非“代码有误”。始终以 df['col'].sample(10).tolist() 或 df['col'].str[:50] 检查原始数据形态，再设计匹配逻辑——正则是工具，数据才是真相的源头。

Kivy 中跨类传递 Spinner 选择值的正确实践

Kivy 中跨类传递 Spinner 选择值的完整实践指南

如何从网页中安全提取并解析嵌入的 JavaScript JSON 数据

如何从网页脚本中安全提取并解析嵌入的 JSON 数据

如何从网页中安全提取并解析嵌入的 JSON 数据（如 App = {...}）

相关标签:

app 正则表达式 pandas 字符串 Regex bug

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：Python Pandas 大数据处理方案下一篇：暂无

作者最新文章

如何安全移除待办列表中的最后一个任务元素

2026-02-25 15:58

PHP 中为 include 文件提供变量类型提示以支持 IDE 自动补全

2026-02-25 16:07

回合制弹幕游戏《超时空地牢》Steam新品节全新试玩版现已推出

2026-02-25 16:24

游戏直播平台Twitch公布违规封禁新规惩罚限制放缓

2026-02-25 16:30

如何在 Go 中设计支持可修改字段的结构体（值语义与指针语义的正确选择）

2026-02-25 16:31

如何在 Pandas 中精确重排合并后 DataFrame 的列顺序

2026-02-25 16:36

JavaScript 中动态获取嵌套对象内所有数组长度的完整方法

2026-02-25 16:52

PHP 8 中正确忽略被抑制错误的实践方法

2026-02-25 16:59

《极限竞速：地平线6》生态区域展示宣传片

2026-02-25 17:24

如何在 PHP 中正确获取当前网页的完整 URL

2026-02-25 17:32

热门AI工具

DeepSeek

幻方量化公司旗下的开源大模型平台

AI编程开发 AI聊天问答

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI编程开发 AI大模型

通义千问

阿里巴巴推出的全能AI助手

AI编程开发 Agent智能体

腾讯元宝

腾讯混元平台推出的AI助手

文档处理 Excel 表格

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI编程开发 AI文本写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

AI文本写作中文写作

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接图画生成

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI编程开发 AI文本写作

智谱清言 - 免费全能的AI助手

AI编程开发 Agent智能体

相关专题

js正则表达式

php中文网为大家提供各种js正则表达式语法大全以及各种js正则表达式使用的方法，还有更多js正则表达式的相关文章、相关下载、相关课程，供大家免费下载体验。

526

2023.06.20

正则表达式不包含

正则表达式，又称规则表达式,，是一种文本模式，包括普通字符和特殊字符，是计算机科学的一个概念。正则表达式使用单个字符串来描述、匹配一系列匹配某个句法规则的字符串，通常被用来检索、替换那些符合某个模式的文本。php中文网给大家带来了有关正则表达式的相关教程以及文章，希望对大家能有所帮助。

258

2023.07.05

java正则表达式语法

java正则表达式语法是一种模式匹配工具，它非常有用，可以在处理文本和字符串时快速地查找、替换、验证和提取特定的模式和数据。本专题提供java正则表达式语法的相关文章、下载和专题，供大家免费下载体验。

760

2023.07.05

java正则表达式匹配字符串

在Java中，我们可以使用正则表达式来匹配字符串。本专题为大家带来java正则表达式匹配字符串的相关内容，帮助大家解决问题。

219

2023.08.11

正则表达式空格

正则表达式空格可以用“s”来表示，它是一个特殊的元字符，用于匹配任意空白字符，包括空格、制表符、换行符等。本专题为大家提供正则表达式相关的文章、下载、课程内容，供大家免费下载体验。

354

2023.08.31

Python爬虫获取数据的方法

Python爬虫可以通过请求库发送HTTP请求、解析库解析HTML、正则表达式提取数据，或使用数据抓取框架来获取数据。更多关于Python爬虫相关知识。详情阅读本专题下面的文章。php中文网欢迎大家前来学习。

293

2023.11.13

正则表达式空格如何表示

正则表达式空格可以用“s”来表示，它是一个特殊的元字符，用于匹配任意空白字符，包括空格、制表符、换行符等。想了解更多正则表达式空格怎么表示的内容，可以访问下面的文章。

244

2023.11.17

正则表达式中如何匹配数字

正则表达式中可以通过匹配单个数字、匹配多个数字、匹配固定长度的数字、匹配整数和小数、匹配负数和匹配科学计数法表示的数字的方法匹配数字。更多关于正则表达式的相关知识详情请看本专题下面的文章。php中文网欢迎大家前来学习。

543

2023.12.06

html5播放器怎么用

本合集全面介绍HTML5播放器的使用方法，涵盖基础语法、自定义控制、兼容性处理及实战示例。阅读专题下面的文章了解更多详细内容。

2026.02.27

热门下载

网站特效

网站源码

网站素材

前端模板