0

0

Pandas DataFrame 多列列表展开与数据对齐教程

霞舞

霞舞

发布时间:2025-12-03 13:19:18

|

604人浏览过

|

来源于php中文网

原创

pandas dataframe 多列列表展开与数据对齐教程

本教程详细介绍了如何使用 Pandas 处理 DataFrame 中包含列表的列,特别是当需要同时展开多个列并将不同长度的列表进行同步对齐时。通过标准化数据类型、填充缺失值以及利用 `explode` 方法,最终实现将列表元素拆分为独立行,并对关联列进行索引化处理,确保数据结构满足复杂分析需求。

引言

在数据分析和处理中,我们经常会遇到 Pandas DataFrame 中某些列的单元格包含列表(list)数据,而其他单元格可能只包含单个值的情况。当需要对这些列表中的每个元素进行独立分析时,就需要将它们“展开”成多行。更具挑战性的是,如果需要同时展开多个列,并且这些列中的列表长度可能不一致,我们还需要确保数据能够正确对齐。本教程将详细介绍如何解决这一常见的数据整理问题,包括数据类型标准化、列表长度同步以及多列展开后的辅助列处理。

假设我们有一个 DataFrame,其中 File Value 和 True Value 列可能包含字符串或字符串列表,我们希望将这些列表中的每个元素转换为单独的行,同时保持 File 和 Color 列的关联信息。此外,对于被展开的行,我们希望 Color 列能够添加一个索引后缀(例如 blue_0, blue_1),并且对于非列表的原始行,Color 列保持不变。

原始 DataFrame 示例:

   File    Color         File Value              True Value
    1       blue    ['123', 'abc', 'tvr']    ['123', 'abc', 'tvr']
    2       green   ['jlak', 'abc', 'vds']   ['123', 'ffs', 'tvr']
    3       red     ['vssf', 'blue', '15a']  ['15a', 'asd', '15a', '234']
    4       black      'fvg'                     'fvg'

期望的输出 DataFrame 结构:

AIBox 一站式AI创作平台
AIBox 一站式AI创作平台

AIBox365一站式AI创作平台,支持ChatGPT、GPT4、Claue3、Gemini、Midjourney等国内外大模型

下载
   File     Color         File Value              True Value
    1       blue_0          '123'                    '123'
    1       blue_1          'abc'                    'abc'
    1       blue_2          'tvr'                    'tvr'
    2       green_0         'jlak'                   '123'
    2       green_1         'abc'                    'ffs'
    2       green_2         'vds'                    'tvr'
    3       red_0           'vssf'                   '15a'
    3       red_1           'blue'                   'asd'
    3       red_2           '15a'                    '15a'
    3       red_3            None                    '234'
    4       black           'fvg'                    'fvg'

1. 构建初始 DataFrame

首先,我们创建用于演示的 Pandas DataFrame。为了避免列名中的空格可能导致的问题,我们将 File Value 和 True Value 改为 File_Value 和 True_Value。

import pandas as pd

df = pd.DataFrame(
    dict(
        File=[1, 2, 3, 4],
        Color=["blue", "green", "red", "black"],
        File_Value=[
            ["123", "abc", "tvr"],
            ["jlak", "abc", "vds"],
            ["vssf", "blue", "15a"],
            "fvg",
        ],
        True_Value=[
            ["123", "abc", "tvr"],
            ["123", "ffs", "tvr"],
            ["15a", "asd", "15a", "234"],
            "fvg",
        ],
    )
)

print("原始 DataFrame:")
print(df)

2. 数据标准化:将所有目标单元格转换为列表

在进行 explode 操作之前,确保所有目标列(File_Value 和 True_Value)中的单元格都以列表形式存在,即使它们最初是单个值。这有助于后续处理的统一性。同时,为了后续正确处理 Color 列的索引化,我们需要记录哪些行最初是列表类型。

def normalize_to_list(x):
    """将非列表值转换为单元素列表,列表值保持不变。"""
    if not isinstance(x, list):
        return [x]
    return x

# 标记哪些行最初是列表,用于后续Color列的条件处理
# 这里我们检查 File_Value 是否为列表,因为它通常是决定是否展开的主要列
df['was_list'] = df['File_Value'].apply(lambda x: isinstance(x, list))

# 对目标列应用列表标准化
df[['File_Value', 'True_Value']] = df[['File_Value', 'True_Value']].applymap(normalize_to_list)

print("\n步骤2:标准化为列表后的 DataFrame:")
print(df)

DataFrame 状态分析: 此时,File_Value 和 True_Value 列中的所有单元格都已是列表。例如,原始的 'fvg' 现在变成了 ['fvg']。was_list 列记录了原始数据类型,这对于区分哪些行的 Color 需要添加索引后缀至关重要。

3. 同步多列列表的长度

当同时展开多个列时,如果这些列中的列表长度不一致,explode 操作将按其各自的长度展开,可能导致数据

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

WorkBuddy
WorkBuddy

腾讯云推出的AI原生桌面智能体工作台

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
Python 时间序列分析与预测
Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧,涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估,以及基于实际业务场景的时间序列项目实操,帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

81

2025.12.04

Python 数据清洗与预处理实战
Python 数据清洗与预处理实战

本专题系统讲解 Python 在数据清洗与预处理中的核心技术,包括使用 Pandas 进行缺失值处理、异常值检测、数据格式化、特征工程与数据转换,结合 NumPy 高效处理大规模数据。通过实战案例,帮助学习者掌握 如何处理混乱、不完整数据,为后续数据分析与机器学习模型训练打下坚实基础。

33

2026.01.31

数据类型有哪几种
数据类型有哪几种

数据类型有整型、浮点型、字符型、字符串型、布尔型、数组、结构体和枚举等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

338

2023.10.31

php数据类型
php数据类型

本专题整合了php数据类型相关内容,阅读专题下面的文章了解更多详细内容。

225

2025.10.31

c语言 数据类型
c语言 数据类型

本专题整合了c语言数据类型相关内容,阅读专题下面的文章了解更多详细内容。

138

2026.02.12

js 字符串转数组
js 字符串转数组

js字符串转数组的方法:1、使用“split()”方法;2、使用“Array.from()”方法;3、使用for循环遍历;4、使用“Array.split()”方法。本专题为大家提供js字符串转数组的相关的文章、下载、课程内容,供大家免费下载体验。

761

2023.08.03

js截取字符串的方法
js截取字符串的方法

js截取字符串的方法有substring()方法、substr()方法、slice()方法、split()方法和slice()方法。本专题为大家提供字符串相关的文章、下载、课程内容,供大家免费下载体验。

221

2023.09.04

java基础知识汇总
java基础知识汇总

java基础知识有Java的历史和特点、Java的开发环境、Java的基本数据类型、变量和常量、运算符和表达式、控制语句、数组和字符串等等知识点。想要知道更多关于java基础知识的朋友,请阅读本专题下面的的有关文章,欢迎大家来php中文网学习。

1569

2023.10.24

TypeScript类型系统进阶与大型前端项目实践
TypeScript类型系统进阶与大型前端项目实践

本专题围绕 TypeScript 在大型前端项目中的应用展开,深入讲解类型系统设计与工程化开发方法。内容包括泛型与高级类型、类型推断机制、声明文件编写、模块化结构设计以及代码规范管理。通过真实项目案例分析,帮助开发者构建类型安全、结构清晰、易维护的前端工程体系,提高团队协作效率与代码质量。

26

2026.03.13

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Java 教程
Java 教程

共578课时 | 81.9万人学习

国外Web开发全栈课程全集
国外Web开发全栈课程全集

共12课时 | 1万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号