如何使用Pandas在分组数据上正确计算滚动平均值

DDD

发布时间：2025-11-21 15:19:02

954人浏览过

来源于php中文网

原创

如何使用pandas在分组数据上正确计算滚动平均值

本文深入探讨了在Pandas中对分组数据计算滚动平均值时遇到的常见问题，特别是TypeError: incompatible index of inserted column with frame index错误以及结果不准确的情况。通过分析groupby().rolling().mean()操作产生的多级索引问题，文章详细介绍了如何利用droplevel()方法来解决索引不兼容性，从而实现对DataFrame正确地添加分组滚动平均值列，确保计算结果的准确性和数据的完整性。

在数据分析中，对分组数据计算滚动统计量（如滚动平均值）是一项常见的操作。Pandas库提供了强大的groupby()和rolling()方法来支持此类计算。然而，在使用这些方法并将结果赋值回原始DataFrame时，用户可能会遇到TypeError: incompatible index of inserted column with frame index错误或得到不符合预期的计算结果。本文将详细解析这个问题的原因，并提供一个简洁有效的解决方案。

理解问题：分组滚动平均值的索引不兼容性

首先，让我们通过一个示例数据集来重现并理解这个问题。

import pandas as pd
import numpy as np

# 创建示例DataFrame
df = pd.DataFrame({
    'a': np.random.choice(['x', 'y'], 8),
    'b': np.random.choice(['r', 's'], 8),
    'c': np.arange(1, 8 + 1)
})

print("原始DataFrame:")
print(df)

一个可能的输出如下：

原始DataFrame:
   a  b  c
0  y  s  1
1  y  r  2
2  y  s  3
3  y  r  4
4  y  s  5
5  x  r  6
6  y  r  7
7  x  r  8

现在，我们尝试按照列'a'和'b'进行分组，然后计算列'c'的窗口大小为3的滚动平均值，并直接将其赋值给原始DataFrame的新列'ROLLING_MEAN'：

# 尝试直接赋值（会导致TypeError）
# df['ROLLING_MEAN'] = df.groupby(['a', 'b'])['c'].rolling(3).mean()

如果直接执行上述代码，Pandas会抛出TypeError: incompatible index of inserted column with frame index。这是因为df.groupby(['a', 'b'])['c'].rolling(3).mean()这个操作的返回值是一个带有多级索引（MultiIndex）的Series。这个多级索引包含了分组键（'a'和'b'）以及原始DataFrame的索引。例如，单独查看其输出：

intermediate_result = df.groupby(['a', 'b'])['c'].rolling(3).mean()
print("\ngroupby().rolling().mean()的中间结果（带有MultiIndex）:")
print(intermediate_result)

一个可能的输出（注意索引结构）：

groupby().rolling().mean()的中间结果（带有MultiIndex）:
a  b   
x  r  5    NaN
      7    NaN
   s  3    NaN
y  r  1    NaN
      4    NaN
      6    5.0
y  s  0    NaN
      2    NaN
Name: c, dtype: float64

（请注意，示例输出中的索引值和原始DataFrame的索引值可能因为np.random.choice的随机性而有所不同，但关键在于其索引结构是a, b和原始索引的组合。）

由于这个Series的索引与原始DataFrame的单级整数索引不兼容，Pandas无法直接将其作为新列插入。

灵机语音

下载

错误的.values使用及其影响

有时，为了规避TypeError，用户可能会尝试在.mean()后面加上.values：

# 尝试使用.values（会避免TypeError，但结果不准确）
df['ROLLING_MEAN_VALUES'] = df.groupby(['a', 'b'])['c'].rolling(3).mean().values
print("\n使用.values后的DataFrame（结果不准确）:")
print(df)

虽然.values操作会提取Series中的数值数组，避免了索引不兼容的错误，但它破坏了数据与原始DataFrame行的对应关系。.values只是简单地按顺序提取数值，而没有考虑原始DataFrame的行索引。这意味着计算出的滚动平均值会错误地分配到DataFrame的行中，导致结果完全不准确。

例如，如果我们查看某个特定分组的滚动平均值，会发现其值与该分组的数据完全不匹配。

解决方案：使用 droplevel() 移除多级索引

解决这个问题的关键在于，我们需要将groupby().rolling().mean()返回的Series的多级索引降维（droplevel），使其只保留原始DataFrame的行索引。这样，生成的Series就能与原始DataFrame的索引对齐，从而实现正确的赋值。

droplevel()方法可以从MultiIndex中移除一个或多个级别。在本例中，我们需要移除代表分组键的'a'和'b'级别。

# 正确的解决方案：使用 droplevel()
df['ROLLING_MEAN'] = df.groupby(['a', 'b'])['c'] \
                        .rolling(3).mean() \
                        .droplevel(['a', 'b'])

print("\n使用droplevel()后的DataFrame（结果正确）:")
print(df)

一个可能的输出如下：

使用droplevel()后的DataFrame（结果正确）:
   a  b  c  ROLLING_MEAN
0  y  s  1           NaN
1  y  r  2           NaN
2  y  s  3           NaN
3  y  r  4           NaN
4  y  s  5      3.000000
5  x  r  6           NaN
6  y  r  7      4.333333
7  x  r  8           NaN

结果验证： 让我们手动验证一个分组的计算。假设在上述输出中，df的索引4对应的行是y, s, 5，并且其ROLLING_MEAN是3.000000。如果df的原始数据是：

对于分组 ('y', 's')，其 c 列的值序列是 1, 3, 5。

索引0 (c=1): NaN (窗口不足3)
索引2 (c=3): NaN (窗口不足3)
索引4 (c=5): (1 + 3 + 5) / 3 = 3.0。这与输出结果一致。

注意事项

索引对齐的重要性： Pandas的核心优势之一是其强大的索引对齐功能。在进行复杂的转换和合并操作时，始终要关注Series或DataFrame的索引结构，确保它们能够正确对齐。
rolling() 的 min_periods 参数： 默认情况下，rolling()要求窗口中有足够的非NaN值才能进行计算。例如，rolling(3)表示需要至少3个值才能计算平均值。可以通过设置min_periods参数来改变这一行为，例如rolling(3, min_periods=1)表示只要有1个值就可以计算。
链式操作的可读性： 当进行多步操作时，使用括号和换行符可以提高代码的可读性，如示例中所示。

总结

在Pandas中对分组数据计算滚动平均值并将其添加回原始DataFrame时，groupby().rolling().mean()操作会产生一个带有MultiIndex的Series，这与原始DataFrame的单级索引不兼容。解决此问题的正确方法是使用.droplevel(['group_key1', 'group_key2'])方法，将MultiIndex降维，使其索引与原始DataFrame的索引对齐。通过这种方式，可以确保计算结果的准确性，并避免常见的TypeError。

如何将 Python Tkinter 项目打包为可独立运行的桌面应用

Python集合去重靠谱吗_set去重副作用分析

如何在 ruamel.yaml 中精确保留原始 YAML 行换行格式

如何使用 Streamlit 与 OpenCV 实现双视频并行播放

Python时间比较陷阱_datetime比较注意事项

相关专题

Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧，涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估，以及基于实际业务场景的时间序列项目实操，帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

2025.12.04

Python 数据清洗与预处理实战

本专题系统讲解 Python 在数据清洗与预处理中的核心技术，包括使用 Pandas 进行缺失值处理、异常值检测、数据格式化、特征工程与数据转换，结合 NumPy 高效处理大规模数据。通过实战案例，帮助学习者掌握如何处理混乱、不完整数据，为后续数据分析与机器学习模型训练打下坚实基础。

2026.01.31

Python 时间序列分析与预测

2025.12.04

Python 数据清洗与预处理实战

2026.01.31

TypeScript类型系统进阶与大型前端项目实践

本专题围绕 TypeScript 在大型前端项目中的应用展开，深入讲解类型系统设计与工程化开发方法。内容包括泛型与高级类型、类型推断机制、声明文件编写、模块化结构设计以及代码规范管理。通过真实项目案例分析，帮助开发者构建类型安全、结构清晰、易维护的前端工程体系，提高团队协作效率与代码质量。

2026.03.13

Python异步编程与Asyncio高并发应用实践

本专题围绕 Python 异步编程模型展开，深入讲解 Asyncio 框架的核心原理与应用实践。内容包括事件循环机制、协程任务调度、异步 IO 处理以及并发任务管理策略。通过构建高并发网络请求与异步数据处理案例，帮助开发者掌握 Python 在高并发场景中的高效开发方法，并提升系统资源利用率与整体运行性能。

2026.03.12

C# ASP.NET Core微服务架构与API网关实践

本专题围绕 C# 在现代后端架构中的微服务实践展开，系统讲解基于 ASP.NET Core 构建可扩展服务体系的核心方法。内容涵盖服务拆分策略、RESTful API 设计、服务间通信、API 网关统一入口管理以及服务治理机制。通过真实项目案例，帮助开发者掌握构建高可用微服务系统的关键技术，提高系统的可扩展性与维护效率。

272

2026.03.11

Go高并发任务调度与Goroutine池化实践

本专题围绕 Go 语言在高并发任务处理场景中的实践展开，系统讲解 Goroutine 调度模型、Channel 通信机制以及并发控制策略。内容包括任务队列设计、Goroutine 池化管理、资源限制控制以及并发任务的性能优化方法。通过实际案例演示，帮助开发者构建稳定高效的 Go 并发任务处理系统，提高系统在高负载环境下的处理能力与稳定性。

2026.03.10

Kotlin Android模块化架构与组件化开发实践

本专题围绕 Kotlin 在 Android 应用开发中的架构实践展开，重点讲解模块化设计与组件化开发的实现思路。内容包括项目模块拆分策略、公共组件封装、依赖管理优化、路由通信机制以及大型项目的工程化管理方法。通过真实项目案例分析，帮助开发者构建结构清晰、易扩展且维护成本低的 Android 应用架构体系，提升团队协作效率与项目迭代速度。

2026.03.09

热门下载

网站特效

网站源码

网站素材

前端模板