0

0

使用 Pandas 分析客户链:提取客户交付顺序模式

碧海醫心

碧海醫心

发布时间:2025-07-31 21:24:01

|

498人浏览过

|

来源于php中文网

原创

使用 pandas 分析客户链:提取客户交付顺序模式

本文介绍如何使用 Pandas 分析客户交付数据,提取并统计特定客户链的出现频率。通过对数据进行排序、去重和分组聚合,最终得到不同客户链及其出现的次数或比例,帮助你发现潜在的交付模式。

在实际业务场景中,我们经常需要分析客户的购买行为、访问路径或交付顺序等数据,从中发现隐藏的模式和规律。本文将以客户交付数据为例,演示如何使用 Pandas 提取并统计客户链,帮助你更好地理解客户行为。

数据准备

首先,我们需要准备包含交付数据的 Pandas DataFrame。DataFrame 至少包含以下几列:

  • DateTime: 交付时间
  • SortieNumber: 批次号
  • CustomerName: 客户名称
  • ProductCode: 产品代码

以下是一个示例 DataFrame:

import pandas as pd

data = {'DateTime': ['01/01/2023 09:00:00', '01/01/2023 09:10:00', '01/01/2023 09:15:00',
                     '01/01/2023 12:00:00', '01/01/2023 12:00:10', '01/01/2023 12:15:00',
                     '01/01/2023 15:00:00', '01/01/2023 15:05:10', '01/01/2023 15:15:00',
                     '01/01/2023 15:30:10', '01/01/2023 15:35:15'],
        'SortieNumber': [1, 1, 1, 2, 2, 2, 3, 3, 3, 3, 3],
        'CustomerName': ['Josh', 'Alice', 'Robert', 'Anna', 'Anna', 'Robert', 'Josh', 'Alice', 'Robert', 'Robert', 'Robert'],
        'ProductCode': ['001', '002', '002', '001', '003', '003', '004', '003', '001', '002', '003']}
df = pd.DataFrame(data)

print(df)

数据处理

接下来,我们需要对 DataFrame 进行处理,提取客户链并统计其出现频率。

  1. 排序: 首先,按照 SortieNumber 和 DateTime 对 DataFrame 进行排序,确保同一批次内的客户按照交付时间先后顺序排列

    df = df.sort_values(by=['SortieNumber', 'DateTime'])
    print(df)
  2. 去重: 移除同一 SortieNumber 下连续重复的 CustomerName。 如果在一次批次中,同一客户连续出现多次,我们只保留第一次出现。

    df = df.loc[lambda d: d[['SortieNumber', 'CustomerName']].ne(d[['SortieNumber', 'CustomerName']].shift()).any(axis=1)]
    # 或者,如果确定同一个 SortieNumber 中,同一个客户不会被其他客户分割,可以使用更简洁的方法:
    # df = df.drop_duplicates(['SortieNumber', 'CustomerName'])
    print(df)
  3. 分组聚合: 按照 SortieNumber 对 DataFrame 进行分组,并将每个批次内的客户名称用 "-" 连接起来,形成客户链。

    方舟订单管理系统
    方舟订单管理系统

    系统开发由二当家的编写,代码完全开源,可自行修改源码,欢迎使用! 1、网站采用php语言开发,更安全、稳定、无漏洞、防注入、防丢单。 2、记录订单来路,客户IP记录及分析,订单数据统计 3、订单邮件提醒、手机短信提醒,让您第一时间追踪订单,大大提升了发货效率,提高订单成交率。 4、多种支付方式,包含:货到付款、支付宝接口、网银支付,可设置在线支付的折扣比率。 5、模板样式多样化,一个订单放到多个网

    下载
    customer_chains = df.groupby('SortieNumber')['CustomerName'].agg('-'.join)
    print(customer_chains)
  4. 统计频率: 使用 value_counts() 函数统计每个客户链出现的次数。

    chain_counts = customer_chains.value_counts()
    print(chain_counts)

结果展示

最终,我们可以得到每个客户链及其出现的次数。例如,Josh-Alice-Robert 出现了 2 次,Anna-Robert 出现了 1 次。

如果需要展示客户链出现的比例,可以将 normalize=True 传递给 value_counts() 函数。

chain_proportions = customer_chains.value_counts(normalize=True)
print(chain_proportions)

完整代码

以下是完整的代码示例:

import pandas as pd

data = {'DateTime': ['01/01/2023 09:00:00', '01/01/2023 09:10:00', '01/01/2023 09:15:00',
                     '01/01/2023 12:00:00', '01/01/2023 12:00:10', '01/01/2023 12:15:00',
                     '01/01/2023 15:00:00', '01/01/2023 15:05:10', '01/01/2023 15:15:00',
                     '01/01/2023 15:30:10', '01/01/2023 15:35:15'],
        'SortieNumber': [1, 1, 1, 2, 2, 2, 3, 3, 3, 3, 3],
        'CustomerName': ['Josh', 'Alice', 'Robert', 'Anna', 'Anna', 'Robert', 'Josh', 'Alice', 'Robert', 'Robert', 'Robert'],
        'ProductCode': ['001', '002', '002', '001', '003', '003', '004', '003', '001', '002', '003']}
df = pd.DataFrame(data)

chain_counts = (df.sort_values(by=['SortieNumber', 'DateTime'])
   .loc[lambda d: d[['SortieNumber', 'CustomerName']]
                 .ne(d[['SortieNumber', 'CustomerName']].shift())
                 .any(axis=1)]
   .groupby('SortieNumber')['CustomerName'].agg('-'.join)
   .value_counts()
)

print(chain_counts)

chain_proportions = (df.sort_values(by=['SortieNumber', 'DateTime'])
   .loc[lambda d: d[['SortieNumber', 'CustomerName']]
                 .ne(d[['SortieNumber', 'CustomerName']].shift())
                 .any(axis=1)]
   .groupby('SortieNumber')['CustomerName'].agg('-'.join)
   .value_counts(normalize=True)
)

print(chain_proportions)

总结

通过本文的教程,你学会了如何使用 Pandas 分析客户交付数据,提取客户链并统计其出现频率。这种方法可以应用于各种场景,例如分析用户在网站上的访问路径、分析客户的购买行为等,帮助你发现隐藏的模式和规律,从而更好地理解客户行为,优化业务流程。

注意事项

  • 在实际应用中,你需要根据数据的具体情况调整代码。例如,如果数据中包含缺失值,你需要先处理缺失值。
  • 如果数据量非常大,可以考虑使用更高效的数据处理工具,例如 Spark。
  • 客户链的长度可以根据实际需求进行调整。例如,你可以只提取长度为 2 或 3 的客户链。
  • 需要注意数据隐私,避免泄露客户的敏感信息。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
Python 时间序列分析与预测
Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧,涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估,以及基于实际业务场景的时间序列项目实操,帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

71

2025.12.04

Python 数据清洗与预处理实战
Python 数据清洗与预处理实战

本专题系统讲解 Python 在数据清洗与预处理中的核心技术,包括使用 Pandas 进行缺失值处理、异常值检测、数据格式化、特征工程与数据转换,结合 NumPy 高效处理大规模数据。通过实战案例,帮助学习者掌握 如何处理混乱、不完整数据,为后续数据分析与机器学习模型训练打下坚实基础。

1

2026.01.31

常用的数据库软件
常用的数据库软件

常用的数据库软件有MySQL、Oracle、SQL Server、PostgreSQL、MongoDB、Redis、Cassandra、Hadoop、Spark和Amazon DynamoDB。更多关于数据库软件的内容详情请看本专题下面的文章。php中文网欢迎大家前来学习。

982

2023.11.02

2026赚钱平台入口大全
2026赚钱平台入口大全

2026年最新赚钱平台入口汇总,涵盖任务众包、内容创作、电商运营、技能变现等多类正规渠道,助你轻松开启副业增收之路。阅读专题下面的文章了解更多详细内容。

52

2026.01.31

高干文在线阅读网站大全
高干文在线阅读网站大全

汇集热门1v1高干文免费阅读资源,涵盖都市言情、京味大院、军旅高干等经典题材,情节紧凑、人物鲜明。阅读专题下面的文章了解更多详细内容。

40

2026.01.31

无需付费的漫画app大全
无需付费的漫画app大全

想找真正免费又无套路的漫画App?本合集精选多款永久免费、资源丰富、无广告干扰的优质漫画应用,涵盖国漫、日漫、韩漫及经典老番,满足各类阅读需求。阅读专题下面的文章了解更多详细内容。

50

2026.01.31

漫画免费在线观看地址大全
漫画免费在线观看地址大全

想找免费又资源丰富的漫画网站?本合集精选2025-2026年热门平台,涵盖国漫、日漫、韩漫等多类型作品,支持高清流畅阅读与离线缓存。阅读专题下面的文章了解更多详细内容。

11

2026.01.31

漫画防走失登陆入口大全
漫画防走失登陆入口大全

2026最新漫画防走失登录入口合集,汇总多个稳定可用网址,助你畅享高清无广告漫画阅读体验。阅读专题下面的文章了解更多详细内容。

13

2026.01.31

php多线程怎么实现
php多线程怎么实现

PHP本身不支持原生多线程,但可通过扩展如pthreads、Swoole或结合多进程、协程等方式实现并发处理。阅读专题下面的文章了解更多详细内容。

1

2026.01.31

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
React 教程
React 教程

共58课时 | 4.4万人学习

Pandas 教程
Pandas 教程

共15课时 | 1.0万人学习

ASP 教程
ASP 教程

共34课时 | 4.3万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号