0

0

如何在 Java 中按首次出现的单词(大小写敏感)统计词频

聖光之護

聖光之護

发布时间:2026-01-02 13:01:32

|

244人浏览过

|

来源于php中文网

原创

如何在 Java 中按首次出现的单词(大小写敏感)统计词频

本文介绍使用 treemap 配合 string.case_insensitive_order 比较器,实现“忽略大小写分组、保留首次出现形式作为键”的单词频次统计,适用于需保持原始大小写标识的场景。

在实际开发中,我们常需统计字符串数组中单词的出现次数,但要求:分组逻辑不区分大小写(如 "AA"、"Aa"、"aa" 视为同一类),而最终的键必须是该类中首次出现的原始字符串(如第一个出现的是 "AA",则结果中键为 "AA",而非标准化后的 "aa")。这与简单地统一转小写(s.toLowerCase())再计数不同——后者会丢失原始格式,也无法满足“以首次出现为准”的业务约束。

Java 的 TreeMap 提供了完美的解决方案:它支持自定义比较器,且在插入时根据比较逻辑判断键是否“已存在”。利用 String.CASE_INSENSITIVE_ORDER 作为比较器,TreeMap 会将 "AA"、"Aa"、"aa" 视为相等键,从而确保它们映射到同一个桶;更重要的是,TreeMap 不会覆盖已有键,而是保留第一次成功插入的键对象本身——这正是我们所需的“首现优先”行为。

以下是简洁、线程安全(若需并发可搭配 Collections.synchronizedMap)、符合语义的实现:

import java.util.*;

public class CaseInsensitiveFirstOccurrenceCounter {
    public static void main(String[] args) {
        final TreeMap<String, Integer> counter 
            = new TreeMap<>(String.CASE_INSENSITIVE_ORDER);

        final String[] words = {"AA", "Bb", "Aa", "aa", "BB"};

        for (final String word : words) {
            counter.merge(word, 1, Integer::sum);
        }

        System.out.println(counter); // 输出: {AA=3, Bb=2}

        // 再验证另一组示例
        final String[] words2 = {"AAa", "aaa", "BBB", "bbb", "BbB", "AaA", "AAc"};
        final TreeMap<String, Integer> counter2 
            = new TreeMap<>(String.CASE_INSENSITIVE_ORDER);

        for (final String word : words2) {
            counter2.merge(word, 1, Integer::sum);
        }

        System.out.println(counter2); // 输出: {AAa=3, BBB=3, AAc=1}
    }
}

关键原理说明

拍我AI
拍我AI

AI视频生成平台PixVerse的国内版本

下载

立即学习Java免费学习笔记(深入)”;

  • String.CASE_INSENSITIVE_ORDER.compare("AA", "aa") == 0 → 被视为相同键;
  • TreeMap.put("AA", 1) 后,再 put("aa", 1) 不会替换键 "AA",而是更新其值(通过 merge 实现累加);
  • 因此,键始终是该等价类中第一个被插入的原始字符串,天然满足“首次出现形式为键”的需求。

⚠️ 注意事项

  • TreeMap 是有序映射(按比较器排序),若无需排序,可改用 LinkedHashMap + 手动维护首次键映射表,但代码复杂度显著上升;
  • ConcurrentHashMap 不支持自定义比较器,原问题中尝试的嵌套遍历 keySet 方式存在竞态风险且效率低(O(n²)),应避免;
  • merge() 方法是 Java 8 引入的原子操作,等价于 map.compute(key, (k, v) -> (v == null) ? 1 : v + 1),简洁且线程安全(在单个 map 操作层面)。

综上,TreeMap 配合 String.CASE_INSENSITIVE_ORDER 是解决该问题最优雅、高效且语义清晰的标准方案。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
string转int
string转int

在编程中,我们经常会遇到需要将字符串(str)转换为整数(int)的情况。这可能是因为我们需要对字符串进行数值计算,或者需要将用户输入的字符串转换为整数进行处理。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

1010

2023.08.02

c语言中null和NULL的区别
c语言中null和NULL的区别

c语言中null和NULL的区别是:null是C语言中的一个宏定义,通常用来表示一个空指针,可以用于初始化指针变量,或者在条件语句中判断指针是否为空;NULL是C语言中的一个预定义常量,通常用来表示一个空值,用于表示一个空的指针、空的指针数组或者空的结构体指针。

254

2023.09.22

java中null的用法
java中null的用法

在Java中,null表示一个引用类型的变量不指向任何对象。可以将null赋值给任何引用类型的变量,包括类、接口、数组、字符串等。想了解更多null的相关内容,可以阅读本专题下面的文章。

1089

2024.03.01

js 字符串转数组
js 字符串转数组

js字符串转数组的方法:1、使用“split()”方法;2、使用“Array.from()”方法;3、使用for循环遍历;4、使用“Array.split()”方法。本专题为大家提供js字符串转数组的相关的文章、下载、课程内容,供大家免费下载体验。

760

2023.08.03

js截取字符串的方法
js截取字符串的方法

js截取字符串的方法有substring()方法、substr()方法、slice()方法、split()方法和slice()方法。本专题为大家提供字符串相关的文章、下载、课程内容,供大家免费下载体验。

221

2023.09.04

java基础知识汇总
java基础知识汇总

java基础知识有Java的历史和特点、Java的开发环境、Java的基本数据类型、变量和常量、运算符和表达式、控制语句、数组和字符串等等知识点。想要知道更多关于java基础知识的朋友,请阅读本专题下面的的有关文章,欢迎大家来php中文网学习。

1566

2023.10.24

字符串介绍
字符串介绍

字符串是一种数据类型,它可以是任何文本,包括字母、数字、符号等。字符串可以由不同的字符组成,例如空格、标点符号、数字等。在编程中,字符串通常用引号括起来,如单引号、双引号或反引号。想了解更多字符串的相关内容,可以阅读本专题下面的文章。

649

2023.11.24

java读取文件转成字符串的方法
java读取文件转成字符串的方法

Java8引入了新的文件I/O API,使用java.nio.file.Files类读取文件内容更加方便。对于较旧版本的Java,可以使用java.io.FileReader和java.io.BufferedReader来读取文件。在这些方法中,你需要将文件路径替换为你的实际文件路径,并且可能需要处理可能的IOException异常。想了解更多java的相关内容,可以阅读本专题下面的文章。

1228

2024.03.22

C# ASP.NET Core微服务架构与API网关实践
C# ASP.NET Core微服务架构与API网关实践

本专题围绕 C# 在现代后端架构中的微服务实践展开,系统讲解基于 ASP.NET Core 构建可扩展服务体系的核心方法。内容涵盖服务拆分策略、RESTful API 设计、服务间通信、API 网关统一入口管理以及服务治理机制。通过真实项目案例,帮助开发者掌握构建高可用微服务系统的关键技术,提高系统的可扩展性与维护效率。

3

2026.03.11

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Kotlin 教程
Kotlin 教程

共23课时 | 4.3万人学习

C# 教程
C# 教程

共94课时 | 11.1万人学习

Java 教程
Java 教程

共578课时 | 80.7万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号