Java 实现多关键词与短语的模糊匹配检测（支持子串与完整词组）

心靈之曲

发布时间：2026-03-09 10:50:12

514人浏览过

来源于php中文网

原创

java 实现多关键词与短语的模糊匹配检测（支持子串与完整词组）

本文介绍如何在 Java 中高效检测文本字段是否包含来自黑名单（如商标库）的单个词汇或连续词组，通过流式处理结合字符串包含判断，兼顾性能与可读性，并给出可直接落地的代码示例与关键注意事项。

本文介绍如何在 Java 中高效检测文本字段是否包含来自黑名单（如商标库）的单个词汇或连续词组，通过流式处理结合字符串包含判断，兼顾性能与可读性，并给出可直接落地的代码示例与关键注意事项。

在实际业务场景中（例如内容审核、品牌合规检查），我们常需判断一段自由文本（如 words.keyword）是否隐含敏感词或注册商标——这些敏感词不仅包括单个单词（如 "ibm"），也可能为固定搭配的短语（如 "while swam"）。此时，简单的 List.contains() 完全失效，因为它是精确全匹配；而基于子串的模糊匹配（String.indexOf() 或 String.contains()）才是正确路径。

以下是一个专业、简洁且可扩展的 Java 实现方案：

✅ 核心逻辑：双重流式匹配

使用嵌套 Stream：外层遍历待检测文本（ProcessedWords），内层遍历黑名单项（BlacklistedWords），只要任一黑名单项（trademark）作为子串出现在当前文本中，即视为命中。

Dora

创建令人惊叹的3D动画网站，无需编写一行代码。

下载

立即学习“Java免费学习笔记（深入）”；

List<ProcessedWords> detected = processedWordsService.findAll().stream()
    .filter(word -> blacklistedWordsService.findAll().stream()
        .anyMatch(blacklist -> word.getKeyword() != null && 
                               word.getKeyword().contains(blacklist.getTrademark())))
    .collect(Collectors.toList());

? 注意：blacklist.getTrademark() 对应数据库 trademarks.trademark 字段（非 keyword），请确保实体类字段命名准确。示例中 BlacklistedWords 实体应映射 trademarks 表，其核心字段为 trademark: String。

✅ 完整可运行示例（含模拟数据）

public class TrademarkMatcher {
    public static void main(String[] args) {
        // 模拟数据库查询结果（生产环境替换为真实 Service 调用）
        List<BlacklistedWords> trademarks = Arrays.asList(
            new BlacklistedWords(1L, "while swam"),
            new BlacklistedWords(2L, "ibm"),
            new BlacklistedWords(3L, "bmw")
        );

        List<ProcessedWords> candidates = Arrays.asList(
            new ProcessedWords(1L, "while swam is interesting"),
            new ProcessedWords(2L, "ibm is a company like bmw"),
            new ProcessedWords(3L, "this is clean text")
        );

        List<ProcessedWords> matches = candidates.stream()
            .filter(candidate -> trademarks.stream()
                .anyMatch(tm -> candidate.getKeyword() != null &&
                                candidate.getKeyword().contains(tm.getTrademark())))
            .collect(Collectors.toList());

        System.out.println("Detected matches:");
        matches.forEach(System.out::println);
        // 输出：
        // ProcessedWords(id=1, keyword=while swam is interesting)
        // ProcessedWords(id=2, keyword=ibm is a company like bmw)
    }
}

⚠️ 关键注意事项

空值防护：务必检查 candidate.getKeyword() 是否为 null，避免 NullPointerException；
大小写敏感：String.contains() 区分大小写。若需忽略大小写，改用：
```
candidate.getKeyword().toLowerCase().contains(tm.getTrademark().toLowerCase())
```
（更推荐预处理：将黑名单与文本统一转小写后缓存，避免重复计算）
性能优化建议：
- 黑名单量大（数千+）时，避免每次匹配都查库 → 使用 @Cacheable 缓存 blacklistedWordsService.findAll() 结果；
- 如需支持正则或词边界匹配（如防止 "ibm" 匹配 "ibmz"），应改用 Pattern + Matcher，但会显著增加开销；
SQL 层替代方案（补充）：PostgreSQL 可用 ILIKE 或全文检索（to_tsvector/to_tsquery），但短语匹配仍推荐应用层处理，逻辑更可控、调试更直观。

✅ 总结

该方案以最小侵入性实现“关键词 + 词组”两级模糊匹配，代码简洁、语义清晰、易于单元测试。它不依赖外部工具或复杂算法，适用于中低频实时检测场景。后续可平滑升级为基于 Aho-Corasick 自动机的高性能多模式匹配，但对多数合规筛查需求而言，当前流式子串匹配已是高性价比首选。

如何理解Java中的副作用(Side Effect)_表达式计算注意事项

Java中的CAS操作是什么_Compare-And-Swap底层CPU指令解析

深入理解Java中的静态内部类_为什么它不持有外部类的引用

Java中接口可以定义变量吗_接口常量与默认方法说明

如何实现Java的代理模式_静态代理与动态代理的OOP实现

相关专题

数据分析工具有哪些

数据分析工具有Excel、SQL、Python、R、Tableau、Power BI、SAS、SPSS和MATLAB等。详细介绍：1、Excel，具有强大的计算和数据处理功能；2、SQL，可以进行数据查询、过滤、排序、聚合等操作；3、Python，拥有丰富的数据分析库；4、R，拥有丰富的统计分析库和图形库；5、Tableau，提供了直观易用的用户界面等等。

1133

2023.10.12

SQL中distinct的用法

SQL中distinct的语法是“SELECT DISTINCT column1, column2,...,FROM table_name;”。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

340

2023.10.27

SQL中months_between使用方法

在SQL中，MONTHS_BETWEEN 是一个常见的函数，用于计算两个日期之间的月份差。想了解更多SQL的相关内容，可以阅读本专题下面的文章。

381

2024.02.23

SQL出现5120错误解决方法

SQL Server错误5120是由于没有足够的权限来访问或操作指定的数据库或文件引起的。想了解更多sql错误的相关内容，可以阅读本专题下面的文章。

2109

2024.03.06

sql procedure语法错误解决方法

sql procedure语法错误解决办法：1、仔细检查错误消息；2、检查语法规则；3、检查括号和引号；4、检查变量和参数；5、检查关键字和函数；6、逐步调试；7、参考文档和示例。想了解更多语法错误的相关内容，可以阅读本专题下面的文章。

380

2024.03.06

oracle数据库运行sql方法

运行sql步骤包括：打开sql plus工具并连接到数据库。在提示符下输入sql语句。按enter键运行该语句。查看结果，错误消息或退出sql plus。想了解更多oracle数据库的相关内容，可以阅读本专题下面的文章。

1642

2024.04.07

sql中where的含义

sql中where子句用于从表中过滤数据，它基于指定条件选择特定的行。想了解更多where的相关内容，可以阅读本专题下面的文章。

585

2024.04.29

sql中删除表的语句是什么

sql中用于删除表的语句是drop table。语法为drop table table_name；该语句将永久删除指定表的表和数据。想了解更多sql的相关内容，可以阅读本专题下面的文章。

439

2024.04.29

JavaScript浏览器渲染机制与前端性能优化实践

本专题围绕 JavaScript 在浏览器中的执行与渲染机制展开，系统讲解 DOM 构建、CSSOM 解析、重排与重绘原理，以及关键渲染路径优化方法。内容涵盖事件循环机制、异步任务调度、资源加载优化、代码拆分与懒加载等性能优化策略。通过真实前端项目案例，帮助开发者理解浏览器底层工作原理，并掌握提升网页加载速度与交互体验的实用技巧。

2026.03.06

热门下载

网站特效

网站源码

网站素材

前端模板