0

0

Java 实现多关键词与短语的模糊匹配检测(支持子串与完整词组)

心靈之曲

心靈之曲

发布时间:2026-03-09 10:50:12

|

514人浏览过

|

来源于php中文网

原创

java 实现多关键词与短语的模糊匹配检测(支持子串与完整词组)

本文介绍如何在 Java 中高效检测文本字段是否包含来自黑名单(如商标库)的单个词汇或连续词组,通过流式处理结合字符串包含判断,兼顾性能与可读性,并给出可直接落地的代码示例与关键注意事项。

本文介绍如何在 Java 中高效检测文本字段是否包含来自黑名单(如商标库)的单个词汇或连续词组,通过流式处理结合字符串包含判断,兼顾性能与可读性,并给出可直接落地的代码示例与关键注意事项。

在实际业务场景中(例如内容审核、品牌合规检查),我们常需判断一段自由文本(如 words.keyword)是否隐含敏感词或注册商标——这些敏感词不仅包括单个单词(如 "ibm"),也可能为固定搭配的短语(如 "while swam")。此时,简单的 List.contains() 完全失效,因为它是精确全匹配;而基于子串的模糊匹配(String.indexOf() 或 String.contains())才是正确路径。

以下是一个专业、简洁且可扩展的 Java 实现方案:

✅ 核心逻辑:双重流式匹配

使用嵌套 Stream:外层遍历待检测文本(ProcessedWords),内层遍历黑名单项(BlacklistedWords),只要任一黑名单项(trademark)作为子串出现在当前文本中,即视为命中。

Dora
Dora

创建令人惊叹的3D动画网站,无需编写一行代码。

下载

立即学习Java免费学习笔记(深入)”;

List<ProcessedWords> detected = processedWordsService.findAll().stream()
    .filter(word -> blacklistedWordsService.findAll().stream()
        .anyMatch(blacklist -> word.getKeyword() != null && 
                               word.getKeyword().contains(blacklist.getTrademark())))
    .collect(Collectors.toList());

? 注意:blacklist.getTrademark() 对应数据库 trademarks.trademark 字段(非 keyword),请确保实体类字段命名准确。示例中 BlacklistedWords 实体应映射 trademarks 表,其核心字段为 trademark: String。

✅ 完整可运行示例(含模拟数据)

public class TrademarkMatcher {
    public static void main(String[] args) {
        // 模拟数据库查询结果(生产环境替换为真实 Service 调用)
        List<BlacklistedWords> trademarks = Arrays.asList(
            new BlacklistedWords(1L, "while swam"),
            new BlacklistedWords(2L, "ibm"),
            new BlacklistedWords(3L, "bmw")
        );

        List<ProcessedWords> candidates = Arrays.asList(
            new ProcessedWords(1L, "while swam is interesting"),
            new ProcessedWords(2L, "ibm is a company like bmw"),
            new ProcessedWords(3L, "this is clean text")
        );

        List<ProcessedWords> matches = candidates.stream()
            .filter(candidate -> trademarks.stream()
                .anyMatch(tm -> candidate.getKeyword() != null &&
                                candidate.getKeyword().contains(tm.getTrademark())))
            .collect(Collectors.toList());

        System.out.println("Detected matches:");
        matches.forEach(System.out::println);
        // 输出:
        // ProcessedWords(id=1, keyword=while swam is interesting)
        // ProcessedWords(id=2, keyword=ibm is a company like bmw)
    }
}

⚠️ 关键注意事项

  • 空值防护:务必检查 candidate.getKeyword() 是否为 null,避免 NullPointerException;
  • 大小写敏感:String.contains() 区分大小写。若需忽略大小写,改用:
    candidate.getKeyword().toLowerCase().contains(tm.getTrademark().toLowerCase())

    (更推荐预处理:将黑名单与文本统一转小写后缓存,避免重复计算)

  • 性能优化建议
    • 黑名单量大(数千+)时,避免每次匹配都查库 → 使用 @Cacheable 缓存 blacklistedWordsService.findAll() 结果;
    • 如需支持正则或词边界匹配(如防止 "ibm" 匹配 "ibmz"),应改用 Pattern + Matcher,但会显著增加开销;
  • SQL 层替代方案(补充):PostgreSQL 可用 ILIKE 或全文检索(to_tsvector/to_tsquery),但短语匹配仍推荐应用层处理,逻辑更可控、调试更直观。

✅ 总结

该方案以最小侵入性实现“关键词 + 词组”两级模糊匹配,代码简洁、语义清晰、易于单元测试。它不依赖外部工具或复杂算法,适用于中低频实时检测场景。后续可平滑升级为基于 Aho-Corasick 自动机的高性能多模式匹配,但对多数合规筛查需求而言,当前流式子串匹配已是高性价比首选。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
数据分析工具有哪些
数据分析工具有哪些

数据分析工具有Excel、SQL、Python、R、Tableau、Power BI、SAS、SPSS和MATLAB等。详细介绍:1、Excel,具有强大的计算和数据处理功能;2、SQL,可以进行数据查询、过滤、排序、聚合等操作;3、Python,拥有丰富的数据分析库;4、R,拥有丰富的统计分析库和图形库;5、Tableau,提供了直观易用的用户界面等等。

1133

2023.10.12

SQL中distinct的用法
SQL中distinct的用法

SQL中distinct的语法是“SELECT DISTINCT column1, column2,...,FROM table_name;”。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

340

2023.10.27

SQL中months_between使用方法
SQL中months_between使用方法

在SQL中,MONTHS_BETWEEN 是一个常见的函数,用于计算两个日期之间的月份差。想了解更多SQL的相关内容,可以阅读本专题下面的文章。

381

2024.02.23

SQL出现5120错误解决方法
SQL出现5120错误解决方法

SQL Server错误5120是由于没有足够的权限来访问或操作指定的数据库或文件引起的。想了解更多sql错误的相关内容,可以阅读本专题下面的文章。

2109

2024.03.06

sql procedure语法错误解决方法
sql procedure语法错误解决方法

sql procedure语法错误解决办法:1、仔细检查错误消息;2、检查语法规则;3、检查括号和引号;4、检查变量和参数;5、检查关键字和函数;6、逐步调试;7、参考文档和示例。想了解更多语法错误的相关内容,可以阅读本专题下面的文章。

380

2024.03.06

oracle数据库运行sql方法
oracle数据库运行sql方法

运行sql步骤包括:打开sql plus工具并连接到数据库。在提示符下输入sql语句。按enter键运行该语句。查看结果,错误消息或退出sql plus。想了解更多oracle数据库的相关内容,可以阅读本专题下面的文章。

1642

2024.04.07

sql中where的含义
sql中where的含义

sql中where子句用于从表中过滤数据,它基于指定条件选择特定的行。想了解更多where的相关内容,可以阅读本专题下面的文章。

585

2024.04.29

sql中删除表的语句是什么
sql中删除表的语句是什么

sql中用于删除表的语句是drop table。语法为drop table table_name;该语句将永久删除指定表的表和数据。想了解更多sql的相关内容,可以阅读本专题下面的文章。

439

2024.04.29

JavaScript浏览器渲染机制与前端性能优化实践
JavaScript浏览器渲染机制与前端性能优化实践

本专题围绕 JavaScript 在浏览器中的执行与渲染机制展开,系统讲解 DOM 构建、CSSOM 解析、重排与重绘原理,以及关键渲染路径优化方法。内容涵盖事件循环机制、异步任务调度、资源加载优化、代码拆分与懒加载等性能优化策略。通过真实前端项目案例,帮助开发者理解浏览器底层工作原理,并掌握提升网页加载速度与交互体验的实用技巧。

59

2026.03.06

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Kotlin 教程
Kotlin 教程

共23课时 | 4.2万人学习

C# 教程
C# 教程

共94课时 | 11万人学习

Java 教程
Java 教程

共578课时 | 79.3万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号