0

0

从一次线上故障思考Java问题定位思路

爱谁谁

爱谁谁

发布时间:2025-07-22 10:06:11

|

799人浏览过

|

来源于php中文网

原创

在cgi服务发布到生产环境后,出现了full gc告警和cpu飙升至99%的情况。在优先恢复生产服务后,开始着手解决full gc问题。虽然现场只抓到了四个gc线程占用高cpu,但未能找到引发full gc的线程。查看服务故障期间的错误日志,发现主要是full gc引发的服务异常日志,无法确定full gc的根本原因。为了找出问题根源,只能从发布本身入手,检查代码,发现一次bugfix提交可能触发了死循环逻辑:

代码语言:javascript

for(int i = 1 ;i < totalPage ; i++) {
    // 循环体
}

循环中的totalPage为long类型,由外部参数赋值。当外部参数非常大,超过int的最大值时,i递增到int的最大值后,i++会翻转成负数,从而导致for循环进入死循环。可以通过以下代码验证:

代码语言:javascript

public static void main(String[] args) {
    long totalPage = Long.MAX_VALUE;
    for(int i = 0 ;i

通过日志确认,外部确实传递了一个非常大的参数:

立即学习Java免费学习笔记(深入)”;

从一次线上故障思考Java问题定位思路

确认命中该逻辑时,会进入死循环。在循环中不断进行字符串拼接和列表添加操作,很快就会耗尽JVM堆内存,导致Full GC。经测算,即使不是死循环,一个较大的循环也足以引发Full GC。对totalPage的大小进行了限制后,发布了新版本,Full GC问题不再出现。

现场还原:重现问题,探索定位思路回顾排查问题的过程并不高效,最初怀疑是否是打包问题或JDK版本不对,花了较多时间确认打包问题。另一方面,发布带出的代码较多,通过重复review代码无法快速锁定问题。为了探索更有效的问题定位方法,将有问题的代码重新部署到机器上,手动构造请求触发bug,探索定位此类问题的通用思路。

如何确定bug可以导致CPU飙升?为何会引发OOM?1)在Java服务上开启JMX,在本地使用VisualVm查看Java服务运行过程中的内存、GC、线程等信息。VisualVM是Sun的一个OpenJDK项目,集成了多个JDK命令工具的可视化工具,用于监控JVM运行情况,可以查看和浏览Heap Dump、Thread Dump、内存对象实例情况、GC执行情况、CPU消耗以及类的装载情况,也可以创建必要信息的日志。

从一次线上故障思考Java问题定位思路

可以看到逻辑被命中时,CPU确实升到100%,此时也发生了Full GC告警。尝试多发几次请求,服务直接挂掉。这里有个问题:不是已经Full GC了吗,为什么还会发生OOM?实际上,虽然JVM已经开始回收内存,但由于对象被引用,这些内存无法回收。从GC日志可以看到回收情况:

从一次线上故障思考Java问题定位思路

从GC日志中可以看到,新生代的Eden区域与老年代都已被占满。如果新生代放不下对象,object会直接放到老年代中。除了GC日志,也可以使用jstat命令统计Java堆内存使用情况:

1000为统计的间隔,单位为毫秒,10为统计的次数,输出如下:

从一次线上故障思考Java问题定位思路

从输出中同样可以看到E(Eden)区与O(Old)区都已被占满。其他几个输出项的含义如下:

可以看到JVM一直在尝试回收老年代,但一直没能将内存回收回来。

如何获取占用CPU最高的线程id?2)可以登上机器,确认是什么线程使CPU飙高。先ps查看Java进程的PID:

从一次线上故障思考Java问题定位思路

拿到进程pid后,可以使用top命令,来看是什么线程占用了CPU。

-p用于指定进程,-H用于获取每个线程的信息,从top输出的内容,可以看到有四个线程占用了非常高的CPU:

从一次线上故障思考Java问题定位思路

MaxAI
MaxAI

MaxAI.me是一款功能强大的浏览器AI插件,集成了多种AI模型。

下载

到这里可以拿到12313、12312、12311、12314这四个线程id。为了确定这些是什么线程,需要使用jstack命令来查看这几个是什么线程。

高占用CPU的是什么线程?3)jstack是java虚拟机自带的一种堆栈跟踪工具,用于打印出给定的java进程ID或core file或远程调试服务的Java堆栈信息。使用下面命令,将java进程的堆栈信息打印到文件中:

在线程堆栈信息中,线程id是使用十六进制来表示的。将上面四个线程id转换为16进制,分别是0X3019、0X3018、0x3017、0x301A。在stack.log中可以找到这几个线程:

从一次线上故障思考Java问题定位思路

到这里可以确定的是,死循环引发了Full GC,四个GC线程一直尝试着回收内存,这四个线程将CPU占满。

是哪些对象占用了内存?4)Full GC、OOM、CPU被占满的问题都得到了解答。那么再次遇到类似的线上问题时,如何确定或者缩小问题范围,找到导致问题的代码呢?这时候需要进一步观察的是Java堆内存的信息,查看是什么对象占用了内存。可以使用上文提到的VisualVM来生成headdump文件:

从一次线上故障思考Java问题定位思路

也可以在机器上使用jmap命令来生成head dump文件。

live这个参数表示我们需要抓取的是目前在生命周期内的内存对象,也就是说GC收不走的对象,在这种场景下,我们需要的就是这些内存的信息。生成了hprof文件后,可以拉回到本地,使用VisualVM来打开它进行分析。打开后可以看到:

从一次线上故障思考Java问题定位思路

从信息中可以看到,字符串char[]占了内存的73%,因此可以确定的是内存泄漏与字符串有关。通常生成的headdump文件会很大,也可以使用下面的命令,来查看占用内存最多的类型:

输出内容如下:

从一次线上故障思考Java问题定位思路

能否对堆内对象进行查询?5)到这里突然有个想法,如果能够分析出相似度高的字符串,那么有比较大的可能是这些字符串存在泄漏,从而可以缩小问题代码的范围。确实是有这么一种工具来对堆内的对象进行分析,也就是OQL(Object Query Language),在VisualVM中可以对headdump文件执行对象查询,下面是一个示例,查找包含内容最多的List:

查询结果如下:

从一次线上故障思考Java问题定位思路

如何查找到相似度最高的字符串,还在继续学习研究中。

一些疑问与总结1)为什么无法抓到引发Full GC的线程?一个猜测是线程抛出OOM异常之后就被终止了,线程只存活了很短的时间。2)为什么对Eden区回收后存活的对象,不会被拷贝到survivor区?从上面的GC日志可以看到,BeforeGC与AfterGC,新生代中的两个survivor区(也就是from\to)一直都是0%,这里猜想可能是survivor区太小,没有足够的空间存放从Eden区拷贝过来的对象。同时老年代也没有足够的空间(已经99%了),因此JVM的GC基本没有什么有效的回收操作。3)重现问题时,在日志里发现了一个OOM的错误信息:

代码语言:javascript

java.lang.OutOfMemoryError: GC overhead limit exceeded

这种情况发生的原因是, 程序基本上耗尽了所有的可用内存, GC也清理不了。JVM执行垃圾收集的时间比例太大, 有效的运算量太小. 默认情况下, 如果GC花费的时间超过98%, 并且GC回收的内存少于2%, JVM就会抛出这个错误。从这里也可以看到GC线程一直在尝试回收内存,但是回收效果实在太差,也就是第二点提到的。4)当时在线上环境出现问题时,看到很多log4j的错误日志信息,是什么原因?猜测大概是写日志的I/O操作要经过内存,而内存已经被使用光,无法进行写操作所导致。这些问题都可以进一步研究。

对于一般的OOM问题,通过这几个方面的思考,大致可以锁定问题所在,或是缩小问题可能发生的范围。例如对某些特定类型的内存泄漏来说,到这一步已经可以分析出是什么类型导致内存泄漏。而对本案例来说,根据排查结果可以优先考虑的是字符串的泄露,代码review中查看是否有操作字符串的地方,而不会将问题的优先级锁定在打包问题上。

相关专题

更多
java
java

Java是一个通用术语,用于表示Java软件及其组件,包括“Java运行时环境 (JRE)”、“Java虚拟机 (JVM)”以及“插件”。php中文网还为大家带了Java相关下载资源、相关课程以及相关文章等内容,供大家免费下载使用。

837

2023.06.15

java正则表达式语法
java正则表达式语法

java正则表达式语法是一种模式匹配工具,它非常有用,可以在处理文本和字符串时快速地查找、替换、验证和提取特定的模式和数据。本专题提供java正则表达式语法的相关文章、下载和专题,供大家免费下载体验。

741

2023.07.05

java自学难吗
java自学难吗

Java自学并不难。Java语言相对于其他一些编程语言而言,有着较为简洁和易读的语法,本专题为大家提供java自学难吗相关的文章,大家可以免费体验。

736

2023.07.31

java配置jdk环境变量
java配置jdk环境变量

Java是一种广泛使用的高级编程语言,用于开发各种类型的应用程序。为了能够在计算机上正确运行和编译Java代码,需要正确配置Java Development Kit(JDK)环境变量。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

397

2023.08.01

java保留两位小数
java保留两位小数

Java是一种广泛应用于编程领域的高级编程语言。在Java中,保留两位小数是指在进行数值计算或输出时,限制小数部分只有两位有效数字,并将多余的位数进行四舍五入或截取。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

399

2023.08.02

java基本数据类型
java基本数据类型

java基本数据类型有:1、byte;2、short;3、int;4、long;5、float;6、double;7、char;8、boolean。本专题为大家提供java基本数据类型的相关的文章、下载、课程内容,供大家免费下载体验。

446

2023.08.02

java有什么用
java有什么用

java可以开发应用程序、移动应用、Web应用、企业级应用、嵌入式系统等方面。本专题为大家提供java有什么用的相关的文章、下载、课程内容,供大家免费下载体验。

430

2023.08.02

java在线网站
java在线网站

Java在线网站是指提供Java编程学习、实践和交流平台的网络服务。近年来,随着Java语言在软件开发领域的广泛应用,越来越多的人对Java编程感兴趣,并希望能够通过在线网站来学习和提高自己的Java编程技能。php中文网给大家带来了相关的视频、教程以及文章,欢迎大家前来学习阅读和下载。

16926

2023.08.03

PHP WebSocket 实时通信开发
PHP WebSocket 实时通信开发

本专题系统讲解 PHP 在实时通信与长连接场景中的应用实践,涵盖 WebSocket 协议原理、服务端连接管理、消息推送机制、心跳检测、断线重连以及与前端的实时交互实现。通过聊天系统、实时通知等案例,帮助开发者掌握 使用 PHP 构建实时通信与推送服务的完整开发流程,适用于即时消息与高互动性应用场景。

11

2026.01.19

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
React 教程
React 教程

共58课时 | 3.8万人学习

Pandas 教程
Pandas 教程

共15课时 | 0.9万人学习

ASP 教程
ASP 教程

共34课时 | 3.7万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号