CPU 100%

先 top -Hp 找线程 tid,转 16 进制后 jstack 定位栈帧。常见:正则灾难、无限循环、GC 线程忙、线程池任务过重。

内存泄漏

堆曲线单调上涨,Full GC 后不回落。MAT 看 Leak Suspects, dominator 找保留大对象的路径,重点怀疑静态集合、ThreadLocal、缓存无上限。

联动中间件

慢 SQL 导致连接池占满,表现为线程 BLOCKED;Redis 超时堆积任务队列。排查要跨层证据链,不要只盯 JVM。

清单

保留 GC 日志、开启 OOM heap dump、线程池命名、限流熔断,比事后 MAT 更值钱。

课堂外的思考

学习「Java 后端线上问题排查:CPU、内存、GC、线程池、数据库与 Redis」时,我把自己放在线上值班的情境里:如果告警与这一主题相关,我能否在较短时间内建立假设并用数据验证?这种提问方式逼迫我从「看过」变成「讲得清楚、做得到」,也避免笔记沦为标题摘抄。

与同事的讨论方式

我会用白板画出状态机、内存布局或调用链,请同事挑错。若被追问「更高并发或更老 JDK 版本会怎样」,答不上来就回到文首原文链接查 primary source,而不是凭记忆硬编。讨论后把新认识补进笔记末尾。

可复现实验

为每个主题保留最小复现:一段可运行的 Java 片段、一条 jcmd/jstack 命令,或一组压测对比。记录环境(JDK 小版本、CPU 核数、容器限制),结论才可靠。实验细节不必全部公开,但索引要能找到。

补充复习

把本篇三个关键词写入间隔重复卡片,并各关联一个真实项目场景;暂时用不到的概念标记「待实践」,避免笔记只增不用。