线上应用诊断与调试利器——Arthas
wptr33 2024-12-11 17:30 27 浏览
转载本文需注明出处:微信公众号EAWorld,违者必究。
?????什么是Arthas?????????????
Java 诊断利器 Arthas,是阿里的一款开源工具。Github-alibaba/arthas 上可以看到它的介绍。
在日常开发中,当我们发现应用的某个接口响应比较慢,这个时候想想要分析一下原因,找到代码中耗时的部分,比较容易想到的是在接口链路的 IO 操作上下游打印时间日志,再根据几个时间点的日志算出耗时长的 IO 操作。这种方式没有问题,但是加日志需要发布,既繁琐又低效,这个时候可以引入一些线上 debug 的工具,arthas 就是很好的一种,除了分析耗时,还可以打印调用栈、方法入参及返回,类加载情况,线程池状态,系统参数等等,其实现原理是解析 JVM 在操作系统中的文件,大部分操作是只读的,对服务进程没有侵入性,因此可以放心使用。
Arthas能解决什么问题?
从我个人的使用经验来看,Arthas至少帮我解决了以下几个问题:
- 监控某方法查看其整个调用链路,从而找出某次调用的性能瓶颈。
- 反编译某个类,查看线上的代码是否与本地代码一致,避免没有提交代码而导致的问题。
- 站在全局视角查看整个系统的运行情况,比如观察内存增长、GC的情况。
- 在微服务架构背景下,通常本地没有完整的环境,此时可以直接在测试环境监控某个方法传入的参数是否正确,返回值是否正确。
快速开始
下载并启动arthas
输入以下命令启动arthas程序
curl -O https://arthas.aliyun.com/arthas-demo.jarjava -jar arthas-demo.jar
选择需要监控应用的进程编号,回车后Arthas会attach到目标进程上,并输出日志:
容器中使用
docker exec -it arthas-demo /bin/sh -c "java -jar /opt/arthas/arthas-boot.jar"
甚至我们可以直接把arthas放到容器镜像文件中:
COPY --from=hengyunabc/arthas:latest /opt/arthas /opt/arthas
Arthas常用命令
下面简要为大家介绍一下Arthas常用的几个命令。
dashboard
使用dashboard命令会显示以下信息:
1. 当前最繁忙的一些线程
2. 显示应用当前使用的内存信息,包括堆内存、新生代伊甸区、老年代、非堆内存的使用情况。
3. 显示程序的GC情况,包括YGC次数、总花费时间,FGC的次数、总花费时间。
4. 当前程序的一些信息,包括系统版本、JDK版本、程序运行时长等。
Thread
查看当前线程信息,查看线程的堆栈
// 查看 CPU 使用率 top n 的线程的栈,当前最忙的前 n 个线程:thread -n 3// 查看 5 秒内的 CPU 使用率 top n 的线程栈:thread -n 3 -i 5000?// 查看线程是否有阻塞:thread -b
watch
有时候我们不太方便进行本地调试,这个时候可以使用watch监控某个方法,然后点击相关的功能,查看该方法的调用情况:
watch com.primeton.dgp.assets.controller.DsResourcePoolController getResourcePool "{params,returnObj}" -x 2
执行以上命令后,控制台会hold在被监控的方法上,此时再次点击页面上的按钮,控制台就会打印此次的调用结果。
trace
trace 命令能主动搜索 class-pattern/method-pattern 对应的方法调用路径,渲染和统计整个调用链路上的所有性能开销和追踪调用链路。通常我们用这个方法可以看到整个调用路径的耗时,从而找出真正的性能瓶颈,帮助解决问题。
trace com.primeton.dgp.assets.controller.DsResourcePoolController getResourcePool
tt
tt方法执行数据的时空隧道,记录下指定方法每次调用的入参和返回信息,并能对这些不同的时间下调用进行观测,使用方法如下:
tt -t com.primeton.dgp.assets.controller.DsResourcePoolController getResourcePool
执行此命令后,arthas会记录下指定方法的每次调用环境现场,并打印一些相关的信息,如调用时长、是否正常返回、是否抛出异常等。
显示所有被记录的调用列表
tt -l
重做一次调用。tt 命令由于保存了当时调用的所有现场信息,所以我们可以自己主动对一个 INDEX 编号的时间片自主发起一次调用,从而解放你的沟通成本。此时你需要 -p 参数。通过 --replay-times 指定 调用次数,通过 --replay-interval 指定多次调用间隔(单位ms, 默认1000ms)
tt -i 1001 -p --replay-times 3 --replay-interval 3000
jad
jad 命令将 JVM 中实际运行的 class 的 byte code 反编译成 java 代码,便于你理解业务逻辑;反编译出来的源码是带语法高亮的,阅读更方便。当我们看到某个方法的调用时长明显过长,或者时空隧道中某方法抛出异常,这个时候就可以直接反编译相关的方法,看看是否能找出原因。
其他
除了以上很常用的命令以外,arthas还有很多实用命令,大家可以参考官方文档来使用
https://arthas.aliyun.com/doc/index.html
另外,每一个命令都支持-help参数,可以查看该命令的说明、参数,甚至包括了使用例子,可以说是非常贴心了
案例
案例1
我们准备了一个简单的springboot应用,应用内有一个Controller,返回一个字符串,代码如下:
@RestControllerpublic class DemoController {??@GetMapping(value = "/getDemo")public String getDemo(){return "demo 1"; }}
启动程序,访问刚刚准备好的controller得到了下面的结果
接下来我们要尝试在没有源码的情况下修改demo controller的返回值,并在不重启应用的情况下,使我们修改的返回值生效。
首先启动arthas并织入到刚才的demo,然后反编译DemoController到临时文件夹。
jad --source-only com.example.arthas.DemoController > /tmp/DemoController.java
接下来我们用vim修改反编译出来的代码
查询加载原有DemoController类的ClassLoader
sc -d com.example.arthas.DemoController
重新编译修改后的类
mc -c 685f4c2e /tmp/DemoController.java
重新加载修改后的类
redefine -c 685f4c2e /opt/arthas/demo/com/example/arthas/DemoController.class
此时,无需重启应用,我们重新访问刚才的controller,会发现返回结果已经成功更改了。
案例2
某燃气系统由于被众多地区的燃气公司所使用,所以版本繁多,经历过很多轮的测试,其中比较耗时的当属性能测试了。以往性能测试工作通常耗时很长,主要是性能测试人员并不一定熟悉项目代码,导致压力测试出现问题的时候不容易找到问题的所在。
在本次的表具接口的性能测试中,我们使用Arthas工具进行故障的快速定位,大幅减少了性能测试的时间,达到了很好的效果。
本次压力测试的过程中我们发现,当并发达到一定数量的时候系统会卡死,大量新的请求会超时。使用dashboard查看发现系统的大量线程处于block或者wating中。
使用trace命令,将压力测试的方法进行监控,并保存到日志文件中,接着重新跑一轮压力测试。
trace -n 150000 com.towngas.tcis.interfaces.nb.NbInfoServlet getService >> tt-2020-10-17-NbServlet-getService
监控日志,当用户数达到500+的时候果然发现了问题
继续使用trace命令跟踪,发现了可能出现问题的方法
使用jad命令反编译该代码可以看到HttpClient并没有被立即关闭,使用release的释放后关闭通常没有问题,但是释放资源有一个过程通常是180秒,所以如果短时间有大量接口调用,会导致打开的socket连接数量超过系统设定值。找到原因后问题得以顺利解决,压力测试得以顺利完成。
小结
本次的分享为大家介绍了Arthas的基本概念与基础的使用方法。更为详细的使用方法、命令的更多参数,还请查看Arthas的官方文档。
https://arthas.aliyun.com/doc/index.html
关于作者:李云涛,普元高级开发工程师,擅长性能调优、微服务、容器、消息队列等技术。先后参与邮储银行Java开发平台、中移总ERP流程平台、中煤信息技术中台等平台的的架构设计与平台研发工作。
关于EAWorld:微服务,DevOps,数据治理,移动架构原创技术分享。
相关推荐
- MySQL进阶五之自动读写分离mysql-proxy
-
自动读写分离目前,大量现网用户的业务场景中存在读多写少、业务负载无法预测等情况,在有大量读请求的应用场景下,单个实例可能无法承受读取压力,甚至会对业务产生影响。为了实现读取能力的弹性扩展,分担数据库压...
- 3分钟短文 | Laravel SQL筛选两个日期之间的记录,怎么写?
-
引言今天说一个细分的需求,在模型中,或者使用laravel提供的EloquentORM功能,构造查询语句时,返回位于两个指定的日期之间的条目。应该怎么写?本文通过几个例子,为大家梳理一下。学习时...
- 一文由浅入深带你完全掌握MySQL的锁机制原理与应用
-
本文将跟大家聊聊InnoDB的锁。本文比较长,包括一条SQL是如何加锁的,一些加锁规则、如何分析和解决死锁问题等内容,建议耐心读完,肯定对大家有帮助的。为什么需要加锁呢?...
- 验证Mysql中联合索引的最左匹配原则
-
后端面试中一定是必问mysql的,在以往的面试中好几个面试官都反馈我Mysql基础不行,今天来着重复习一下自己的弱点知识。在Mysql调优中索引优化又是非常重要的方法,不管公司的大小只要后端项目中用到...
- MySQL索引解析(联合索引/最左前缀/覆盖索引/索引下推)
-
目录1.索引基础...
- 你会看 MySQL 的执行计划(EXPLAIN)吗?
-
SQL执行太慢怎么办?我们通常会使用EXPLAIN命令来查看SQL的执行计划,然后根据执行计划找出问题所在并进行优化。用法简介...
- MySQL 从入门到精通(四)之索引结构
-
索引概述索引(index),是帮助MySQL高效获取数据的数据结构(有序),在数据之外,数据库系统还维护者满足特定查询算法的数据结构,这些数据结构以某种方式引用(指向)数据,这样就可以在这些数据结构...
- mysql总结——面试中最常问到的知识点
-
mysql作为开源数据库中的榜一大哥,一直是面试官们考察的重中之重。今天,我们来总结一下mysql的知识点,供大家复习参照,看完这些知识点,再加上一些边角细节,基本上能够应付大多mysql相关面试了(...
- mysql总结——面试中最常问到的知识点(2)
-
首先我们回顾一下上篇内容,主要复习了索引,事务,锁,以及SQL优化的工具。本篇文章接着写后面的内容。性能优化索引优化,SQL中索引的相关优化主要有以下几个方面:最好是全匹配。如果是联合索引的话,遵循最...
- MySQL基础全知全解!超详细无废话!轻松上手~
-
本期内容提醒:全篇2300+字,篇幅较长,可搭配饭菜一同“食”用,全篇无废话(除了这句),干货满满,可收藏供后期反复观看。注:MySQL中语法不区分大小写,本篇中...
- 深入剖析 MySQL 中的锁机制原理_mysql 锁详解
-
在互联网软件开发领域,MySQL作为一款广泛应用的关系型数据库管理系统,其锁机制在保障数据一致性和实现并发控制方面扮演着举足轻重的角色。对于互联网软件开发人员而言,深入理解MySQL的锁机制原理...
- Java 与 MySQL 性能优化:MySQL分区表设计与性能优化全解析
-
引言在数据库管理领域,随着数据量的不断增长,如何高效地管理和操作数据成为了一个关键问题。MySQL分区表作为一种有效的数据管理技术,能够将大型表划分为多个更小、更易管理的分区,从而提升数据库的性能和可...
- MySQL基础篇:DQL数据查询操作_mysql 查
-
一、基础查询DQL基础查询语法SELECT字段列表FROM表名列表WHERE条件列表GROUPBY分组字段列表HAVING分组后条件列表ORDERBY排序字段列表LIMIT...
- MySql:索引的基本使用_mysql索引的使用和原理
-
一、索引基础概念1.什么是索引?索引是数据库表的特殊数据结构(通常是B+树),用于...
- 一周热门
-
-
C# 13 和 .NET 9 全知道 :13 使用 ASP.NET Core 构建网站 (1)
-
程序员的开源月刊《HelloGitHub》第 71 期
-
详细介绍一下Redis的Watch机制,可以利用Watch机制来做什么?
-
假如有100W个用户抢一张票,除了负载均衡办法,怎么支持高并发?
-
如何将AI助手接入微信(打开ai手机助手)
-
Java面试必考问题:什么是乐观锁与悲观锁
-
redission YYDS spring boot redission 使用
-
SparkSQL——DataFrame的创建与使用
-
一文带你了解Redis与Memcached? redis与memcached的区别
-
如何利用Redis进行事务处理呢? 如何利用redis进行事务处理呢英文
-
- 最近发表
- 标签列表
-
- git pull (33)
- git fetch (35)
- mysql insert (35)
- mysql distinct (37)
- concat_ws (36)
- java continue (36)
- jenkins官网 (37)
- mysql 子查询 (37)
- python元组 (33)
- mybatis 分页 (35)
- vba split (37)
- redis watch (34)
- python list sort (37)
- nvarchar2 (34)
- mysql not null (36)
- hmset (35)
- python telnet (35)
- python readlines() 方法 (36)
- munmap (35)
- docker network create (35)
- redis 集合 (37)
- python sftp (37)
- setpriority (34)
- c语言 switch (34)
- git commit (34)