目录
1、介绍
2、安装
3、命令显示字段
4、常用参数
5、常见性能问题分析
6、其他说明:
1、介绍vmstat命令是最常见的Linux/Unix监控工具,属于sysstat软件包。 可以按固定的时间间隔查看服务器状态值,包括服务器的CPU使用率、内存使用率、虚拟内存交换和I/o读写。 这个命令是最喜欢看Linux/Unix的命令。 一个是同时支持Linux/Unix。 另一个是,与top相比,可以看到机器整体的CPU、内存、IO的使用情况。 不仅仅是看单个进程的CPU利用率和内存利用率。
2、yum install -y sysstatvmstat 2 1表示安装时,将每2秒收集一次服务器状态,而只收集一次vmstat 2。 这表示vmstat每2秒收集一次数据,并继续收集,直到我退出程序3,命令显示字段类别项的含义为procs(r表示等待执行的任务数,表示正在等待cpu资源,该值超过了cpu数bio等待进程数Memory (内存) swpd为虚拟内存大小,单位kfree可用内存大小) buff )已用缓冲区大小,缓存已用缓存大小,用于缓冲块设备读写区分free和activeactive的活动内存大小具体含义是:使用-a选项时显示的概念完成(Swapsi每秒从交换空间写入的内存大小)单位: kb/s ) so从内存中每秒写入交换空间的大小IObi每秒读取的块数)块设备接收的块数,单位为block此处的块设备是指系统中的所有磁盘和当前Linux版本的块大小为1024bytesbo秒写入块数(写入磁盘)块设备每秒发送的块数,单位为blocksystemin秒中断数,包含时钟中断的两个值最大例如,要调用系统函数,需要切换上下文、切换线程和切换进程上下文。 这个值越小越好。 太大了。 考虑降低线程或进程的数量。 us执行用户进程占用的CPU时间(user time )如果us值较高,则表示用户进程占用的CPU时间较多;如果长期占用的CPU时间超过50%,则应该考虑优化程序算法或其他措施。 如果sy系统进程占用cpu时间(sys time )的sys值过高,则表示系统核心占用了大量cpu资源,这不是一种健全的表示。 应该调查原因。 其中,us sy的参考值为80%,如果us sy大于80%,则CPU可能没有足够的Id空闲时间,包括IO延迟。 通常,如果us sy id=100wa的IO延迟wa过高,则表示IO延迟严重。 这可能是因为对磁盘的大量随机访问,也可能是磁盘带宽存在瓶颈。 4、常用参数的用法
vmstat [-a ] [-n ] [-sunit ] [ delay [ count ] ]
vmstat [-s] [-n] [-S unit]
vmstat [-m] [-n] [delay [ count]]
vmstat [-d] [-n] [delay [ count]]
vmstat [-pdisk partition ] [-n ] [ delay [ count ] ]
vmstat [-f]
vmstat [-V]
-a :显示活动内存和非活动内存
-f :显示从系统启动到现在的传真数
-m :显示斯拉宾夫
-n :每个字段名最初仅显示一次。
-s :显示内存相关的统计信息和各种系统活动的数量。
delay :刷新间隔。 如果未指定,则只显示一个结果。
count :刷新次数。 如果没有指定刷新次数,而是指定了刷新间隔,则刷新次数将是无限的。
-d :显
示磁盘相关统计信息。-p:显示指定磁盘分区统计信息
-S:使用指定单位显示。参数有 k 、K 、m 、M ,分别代表1000、1024、1000000、1048576字节(byte)。默认单位为K(1024 bytes)
-V:显示vmstat版本信息。
5、常见性能问题分析
IO/CPU/men连锁反应
1.free急剧下降
2.buff和cache被回收下降,但也无济于事
3.依旧需要使用大量swap交换分区swpd
4.等待进程数,b增多
5.读写IO,bi bo增多
6.si so大于0开始从硬盘中读取
7.cpu等待时间用于 IO等待,wa增加
内存不足
1.开始使用swpd,swpd不为0
2.si so大于0开始从硬盘中读取
io瓶颈
1.读写IO,bi bo增多超过2000
2.cpu等待时间用于 IO等待,wa增加 超过20
3.sy 系统调用时间长,IO操作频繁会导致增加 >30%
4.wa io等待时间长
iowait% <20% 良好
iowait% <35% 一般
iowait% >50%
5.进一步使用iostat观察
CPU瓶颈:load,vmstat中r列
1.反应为CPU队列长度
2.一段时间内,CPU正在处理和等待CPU处理的进程数之和,直接反应了CPU的使用和申请情况。
3.理想的load average:核数*CPU数*0.7
CPU个数:grep 'physical id' /proc/cpuinfo | sort -u
核数:grep 'core id' /proc/cpuinfo | sort -u | wc -l
4.超过这个值就说明已经是CPU瓶颈了
CPU瓶颈
1.us 用户CPU时间高超过90%
涉及到web服务器,cs 每秒上下文切换次数
例如我们调用系统函数,就要进行上下文切换,线程的切换,也要进程上下文切换,这个值要越小越好,太大了,要考虑调低线程或者进程的数目,例如在apache和nginx这种web服务器中,我们一般做性能测试时会进行几千并发甚至几万并发的测试,选择web服务器的进程可以由进程或者线程的峰值一直下调,压测,直到cs到一个比较小的值,这个进程和线程数就是比较合适的值了。系统调用也是,每次调用系统函数,我们的代码就会进入内核空间,导致上下文切换,这个是很耗资源,也要尽量避免频繁调用系统函数。上下文切换次数过多表示你的CPU大部分浪费在上下文切换,导致CPU干正经事的时间少了,CPU没有充分利用,是不可取的。
1.cs可以对apache和nginx线程和进程数限制起到一定的参考作用
2.我们一般做性能测试时会进行几千并发甚至几万并发的测试,选择web服务器的进程可以由进程或者线程的峰值一直下调,压测,直到cs到一个比较小的值,这个进程和线程数就是比较合适的值了
较好的趋势:主要是 swap使用少,swpd数值低。si so分页读取写入数值趋近于零
6、其他说明:
b 表示阻塞的进程,这个不多说,进程阻塞,大家懂的。
swpd 虚拟内存已使用的大小,如果大于0,表示你的机器物理内存不足了,如果不是程序内存泄露的原因,那么你该升级内存了或者把耗内存的任务迁移到其他机器。
free 空闲的物理内存的大小,我的机器内存总共8G,剩余3415M。
buff Linux/Unix系统是用来存储,目录里面有什么内容,权限等的缓存,我本机大概占用300多M
cache cache直接用来记忆我们打开的文件,给文件做缓冲,我本机大概占用300多M(这里是Linux/Unix的聪明之处,把空闲的物理内存的一部分拿来做文件和目录的缓存,是为了提高 程序执行的性能,当程序使用内存时,buffer/cached会很快地被使用。)
si 每秒从磁盘读入虚拟内存的大小,如果这个值大于0,表示物理内存不够用或者内存泄露了,要查找耗内存进程解决掉。我的机器内存充裕,一切正常。
so 每秒虚拟内存写入磁盘的大小,如果这个值大于0,同上。
bi 块设备每秒接收的块数量,这里的块设备是指系统上所有的磁盘和其他块设备,默认块大小是1024byte,我本机上没什么IO操作,所以一直是0,但是我曾在处理拷贝大量数据(2-3T)的机器上看过可以达到140000/s,磁盘写入速度差不多140M每秒
bo 块设备每秒发送的块数量,例如我们读取文件,bo就要大于0。bi和bo一般都要接近0,不然就是IO过于频繁,需要调整。
in 每秒CPU的中断次数,包括时间中断
cs 每秒上下文切换次数,例如我们调用系统函数,就要进行上下文切换,线程的切换,也要进程上下文切换,这个值要越小越好,太大了,要考虑调低线程或者进程的数目,例如在apache和nginx这种web服务器中,我们一般做性能测试时会进行几千并发甚至几万并发的测试,选择web服务器的进程可以由进程或者线程的峰值一直下调,压测,直到cs到一个比较小的值,这个进程和线程数就是比较合适的值了。系统调用也是,每次调用系统函数,我们的代码就会进入内核空间,导致上下文切换,这个是很耗资源,也要尽量避免频繁调用系统函数。上下文切换次数过多表示你的CPU大部分浪费在上下文切换,导致CPU干正经事的时间少了,CPU没有充分利用,是不可取的。
us 用户CPU时间,我曾经在一个做加密解密很频繁的服务器上,可以看到us接近100,r运行队列达到80(机器在做压力测试,性能表现不佳)。
sy 系统CPU时间,如果太高,表示系统调用时间长,例如是IO操作频繁。
id 空闲 CPU时间,一般来说,id + us + sy = 100,一般我认为id是空闲CPU使用率,us是用户CPU使用率,sy是系统CPU使用率。
wt 等待IO CPU时间。