大橙子网站建设,新征程启航

为企业提供网站建设、域名注册、服务器等服务

nagios和pycurl的超时时间

 线上使用自己开发的url monitor工具进行应用层面的监控,主要的原理使用nagios驱动pycurl做url的检测,url的检测属性(ip,port,url,httpcode等)是放在数据库里面的。
对于http code的监控,当获取的http code和期望的http code不一致时,产生报警邮件。

最近发现在报警邮件中,有显示current http code是200,但是nagios的状态却是critical的情况。

创新互联公司于2013年开始,先为工农等服务建站,工农等地企业,进行企业商务咨询服务。为工农企业网站制作PC+手机+微官网三网同步一站式服务解决您的所有建站问题。

报警邮件:

nagios和pycurl的超时时间

nagios和pycurl的超时时间

通过nagios的页面查看,确实看到了监控报错的情况:

nagios页面:

nagios和pycurl的超时时间nagios和pycurl的超时时间

分析nagio的报判断的几种状态:

soft:监控项处于retry_check检测周期内的非正常状态
hard:监控项达到max_check_attempts最大次数后的非正常状态
常态:soft和hard之外的状态

线上关于这个service的配置:
                check_interval         3          
                retry_interval         1            
                max_check_attempts     3    

即检测间隔为3分钟,检测间隔为1分钟,最大重试3次。当第一次失败后,进入soft1,间隔1分钟后继续检测,失败进入soft2,当第3次同样失败时,进入hard状态。
进入hard状态后,就会每间隔3分钟检测。(注:进入soft状态后, 按retry_interval的时间检测,不按check_interval的时间检测,直到恢复常态或hard )

从nagios的结果可以看出,是由于service check超时导致,nagios的service check和pycurl都是有超时设置的,产生这种问题的原因就是在nagios的超时时间内,pycurl没有正常返回值,导致nagios任务检测失败。但是pycurl的超时时间比较长,最终返回了正确的值update到了数据库,但是nagios确认为检测失败了。。

在pycurl中控制超时的设置是CONNECTTIMEOUT(默认300s),TIMEOUT(永不超时)

而nagios的模式设置service_check_timeout模式时60s.


解决方法:
对pycurl的超时参数做设置,小于nagios的超时时间即可。

具体的pycurl的代码:

def check_server_url(proxy,url,location):
        buf_header = cStringIO.StringIO()
        c =  pycurl.Curl()
        c.setopt(c.URL,url)
        c.setopt(c.CONNECTTIMEOUT,20)
        c.setopt(c.TIMEOUT,40)
        if location == 0:
                c.setopt(c.FOLLOWLOCATION,0)
        else:
                c.setopt(c.FOLLOWLOCATION,1)
        c.setopt(c.PROXY,proxy)
        c.setopt(c.HEADERFUNCTION,buf_header.write)
        c.setopt(c.NOBODY,True)
        try:
                c.perform()
                http_code = c.getinfo(c.HTTP_CODE)
                print http_code
                http_hearder = buf_header.getvalue()
        except pycurl.error:
                http_code = "-1"
        c.close()
        buf_header.close()
        return http_code

其实最根本的rc还是业务响应慢导致(最终定位为db的响应慢)。


文章名称:nagios和pycurl的超时时间
转载源于:http://dzwzjz.com/article/gedodi.html
在线咨询
服务热线
服务热线:028-86922220
TOP