标签: monitoring

记录 haproxy 检查结果/问题

如何启用 haproxy 检查结果(或仅失败)的日志记录?我看到一些邮件列表帖子表明这是可能的

Server LDAPSFarm/LDAPS1 is DOWN, reason: Socket error, check duration: 277ms. 1 active and 0 backup servers online. 0 sessions requeued, 0 total in queue.
Run Code Online (Sandbox Code Playgroud)

但我没有得到相同的结果。我的配置更多的是这样的:

global
        log 127.0.0.1 local0
        user haproxy
        group haproxy
        spread-checks 5

defaults
        log     global
        mode    http
        option  httplog
        option  dontlognull
        retries 3
        redispatch
        maxconn 2000

        stats enable
        stats hide-version

        option allbackups

listen XXX YYY
        mode tcp
        balance roundrobin
        option httpchk /

        server XXX-1 ZZZ1 check port 8080 inter 2s rise 15 …
Run Code Online (Sandbox Code Playgroud)

monitoring logging haproxy

5
推荐指数
1
解决办法
2万
查看次数

如何监控哪些文件通过NFS被访问?

我有一个运行 CentOS 6 的 Linux 文件服务器。文件通过 NFS4 访问。

有时我会遇到磁盘 io 负载问题。我想找出是什么原因造成它们。

我可以使用 tcpdump 和 nfsiostat(在客户端上)找出哪个客户端导致了这些问题。但我想知道哪些文件被访问或者哪个进程正在执行访问。然后我就可以想一个解决办法。

我尝试使用wireshark来解码访问,但是当打开和读/写不紧密或者您有很多具有相似名称的文件时很难读取(不显示目录,仅显示目录句柄)。如果您有很多活动,那么最好有一种方法可以按活动对文件进行排序,以找出罪魁祸首。

有人知道这个问题的解决方案吗?

linux monitoring nfs nfs4

5
推荐指数
1
解决办法
8101
查看次数

HP Proliant G6 报告 SSD 驱动器故障 - 监控的替代策略?

我想得到您对几天前我遇到的一个有争议的情况的反馈。我的任务是使用 HP Proliant G6 进行开发,并在 RAID1 配置中使用 2 个新的(不到 2 个月,以前从未使用过)非 HP SSD。它们用于密集型开发任务(每天写入约 500GB);RAID5 中也有常规 HDD,但我们在这里讨论 RAID1 阵列。

  • 三星SSD 840 PRO系列
  • 浦科特 PX-256M5Pro

两者的 smartctl 输出均可在此处获得:https://gist.github.com/anonymous/cf8a5208a7315440f796

过去的相关问题

Plextor 驱动器一直受到报告的过热状况的影响,我认为这是因为它不是原装部件

我曾经见过一次服务器偶尔重新启动后重建 RAID1,但无法解释其原因。

失败事件

几天前,Plextor 磁盘被报告为简单的“故障”状态: physicaldrive 1I:1:1 (port 1I:box 1:bay 1, Solid State SATA, 256.0 GB, Failed)

假阳性?

因此,我拔掉了它,检查了 SMART 输出并运行了完整的测试(请参阅上面的 smartctl 输出)。测试通过了,更糟糕的是,将驱动器放回原处可提供功能完美的 RAID1 阵列。

这很尴尬。

替代监控?

我不知道如何让 P410i 告诉我“失败”状态的具体原因是什么(我认为不可能),并且我知道这些是非原装 HP 部件(从而使我的付费 HP 支持失效),但是对于这个非关键任务服务器,我想看看是否仍然可以继续使用非惠普磁盘,并且仍然对其健康状态进行某种监控。

你有什么意见?我有 3 个问题:

  • 仅当与原装部件一起使用时,HP 控制器监控状态才可信吗?(这很容易)
  • 这些(完全非高质量)SSD 客观上状况良好吗?
  • 我应该对 SMART 测试的结果给予 100% 的信任吗?

提前致谢

monitoring ssd smart hp hp-proliant

5
推荐指数
1
解决办法
2050
查看次数

虚拟主机的Nginx状态信息

我想监控每个 nginx 虚拟主机(我有不同域的多个 nginx 配置)并找到 nginx 模块ngx_http_stub_status_module

但似乎该模块用于显示服务器范围的状态,而不是按虚拟主机显示。有没有收集 vhost 统计信息的解决方案?

monitoring nginx virtualhost

5
推荐指数
1
解决办法
4019
查看次数

是否可以在 Busybox 系统上检查 NTPd 状态?

我需要知道当前日期/时间在基于 Busybox 的小型嵌入式 Linux 系统中是否可靠。

我正在运行 Busybox ntpd,但显然没有程序可以查询状态。

在更传统的 Linux 安装中,我会使用 ntpdc、ntpq、ntpstat 甚至 timedatectl,但这些在 Busybox/Buildroot 系统上都不可用。

我还可以做些什么?

monitoring busybox ntpd

5
推荐指数
1
解决办法
7761
查看次数

如何使用 Telegraf、InfluxDB 和 Grafana 正确监控网络接口利用率?

我在服务器上安装了 Telegraf,它包含以下网络配置:

[[inputs.net]]
  interfaces = ["eth0"]
Run Code Online (Sandbox Code Playgroud)

这会将以下指标输入 InfluxDB:

bytes_recv,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,bytes_sentdrop_indrop_outerr_inerr_outicmp_inaddrmaskrepsicmp_inaddrmasksicmp_incsumerrorsicmp_indestunreachsicmp_inechorepsicmp_inechosicmp_inerrorsicmp_inmsgsicmp_inparmprobsicmp_inredirectsicmp_insrcquenchsicmp_intimeexcdsicmp_intimestamprepsicmp_intimestampsicmp_outaddrmaskrepsicmp_outaddrmasksicmp_outdestunreachsicmp_outechorepsicmp_outechosicmp_outerrorsicmp_outmsgsicmp_outparmprobsicmp_outredirectsicmp_outsrcquenchsicmp_outtimeexcdsicmp_outtimestamprepsicmp_outtimestampsip_defaultttlip_forwardingip_forwdatagrams​ …

networking monitoring grafana

5
推荐指数
1
解决办法
2万
查看次数

如何在 Ubuntu 18.04LTS 上安装 Stackdriver 的监控代理?

我正在尝试在 Google Compute Engine 上的 Ubuntu 18.04 VM 上使用 Stackdriver Monitoring。看起来 18.04尚不受支持,即使它是 LTS 版本

我尝试编辑安装脚本以安装 16.04 版本,但看起来需要 libcurl3(18.04 安装 libcurl4,加上 18.04 的 Google Compute Engine 实用程序需要 libcurl4)。

如何安装监控代理?或者如果 18.04 的官方支持即将到来,什么时候?

ubuntu monitoring google-compute-engine google-cloud-platform google-stackdriver

5
推荐指数
1
解决办法
2197
查看次数

平滑 Grafana 图

我正在对我的公司基础设施进行监控。我安装了 Grafana 和 Prometheus 数据源。我构建了仪表板并拥有相当“尖峰”的图表。我想知道是否有任何方法可以让它变得更平滑,以便它更具可读性。

谢谢 !

monitoring grafana prometheus

5
推荐指数
1
解决办法
9435
查看次数

当 ECS 服务无法持续成功启动任务时创建 CloudWatch 警报

如果我向我的 ECS 服务发布了一个存在错误的新 Docker 映像,则该服务将尝试启动新任务,但如果新任务无法启动,则将保留旧版本。

在这种情况下,它有时(并非总是)会向总线发出一个事件,例如:

服务 xxx 无法持续​​成功启动任务。有关详细信息,请参阅故障排除部分。

有时它只会发出大量事件,例如:

服务 xxx 注销了目标组 yyy 中的 1 个目标

我希望在这种情况下触发 CloudWatch 警报。我怎样才能做到这一点?

我看不到任何跟踪可用于触发此警报的相关事件的 CloudWatch 指标。https://docs.aws.amazon.com/AmazonECS/latest/developerguide/cloudwatch-metrics.html

如果任务无法启动,那么我什至无法获得有关 LB 目标组的任何 UnHealthyHostCount 指标。

我想我必须创建一个 EventBridge 规则来监视上述指定的事件,但我看不到让该规则触发警报的明显方法。我设置了一条规则,将“警告”和“错误”事件转发到 SNS/电子邮件,但我并不总是收到这些事件。所以我经常遇到重启循环而没有警报触发。:-(

monitoring amazon-web-services amazon-cloudwatch amazon-ecs

5
推荐指数
1
解决办法
4007
查看次数

Netdata、prometheus 和 grafana - 为什么在这个星座推荐?

目前我正在为我们的服务器设置监控服务。我找到了一些文章,推荐使用:Netdata, prometheus and grafana

所以我想知道使用这三种方法有什么好处。任何人都可以向我解释一下,为什么推荐 prometheus 和 grafana,如果 netdata 似乎与这两者做同样的事情?

即使在 netdata-documentations 中,也有一篇关于此设置的文章: https: //learn.netdata.cloud/docs/agent/backends/prometheus/#filtering-metrics-sent-to-prometheus

这个星座有什么好处呢?

monitoring grafana prometheus netdata

5
推荐指数
1
解决办法
5574
查看次数