如何启用 haproxy 检查结果(或仅失败)的日志记录?我看到一些邮件列表帖子表明这是可能的:
Server LDAPSFarm/LDAPS1 is DOWN, reason: Socket error, check duration: 277ms. 1 active and 0 backup servers online. 0 sessions requeued, 0 total in queue.
Run Code Online (Sandbox Code Playgroud)
但我没有得到相同的结果。我的配置更多的是这样的:
global
log 127.0.0.1 local0
user haproxy
group haproxy
spread-checks 5
defaults
log global
mode http
option httplog
option dontlognull
retries 3
redispatch
maxconn 2000
stats enable
stats hide-version
option allbackups
listen XXX YYY
mode tcp
balance roundrobin
option httpchk /
server XXX-1 ZZZ1 check port 8080 inter 2s rise 15 …Run Code Online (Sandbox Code Playgroud) 我有一个运行 CentOS 6 的 Linux 文件服务器。文件通过 NFS4 访问。
有时我会遇到磁盘 io 负载问题。我想找出是什么原因造成它们。
我可以使用 tcpdump 和 nfsiostat(在客户端上)找出哪个客户端导致了这些问题。但我想知道哪些文件被访问或者哪个进程正在执行访问。然后我就可以想一个解决办法。
我尝试使用wireshark来解码访问,但是当打开和读/写不紧密或者您有很多具有相似名称的文件时很难读取(不显示目录,仅显示目录句柄)。如果您有很多活动,那么最好有一种方法可以按活动对文件进行排序,以找出罪魁祸首。
有人知道这个问题的解决方案吗?
我想得到您对几天前我遇到的一个有争议的情况的反馈。我的任务是使用 HP Proliant G6 进行开发,并在 RAID1 配置中使用 2 个新的(不到 2 个月,以前从未使用过)非 HP SSD。它们用于密集型开发任务(每天写入约 500GB);RAID5 中也有常规 HDD,但我们在这里讨论 RAID1 阵列。
两者的 smartctl 输出均可在此处获得:https://gist.github.com/anonymous/cf8a5208a7315440f796
Plextor 驱动器一直受到报告的过热状况的影响,我认为这是因为它不是原装部件
我曾经见过一次服务器偶尔重新启动后重建 RAID1,但无法解释其原因。
几天前,Plextor 磁盘被报告为简单的“故障”状态:
physicaldrive 1I:1:1 (port 1I:box 1:bay 1, Solid State SATA, 256.0 GB, Failed)
因此,我拔掉了它,检查了 SMART 输出并运行了完整的测试(请参阅上面的 smartctl 输出)。测试通过了,更糟糕的是,将驱动器放回原处可提供功能完美的 RAID1 阵列。
这很尴尬。
我不知道如何让 P410i 告诉我“失败”状态的具体原因是什么(我认为不可能),并且我知道这些是非原装 HP 部件(从而使我的付费 HP 支持失效),但是对于这个非关键任务服务器,我想看看是否仍然可以继续使用非惠普磁盘,并且仍然对其健康状态进行某种监控。
你有什么意见?我有 3 个问题:
提前致谢
我想监控每个 nginx 虚拟主机(我有不同域的多个 nginx 配置)并找到 nginx 模块ngx_http_stub_status_module
但似乎该模块用于显示服务器范围的状态,而不是按虚拟主机显示。有没有收集 vhost 统计信息的解决方案?
我需要知道当前日期/时间在基于 Busybox 的小型嵌入式 Linux 系统中是否可靠。
我正在运行 Busybox ntpd,但显然没有程序可以查询状态。
在更传统的 Linux 安装中,我会使用 ntpdc、ntpq、ntpstat 甚至 timedatectl,但这些在 Busybox/Buildroot 系统上都不可用。
我还可以做些什么?
我在服务器上安装了 Telegraf,它包含以下网络配置:
[[inputs.net]]
interfaces = ["eth0"]
Run Code Online (Sandbox Code Playgroud)
这会将以下指标输入 InfluxDB:
bytes_recv,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,bytes_sentdrop_indrop_outerr_inerr_outicmp_inaddrmaskrepsicmp_inaddrmasksicmp_incsumerrorsicmp_indestunreachsicmp_inechorepsicmp_inechosicmp_inerrorsicmp_inmsgsicmp_inparmprobsicmp_inredirectsicmp_insrcquenchsicmp_intimeexcdsicmp_intimestamprepsicmp_intimestampsicmp_outaddrmaskrepsicmp_outaddrmasksicmp_outdestunreachsicmp_outechorepsicmp_outechosicmp_outerrorsicmp_outmsgsicmp_outparmprobsicmp_outredirectsicmp_outsrcquenchsicmp_outtimeexcdsicmp_outtimestamprepsicmp_outtimestampsip_defaultttlip_forwardingip_forwdatagrams …
我正在尝试在 Google Compute Engine 上的 Ubuntu 18.04 VM 上使用 Stackdriver Monitoring。看起来 18.04尚不受支持,即使它是 LTS 版本。
我尝试编辑安装脚本以安装 16.04 版本,但看起来需要 libcurl3(18.04 安装 libcurl4,加上 18.04 的 Google Compute Engine 实用程序需要 libcurl4)。
如何安装监控代理?或者如果 18.04 的官方支持即将到来,什么时候?
ubuntu monitoring google-compute-engine google-cloud-platform google-stackdriver
我正在对我的公司基础设施进行监控。我安装了 Grafana 和 Prometheus 数据源。我构建了仪表板并拥有相当“尖峰”的图表。我想知道是否有任何方法可以让它变得更平滑,以便它更具可读性。
谢谢 !
如果我向我的 ECS 服务发布了一个存在错误的新 Docker 映像,则该服务将尝试启动新任务,但如果新任务无法启动,则将保留旧版本。
在这种情况下,它有时(并非总是)会向总线发出一个事件,例如:
服务 xxx 无法持续成功启动任务。有关详细信息,请参阅故障排除部分。
有时它只会发出大量事件,例如:
服务 xxx 注销了目标组 yyy 中的 1 个目标
我希望在这种情况下触发 CloudWatch 警报。我怎样才能做到这一点?
我看不到任何跟踪可用于触发此警报的相关事件的 CloudWatch 指标。https://docs.aws.amazon.com/AmazonECS/latest/developerguide/cloudwatch-metrics.html
如果任务无法启动,那么我什至无法获得有关 LB 目标组的任何 UnHealthyHostCount 指标。
我想我必须创建一个 EventBridge 规则来监视上述指定的事件,但我看不到让该规则触发警报的明显方法。我设置了一条规则,将“警告”和“错误”事件转发到 SNS/电子邮件,但我并不总是收到这些事件。所以我经常遇到重启循环而没有警报触发。:-(
目前我正在为我们的服务器设置监控服务。我找到了一些文章,推荐使用:Netdata, prometheus and grafana
所以我想知道使用这三种方法有什么好处。任何人都可以向我解释一下,为什么推荐 prometheus 和 grafana,如果 netdata 似乎与这两者做同样的事情?
即使在 netdata-documentations 中,也有一篇关于此设置的文章: https: //learn.netdata.cloud/docs/agent/backends/prometheus/#filtering-metrics-sent-to-prometheus
这个星座有什么好处呢?
monitoring ×10
grafana ×3
prometheus ×2
amazon-ecs ×1
busybox ×1
haproxy ×1
hp ×1
hp-proliant ×1
linux ×1
logging ×1
netdata ×1
networking ×1
nfs ×1
nfs4 ×1
nginx ×1
ntpd ×1
smart ×1
ssd ×1
ubuntu ×1
virtualhost ×1