任何有关以下方面的帮助将不胜感激:
有任何想法吗?
如何检查 SMTP 服务器是否正常工作。基本上我有:
SMTPserver= mail.my1stdomain.com,
FromAddress=mymailbox@my1stdomain.com,
ToAddress=Recipient@my1stdomain.com.
Run Code Online (Sandbox Code Playgroud)
我想检查我是否可以发送电子邮件。如果可以的话没问题,但是如果Powershell 脚本输出错误,那么我想使用我的第二个SMTP 服务器来通知第一个SMTP 服务器发送电子邮件失败。
我的第二组 SMTP 信息是:
SMTPserver=mail.my2nddomain.com,
FromAddress=mymailbox@my2nddomain.com,
ToAddress=Recipient@my2nddomain.com
Run Code Online (Sandbox Code Playgroud)
我用这个脚本发送电子邮件:
Send-MailMessage -from mymailbox@my1stdomain.com -to Recipient@my1stdomain.com -Subject "Test OK" -Body "Test is OK" -SmtpServer mail.my1stdomain.com
Run Code Online (Sandbox Code Playgroud)
当然要通过第二个 SMTP 服务器发送电子邮件,我必须这样做:
Send-MailMessage -from mymailbox@my2nddomain.com -to Recipient@my2nddomain.com -Subject "Test OK" -Body "Test is OK" -SmtpServer mail.my2nddomain.com
Run Code Online (Sandbox Code Playgroud)
如果第一个命令失败,我不知道如何编写 IF case
尝试了各种标志来避免在 RAM 上保留大量数据,但没有成功。即使我限制“storage.local.memory-chunks”和“持久化块”。我已经尝试过这两个参数的不同值,我连接了几乎 1TB 的辅助存储,但我仍然用完了 RAM。
Can I get memory usage per process with Linux? we monitor our servers with sysstat/sar. But besides seeing that memory went off the roof at some point, we can't pinpoint which process was getting bigger and bigger. is there a way with sar (or other tools) to get memory usage per process? and look at it, later on?
试图研究 Redis 的指标并得出了这些术语。不知道他们。有人可以用外行人的话解释这些术语吗?
我有一个 spring-boot 应用程序,我用它Prometheus来收集指标数据。Prometheus 有一些指标,例如Counter可以很好地计算某事发生的次数,Gauge它也可以保持计数,但可以减少等等。是否有一个指标可以让我跟踪某事的请求持续时间?例如,假设我想记录在进行 api 调用和 api 返回响应之间所花费的时间。我将如何跟踪进行调用和收到 api 响应之间的时间?然后,是否可以在Y坐标上创建一个图表,我可以列出响应所花费的时间长度(以秒或毫秒为单位);然后在X 轴,是否显示时间戳(收集指标的时间)?
如果生产者端的确认延迟非常高,我们是否可以使用一些代理指标来监控 Kafka 代理。
我们正在使用 datadog 来监控生产者和 Kafka 代理端。可以看出生产者的ack滞后超过10秒。但是,在broker方面,我觉得只用message.in.rate,kafka.net.bytes_in.rate效率不高。最好我们可以在代理端有一些 LAG 指标来表明the broker is fully loaded to acknowledge back the producer.
此外,我们仅kafka.acks = 1用于分区领导。
我想知道是否有人对此有一些经验,欢迎提供任何建议。:) 提前致谢。
我试图弄清楚 Prometheus 的increase()查询函数在进程重新启动时的行为。
当在 2m 间隔内有一个进程重新启动时,我查询:
sum(increase(my_metric_total[2m]))
Run Code Online (Sandbox Code Playgroud)
我得到的值低于预期。
例如,在一个简单的实验中,我模拟了:
全部在 2 分钟的间隔内。
查询时:
sum(increase(lcm_restarts[2m]))
Run Code Online (Sandbox Code Playgroud)
当我期待 5 时,我收到了 ~4.5 的值。
有人可以解释一下吗?
如果 Pod 变得不健康并重新启动,为什么没有简单的方法来获取通知?
对我来说,这表明我不应该关心 Pod 是否重新启动,但为什么不呢?
我们正在监控 jvm 指标,如堆、元空间、线程和 gc 计数,我们能够将这些指标推送到监控服务器,如 prometheus。类似地,我们想跟踪 Java 本机内存指标(jcmd VM.sumary 的输出)。我的问题是,是否可以通过调用任何 jvm 运行时类来获取这些指标?
monitoring ×10
prometheus ×4
java ×2
shell ×2
apache-kafka ×1
benchmarking ×1
cpu-usage ×1
email ×1
grafana ×1
jcmd ×1
jvm ×1
kubernetes ×1
linux ×1
metrics ×1
performance ×1
powershell ×1
ram ×1
redis ×1
sar ×1
smtp ×1