我们注意到一些杂散数据包从我们的交换机出去他们不应该有的端口。
清除凸轮表后clear mac address-table,问题似乎消失了。我们目前最好的理论是表在某个时候被淹没,导致交换机表现出这种类似集线器的行为。
有谁知道是否可以通过 SNMP 监控表的大小,以便我们可以跟踪它?
我们让 Nagios 在我们的一台服务器上运行一段时间没有任何问题,但最近我们得到了(返回代码 141 超出范围)。
由于我们使用我们的服务上线,服务器上的负载增加了,但它仍然不是很高(负载平均最大值:0.7)。在发布之前,Nagios 中的一切正常。
请参阅图像,当前负载返回代码 141。2 分钟前 Beancounters VZ 返回 141。这种情况不规则发生。只有 HTTP 和 PING 不返回 141,它们不会在 nrpe 上中继。
http://pic-hoster.net/view/45030/ScreenShot2012-05-28at5.31.35PM.png
我注意到,如果我从 Nagios 主机对有问题的客户端执行命令,有时返回会丢失:
root@xxx23:/usr/local/nagios/libexec# ./check_nrpe -H 123.123.123.123 -c check_apt
APT OK: 0 packages available for upgrade (0 critical updates).
root@xxx23:/usr/local/nagios/libexec# ./check_nrpe -H 123.123.123.123 -c check_apt
root@xxx23:/usr/local/nagios/libexec# ./check_nrpe -H 123.123.123.123 -c check_apt
APT OK: 0 packages available for upgrade (0 critical updates).
Run Code Online (Sandbox Code Playgroud)
如果我直接在客户端上执行它,则不会发生这种情况。
我做了什么:
我有一个在 Windows 2008 中作为 JVM 运行的应用程序。我想监视它的内存使用情况,并在内存使用量达到特定阈值时收到一封电子邮件。是否有免费的实用程序或方法可以执行此操作?
所以我在亚马逊云中建立了一家公司——创建 IAAS 协议/解决方案/标准化实施等,同时还担任各个系统、应用程序环境和日常正常运行时间的系统管理员。
我遇到的最大问题之一是以集中方式跟踪各种系统/应用程序日志,以及日志记录/监控/归档系统指标,如内存使用情况、cpu 使用情况等。例如 --> Nagios + Urchin。
我努力的最大障碍如下:
公司应用程序以 Java *.WAR 文件的形式部署,上传到 Elastic BeanStalk 应用程序环境,在 3(min) 和 10(max) 个服务器之间进行负载平衡和自动缩放,并且运行该应用程序的 EC2 是启动并临时处理。
也就是说,我无法长时间监控单个 EC2,因为很多 EC2 被终止然后自动配置/自动扩展——所以我必须不断地“监控我正在监控的内容” ",并不断地将 EC2 机器地址删除/添加到我的监控列表中。
是否有某种方法可以使用 Zabbix 或 Nagios 等监控工具来监控 ElasticBeanStalk,并让它自动添加新的 EC2,并自动从其监控列表中删除终止/失败的 EC2?
此外,通过将我的应用程序日志从多个 EC2 实例聚合/集中到一个合并的日志/事件集,我可以用 GrayLog 做些什么来实现类似的结果?如果不是 GrayLog,是否有任何类似 GrayLog 的东西可以自动检测正在从环境中添加/删除哪些 EC2 成员,并自动从他们那里收集日志?
任何和所有的建议或方向表示赞赏。
非常感谢,干杯!!
我知道之前在许多论坛上已经多次询问过这个问题,但我仍然遇到类似的问题。
单个图工作正常,但聚合图则不然。我什至没有得到一个空图(没有数据的图)。
所有机器都在 Ubuntu-12.04 m1.medium ec2 实例上运行。Munin 版本是 1.4.6。
我的 munin.conf 看起来像...
[localhost.localdomain]
地址 127.0.0.1
use_node_name 是[.us-west-1.compute.internal]
地址
use_node_name 是[.us-west-1.compute.internal]
地址
use_node_name 是[.us-west-1.compute.internal]
地址
use_node_name 是[us-west-1.compute.internal;totalcheckpoints]
更新没有
联系没有Run Code Online (Sandbox Code Playgroud)postgres_checkpoints_checkpoints_req.update no postgres_checkpoints_checkpoints_req.graph yes postgres_checkpoints_checkpoints_req.graph_args --base 1000 -l 0 postgres_checkpoints_checkpoints_req.cdef 0 postgres_checkpoints_checkpoints_req.graph_category PG Total Checkpoints postgres_checkpoints_checkpoints_req.graph_title Aggregated checkpoints postgres_checkpoints_checkpoints_req.graph_vlabel Total Checkpoints postgres_checkpoints_checkpoints_req.checkpoints_req_total.label Total checkpoints postgres_checkpoints_checkpoints_req.graph_order checkpoints_req_total postgres_checkpoints_checkpoints_req.checkpoints_req_total.sum \ <internal_ip>.us-west-1.compute.internal:postgres_checkpoints_<internal_ip>.us-west-1.compute.internal_checkpoints_req.checkpoints_req \ <internal_ip>.us-west-1.compute.internal:postgres_checkpoints_<internal_ip>.us-west-1.compute.internal_checkpoints_req.checkpoints_req \ <internal_ip>.us-west-1.compute.internal:postgres_checkpoints_<internal_ip>.us-west-1.compute.internal_checkpoints_req.checkpoints_req
我尝试在 /etc/munin/plugins 中遵循以下符号链接:
postgres_checkpoints -> /usr/share/munin/plugins/postgres_checkpoints
postgres_checkpoints_ -> /usr/share/munin/plugins/postgres_checkpoints
postgres_checkpoints__ -> /usr/share/munin/plugins/postgres_checkpoints
由于 munin 用户遵循 …
不幸的是,我不得不让一个我不完全信任的人拥有访问网络服务器的特权来完成他们从未完成的工作。
他们将远程访问服务器(即我将无法看到他们的屏幕)。
可以做些什么来 a) 主动限制任何潜在的损害,b) 准确地记录他们在服务器上所做的任何事情以供事后分析,即使事情看起来没问题?
他们将更新 Web 应用程序。
提前致谢!
--- 更多信息:服务器是 Ubuntu AWS 服务器。
我正在寻找一个像 Cacti 这样的监控系统,它不会随着时间的推移丢失数据,我发现的所有工具都使用 rrd 文件,随着时间的推移平均数据。
我希望能够回到(例如)4 月 1 日 12:00 并查看当时捕获的数据是什么,而不是一整天的平均值。
有没有可以做到这一点的监控系统?
我的管理层要求在走廊内显示监控屏幕。当他们试图销售这种绝妙的设备时,他们会想到销售人员展示的那些绝妙的屏幕截图,这些设备永远不会出现故障(永远不会,保证)。或者我们在访问 Nagio 或 Cacti 网站时看到的那种东西(我展示了一些,他们说是的)。
我的管理层对计算人员在做什么几乎一无所知。他们希望这对网络、服务器等有一些专业的感觉。并且可能被视为专业的自己。
我们有 :
我们已经在使用 Nagios。他们对我们的简单观点不感兴趣,说一切都好。我想向他们展示一些更好的想法,这样他们就可以告诉我他们想要这个或那个。
我想想 :
有什么更好的想法吗?
我想检查我的 nagios 监控是否每个节点都使用 puppetmaster 提供的当前目录版本。
在我的情况下,有:
我想在 host1、host2、hostX 上创建nrpe插件以:
问题:
所以我的问题是,如何监控傀儡代理的健康状况,并在任何主机使用旧的傀儡目录时得到通知?有什么意义吗?
在我的 DL380 G6 上的 ILO2 固件 2.15 中,Temp 30 传感器(位置:I/O 板区域)指示 65C,我的风扇以 78% 的容量运行。该区域的注意级别为 110C,临界级别为 115C。
有谁知道 Temp 30 传感器在哪里?还有其他 8 个传感器指向“I/O 板区域”位置。
谢谢,
亚历山大
monitoring ×10
nagios ×3
linux ×2
amazon-ec2 ×1
cacti ×1
cisco ×1
cloud ×1
debian ×1
graph ×1
hp ×1
hp-proliant ×1
java ×1
logging ×1
memory-usage ×1
munin ×1
networking ×1
nrpe ×1
openvz ×1
puppet ×1
security ×1
snmp ×1
ubuntu ×1
zabbix ×1