我有一个 linux 电子邮件服务器,我正在考虑将其迁移到“云”中。在调查定价后,我发现我的主要成本将是带宽。你们建议如何测量一段时间内传输的数据总量?
我是多年的开发人员,但没有大量的操作经验,所以如果这是一个新问题,请道歉。
在我的公司,我们运行一个用 Java 编写的 Web 服务,主要基于 Tomcat Web 服务器。我们有两个数据中心,每个数据中心大约有 10 台主机。主机有几种类型:Dababase、Tomcats、一些离线java进程、memcached服务器。所有主机都是 Linux CentOS
到目前为止,在发布新版本到生产环境时,我们一直在使用一组内部 shell 脚本来复制 jars/wars 并重新启动 tomcat。
公司变得越来越大,因此操作所有这些并从开发、QA、暂存和生产中获取代码变得越来越困难。一次典型的发布多次涉及人为错误,这会花费我们宝贵的正常运行时间。有时我们需要恢复到上次已知的好处,这至少不容易说......
我们正在寻找一个工具、一个框架、一个解决方案,可以提供以下内容:
有人可以分享他们的经验吗?推荐几个工具?
谢谢!
我已经god在至少十几个(或更多)服务器上安装了运行 CentOS 5.5 的 i386 和 x86_64 版本的完美运行。我刚刚设置了两个新的 CentOS 5.5 x86_64 服务器并安装了 God,但是我收到了一个事件系统错误:
$ tail /var/log/god.log
E [2011-04-22 12:33:17] ERROR: Condition 'God::Conditions::ProcessExits'
requires an event system but none has been loaded
$ god check
using event system: none
[fail] event system did not load
$ uname -a
Linux server2.example.com 2.6.18-238.9.1.el5 #1 SMP Tue Apr 12 18:10:13 EDT 2011 x86_64 x86_64 x86_64 GNU/Linux
Run Code Online (Sandbox Code Playgroud)
我在任何 CentOS 服务器上都找不到任何cn或netlink内核模块。但是我还有其他可以正常工作的服务器:
$ god check
using event system: netlink
starting event …Run Code Online (Sandbox Code Playgroud) 有没有人在 nagios 警报消息中添加了一个链接,允许接收者只需单击链接即可将警报置于确认状态。我环顾四周,但什么也看不见。
我的任务是设置 300 台服务器的监控,做不同的事情。我一直在研究各种工具,例如 Nagios、Munin 和其他工具——所以我首先对如何实现监控有了一个很好的想法。
我想知道的是,如果我对服务器不太了解,通常将哪些指标作为良好的默认值进行监控?而且,就警报而言,什么是“合理的默认值”?
我的计划是首先部署一个具有合理默认值的监控方案,同时我会规划不同系统的角色——我预计这需要一些时间。
这个问题也可以用不同的方式问:
如果你正在设计一个监控设备——它的默认 Linux 监控模板应该包含什么?
使用 Active Directory,监控复制的好方法是什么?
我有多个站点和多个位置,因此理想情况下,站点之间和站点内的复制都会受到监控。我不确定是否需要监视每个 DC、每个 NTDS 连接或每个 DC *每个 NTDS 连接。
为了适应标准的警报方法,如果复制延迟 X 分钟,性能计数器将允许我发出警报,这似乎是理想的。
我们在其中一台服务器上安装了 munin 监控。一般来说,它似乎运行良好,但有时,准确地说是 2 个月内 4 次,munin-cron 会产生以下错误:
[致命] 这里没有什么可做的,因为没有带有任何插件的节点。请参阅http://munin-monitoring.org/wiki/FAQ_no_graphs在 /usr/share/munin/munin-html 第 38 行
在搜索此错误时,我只能找到 munin 根本无法工作的问题,而不是我们面临的间歇性问题。
一些帮助防止此错误或如何调试它将不胜感激。
我们正在运行 CentOS 5.5,使用 yum 安装的 Munin 1.4.5。
我知道 Nagios 可以监控日志文件中的内容并发出警报,但是有谁知道插件或其他工具可以监控特定字符串的日志文件,然后在电子邮件中发送整行那场比赛发生了?
我正在我的 64 位 Web 服务器上执行监控任务,该服务器有几个以 32 位模式运行的应用程序池。我在 perfmon 中使用 .Net CLR Memory 对象来监视它们。但是,我的性能监视器显示 0,除了 GC 句柄和正在使用的接收器块数之外的所有内容。其余的应用程序池工作正常。在以完全相同的方式配置的另一台服务器(在 64 位 IIS 上运行的 32 位应用程序池)上,WMI 甚至不会枚举我的所有 w3wp 实例。
有没有人对这些问题有任何想法?或者是否有工具可以监控在 64 位平台上运行的 32 位应用程序池,而不是使用内置的性能监控器?
另外,在 WMI 没有枚举所有 w3wp 实例的服务器上,我们在事件日志中有以下三个错误消息。
“ASP”服务的性能库“C:\WINDOWS\system32\aspperf.dll”的配置信息与存储在注册表中的可信性能库信息不匹配。该库中的函数不会被视为受信任的。(事件 ID 2003,源 Perflib)
“W3SVC”服务的性能库“C:\WINDOWS\system32\inetsrv\w3ctrs.dll”的配置信息与存储在注册表中的可信性能库信息不匹配。此库中的函数不会被视为受信任的。(事件 ID 2003,源 Perflib)
“InetInfo”服务的性能库“C:\WINDOWS\system32\infoctrs.dll”的配置信息与存储在注册表中的可信性能库信息不匹配。此库中的函数不会被视为受信任的。(事件 ID 2003,源 Perflib)
由于“ASP.NET_2.0.50727”服务的性能计数器库为该服务生成了一个或多个错误,因此该会话已禁用该服务的性能计数器数据收集。强制执行此操作的错误已写入应用程序事件日志。(事件 ID 1018,源 Perflib)
这些错误可能与我的问题有关。即使我在 wbem 目录中重新注册所有 .dll 文件,它仍然出现。有谁知道这些错误消息的含义以及如何修复它们?
另外对于.Net CLR Memory 对象中第一个值为0 的服务器,事件日志中没有错误消息。
iis windows-server-2003 monitoring performance-monitoring wmi
我正在 AWS ec2 上运行一个 ubuntu gpu 实例。我不确定我的应用程序是否使用 GPU 加速。那么如何检查 aws gpu 实例上的 gpu 使用情况?
monitoring ×10
linux ×4
nagios ×3
centos ×2
munin ×2
amazon-ec2 ×1
bandwidth ×1
cpu-usage ×1
deployment ×1
god ×1
iis ×1
java ×1
wmi ×1