切换机器后如何重启rabbitmq?

Abe*_*Abe 17 rabbitmq

我在 EC2 上运行 django/celery,rabbitmq 作为代理。我使用的机器出现故障,所以我启动了另一个实例。但是自从切换到新机器后,我一直无法让 celery 工作。

编辑:我在下面包含了很多日志,以防万一我误诊了问题。但我 85% 确定问题在于 rabbitmq-server 在“启动数据库”阶段无法启动。

node          : rabbit@ip-10-212-66-181
app descriptor: /usr/lib/rabbitmq/lib/rabbitmq_server-1.7.2/sbin/../ebin/rabbit.app
home dir      : /var/lib/rabbitmq
cookie hash   : 5+uQ077En5bpvle3HJCQMg==
log           : /var/log/rabbitmq/rabbit.log
sasl log      : /var/log/rabbitmq/rabbit-sasl.log
database dir  : /var/lib/rabbitmq/mnesia/rabbit

starting internal event notification system                           ...done
starting logging server                                               ...done
starting database                                                     ...Erlang has closed
Run Code Online (Sandbox Code Playgroud)

关于如何进一步诊断/解决这个问题的任何想法?

这是我尝试运行 celery 时发生的情况:

$ python manage.py celeryd -l info
/opt/bitnami/python/lib/python2.6/site-packages/django_celery-2.4.2-py2.6.egg/djcelery/loaders.py:86: UserWarning: Using settings.DEBUG leads to a memory leak, never use this setting in production environments!
  warnings.warn("Using settings.DEBUG leads to a memory leak, never "
[2011-12-05 19:40:13,545: WARNING/MainProcess]  

 -------------- celery@ip-10-212-66-181 v2.4.3
---- **** -----
--- * ***  * -- [Configuration]
-- * - **** ---   . broker:      amqp://guest@localhost:5672//
- ** ----------   . loader:      djcelery.loaders.DjangoLoader
- ** ----------   . logfile:     [stderr]@INFO
- ** ----------   . concurrency: 1
- ** ----------   . events:      OFF
- *** --- * ---   . beat:        OFF
-- ******* ----
--- ***** ----- [Queues]
 --------------   . celery:      exchange:celery (direct) binding:celery


[Tasks]
  . tbAnalytics.models.processAnalysis
  . tbCollections.models.processCollection

[2011-12-05 19:40:13,558: INFO/PoolWorker-1] child process calling self.run()
[2011-12-05 19:40:13,562: WARNING/MainProcess] celery@ip-10-212-66-181 has started.
[2011-12-05 19:40:13,564: ERROR/MainProcess] Consumer: Connection Error: [Errno 111] Connection refused. Trying again in 2 seconds...
[2011-12-05 19:40:15,574: ERROR/MainProcess] Consumer: Connection Error: [Errno 111] Connection refused. Trying again in 4 seconds...
Run Code Online (Sandbox Code Playgroud)

回溯它,看起来rabbitmq服务器是问题,尤其是数据库:

$ sudo rabbitmqctl status
Status of node 'rabbit@ip-10-212-66-181' ...
Error: unable to connect to node 'rabbit@ip-10-212-66-181': nodedown
diagnostics:
- nodes and their ports on ip-10-212-66-181: [{rabbitmqctl14448,38289}]
- current node: 'rabbitmqctl14448@ip-10-212-66-181'
- current node home dir: /var/lib/rabbitmq
- current node cookie hash: 5+uQ077En5bpvle3HJCQMg==
Run Code Online (Sandbox Code Playgroud)

但是我一直无法弄清楚如何重新启动服务器:

bitnami@ip-10-212-66-181:/var/log/rabbitmq$ sudo rabbitmq-server start_app

+---+   +---+
|   |   |   |
|   |   |   |
|   |   |   |
|   +---+   +-------+
|                   |
| RabbitMQ  +---+   |
|           |   |   |
|   v1.7.2  +---+   |
|                   |
+-------------------+
AMQP 8-0
Copyright (C) 2007-2010 LShift Ltd., Cohesive Financial Technologies LLC., and Rabbit Technologies Ltd.
Licensed under the MPL.  See http://www.rabbitmq.com/

node          : rabbit@ip-10-212-66-181
app descriptor: /usr/lib/rabbitmq/lib/rabbitmq_server-1.7.2/sbin/../ebin/rabbit.app
home dir      : /var/lib/rabbitmq
cookie hash   : 5+uQ077En5bpvle3HJCQMg==
log           : /var/log/rabbitmq/rabbit.log
sasl log      : /var/log/rabbitmq/rabbit-sasl.log
database dir  : /var/lib/rabbitmq/mnesia/rabbit

starting internal event notification system                           ...done
starting logging server                                               ...done
starting database                                                     ...Erlang has closed
{"init terminating in do_boot",{{nocatch,{error,{cannot_start_application,rabbit,{bad_return,{{rabbit,start,[normal,[]]},{'EXIT',{{case_clause,{error,{timeout_waiting_for_tables,[rabbit_user,rabbit_user_permission,rabbit_vhost,rabbit_config,rabbit_listener,rabbit_durable_route,rabbit_route,rabbit_reverse_route,rabbit_durable_exchange,rabbit_exchange,rabbit_durable_queue,rabbit_queue]}}},[{rabbit,'-run_boot_step/1-lc$^1/1-1-',1},{rabbit,run_boot_step,1},{rabbit,'-start/2-lc$^0/1-0-',1},{rabbit,start,2},{application_master,start_it_old,4}]}}}}}}},[{init,start_it,1},{init,start_em,1}]}}

Crash dump was written to: erl_crash.dump
init terminating in do_boot ()
Run Code Online (Sandbox Code Playgroud)

另外,不知道它是否相关,但是这个过程是在后台运行的。

$ ps aux | grep rabbit
rabbitmq   714  0.0  0.0   1980   408 ?        S    Dec04   0:00 /usr/lib/erlang/erts-5.7.4/bin/epmd -daemon
Run Code Online (Sandbox Code Playgroud)

我一直无法找到有关此类故障的任何文档。有什么建议?

Abe*_*Abe 17

我从 rabbitmq-discuss 列表中得到了一些非常好的帮助:

RabbitMQ 使用的数据库绑定到机器的主机名,因此如果您将数据库目录复制到另一台机器,它将无法工作。如果是这种情况,您必须使用与以前相同的主机名设置一台机器,并将所有未完成的消息传输到新机器。如果rabbit 中没有什么重要的,你可以通过删除/var/lib/rabbitmq 中的RabbitMQ 文件来清除所有内容。

我删除了 /var/lib/rabbitmq/mnesia/rabbit/ 中的所有内容,并且它毫无问题地启动了。万岁!


小智 9

该问题与存储 RabbitMQ 的队列和元数据配置的 Mnesia 使用机器的主机名创建数据库有关。

这种基于主机名的数据库目录将位于:

<rabbitmq_installdir>/var/lib/rabbitmq/mnesia/rabbit@<yourhostname>
<rabbitmq_installdir>/var/lib/rabbitmq/mnesia/rabbit@<yourhostname>-plugins-expanded
Run Code Online (Sandbox Code Playgroud)

因此,删除上述 2 个目录并重新启动 rabbitmq 的选项将起作用。如果您将 rabbitmq 服务器从一台主机迁移到另一台主机,您将携带以前的主机名 mnesia 数据库。只需重命名目录向右主机将无法正常工作,根据我的测试。

因此,如果您需要保留为 RabbitMQ 服务器定义的队列结构、用户帐户和任何其他元数据,则需要保留此类元数据的副本。

有两种方法可以提取或导入元数据配置

  • 管理插件:激活rabbitmq的管理插件,进入url server:15672。主页底部有两个选项,一个是导出,一个是导入定义

  • 命令行:rabbitmqadmin export rabbit.config(或 import 而不是 export )

所以,底线建议:

  • 保持队列结构/用户/等的当前导出
  • 在迁移服务器或进行恢复时,采取措施删除以前的目录结构(如果排队的数据不相关)并重新导入原始配置/元数据。
  • 如果任何持久排队数据相关,最好的选择是将恢复的主机的主机名重命名为原始主机名并允许消息处理/出队,然后您可以根据需要再次调整主机名。