我在 EC2 上运行 django/celery,rabbitmq 作为代理。我使用的机器出现故障,所以我启动了另一个实例。但是自从切换到新机器后,我一直无法让 celery 工作。
编辑:我在下面包含了很多日志,以防万一我误诊了问题。但我 85% 确定问题在于 rabbitmq-server 在“启动数据库”阶段无法启动。
node : rabbit@ip-10-212-66-181
app descriptor: /usr/lib/rabbitmq/lib/rabbitmq_server-1.7.2/sbin/../ebin/rabbit.app
home dir : /var/lib/rabbitmq
cookie hash : 5+uQ077En5bpvle3HJCQMg==
log : /var/log/rabbitmq/rabbit.log
sasl log : /var/log/rabbitmq/rabbit-sasl.log
database dir : /var/lib/rabbitmq/mnesia/rabbit
starting internal event notification system ...done
starting logging server ...done
starting database ...Erlang has closed
Run Code Online (Sandbox Code Playgroud)
关于如何进一步诊断/解决这个问题的任何想法?
这是我尝试运行 celery 时发生的情况:
$ python manage.py celeryd -l info
/opt/bitnami/python/lib/python2.6/site-packages/django_celery-2.4.2-py2.6.egg/djcelery/loaders.py:86: UserWarning: Using settings.DEBUG leads to a memory leak, never use this setting in production environments!
warnings.warn("Using settings.DEBUG leads to a memory leak, never "
[2011-12-05 19:40:13,545: WARNING/MainProcess]
-------------- celery@ip-10-212-66-181 v2.4.3
---- **** -----
--- * *** * -- [Configuration]
-- * - **** --- . broker: amqp://guest@localhost:5672//
- ** ---------- . loader: djcelery.loaders.DjangoLoader
- ** ---------- . logfile: [stderr]@INFO
- ** ---------- . concurrency: 1
- ** ---------- . events: OFF
- *** --- * --- . beat: OFF
-- ******* ----
--- ***** ----- [Queues]
-------------- . celery: exchange:celery (direct) binding:celery
[Tasks]
. tbAnalytics.models.processAnalysis
. tbCollections.models.processCollection
[2011-12-05 19:40:13,558: INFO/PoolWorker-1] child process calling self.run()
[2011-12-05 19:40:13,562: WARNING/MainProcess] celery@ip-10-212-66-181 has started.
[2011-12-05 19:40:13,564: ERROR/MainProcess] Consumer: Connection Error: [Errno 111] Connection refused. Trying again in 2 seconds...
[2011-12-05 19:40:15,574: ERROR/MainProcess] Consumer: Connection Error: [Errno 111] Connection refused. Trying again in 4 seconds...
Run Code Online (Sandbox Code Playgroud)
回溯它,看起来rabbitmq服务器是问题,尤其是数据库:
$ sudo rabbitmqctl status
Status of node 'rabbit@ip-10-212-66-181' ...
Error: unable to connect to node 'rabbit@ip-10-212-66-181': nodedown
diagnostics:
- nodes and their ports on ip-10-212-66-181: [{rabbitmqctl14448,38289}]
- current node: 'rabbitmqctl14448@ip-10-212-66-181'
- current node home dir: /var/lib/rabbitmq
- current node cookie hash: 5+uQ077En5bpvle3HJCQMg==
Run Code Online (Sandbox Code Playgroud)
但是我一直无法弄清楚如何重新启动服务器:
bitnami@ip-10-212-66-181:/var/log/rabbitmq$ sudo rabbitmq-server start_app
+---+ +---+
| | | |
| | | |
| | | |
| +---+ +-------+
| |
| RabbitMQ +---+ |
| | | |
| v1.7.2 +---+ |
| |
+-------------------+
AMQP 8-0
Copyright (C) 2007-2010 LShift Ltd., Cohesive Financial Technologies LLC., and Rabbit Technologies Ltd.
Licensed under the MPL. See http://www.rabbitmq.com/
node : rabbit@ip-10-212-66-181
app descriptor: /usr/lib/rabbitmq/lib/rabbitmq_server-1.7.2/sbin/../ebin/rabbit.app
home dir : /var/lib/rabbitmq
cookie hash : 5+uQ077En5bpvle3HJCQMg==
log : /var/log/rabbitmq/rabbit.log
sasl log : /var/log/rabbitmq/rabbit-sasl.log
database dir : /var/lib/rabbitmq/mnesia/rabbit
starting internal event notification system ...done
starting logging server ...done
starting database ...Erlang has closed
{"init terminating in do_boot",{{nocatch,{error,{cannot_start_application,rabbit,{bad_return,{{rabbit,start,[normal,[]]},{'EXIT',{{case_clause,{error,{timeout_waiting_for_tables,[rabbit_user,rabbit_user_permission,rabbit_vhost,rabbit_config,rabbit_listener,rabbit_durable_route,rabbit_route,rabbit_reverse_route,rabbit_durable_exchange,rabbit_exchange,rabbit_durable_queue,rabbit_queue]}}},[{rabbit,'-run_boot_step/1-lc$^1/1-1-',1},{rabbit,run_boot_step,1},{rabbit,'-start/2-lc$^0/1-0-',1},{rabbit,start,2},{application_master,start_it_old,4}]}}}}}}},[{init,start_it,1},{init,start_em,1}]}}
Crash dump was written to: erl_crash.dump
init terminating in do_boot ()
Run Code Online (Sandbox Code Playgroud)
另外,不知道它是否相关,但是这个过程是在后台运行的。
$ ps aux | grep rabbit
rabbitmq 714 0.0 0.0 1980 408 ? S Dec04 0:00 /usr/lib/erlang/erts-5.7.4/bin/epmd -daemon
Run Code Online (Sandbox Code Playgroud)
我一直无法找到有关此类故障的任何文档。有什么建议?
Abe*_*Abe 17
我从 rabbitmq-discuss 列表中得到了一些非常好的帮助:
RabbitMQ 使用的数据库绑定到机器的主机名,因此如果您将数据库目录复制到另一台机器,它将无法工作。如果是这种情况,您必须使用与以前相同的主机名设置一台机器,并将所有未完成的消息传输到新机器。如果rabbit 中没有什么重要的,你可以通过删除/var/lib/rabbitmq 中的RabbitMQ 文件来清除所有内容。
我删除了 /var/lib/rabbitmq/mnesia/rabbit/ 中的所有内容,并且它毫无问题地启动了。万岁!
小智 9
该问题与存储 RabbitMQ 的队列和元数据配置的 Mnesia 使用机器的主机名创建数据库有关。
这种基于主机名的数据库目录将位于:
<rabbitmq_installdir>/var/lib/rabbitmq/mnesia/rabbit@<yourhostname>
<rabbitmq_installdir>/var/lib/rabbitmq/mnesia/rabbit@<yourhostname>-plugins-expanded
Run Code Online (Sandbox Code Playgroud)
因此,删除上述 2 个目录并重新启动 rabbitmq 的选项将起作用。如果您将 rabbitmq 服务器从一台主机迁移到另一台主机,您将携带以前的主机名 mnesia 数据库。只需重命名目录向右主机将无法正常工作,根据我的测试。
因此,如果您需要保留为 RabbitMQ 服务器定义的队列结构、用户帐户和任何其他元数据,则需要保留此类元数据的副本。
有两种方法可以提取或导入元数据配置
管理插件:激活rabbitmq的管理插件,进入url server:15672。主页底部有两个选项,一个是导出,一个是导入定义
命令行:rabbitmqadmin export rabbit.config(或 import 而不是 export )
所以,底线建议:
| 归档时间: |
|
| 查看次数: |
24595 次 |
| 最近记录: |