Linux и другие UNIX‑подобные системы в контексте работы, совместимости и перехода на BSD.
Модератор: weec
Правила форума
Убедительная просьба юзать теги [cоde] при оформлении листингов.
Сообщения не оформленные должным образом имеют все шансы быть незамеченными.
-
kirill666
- мл. сержант
- Сообщения: 74
- Зарегистрирован: 2009-07-28 17:10:04
-
Контактная информация:
Непрочитанное сообщение
kirill666 » 2013-04-24 15:43:20
Доброго всем времени суток.
При настроике heartbeat столкнулся с проблемой: вторая нода отказоустоичивого кластера считает первую упавшей и звбирает на себя ip адрес.
ha.cf такой:
Код: Выделить всё
logfacility local0
keepalive 5
deadtime 60
warntime 10
udpport 694
bcast eth0 eth1
auto_failback on
node cl1.cl
node cl2.cl
ping 172.16.0.1
authkeys
Если пинговать, то по именам пингуются, фаервол и selinux погашены.
[root@cl1 /]# uname -n
cl1.cl
[root@cl2 ~]# uname -n
cl2.cl
Вот лог с первой ноды (вообще они одинаковые)
Код: Выделить всё
Apr 24 13:28:13 cl1 heartbeat: [3044]: info: Pacemaker support: false
Apr 24 13:28:13 cl1 heartbeat: [3044]: WARN: Logging daemon is disabled --enabling logging daemon is recommended
Apr 24 13:28:13 cl1 heartbeat: [3044]: info: **************************
Apr 24 13:28:13 cl1 heartbeat: [3044]: info: Configuration validated. Starting heartbeat 3.0.4
Apr 24 13:28:13 cl1 heartbeat: [3045]: info: heartbeat: version 3.0.4
Apr 24 13:28:13 cl1 heartbeat: [3045]: info: Heartbeat generation: 1366789115
Apr 24 13:28:13 cl1 heartbeat: [3045]: info: glib: UDP Broadcast heartbeat started on port 694 (694) interface eth0
Apr 24 13:28:13 cl1 heartbeat: [3045]: info: glib: UDP Broadcast heartbeat closed on port 694 interface eth0 - Status: 1
Apr 24 13:28:13 cl1 heartbeat: [3045]: info: glib: UDP Broadcast heartbeat started on port 694 (694) interface eth1
Apr 24 13:28:13 cl1 heartbeat: [3045]: info: glib: UDP Broadcast heartbeat closed on port 694 interface eth1 - Status: 1
Apr 24 13:28:13 cl1 heartbeat: [3045]: info: glib: ping heartbeat started.
Apr 24 13:28:13 cl1 heartbeat: [3045]: info: G_main_add_TriggerHandler: Added signal manual handler
Apr 24 13:28:13 cl1 heartbeat: [3045]: info: G_main_add_TriggerHandler: Added signal manual handler
Apr 24 13:28:13 cl1 heartbeat: [3045]: info: G_main_add_SignalHandler: Added signal handler for signal 17
Apr 24 13:28:13 cl1 heartbeat: [3045]: info: Local status now set to: 'up'
Apr 24 13:28:13 cl1 heartbeat: [3045]: info: Link 172.16.0.1:172.16.0.1 up.
Apr 24 13:28:13 cl1 heartbeat: [3045]: info: Status update for node 172.16.0.1: status ping
Apr 24 13:28:13 cl1 heartbeat: [3045]: info: Link cl1.cl:eth0 up.
Apr 24 13:28:13 cl1 heartbeat: [3045]: info: Link cl1.cl:eth1 up.
Apr 24 13:29:14 cl1 heartbeat: [3045]: WARN: node cl2.cl: is dead
Apr 24 13:29:14 cl1 heartbeat: [3045]: info: Comm_now_up(): updating status to active
Apr 24 13:29:14 cl1 heartbeat: [3045]: info: Local status now set to: 'active'
Apr 24 13:29:14 cl1 heartbeat: [3045]: WARN: No STONITH device configured.
Apr 24 13:29:14 cl1 heartbeat: [3045]: WARN: Shared disks are not protected.
Apr 24 13:29:14 cl1 heartbeat: [3045]: info: Resources being acquired from cl2.cl.
Apr 24 13:29:14 cl1 harc(default)[3057]: info: Running /etc/ha.d//rc.d/status status
Apr 24 13:29:14 cl1 mach_down(default)[3091]: info: /usr/share/heartbeat/mach_down: nice_failback: foreign resources acquired
Apr 24 13:29:14 cl1 mach_down(default)[3091]: info: mach_down takeover complete for node cl2.cl.
Apr 24 13:29:14 cl1 heartbeat: [3045]: info: mach_down takeover complete.
Apr 24 13:29:14 cl1 heartbeat: [3045]: info: Initial resource acquisition complete (mach_down)
Apr 24 13:29:14 cl1 /usr/lib/ocf/resource.d//heartbeat/IPaddr(IPaddr_172.16.0.240)[3131]: INFO: Resource is stopped
Apr 24 13:29:14 cl1 heartbeat: [3058]: info: Local Resource acquisition completed.
Apr 24 13:29:14 cl1 harc(default)[3189]: info: Running /etc/ha.d//rc.d/ip-request-resp ip-request-resp
Apr 24 13:29:14 cl1 ip-request-resp(default)[3189]: received ip-request-resp IPaddr::172.16.0.240/24/eth0 OK yes
Apr 24 13:29:14 cl1 ResourceManager(default)[3212]: info: Acquiring resource group: cl1.cl IPaddr::172.16.0.240/24/eth0
Apr 24 13:29:14 cl1 /usr/lib/ocf/resource.d//heartbeat/IPaddr(IPaddr_172.16.0.240)[3240]: INFO: Resource is stopped
Apr 24 13:29:14 cl1 ResourceManager(default)[3212]: info: Running /etc/ha.d/resource.d/IPaddr 172.16.0.240/24/eth0 start
Apr 24 13:29:14 cl1 IPaddr(IPaddr_172.16.0.240)[3325]: INFO: Using calculated netmask for 172.16.0.240: 255.255.255.0
Apr 24 13:29:14 cl1 IPaddr(IPaddr_172.16.0.240)[3325]: INFO: eval ifconfig eth0:0 172.16.0.240 netmask 255.255.255.0 broadcast 172.16.0.255
Apr 24 13:29:14 cl1 /usr/lib/ocf/resource.d//heartbeat/IPaddr(IPaddr_172.16.0.240)[3299]: INFO: Success
Система Centos 6.4.
Почему такое может просиходить ?
bom-bom.nadejnei.net - it wiki
kirill666
-
Хостинг HostFood.ru
-
Хостинг HostFood.ru
Тарифы на хостинг в России, от 12 рублей:
https://www.host-food.ru/tariffs/hosting/
Тарифы на виртуальные сервера (VPS/VDS/KVM) в РФ, от 189 руб.:
https://www.host-food.ru/tariffs/virtualny-server-vps/
Выделенные сервера, Россия, Москва, от 2000 рублей (HP Proliant G5, Intel Xeon E5430 (2.66GHz, Quad-Core, 12Mb), 8Gb RAM, 2x300Gb SAS HDD, P400i, 512Mb, BBU):
https://www.host-food.ru/tariffs/vydelennyi-server-ds/
Недорогие домены в популярных зонах:
https://www.host-food.ru/domains/
-
kirill666
- мл. сержант
- Сообщения: 74
- Зарегистрирован: 2009-07-28 17:10:04
-
Контактная информация:
Непрочитанное сообщение
kirill666 » 2013-04-25 11:08:18
не спасло, причем заметил сосбенность, на главной ноде тоже не сркзу поднимается а только полсе того как первая понимает что вторая мертвая .
Код: Выделить всё
Apr 25 11:59:44 cl1.cl heartbeat: [5391]: info: Link cl1.cl:eth0 up.
Apr 25 11:59:44 cl1.cl heartbeat: [5391]: info: Link cl1.cl:eth1 up.
Apr 25 12:01:45 cl1.cl heartbeat: [5391]: WARN: node cl2.cl: is dead
Apr 25 12:01:45 cl1.cl heartbeat: [5391]: info: Comm_now_up(): updating status to active
Apr 25 12:01:45 cl1.cl heartbeat: [5391]: info: Local status now set to: 'active'
Apr 25 12:01:45 cl1.cl heartbeat: [5391]: WARN: No STONITH device configured.
Apr 25 12:01:45 cl1.cl heartbeat: [5391]: WARN: Shared disks are not protected.
Apr 25 12:01:45 cl1.cl heartbeat: [5391]: info: Resources being acquired from cl2.cl.
harc(default)[5428]: 2013/04/25_12:01:45 info: Running /etc/ha.d//rc.d/status status
mach_down(default)[5464]: 2013/04/25_12:01:45 info: /usr/share/heartbeat/mach_down: nice_failback: foreign resources acquired
mach_down(default)[5464]: 2013/04/25_12:01:45 info: mach_down takeover complete for node cl2.cl.
Apr 25 12:01:45 cl1.cl heartbeat: [5391]: info: mach_down takeover complete.
Apr 25 12:01:45 cl1.cl heartbeat: [5391]: info: Initial resource acquisition complete (mach_down)
/usr/lib/ocf/resource.d//heartbeat/IPaddr(IPaddr_172.16.0.240)[5501]: 2013/04/25_12:01:45 INFO: Resource is stopped
Apr 25 12:01:45 cl1.cl heartbeat: [5429]: info: Local Resource acquisition completed.
bom-bom.nadejnei.net - it wiki
kirill666
-
Graf
- сержант
- Сообщения: 205
- Зарегистрирован: 2008-10-29 18:44:32
-
Контактная информация:
Graf
-
kirill666
- мл. сержант
- Сообщения: 74
- Зарегистрирован: 2009-07-28 17:10:04
-
Контактная информация:
Непрочитанное сообщение
kirill666 » 2013-04-25 12:04:33
пинговать внешний узел, для проверки работосопосбности внешней сети.
судя по логам каждая нода считает себя вторичной.
я так понимаю определяется это только в /etc/ha.d/haresources
bom-bom.nadejnei.net - it wiki
kirill666
-
Graf
- сержант
- Сообщения: 205
- Зарегистрирован: 2008-10-29 18:44:32
-
Контактная информация:
Непрочитанное сообщение
Graf » 2013-04-25 12:26:08
"внешний узел" - это и есть вторая нода? или нет?
Чет я запутался в формулировках.
Давай ориентироваться и использовать названия нод и их IP-адреса.
как-то так:
192.168.10.188 node1
192.168.10.189 node2
192.168.10.190 общий для юзверей.
Graf
-
kirill666
- мл. сержант
- Сообщения: 74
- Зарегистрирован: 2009-07-28 17:10:04
-
Контактная информация:
Непрочитанное сообщение
kirill666 » 2013-04-25 14:39:59
значит моя терминалогия )))
cl1.cl eth0:172.16.0.210 eth1:10.10.10.1
cl2.cl eth0:172.16.0.211 eth1:10.10.10.2
интерфейсы eth1 используются для сердцебиения, и обмена drbd ....
виртуальный интерфейс кластера(переходящий) - 172.16.0.240
172.16.0.1 - левый хост в сети которого пингуют ноды для проверки савязи с внешнем миром
bom-bom.nadejnei.net - it wiki
kirill666
-
Graf
- сержант
- Сообщения: 205
- Зарегистрирован: 2008-10-29 18:44:32
-
Контактная информация:
Непрочитанное сообщение
Graf » 2013-04-25 16:52:44
kirill666 писал(а):
пинговать внешний узел, для проверки работосопосбности внешней сети.
хм... я думал этот параметр совсем для других нужд.
kirill666 писал(а):
судя по логам каждая нода считает себя вторичной.
на каждой ноде, тоже так считает?
Graf
-
kirill666
- мл. сержант
- Сообщения: 74
- Зарегистрирован: 2009-07-28 17:10:04
-
Контактная информация:
Непрочитанное сообщение
kirill666 » 2013-04-26 12:17:36
по поводу пинга утверждать не берусь(читал доку в переводе. а оригинале как то мутно написано про пинг), убрал его, на полет это не повлияло,
сейчас ndbd отключен от конфига и погашен, вторая попытка на виртуалках без drbd тоже не увенчалась успехом.
bom-bom.nadejnei.net - it wiki
kirill666
-
Игорь
- проходил мимо
Непрочитанное сообщение
Игорь » 2014-12-02 18:49:14
Я бы поменял еще конфигурацию haresources на что - то вроде этого
node1 IPaddr::192.168.1.2/24/eth0 drbddisk::srv Filesystem::/dev/drbd0::/srv::ext4
Так heartbeat сервис будет знать что нужно смонтировать DRBD ресурс на secondary узле.
Игорь