<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="en">
	<id>https://wiki.tetrain.com/index.php?action=history&amp;feed=atom&amp;title=Nagios_XI_Cluster_Setup_Checklist-Updated</id>
	<title>Nagios XI Cluster Setup Checklist-Updated - Revision history</title>
	<link rel="self" type="application/atom+xml" href="https://wiki.tetrain.com/index.php?action=history&amp;feed=atom&amp;title=Nagios_XI_Cluster_Setup_Checklist-Updated"/>
	<link rel="alternate" type="text/html" href="https://wiki.tetrain.com/index.php?title=Nagios_XI_Cluster_Setup_Checklist-Updated&amp;action=history"/>
	<updated>2026-07-27T11:10:38Z</updated>
	<subtitle>Revision history for this page on the wiki</subtitle>
	<generator>MediaWiki 1.43.9</generator>
	<entry>
		<id>https://wiki.tetrain.com/index.php?title=Nagios_XI_Cluster_Setup_Checklist-Updated&amp;diff=4315&amp;oldid=prev</id>
		<title>Admin: Auto-created from uploaded PDF text extraction</title>
		<link rel="alternate" type="text/html" href="https://wiki.tetrain.com/index.php?title=Nagios_XI_Cluster_Setup_Checklist-Updated&amp;diff=4315&amp;oldid=prev"/>
		<updated>2026-07-26T16:27:10Z</updated>

		<summary type="html">&lt;p&gt;Auto-created from uploaded PDF text extraction&lt;/p&gt;
&lt;p&gt;&lt;b&gt;New page&lt;/b&gt;&lt;/p&gt;&lt;div&gt;&amp;#039;&amp;#039;Auto-generated from the uploaded PDF [[:File:Nagios_XI_Cluster_Setup_Checklist-Updated.pdf|Nagios_XI_Cluster_Setup_Checklist-Updated.pdf]]. This is an extracted-text rendering for searchability; see the original PDF for exact formatting, diagrams, tables, and images.&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;pre&amp;gt;&lt;br /&gt;
&amp;lt;nowiki&amp;gt;&lt;br /&gt;
Nagios XI Cluster Setup Checklist with&lt;br /&gt;
DRBD and Pacemaker&lt;br /&gt;
Pre-Deployment Checklist&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
Ensure the environment and system prerequisites are in place before proceeding with&lt;br /&gt;
clustering. This sets a stable foundation for DRBD and Pacemaker configuration.&lt;br /&gt;
&lt;br /&gt;
 Step    Task                  Details&lt;br /&gt;
 1       System Prep           Same OS (e.g.,&lt;br /&gt;
                               RHEL/CentOS/Ubuntu),&lt;br /&gt;
                               updates applied&lt;br /&gt;
 2       Hostnames             Unique FQDNs (e.g., `nagios-&lt;br /&gt;
                               node1`, `nagios-node2`)&lt;br /&gt;
 3       DNS or `/etc/hosts`   Proper name resolution&lt;br /&gt;
                               between nodes&lt;br /&gt;
 4       NTP                   Time sync via NTP on both&lt;br /&gt;
                               nodes&lt;br /&gt;
 5       Static IPs            Two IPs (one per node) +&lt;br /&gt;
                               one VIP reserved&lt;br /&gt;
 6       Partition for DRBD    Dedicated block device (e.g.,&lt;br /&gt;
                               `/dev/sdb1`) on both nodes&lt;br /&gt;
 7       Open Firewall         Ports for MySQL, HTTP(S),&lt;br /&gt;
                               DRBD, Corosync&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
DRBD Storage Setup&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
Configure the Distributed Replicated Block Device (DRBD) to replicate Nagios XI data&lt;br /&gt;
storage between nodes for high availability.&lt;br /&gt;
&lt;br /&gt;
 Step    Task                          Details&lt;br /&gt;
 1       Install DRBD                  `yum install drbd-utils` or&lt;br /&gt;
                                       `apt install drbd-utils`&lt;br /&gt;
 2       Create DRBD config            `/etc/drbd.d/nagios.res`&lt;br /&gt;
                                       defining resource&lt;br /&gt;
 3       Init DRBD meta                `drbdadm create-md&lt;br /&gt;
                                       nagios`&lt;br /&gt;
 4       Bring up DRBD                 `drbdadm up nagios`&lt;br /&gt;
&lt;br /&gt;
 5       Make one primary               `drbdadm -- --overwrite-&lt;br /&gt;
                                        data-of-peer primary&lt;br /&gt;
                                        nagios`&lt;br /&gt;
 6       Format DRBD                    `mkfs.ext4 /dev/drbd0`&lt;br /&gt;
 7       Mount DRBD                     Mount at&lt;br /&gt;
                                        `/usr/local/nagiosxi` or&lt;br /&gt;
                                        `/opt/nagios`&lt;br /&gt;
 8       Sync Nagios XI data            Install on node1, sync to&lt;br /&gt;
                                        DRBD volume&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
Nagios XI Setup on DRBD&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
Place Nagios XI data and configuration files on the DRBD shared storage to ensure&lt;br /&gt;
persistence and synchronization between nodes.&lt;br /&gt;
&lt;br /&gt;
 Step    Task                        Details&lt;br /&gt;
 1       Move Nagios XI to DRBD      Move `/usr/local/nagiosxi`&lt;br /&gt;
                                     to DRBD mount&lt;br /&gt;
 2       Symlink or remount          Ensure Nagios, MySQL, and&lt;br /&gt;
                                     logs use shared storage&lt;br /&gt;
 3       Sync MySQL Data             Ensure MySQL data also&lt;br /&gt;
                                     resides on DRBD&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
Corosync &amp;amp; Pacemaker Cluster Setup&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
Set up the core cluster software that manages failover, monitoring, and service&lt;br /&gt;
orchestration.&lt;br /&gt;
&lt;br /&gt;
 Step    Task                       Details&lt;br /&gt;
 1       Install Components         `pcs`, `corosync`,&lt;br /&gt;
                                    `pacemaker`, `fence-agents`&lt;br /&gt;
 2       Enable pcsd                `systemctl enable pcsd --&lt;br /&gt;
                                    now`&lt;br /&gt;
 3       Set hacluster password     `echo mypass | passwd&lt;br /&gt;
                                    hacluster --stdin`&lt;br /&gt;
 4       Authenticate Nodes         `pcs cluster auth nagios-&lt;br /&gt;
                                    node1 nagios-node2`&lt;br /&gt;
 5       Create Cluster             `pcs cluster setup --name&lt;br /&gt;
                                    nagios-cluster nagios-node1&lt;br /&gt;
                                    nagios-node2`&lt;br /&gt;
 6       Start &amp;amp; Enable Cluster     `pcs cluster start --all` and&lt;br /&gt;
                                    `pcs cluster enable --all`&lt;br /&gt;
&lt;br /&gt;
Pacemaker Resources (in Order)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
Define and order the cluster-managed resources to control DRBD, filesystem, VIP, and&lt;br /&gt;
services in a consistent failover pattern.&lt;br /&gt;
&lt;br /&gt;
 Step    Task                           Details&lt;br /&gt;
 1       DRBD resource                  `ocf:linbit:drbd` with&lt;br /&gt;
                                        master/slave configuration&lt;br /&gt;
 2       Filesystem                     `ocf:heartbeat:Filesystem`&lt;br /&gt;
                                        for DRBD mount&lt;br /&gt;
 3       Virtual IP (VIP)               `ocf:heartbeat:IPaddr2` on&lt;br /&gt;
                                        shared subnet&lt;br /&gt;
 4       Nagios XI service              Custom `systemd:nagiosxi`&lt;br /&gt;
                                        script or service group&lt;br /&gt;
 5       MySQL/MariaDB                  Optional: managed as&lt;br /&gt;
                                        cluster resource if HA DB&lt;br /&gt;
 6       Colocation                     Ensure filesystem and VIP&lt;br /&gt;
                                        before Nagios starts&lt;br /&gt;
 7       Ordering                       DRBD → Filesystem → VIP&lt;br /&gt;
                                        → Nagios services&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
Failover &amp;amp; Health Check&lt;br /&gt;
Test and verify failover functionality and ensure all services remain operational and data&lt;br /&gt;
remains consistent.&lt;br /&gt;
&lt;br /&gt;
 Step        Task                     Details&lt;br /&gt;
 1           Manual Failover Test     Stop node1, ensure node2 takes over&lt;br /&gt;
                                      services&lt;br /&gt;
 2           VIP Test                 Ping/telnet to VIP for Nagios web, DB&lt;br /&gt;
&lt;br /&gt;
 3           Log Checks               `pcs status`, `journalctl -xe`, DRBD logs&lt;br /&gt;
&lt;br /&gt;
 4           Service State            Ensure NagiosXI, MySQL, npcd, crond&lt;br /&gt;
                                      running&lt;br /&gt;
 5           External Monitoring      Verify notifications still trigger during&lt;br /&gt;
                                      failover&lt;br /&gt;
&lt;br /&gt;
Security &amp;amp; Hardening&lt;br /&gt;
Secure your cluster environment and restrict unauthorized access to critical resources and&lt;br /&gt;
ports.&lt;br /&gt;
&lt;br /&gt;
 Step    Task                          Details&lt;br /&gt;
 1       Limit DRBD port               Allow only internal IPs on&lt;br /&gt;
                                       port 7788&lt;br /&gt;
 2       Secure `pcs` user             Limit `hacluster` access via&lt;br /&gt;
                                       firewall&lt;br /&gt;
 3       Enable STONITH                For production&lt;br /&gt;
                                       environments only&lt;br /&gt;
 4       Monitor Logs                  Integrate logs with&lt;br /&gt;
                                       centralized syslog server&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
Post-Setup and Documentation&lt;br /&gt;
Document the setup process, ensure proper backup procedures, and integrate the cluster&lt;br /&gt;
with monitoring and alerting systems.&lt;br /&gt;
&lt;br /&gt;
 Step    Task                          Details&lt;br /&gt;
 1       Update SOP                    Create documentation for&lt;br /&gt;
                                       failover, failback&lt;br /&gt;
 2       Monitoring Integration        Add checks for VIP, DB,&lt;br /&gt;
                                       DRBD status in Nagios&lt;br /&gt;
 3       Test Restore                  Test full restore from&lt;br /&gt;
                                       backup with DRBD volume&lt;br /&gt;
 4       Backup Plan                   Configure daily backups of&lt;br /&gt;
                                       Nagios DB and configs&lt;br /&gt;
&lt;br /&gt;
Fallback Plan (Manual Recovery Procedures)&lt;br /&gt;
In the event of a complete cluster failure or unexpected behavior not handled by automatic&lt;br /&gt;
failover, follow the steps below to restore Nagios XI operations manually.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
1. Assess Cluster State&lt;br /&gt;
&lt;br /&gt;
- Run `pcs status` and `drbdadm status` on both nodes.&lt;br /&gt;
&lt;br /&gt;
- Check system logs: `journalctl -xe`, `/var/log/messages`, DRBD logs.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
2. Manual DRBD Promotion&lt;br /&gt;
&lt;br /&gt;
If DRBD resource fails to auto-promote:&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
3. Force Service Start on One Node&lt;br /&gt;
&lt;br /&gt;
Manually start Nagios XI and dependencies:&lt;br /&gt;
&lt;br /&gt;
Confirm that services are running and accessible.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
4. Force VIP Assignment&lt;br /&gt;
&lt;br /&gt;
If the virtual IP (VIP) is not assigned&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
5. Check Application Functionality&lt;br /&gt;
&lt;br /&gt;
- Confirm Nagios web interface loads from VIP.&lt;br /&gt;
&lt;br /&gt;
- Verify alerting and checks are functioning.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
6. Isolate Problem Node&lt;br /&gt;
&lt;br /&gt;
- If one node is unstable, isolate it:&lt;br /&gt;
&lt;br /&gt;
- Avoid split-brain scenarios.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
7. Plan Rejoin or Rebuild&lt;br /&gt;
&lt;br /&gt;
- Once stable, re-integrate the failed node using `pcs` or rebuild from backup.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
8. Log and Review&lt;br /&gt;
&lt;br /&gt;
- Record issue, recovery actions, and outcomes.&lt;br /&gt;
&lt;br /&gt;
- Update SOP/documentation.&lt;br /&gt;
&amp;lt;/nowiki&amp;gt;&lt;br /&gt;
&amp;lt;/pre&amp;gt;&lt;/div&gt;</summary>
		<author><name>Admin</name></author>
	</entry>
</feed>