Monitoring techniczny
Alarm ma prowadzić do decyzji, a nie tylko generować wiadomość
Monitoring pracuje stale, ale jego wartość powstaje dopiero wtedy, gdy wiadomo, co oznacza przekroczenie progu, kto odbiera alarm i jaka jest procedura. Dlatego wdrożenie obejmuje metryki, progi, kanały powiadomień i test alarmu.
Co zwykle obejmujemy obserwacją
Sprzęt i system
- SMART i stan macierzy RAID
- CPU, load, pamięć i swap
- miejsce oraz przyrost danych
- temperatury i czujniki — jeśli dostępne
Sieć i dostępność
- ping, opóźnienia i utrata pakietów
- porty i czas zestawiania połączenia
- DNS i ważność certyfikatów TLS
- dostęp do IPMI/KVM
Usługi
- HTTP/HTTPS wraz z kodem odpowiedzi
- SMTP, IMAP i kolejka pocztowa
- bazy danych i replikacja
- procesy, workery i harmonogramy zadań
Bezpieczeństwo i ciągłość
- wynik oraz wiek ostatniej kopii
- nietypowe błędy uwierzytelniania
- aktualność systemu i usług
- obecność adresu na listach RBL
Narzędzie dobieramy do środowiska
Nagios pozostaje dobrym rozwiązaniem dla jawnych testów i infrastruktury o stabilnym zakresie. Zabbix upraszcza zbieranie wielu metryk z hostów, a Prometheus sprawdza się w środowiskach aplikacyjnych i dynamicznych. Nie wdrażamy stosu obserwowalności większego niż system, który ma chronić.
Wdrożenie monitoringu krok po kroku
- 1
Inwentaryzacja
Hosty, usługi, zależności, właściciele i aktualne źródła alarmów.
- 2
Metryki i progi
Progi ostrzegawcze i krytyczne, opóźnienia oraz wyciszenia serwisowe.
- 3
Powiadomienia
Adresaci, kanały, eskalacja i godziny odpowiedzialności.
- 4
Test
Kontrolowane wywołanie alarmu oraz potwierdzenie, że komunikat pozwala rozpocząć diagnozę.
Ważne rozróżnienie
Monitoring nie jest jeszcze reakcją 24/7
Możemy uruchomić obserwację i powiadomienia dla zespołu klienta. Jeżeli alarmy ma przejmować administrator w uzgodnionym SLA, potrzebna jest osobna usługa stałej administracji LinuxAdmin.
Stała administracja i SLA