Home Bez kategorii Business continuity — jak zbudować firmę odporną na awarie i przestoje
Business continuity — jak zbudować firmę odporną na awarie i przestoje - ilustracja artykulu

Business continuity — jak zbudować firmę odporną na awarie i przestoje

by DigitalGates

Business continuity — jak zbudować firmę odporną na awarie i przestoje

Business continuity to zdolność organizacji do dalszego świadczenia usług mimo awarii, ataku ransomware czy utraty dostępu do biura. W polskich firmach business continuity wciąż bywa mylone z backupem, choć kopia zapasowa to zaledwie jeden z kilkunastu elementów całej układanki. Plan ciągłości działania opisuje, które procesy są krytyczne, kto podejmuje decyzje w pierwszych dwudziestu minutach incydentu, z jakiego sprzętu zastępczego korzysta zespół i w jakim czasie klient znów zobaczy działający sklep. Różnica między firmą przygotowaną a nieprzygotowaną to zwykle nie technologia, lecz przećwiczona procedura: jedna organizacja wraca do pracy w czterdzieści minut, druga traci trzy dni obrotu i pozycje w wynikach wyszukiwania. Ten artykuł pokazuje, jak zbudować taki plan od analizy wpływu na biznes, przez architekturę infrastruktury, aż po realne koszty w złotówkach i harmonogram testów. Zamiast ogólników znajdziesz tu konkretne parametry, które da się wpisać do umowy z dostawcą i rozliczyć z zarządem.

Czym jest ciągłość działania i czym różni się od backupu

Ciągłość działania obejmuje trzy warstwy: technologię, ludzi i procesy. Backup odpowiada wyłącznie za pierwszą z nich, i to tylko częściowo, ponieważ kopia bez przetestowanego odtworzenia pozostaje wyłącznie kosztem magazynowym. Dopiero opisany scenariusz przełączenia, wyznaczone role oraz aktualna lista kontaktów zmieniają zbiór plików w realną zdolność przetrwania awarii.

Disaster recovery to reakcja techniczna po zdarzeniu, czyli odtworzenie systemów ze stanu sprzed awarii. Plan ciągłości idzie dalej i zakłada, że firma pracuje również w trakcie incydentu: obsługa telefoniczna przejmuje zamówienia, magazyn wydaje towar na podstawie wydruku, a księgowość korzysta z offline’owej kopii rejestrów sprzedaży.

Skala zdarzeń bywa banalna. Zalany laptop, padnięty dysk NVMe, wygasły certyfikat SSL albo zablokowane wordpress logowanie po nieudanej aktualizacji wtyczki potrafią wstrzymać publikację oferty na kilkanaście godzin. Plan nie dotyczy więc wyłącznie pożaru serwerowni, lecz przede wszystkim drobiazgów, które w każdej firmie zdarzają się co miesiąc.

Dojrzała organizacja opisuje te sytuacje w jednym dokumencie i aktualizuje go po każdej zmianie infrastruktury. Dokument liczy zwykle od dwunastu do trzydziestu stron, zawiera macierz decyzyjną, progi eskalacji oraz komplet danych dostępowych przechowywanych w menedżerze haseł z awaryjnym kluczem offline.

BIA, RTO i RPO — fundament planu ciągłości działania

Analiza wpływu na biznes, czyli BIA, odpowiada na pytanie, które procesy naprawdę generują przychód. Zespół wypisuje wszystkie czynności, przypisuje im właścicieli i szacuje straty po godzinie, dobie oraz tygodniu przestoju. Dopiero taka lista pozwala racjonalnie dzielić budżet, zamiast finansować redundancję archiwum kosztem systemu zamówień.

RTO określa maksymalny akceptowalny czas powrotu usługi, a RPO maksymalną ilość danych, które wolno bezpowrotnie stracić. Sklep z ośmioma tysiącami zamówień miesięcznie potrzebuje RPO liczonego w minutach, natomiast archiwum projektów graficznych spokojnie zniesie dobę. Parametry te wpisuje się później do umowy z dostawcą hostingu.

Poniższa tabela pokazuje przykładowy podział dla agencji łączącej usługi wdrożeniowe ze sprzedażą online. Wartości są punktem wyjścia do negocjacji, nie dogmatem, ale dobrze ilustrują zasadę: im bliżej pieniędzy, tym krótszy czas odtworzenia i tym droższe rozwiązanie zapasowe.

ProcesRTORPORozwiązanie zapasowe
Sklep internetowy30 minut5 minutReplikacja bazy i druga instancja aplikacji
Poczta firmowa1 godzina15 minutUsługa chmurowa z archiwizacją
Fakturowanie i księgowość8 godzin24 godzinyKopia dzienna w lokalizacji zdalnej
Serwisy WWW klientów4 godziny1 godzinaSnapshot serwera co godzinę
Archiwum projektów72 godziny24 godzinyMagazyn zimny, odzysk na żądanie

Jak policzyć koszt jednej godziny przestoju

Wzór jest prosty: roczny przychód dzielimy przez liczbę godzin pracy handlowej, a wynik mnożymy przez współczynnik utraconych konwersji. Firma z obrotem trzech milionów złotych i dwoma tysiącami godzin sprzedaży traci około 1500 zł za każdą godzinę ciszy, zanim doliczymy nadgodziny zespołu i rabaty dla zawiedzionych klientów.

Do rachunku dopisujemy koszty pośrednie: kary umowne, utracone dane telemetryczne oraz spadek widoczności, jeśli awaria trwa dłużej niż kilkanaście godzin. Gdy koszt przestoju przekracza miesięczną ratę za rozwiązanie zapasowe, decyzja inwestycyjna broni się sama i nie wymaga dodatkowego uzasadniania przed zarządem.

Infrastruktura odporna na awarie: serwery, chmura i sprzęt

Podstawą jest rozdzielenie warstw. Aplikacja, baza danych i kopie zapasowe nie powinny mieszkać na jednej maszynie ani u jednego dostawcy. Typowy układ dla małej firmy to ovh vps z aplikacją produkcyjną, druga instancja u innego operatora oraz kopie w magazynie obiektowym umieszczonym w trzeciej lokalizacji.

Poczta i dokumenty najlepiej trzymają się w usłudze zarządzanej z gwarancją dostępności. Google workspace cena zaczyna się od kilkudziesięciu złotych miesięcznie za użytkownika i obejmuje archiwizację, dwuskładnikowe uwierzytelnianie oraz odzyskiwanie skasowanych plików, co samodzielnie utrzymywany serwer pocztowy oferuje rzadko i znacznie drożej.

Sprzedaż wymaga osobnego scenariusza. Integracja z google merchant potrafi odrzucić cały feed produktowy, gdy witryna zwraca błąd przez kilkanaście godzin, a przywrócenie statusu konta trwa dłużej niż sama naprawa serwera. Dlatego plik z ofertą lepiej generować statycznie i hostować niezależnie od głównej aplikacji sklepu.

Redundantne stanowisko pracy

Ciągłość kończy się tam, gdzie kończy się sprawny sprzęt. W szufladzie serwisowej powinny leżeć zapasowa klawiatura mechaniczna, mysz, komplet przejściówek oraz dodatkowy monitor do komputera, ponieważ brak drugiego ekranu obniża tempo pracy administratora o kilkanaście procent podczas odtwarzania danych z konsoli.

Business continuity — jak zbudować firmę odporną na awarie i przestoje - zdjecie w tresci
Zdj. tematyczne: Business continuity — jak zbudować firmę odpo (fot. panumas nikhomkhai/Pexels)

Kompaktowy format bywa praktyczniejszy w mobilnym zestawie awaryjnym: klawiatura mechaniczna 60 zajmuje w plecaku o połowę mniej miejsca niż pełnowymiarowa klawiatura gamingowa mechaniczna, a tablet graficzny wacom pozwala grafikowi dokończyć projekt z domu, gdy dostęp do biura zostaje odcięty na kilka dni.

Ludzie, procedury i komunikacja kryzysowa

Najlepszy plan przegrywa z brakiem jasnych ról. Każdy scenariusz musi wskazywać osobę decyzyjną, jej zastępcę oraz kanał kontaktu niezależny od firmowej poczty. Numery telefonów, adresy prywatne i kody dostępu do serwerowni należy wydrukować, bo w czasie ataku ransomware dokument w chmurze bywa zwyczajnie nieosiągalny.

Komunikacja zewnętrzna waży tyle samo, co techniczna naprawa. Klient, który dostaje krótką informację o awarii i szacowanym czasie powrotu, czeka spokojnie; klient zostawiony bez odpowiedzi pisze recenzję i sprawdza konkurencję. Przygotowane wcześniej szablony wiadomości skracają czas reakcji z godziny do kilku minut.

Minimalny zestaw dokumentów, które trzeba mieć również w wersji papierowej:

  • macierz kontaktów z numerami prywatnymi i kolejnością eskalacji,
  • karta odtworzenia każdego systemu krytycznego, opisana krok po kroku,
  • lista licencji, umów SLA oraz identyfikatorów zgłoszeń u dostawców,
  • szablony komunikatów dla klientów, pracowników i partnerów,
  • koperta z kluczami odzyskiwania i kodami zapasowymi do 2FA.

Zestaw aktualizuje się co kwartał, najlepiej podczas krótkiego spotkania zamykającego przegląd infrastruktury. Rotacja pracowników sprawia, że po roku około jednej trzeciej kontaktów bywa nieaktualna, a martwy numer telefonu kosztuje w kryzysie dokładnie tyle samo, co brakująca kopia zapasowa.

Testowanie planu, koszty wdrożenia i mierniki skuteczności

Plan nietestowany pozostaje hipotezą. Minimalny cykl to jedno ćwiczenie sztabowe na papierze co pół roku oraz jedno realne odtworzenie środowiska rocznie, z pomiarem czasu i protokołem rozbieżności. Dopiero wtedy okazuje się, że skrypt migracyjny odwołuje się do nieistniejącego katalogu, a klucz SSH dawno wygasł.

Budżet bywa niższy, niż zakładają właściciele. Dla firmy zatrudniającej dziesięć osób sensowny zestaw, czyli druga instancja serwera, kopie w zdalnej lokalizacji, menedżer haseł i monitoring dostępności, mieści się zwykle w przedziale od 400 do 900 zł miesięcznie. To mniej niż jeden dzień przestoju liczony wcześniejszym wzorem.

Skuteczne business continuity mierzy się liczbami: średnim czasem wykrycia incydentu, czasem odtworzenia względem deklarowanego RTO oraz odsetkiem udanych testów kopii. Sprawdzaj też widoczność w wyszukiwarce, ponieważ długie przestoje realnie cofają pozycjonowanie strony, a odbudowa ruchu trwa zauważalnie dłużej niż naprawa samego serwera.

Firmy, dla których projektowanie stron internetowych stanowi podstawową usługę, powinny wpisać parametry ciągłości bezpośrednio do swoich ofert, bo to argument sprzedażowy, a nie koszt operacyjny. Klient inwestujący w pozycjonowanie strony w google traci wymierne pieniądze przy każdej godzinie niedostępności witryny.

Jak wdrożyć business continuity w małej firmie krok po kroku?

Zacznij od inwentaryzacji: wypisz wszystkie systemy, konta i urządzenia, bez których zespół nie wykona swojej pracy. Następnie przeprowadź uproszczoną analizę BIA i przypisz każdemu procesowi wartości RTO oraz RPO, do czego wystarczy arkusz kalkulacyjny z pięcioma kolumnami. Trzeci krok to dobranie rozwiązań technicznych do najkrótszych czasów odtworzenia i skonfigurowanie kopii w trzech miejscach, w tym jednej całkowicie odciętej od sieci. Czwarty krok to spisanie kart odtworzenia, czyli instrukcji na tyle szczegółowych, by wykonała je osoba spoza zespołu. Na końcu wyznacz datę pierwszego testu i potraktuj ją równie poważnie jak termin wobec klienta. W organizacji do dwudziestu osób cały proces zajmuje zazwyczaj od dwóch do czterech tygodni pracy rozłożonej na kilka popołudni.

Czy plan ciągłości jest potrzebny firmie bez własnej serwerowni?

Tak, a często nawet bardziej niż organizacji z własnym sprzętem. Przeniesienie usług do chmury oddaje dostawcy odpowiedzialność za maszyny, ale nie za dane, konta i procesy. Operator gwarantuje dostępność platformy, natomiast nie odzyska skasowanego projektu, nie odblokuje konta przejętego przez atakującego i nie przywróci sklepu wyłączonego po naruszeniu regulaminu. Model współdzielonej odpowiedzialności rozdziela te obowiązki bardzo jasno, choć rzadko ktoś czyta go przed incydentem. Firma bez serwerowni potrzebuje więc niezależnych kopii danych wyeksportowanych z usług chmurowych, drugiego kanału komunikacji, listy administratorów zapasowych oraz procedury odzyskiwania dostępu do domeny. Ten ostatni element bywa pomijany najczęściej, a utrata kontroli nad domeną zatrzymuje jednocześnie pocztę, stronę i wszystkie integracje sprzedażowe.

Co zrobić w pierwszej godzinie po wykryciu poważnej awarii?

Pierwsze piętnaście minut poświęć na potwierdzenie zakresu: co dokładnie nie działa, od kiedy i ilu użytkowników dotyczy problem. Nie podejmuj wtedy prób naprawy na produkcji, ponieważ pochopne restarty niszczą ślady potrzebne do późniejszej analizy. Kolejny krok to izolacja, czyli odłączenie podejrzanych maszyn od sieci i zablokowanie kont użytych do nietypowych logowań. Następnie uruchom komunikację: powiadom osobę decyzyjną, zespół oraz klientów według przygotowanego szablonu, podając realny, a nie optymistyczny czas powrotu. Dopiero po tych krokach rozpoczyna się odtwarzanie z kopii, zawsze na czystym środowisku i zawsze z weryfikacją integralności danych. Równolegle prowadź notatkę czasową ze wszystkimi decyzjami, bo posłuży ona później do rozliczenia z ubezpieczycielem i do poprawy samego planu.

Powiązane artykuły