Jak radzić sobie z przestojami SaaS: Przewodnik krok po kroku
Aby przygotować się na przestoje SaaS, powinien istnieć pisemny plan zawierający kroki, natychmiastową reakcję na incydent i jasną komunikację.
Ten artykuł przedstawia kroki do rozważenia w związku z wpływem przestojów na biznes i zaufanie klientów, uwzględniając strategie i studia przypadków.
Zarys koncepcji
-
Kategoria: Zarządzanie incydentami, niezawodność SaaS
-
Używane przez: SaaS B2B, dostawcy cyfrowi, platformy SaaS
-
Główny cel:
Minimalizuj przestoje i chroń zaufanie klientów
-
Powiązane koncepcje: Umowa o Poziomie Usług (SLA), Redundancja, Retencja klientów, Analiza przyczyn źródłowych (RCA)
-
Etap wzrostu:
Skalowanie, po osiągnięciu PMF, gotowość korporacyjna
Opracowanie kompleksowego planu reagowania na incydenty
the plan reagowania na incydenty jest kluczową częścią strategii zarządzania czasem i powinien być dokładnie aktualizowany i edytowany wraz z rozwojem systemu oraz w oparciu o wszelkie poprzednie incydenty.
- Określanie Ról i Obowiązków: Przypisz jasne role członkom swojego zespołu, takie jak Dowódca Incydentu (osoba odpowiedzialna za kierowanie reakcją), Lider Techniczny (osoba odpowiedzialna za rozwiązywanie problemów i ich usuwanie) oraz Lider Komunikacji (osoba odpowiedzialna za komunikację z klientami). Odgrywa to rolę w ustalaniu konkretnych parametrów i może zmniejszyć dwuznaczność w przypadku wystąpienia sytuacji awaryjnej.
Przykład:
| Rola | Obowiązki |
| Dowódca Incydentu | Koordynowanie odpowiedzi, podejmowanie decyzji, alokacja zasobów, komunikacja z interesariuszami. |
| Lider Techniczny | Diagnozowanie i rozwiązywanie problemów technicznych, eskalowanie w razie potrzeby. |
| Lider ds. Komunikacji | Zarządzanie komunikacją wewnętrzną i zewnętrzną, aktualizowanie strony statusu, opracowywanie powiadomień dla klientów oraz odpowiadanie na zapytania. |
| Lider Obsługi Klienta | Obsługa zapytań i reklamacji klientów, dostarczanie aktualizacji oraz eskalowanie problemów do odpowiednich członków zespołu. |
| Ekspert Dziedzinowy | Zapewniaj specjalistyczną wiedzę i doświadczenie dotyczące konkretnych obszarów aplikacji lub infrastruktury. |
Określ procedury eskalacji. Stwórz przejrzystą ścieżkę eskalacji, aby upewnić się, że problemy są rozwiązywane skutecznie i terminowo przez właściwe osoby. Zrozum, kiedy należy eskalować incydent do menedżerów wyższego szczebla lub zewnętrznych zespołów wsparcia.
Stwórz szablony komunikacji. Rozważ stworzenie szablonów dla różnych sytuacji związanych z incydentami (np. degradacja usługi, częściowa awaria, całkowita awaria). Szablony te powinny zawierać istotne szczegóły, takie jak dotknięte usługi, szacowany czas rozwiązania problemu oraz podejmowane kroki zaradcze. Pamiętaj o odpowiednim modyfikowaniu tych szablonów dla różnych grup odbiorców, takich jak klienci, interesariusze firmy lub firmy partnerskie.
Plan reagowania na incydenty autorstwa Slack ilustruje proces definiowania ról, ustanawiania kanałów komunikacji oraz przygotowywania szablonów do aktualizacji statusu.
BEZPŁATNA Lista kontrolna reagowania na przestoje w SaaS
Szybko reaguj na awarie SaaS dzięki tej liście kontrolnej reagowania na incydenty i ich przywracania.
-
Sprawdzenia gotowości przed incydentem dotyczące monitorowania, redundancji i przełączania awaryjnego
-
Sekwencja reakcji krok po kroku: potwierdź, zaktualizuj, rozwiąż, zrekompensuj
-
Poincydentalna analiza przyczyn źródłowych i lista działań naprawczych
-
Uzupełnij pola, aby rejestrować wagę problemu, czas przestoju i dotkniętych klientów
Skonfiguruj monitorowanie w czasie rzeczywistym i alertowanie
Pierwszą obroną przed przestojami jest monitorowanie zapobiegawcze. Takie monitorowanie może ułatwić terminowe wykrywanie problemów, potencjalnie wpływając na ich eskalację w pełne awarie.
Podczas wybór zestawu narzędzi, należy wziąć pod uwagę infrastrukturę techniczną, w której działasz, a także rozwijane aplikacje. Rozważ obie kategorie, takie jak monitorowanie infrastruktury (serwery, bazy danych, sieć) i monitorowanie wydajności aplikacji (APM).
Ustaw wartości progowe dla ważnych metryk, takich jak czas odpowiedzi, wskaźniki błędów, zużycie procesora i zużycie pamięci. Stwórz również alerty aby powiadomić Twój zespół za każdym razem, gdy te progi zostaną przekroczone. Lepiej jest wysyłać alerty za pośrednictwem poczty e-mail, SMS lub Slacka, zgodnie z preferencjami zespołu.
Taka praktyka jest popularna wśród firm SaaS, z których wiele korzysta z Datadog do wykrywania i szybkiego rozwiązywania incydentów.
BEZPŁATNA Lista kontrolna reagowania na przestoje w SaaS
Szybko reaguj na awarie SaaS dzięki tej liście kontrolnej reagowania na incydenty i ich przywracania.
-
Sprawdzenia gotowości przed incydentem dotyczące monitorowania, redundancji i przełączania awaryjnego
-
Sekwencja reakcji krok po kroku: potwierdź, zaktualizuj, rozwiąż, zrekompensuj
-
Poincydentalna analiza przyczyn źródłowych i lista działań naprawczych
-
Uzupełnij pola, aby rejestrować wagę problemu, czas przestoju i dotkniętych klientów
Wdrażaj nadmiarowość i mechanizmy przełączania awaryjnego
Nadmiarowość SaaS odnosi się do posiadania wielu instancji aplikacji, serwerów itp. w Twojej infrastrukturze w przypadku awarii jednej z nich. Podejście to jest związane ze skróceniem czasu przywracania usług.
- Aby zwiększyć wydajność i niezawodność Twojej infrastruktury, możesz rozważyć wdrożenie kluczowych rozwiązań zapewniających redundancję. Jednym z takich podejść jest zastosowanie dwóch lub więcej serwerów WWW i umieszczenie ich w różnych lokalizacjach, wykorzystując redundancję geograficzną. System umożliwia dystrybucję obciążenia, co wiąże się z ciągłym działaniem witryny, pomimo awarii serwera.
- Inną opcją jest replikowanie baz danych na wielu serwerach lub w strefach dostępności, wykorzystując replikację baz danych. Funkcjonalność ta ma na celu wspieranie ochrony danych i możliwości dostępu.
- Jeśli korzystasz z infrastrukturę chmury, istnieje kilka wbudowanych funkcji redundancji które możesz wykorzystać, takich jak wiele stref dostępności lub regionów.
Netflix działa z wieloma Strefami Dostępności w AWS, co jest konfiguracją odpowiadającą jej celom w zakresie wysokiej dostępności i odzyskiwania po awarii.
BEZPŁATNA Lista kontrolna reagowania na przestoje w SaaS
Szybko reaguj na awarie SaaS dzięki tej liście kontrolnej reagowania na incydenty i ich przywracania.
-
Sprawdzenia gotowości przed incydentem dotyczące monitorowania, redundancji i przełączania awaryjnego
-
Sekwencja reakcji krok po kroku: potwierdź, zaktualizuj, rozwiąż, zrekompensuj
-
Poincydentalna analiza przyczyn źródłowych i lista działań naprawczych
-
Uzupełnij pola, aby rejestrować wagę problemu, czas przestoju i dotkniętych klientów
Potwierdź przestój
Przejrzystość jest bardzo ważne podczas incydentu przestoju. Niezwłoczne publiczne powiadomienie po wykryciu awarii jest związane z potwierdzeniem problemu i zainicjowaniem procesów jego rozwiązywania. Taka komunikacja może wpłynąć na budowanie zaufania i dostosowanie oczekiwań.
Wybierz kanały komunikacji:
- Uwzględnij na stronie statusu informacje o awarii, usługach, których dotyczy problem, szacowanym czasie rozwiązania problemu oraz wszelkich znanych obejściach.
- Korzystaj z platform mediów społecznościowych, takich jak Twitter i LinkedIn, aby zwiększyć swoją publiczność i przedstawić krótki przegląd sytuacji.
- Wyślij wiadomość e-mail do osób, których to dotyczy, aby przedstawić szczegółowe wyjaśnienie i najnowsze informacje.
Bądź szczery i transparentny. Ważne jest, aby dokładnie ocenić zakres problemu i składać zobowiązania, które można spełnić. Przedstaw klientom informacje dotyczące przyczyny przestoju. Udokumentuj działania podejmowane obecnie w celu rozwiązania problemu.
Przedstaw harmonogram. Oszacuj czas potrzebny na rozwiązanie problemu (ETR) i podaj zakres, nawet ogólny. Następnie ponownie zaktualizuj ETR najnowszymi informacjami. Tworzenie oczekiwań bez wystarczającego uzasadnienia może prowadzić do negatywnych reakcji emocjonalnych.
Szablon:
| “Doświadczamy awarii wpływającej na [service/feature]. Nasz zespół aktywnie pracuje nad jej rozwiązaniem i będziemy dostarczać aktualizacje co [time interval, e.g., 30 minutes], dopóki problem nie zostanie usunięty. Przepraszamy za wszelkie niedogodności i dziękujemy za Państwa cierpliwość.” |
BEZPŁATNA Lista kontrolna reagowania na przestoje w SaaS
Szybko reaguj na awarie SaaS dzięki tej liście kontrolnej reagowania na incydenty i ich przywracania.
-
Sprawdzenia gotowości przed incydentem dotyczące monitorowania, redundancji i przełączania awaryjnego
-
Sekwencja reakcji krok po kroku: potwierdź, zaktualizuj, rozwiąż, zrekompensuj
-
Poincydentalna analiza przyczyn źródłowych i lista działań naprawczych
-
Uzupełnij pola, aby rejestrować wagę problemu, czas przestoju i dotkniętych klientów
Dostarczaj regularne aktualizacje
Jedną ważną rzeczą do rozważenia jest to, aby na bieżąco informować klientów statusu rozwiązania incydentu. Należy również przedstawić szacowany czas potrzebny na ukończenie rozwiązania oraz w prosty sposób podać przyczynę przestoju.
Awaria Facebooka w 2021 roku pokazała, dlaczego strona statusowa musi działać na infrastrukturze niezależnej od produktu — ich własna przestała działać wraz z usługą, co wymusiło publikowanie aktualizacji na platformie zewnętrznej.
BEZPŁATNA Lista kontrolna reagowania na przestoje w SaaS
Szybko reaguj na awarie SaaS dzięki tej liście kontrolnej reagowania na incydenty i ich przywracania.
-
Sprawdzenia gotowości przed incydentem dotyczące monitorowania, redundancji i przełączania awaryjnego
-
Sekwencja reakcji krok po kroku: potwierdź, zaktualizuj, rozwiąż, zrekompensuj
-
Poincydentalna analiza przyczyn źródłowych i lista działań naprawczych
-
Uzupełnij pola, aby rejestrować wagę problemu, czas przestoju i dotkniętych klientów
Zaoferuj przeprosiny i rekompensatę
Przeproś i przedstawić uzasadnienie przedłużenia terminu oraz okoliczności, jakie to spowodowało. Praktyką jest nieprzedstawianie uzasadnień ani nieprzypisywanie odpowiedzialności innym stronom.
Oferuj kredyty usługowe lub zniżka dla klientów w oparciu o zakres awarii, jej czas trwania i jej powagę. Rozważ zapewnienie innych korzyści, takich jak bezpłatne okresy próbne lub dostęp do funkcji premium ze zniżką. Uwzględnij okoliczności klientów i odpowiednio dostosuj rekompensatę.
W 2019 roku, Salesforce zmieniło swoją politykę przyznawania rekompensat opartą na umowie o poziomie usług (SLA) w taki sposób, że przyznaje klientom rekompensaty za czas, w którym usługa była niedostępna.
BEZPŁATNA Lista kontrolna reagowania na przestoje w SaaS
Szybko reaguj na awarie SaaS dzięki tej liście kontrolnej reagowania na incydenty i ich przywracania.
-
Sprawdzenia gotowości przed incydentem dotyczące monitorowania, redundancji i przełączania awaryjnego
-
Sekwencja reakcji krok po kroku: potwierdź, zaktualizuj, rozwiąż, zrekompensuj
-
Poincydentalna analiza przyczyn źródłowych i lista działań naprawczych
-
Uzupełnij pola, aby rejestrować wagę problemu, czas przestoju i dotkniętych klientów
Analizuj, Ucz się i Usprawniaj
Wystąpienie problemu z produktem lub usługą może prowadzić do przegląd dogłębnej analizy powiązanego procesu i jego efektywności. Rozłożenie incydentu na czynniki pierwsze i zidentyfikowanie jego pierwotnej przyczyny, a następnie zastosowanie tych wniosków w celu zapobieżenia podobnym sytuacjom w przyszłości, jest kluczem do maksymalnego wykorzystania tego rodzaju analizy.
Gruntowna Analiza przyczyn źródłowych (RCA) obejmuje tworzenie osi czasu kluczowych zdarzeń, wyjaśnianie wpływu zdarzenia, identyfikowanie podstawowej przyczyny i sugerowanie działań naprawczych. Proces ten jest związany z identyfikacją podstawowych problemów i wyborem rozwiązań.
Zacznij zbieranie logów, metryk i innych istotnych danych z narzędzi monitorujących, serwerów i aplikacji. Porozmawiaj z osobami, które były zaangażowane w proces rozwiązywania incydentów i weź pod uwagę ich uwagi i spostrzeżenia.
Ocena opinie klientów oraz zgłoszenia do obsługi klienta od momentu niedostępności witryny internetowej jest opcją. Uporządkuj dostarczone informacje zgodnie z chronologiczną kolejnością zdarzeń związanych z awarią.
Wykorzystaj informacje, aby stworzyć oś czasu wydarzeń. Wykorzystaj dane do zidentyfikowania wzorców lub wszelkich nietypowych działań, które mogą pomóc w znalezieniu przyczyny źródłowej.
Nie wyciągaj wniosków od razu. Rozważ wszystkie możliwe przyczyny awarii, czy to techniczne, ludzkie, mechaniczne, czy zewnętrzne.
Udokumentuj swoje ustalenia. Przygotuj szczegółowy raport APŹ, który zawiera:
- Oś czasu zdarzeń
- Ocena wpływu
- Przyczyna(y) źródłowa(e)
- Czynniki przyczyniające się
- Zalecane działania naprawcze
Szablon:
| Raport z Analizy Przyczyn Źródłowych
Incydent: [Awaria Usługi/Funkcjonalności] Data: [Data awarii] Oś Czasu Zdarzeń:
Ocena Wpływu:
Przyczyna(y) Źródłowa(e):
Czynniki przyczyniające się:
Zalecane działania naprawcze:
|
Wdrażaj środki naprawcze. Zgodnie z wynikami analizy RCA, podejmij kroki, aby uniknąć przyszłych przestojów. Może to obejmować łatanie błędów oprogramowania, aktualizację konfiguracji, dodanie monitoringu i alertów, lub zapewnienie dodatkowych szkoleń dla zespołu.
Przekaż wyciągnięte wnioski. Uwzględnij ustalenia swojej analizy RCA w działaniach naprawczych oraz w działaniach z zespołem i klientami. Może to być postrzegane jako wskaźnik zaangażowania w rozwój i może wpłynąć na poziom zaufania.
- Wewnętrznie: Przedstaw raport RCA swojemu zespołowi i omów kluczowe wnioski. Obecność otwartej komunikacji i informacji zwrotnej jest związana z warunkami wspierającymi iteracyjne udoskonalanie. Rozpowszechniaj informacje o najlepszych praktykach i wnioskach z incydentów, aby zapobiec podobnym zdarzeniom.
- Zewnętrznie: Dodaj sekcję na swojej stronie statusu lub blogu, aby podzielić się kluczowymi wnioskami z analizy przyczyn źródłowych (RCA). Ważne jest, aby publicznie wyjaśnić przyczynę awarii i informować o jej rozwiązaniu. Zdobądź uznanie za cierpliwość swoich klientów, doceniając ją.
Aby uzyskać więcej informacji na temat przestojów SaaS i sposobów ich obsługi, możesz zapoznać się z tymi zasobami: Jak napisać SLA.
Doświadczenie GitHub sugeruje znaczenie uczenia się na błędach. W odpowiedzi na poważną awarię W 2018 roku GitHub ponownie skonfigurował swoje narzędzia do przełączania awaryjnego, aby zapobiec przełączaniu między regionami, i przebudował system raportowania statusu, a zmiany te mają wpłynąć na prawdopodobieństwo wystąpienia podobnych zdarzeń.
Wniosek
Zarządzanie przestojami podczas gdy aplikacja SaaS działa, jest stałym procesem, który musi być proaktywny, szybki i nigdy się nie kończy. Wdrażanie monitorowanie, Kopia zapasowa, Plany reagowania na incydenty, i komunikacyjnego Metody mogą wpływać na skutki przestojów i poziom zaufania klientów.
Przestoje aplikacji SaaS mogą zapewnić informacje możliwość oceny i dostosowania systemu, co może wpłynąć na stabilność i niezawodność aplikacji.
Gotowy do rozpoczęcia?
Byliśmy tam, gdzie Ty jesteś. Podzielmy się naszym 19-letnim doświadczeniem i sprawmy, by Twoje globalne marzenia stały się rzeczywistością.
FAQ
-
Kiedy projekty napotykają problemy, kwestie techniczne często odgrywają kluczową rolę. Należy również rozważyć czynniki takie jak błąd ludzki lub wpływy zewnętrzne, np. cyberataki.
-
Najlepszą obroną przed przestojami jest zapobieganie, a można to osiągnąć poprzez wdrażanie redundancji, przeprowadzanie regularnej konserwacji i wykonywanie dokładnych testów. Dodatkowo, należy stosować monitorowanie w czasie rzeczywistym, aby wykrywać i rozwiązywać problemy na wczesnym etapie.
-
Pierwszym krokiem jest przyznanie, że istnieje problem, a następnie otwarta komunikacja z klientami na temat sytuacji, podając rzeczywisty czas, kiedy problem zostanie rozwiązany. Zazwyczaj składane są przeprosiny, a w przypadku znacznych zakłóceń może zostać rozważona rekompensata dla użytkowników.
-
Posiadanie planu reagowania na incydenty jest bardzo ważne, a plan ten powinien obejmować role i obowiązki, procedury eskalacji oraz szablony komunikacji, aby zapewnić szybką i uporządkowaną reakcję.
-
Po incydencie należy przeprowadzić dokładną analizę przyczyn źródłowych (RCA). Obejmuje to zidentyfikowanie głównej przyczyny incydentu, podjęcie działań naprawczych oraz podzielenie się wyciągniętymi wnioskami z resztą zespołu w celu uniknięcia powtórzenia tych samych błędów.