Umgang mit SaaS-Ausfallzeiten: Eine Schritt-für-Schritt-Anleitung
Zur Vorbereitung auf SaaS-Ausfallzeiten, sollte ein schriftlicher Plan vorhanden sein, der Schritte, sofortige Reaktion auf Vorfälle und klare Kommunikation umfasst.
Dieser Artikel beschreibt Schritte, die hinsichtlich der Auswirkungen von Ausfallzeiten auf das Geschäft und das Kundenvertrauen zu berücksichtigen sind, einschließlich Strategien und Fallstudien.
Konzept-Schnappschuss
-
Kategorie: Vorfallsmanagement, SaaS-Zuverlässigkeit
-
Genutzt von: B2B SaaS, digitale Anbieter, SaaS-Plattformen
-
Hauptzweck:
Ausfallzeiten minimieren und Kundenvertrauen schützen
-
Verwandte Konzepte: Service-Lernvereinbarung (SLA), Redundanz, Kundenbindung, Ursachenanalyse (RCA)
-
Wachstumsphase:
Skalierung, nach PMF, Enterprise-Readiness
Einen umfassenden Incident-Response-Plan etablieren
die Incident-Response-Plan ist ein zentraler Bestandteil der Zeitmanagementstrategie und sollte mit dem Fortschritt des Systems und allen früheren Vorfällen gründlich aktualisiert und überarbeitet werden.
- Definition von Rollen und Verantwortlichkeiten: Weisen Sie den Mitgliedern Ihres Teams klare Rollen zu, wie z.B. den Incident Commander (die für die Leitung der Reaktion zuständige Person), den Technical Lead (die für die Fehlerbehebung und -lösung verantwortliche Person) und den Communication Lead (die für die Kommunikation mit Kunden zuständige Person). Dies trägt dazu bei, spezifische Parameter festzulegen und kann Unklarheiten im Notfall mindern.
Beispiel:
| Rolle | Verantwortlichkeiten |
| Incident Commander | Reaktion koordinieren, Entscheidungen treffen, Ressourcen zuweisen, mit Stakeholdern kommunizieren. |
| Technischer Leiter | Technische Probleme beheben und lösen, bei Bedarf eskalieren. |
| Leiter Kommunikation | Interne und externe Kommunikation verwalten, die Statusseite aktualisieren, Kundenbenachrichtigungen entwerfen und auf Anfragen antworten. |
| Leiter Kundensupport | Kundenanfragen und Beschwerden bearbeiten, Updates bereitstellen und Probleme an die zuständigen Teammitglieder eskalieren. |
| Fachexperte | Fachwissen und Expertise zu spezifischen Bereichen der Anwendung oder Infrastruktur bereitstellen. |
Eskalationsverfahren darlegen. Einen klaren Eskalationsweg schaffen, um sicherzustellen, dass Probleme von den richtigen Personen effektiv und zeitnah gelöst werden. Verstehen, wann ein Vorfall an Manager höherer Ebene oder externe Support-Teams eskaliert werden muss.
Kommunikationsvorlagen erstellen. Erwägen Sie die Erstellung von Vorlagen für verschiedene Vorfallssituationen (z.B. Dienstverschlechterung, Teilausfall, vollständiger Ausfall). Diese Vorlagen sollten relevante Details enthalten, wie die betroffenen Dienste, die geschätzte Zeit zur Problemlösung und die ergriffenen Abhilfemaßnahmen. Stellen Sie sicher, diese Vorlagen für verschiedene Zielgruppen, wie Kunden, interne Stakeholder oder Partnerunternehmen, entsprechend anzupassen.
Der Vorfallreaktionsplan von Slack veranschaulicht den Prozess der Rollendefinition, des Aufbaus von Kommunikationskanälen und der Vorbereitung von Vorlagen für Statusmeldungen.
KOSTENLOSE Checkliste zur Reaktion auf SaaS-Ausfallzeiten
Reagieren Sie schnell auf SaaS-Ausfälle mit dieser Checkliste für Incident Response und Wiederherstellung.
-
Bereitschaftsprüfungen vor einem Vorfall für Überwachung, Redundanz und Failover
-
Eine Schritt-für-Schritt-Reaktionssequenz: bestätigen, informieren, beheben, entschädigen.
-
Eine Ursachenanalyse nach einem Vorfall und eine Liste der Korrekturmaßnahmen.
-
Felder ausfüllen, um Schweregrad, Ausfallzeiten und betroffene Kunden zu protokollieren
Echtzeit-Monitoring und Alarmierung einrichten
Die erste Verteidigung gegen Ausfallzeiten ist präventives Monitoring. Ein solches Monitoring kann die rechtzeitige Erkennung von Problemen erleichtern und deren Entwicklung zu vollständigen Ausfällen möglicherweise beeinflussen.
Wenn Auswahl eines Toolkits, ist es notwendig, die technische Infrastruktur, in der Sie operieren, und auch die entwickelten Anwendungen zu berücksichtigen. Denken Sie an beide Kategorien wie Infrastruktur-Monitoring (Server, Datenbanken, Netzwerk) und Application Performance Monitoring (APM).
Legen Sie Schwellenwerte fest für wichtige Metriken wie Antwortzeit, Fehlerraten, CPU-Auslastung und Speicherauslastung. Erstellen Sie außerdem Alarme um Ihr Team zu benachrichtigen, wann immer diese Schwellenwerte überschritten werden. Es ist besser, Benachrichtigungen per E-Mail, SMS oder Slack zu senden, je nach den Präferenzen des Teams.
Solche Praktiken sind bei SaaS-Unternehmen beliebt, viele davon nutzen Datadog um Vorfälle schnell zu erkennen und zu beheben.
KOSTENLOSE Checkliste zur Reaktion auf SaaS-Ausfallzeiten
Reagieren Sie schnell auf SaaS-Ausfälle mit dieser Checkliste für Incident Response und Wiederherstellung.
-
Bereitschaftsprüfungen vor einem Vorfall für Überwachung, Redundanz und Failover
-
Eine Schritt-für-Schritt-Reaktionssequenz: bestätigen, informieren, beheben, entschädigen.
-
Eine Ursachenanalyse nach einem Vorfall und eine Liste der Korrekturmaßnahmen.
-
Felder ausfüllen, um Schweregrad, Ausfallzeiten und betroffene Kunden zu protokollieren
Implementieren Sie Redundanz- und Failover-Mechanismen
SaaS-Redundanz bezieht sich auf das Vorhandensein mehrerer Instanzen von Anwendungen, Servern usw. in Ihrer Infrastruktur im Falle eines Ausfalls einer davon. Dieser Ansatz ist mit einer Verkürzung der Dienstwiederherstellungszeit verbunden.
- Um die Leistung und Zuverlässigkeit Ihrer Infrastruktur zu verbessern, können Sie die Implementierung einiger wichtiger Redundanzen in Betracht ziehen. Ein solcher Ansatz besteht darin, zwei oder mehr Webserver einzusetzen und diese an verschiedenen Standorten zu platzieren, wobei geografische Redundanz. Das System ermöglicht eine Lastverteilung, die den kontinuierlichen Betrieb der Website gewährleistet, selbst wenn ein Server ausfällt.
- Eine weitere Option ist es, Ihre Datenbanken zu replizieren über mehrere Server oder Verfügbarkeitszonen hinweg, unter Verwendung von Datenbankreplikation. Diese Funktionalität ist darauf ausgelegt, Datenschutz und Zugriffsmöglichkeiten zu unterstützen.
- Wenn Sie einen Cloud-Infrastruktur, gibt es mehrere integrierte Redundanzfunktionen die Sie nutzen können, wie zum Beispiel mehrere Verfügbarkeitszonen oder Regionen.
Netflix betreibt mehrere Verfügbarkeitszonen in AWS, eine Konfiguration, die mit seinen Zielen für hohe Verfügbarkeit und Notfallwiederherstellung zusammenhängt.
KOSTENLOSE Checkliste zur Reaktion auf SaaS-Ausfallzeiten
Reagieren Sie schnell auf SaaS-Ausfälle mit dieser Checkliste für Incident Response und Wiederherstellung.
-
Bereitschaftsprüfungen vor einem Vorfall für Überwachung, Redundanz und Failover
-
Eine Schritt-für-Schritt-Reaktionssequenz: bestätigen, informieren, beheben, entschädigen.
-
Eine Ursachenanalyse nach einem Vorfall und eine Liste der Korrekturmaßnahmen.
-
Felder ausfüllen, um Schweregrad, Ausfallzeiten und betroffene Kunden zu protokollieren
Die Ausfallzeit anerkennen
Transparenz ist sehr wichtig während eines Ausfallereignisses. Eine schnelle öffentliche Benachrichtigung nach der Erkennung eines Ausfalls dient der Anerkennung des Problems und der Einleitung von Lösungsprozessen. Eine solche Kommunikation kann den Aufbau von Vertrauen und die Anpassung von Erwartungen beeinflussen.
Wählen Sie die Kommunikationskanäle:
- Fügen Sie auf Ihrer Statusseite Informationen zum Ausfall, den betroffenen Diensten, der geschätzten Zeit zur Behebung des Problems und bekannten Problemumgehungen hinzu.
- Nutzen Sie Social-Media-Plattformen wie Twitter und LinkedIn, um Ihr Publikum zu vergrößern und einen kurzen Überblick über die Situation zu geben.
- Senden Sie eine E-Mail an die betroffenen Personen, um eine detaillierte Erklärung und die neuesten Informationen zu geben.
Seien Sie ehrlich und transparent. Es ist wichtig, den Umfang des Problems genau zu bewerten und Zusagen zu machen, die eingehalten werden können. Informieren Sie die Kunden über die Ursache des Ausfalls. Dokumentieren Sie die Maßnahmen, die derzeit zur Behebung des Problems ergriffen werden.
Geben Sie einen Zeitplan an. Schätzen Sie die Zeit ein, die zur Behebung des Problems benötigt wird (ETR), und geben Sie einen Bereich an, wenn auch nur einen allgemeinen. Aktualisieren Sie dann die ETR erneut mit den neuesten Informationen. Erwartungen ohne ausreichende Begründung zu wecken, kann zu unerwünschten emotionalen Reaktionen führen.
Vorlage:
| “Es liegt eine Störung vor, die [Dienst/Funktion] betrifft. Unser Team arbeitet aktiv an einer Lösung, und wir werden alle [Zeitintervall, z.B. 30 Minuten] Updates bereitstellen, bis das Problem behoben ist. Wir entschuldigen uns für die dadurch entstandenen Unannehmlichkeiten und bitten um Ihr Verständnis.” |
KOSTENLOSE Checkliste zur Reaktion auf SaaS-Ausfallzeiten
Reagieren Sie schnell auf SaaS-Ausfälle mit dieser Checkliste für Incident Response und Wiederherstellung.
-
Bereitschaftsprüfungen vor einem Vorfall für Überwachung, Redundanz und Failover
-
Eine Schritt-für-Schritt-Reaktionssequenz: bestätigen, informieren, beheben, entschädigen.
-
Eine Ursachenanalyse nach einem Vorfall und eine Liste der Korrekturmaßnahmen.
-
Felder ausfüllen, um Schweregrad, Ausfallzeiten und betroffene Kunden zu protokollieren
Regelmäßige Updates bereitstellen
Ein wichtiger Punkt, den es zu beachten gilt, ist, Ihre Kunden auf dem Laufenden zu halten des Statuses der Vorfalllösung. Es ist auch notwendig, eine Schätzung der benötigten Zeit für die vollständige Behebung anzugeben und den Grund für die Ausfallzeit auf einfache Weise zu erläutern.
Facebooks Ausfall 2021 zeigte, warum eine Statusseite auf einer vom Produkt unabhängigen Infrastruktur existieren muss — ihre eigene ging mit dem Dienst offline, was Updates auf eine Drittanbieter-Plattform erzwang.
KOSTENLOSE Checkliste zur Reaktion auf SaaS-Ausfallzeiten
Reagieren Sie schnell auf SaaS-Ausfälle mit dieser Checkliste für Incident Response und Wiederherstellung.
-
Bereitschaftsprüfungen vor einem Vorfall für Überwachung, Redundanz und Failover
-
Eine Schritt-für-Schritt-Reaktionssequenz: bestätigen, informieren, beheben, entschädigen.
-
Eine Ursachenanalyse nach einem Vorfall und eine Liste der Korrekturmaßnahmen.
-
Felder ausfüllen, um Schweregrad, Ausfallzeiten und betroffene Kunden zu protokollieren
Entschuldigungen und Entschädigungen anbieten
Entschuldigen und die Begründung für die Fristverlängerung und die damit verbundenen Umstände kommunizieren. Es ist nicht üblich, Rechtfertigungen zu liefern oder anderen Parteien die Verantwortung zuzuschreiben.
Angebot Service-Gutschriften oder einen Rabatt für Kunden, basierend auf dem Ausmaß des Ausfalls, dessen Dauer und dessen Schwere. Erwägen Sie, andere Vorteile wie kostenlose Testversionen oder Zugang zu Premium-Funktionen mit einem Rabatt anzubieten. Berücksichtigen Sie die Umstände der Kunden und die Entschädigung entsprechend.
Im Jahr 2019, Salesforce hat seine auf dem Service Level Agreement (SLA) basierende Gutschriftrichtlinie geändert, sodass Kunden eine Gutschrift für die Zeit erhalten, in der der Dienst nicht verfügbar war.
KOSTENLOSE Checkliste zur Reaktion auf SaaS-Ausfallzeiten
Reagieren Sie schnell auf SaaS-Ausfälle mit dieser Checkliste für Incident Response und Wiederherstellung.
-
Bereitschaftsprüfungen vor einem Vorfall für Überwachung, Redundanz und Failover
-
Eine Schritt-für-Schritt-Reaktionssequenz: bestätigen, informieren, beheben, entschädigen.
-
Eine Ursachenanalyse nach einem Vorfall und eine Liste der Korrekturmaßnahmen.
-
Felder ausfüllen, um Schweregrad, Ausfallzeiten und betroffene Kunden zu protokollieren
Analysieren, Lernen und Verbessern
Das Auftreten eines Produkt- oder Serviceproblems kann zu einer Überprüfung des zugehörigen Prozesses und seiner Effizienz. Indem man den Vorfall detailliert untersucht und die Grundursache identifiziert und diese Erkenntnisse dann anwendet, um ähnliche Situationen in Zukunft zu vermeiden, ist entscheidend, um das Beste aus dieser Art von Analyse herauszuholen.
Eine gründliche Ursachenanalyse (RCA) umfasst die Erstellung einer Zeitleiste der Schlüsselereignisse, die Erläuterung der Auswirkungen des Ereignisses, die Identifizierung der Grundursache und das Vorschlagen von Korrekturmaßnahmen. Dieser Prozess ist mit der Identifizierung grundlegender Probleme und der Auswahl von Lösungen verbunden.
Start Sammeln von Protokollen, Metriken und anderen relevanten Daten von Ihren Überwachungstools, Servern und Anwendungen. Sprechen Sie mit den Personen, die am Vorfalllösungsprozess beteiligt waren, und holen Sie deren Kommentare und Erkenntnisse ein.
Eine Bewertung von Kundenfeedback und Support-Tickets ab dem Zeitpunkt der Website-Nichtverfügbarkeit ist eine Option. Ordnen Sie die bereitgestellten Informationen gemäß der chronologischen Abfolge der Ereignisse im Zusammenhang mit dem Ausfall an.
Verwenden Sie die Informationen, um eine Ereignis-Zeitleiste. Verwenden Sie die Daten, um Muster oder ungewöhnliche Aktivitäten zu erkennen, die bei der Ursachenforschung helfen können.
Ziehen Sie nicht sofort Schlussfolgerungen. Berücksichtigen Sie alle möglichen Gründe für den Ausfall, sei es technischer, menschlicher, mechanischer oder externer Natur.
Dokumentieren Sie Ihre Ergebnisse. Erstellen Sie einen detaillierten RCA-Bericht, der Folgendes enthält:
- Chronologie der Ereignisse
- Auswirkungsanalyse
- Grundursache(n)
- Mitwirkende Faktoren
- Empfohlene Korrekturmaßnahmen
Vorlage:
| Bericht zur Grundursachenanalyse
Vorfall: [Dienst-/Funktionsausfall] Datum: [Datum des Ausfalls] Chronologie der Ereignisse:
Auswirkungsanalyse:
Grundursache(n):
Mitwirkende Faktoren:
Empfohlene Korrekturmaßnahmen:
|
Korrekturmaßnahmen umsetzen. Basierend auf den Ergebnissen Ihrer RCA ergreifen Sie Maßnahmen, um zukünftige Ausfallzeiten zu vermeiden. Dies kann das Patchen von Software-Fehlern, das Aktualisieren von Konfigurationen, das Hinzufügen von mehr Überwachung und Alarmierung oder die Bereitstellung weiterer Schulungen für Ihr Team umfassen.
Gelernte Lektionen kommunizieren. Beziehen Sie die Ergebnisse Ihrer RCA in Ihre Korrekturmaßnahmen und Aktionen mit Ihrem Team und Ihren Kunden ein. Dies kann als Indikator für Engagement in der Entwicklung wahrgenommen werden und das Vertrauen beeinflussen.
- Intern: Legen Sie Ihrem Team den RCA-Bericht vor und besprechen Sie die wichtigsten Erkenntnisse. Offene Kommunikation und Feedback schaffen Bedingungen, die eine iterative Verfeinerung unterstützen. Verbreiten Sie Informationen über Best Practices und Erkenntnisse aus Vorfällen, um ähnliche Vorkommnisse zu verhindern.
- Extern: Fügen Sie einen Abschnitt zu Ihrer Statusseite oder Ihrem Blog hinzu, um die wichtigsten Erkenntnisse aus der RCA zu teilen. Es ist wichtig, der Öffentlichkeit den Grund für den Ausfall zu erläutern und sie über die Behebung auf dem Laufenden zu halten. Erhalten Sie Anerkennung für die Geduld Ihrer Kunden, indem Sie diese würdigen.
Für weitere Informationen zu SaaS-Ausfallzeiten und wie man damit umgeht, können Sie sich auf diese Ressourcen beziehen: Wie man ein SLA schreibt.
Die Erfahrung von GitHub deutet auf die Relevanz hin, aus Fehlern zu lernen. Als Reaktion auf einen größeren Ausfall 2018 konfigurierte GitHub seine Failover-Tools neu, um regionenübergreifende Promotionen zu verhindern, und baute sein Status-Reporting wieder auf. Diese Änderungen sollen die Wahrscheinlichkeit ähnlicher Ereignisse beeinflussen.
Schlussfolgerung
Ausfallzeitenmanagement während des Betriebs einer SaaS-Anwendung ist ein ständiger Prozess, der proaktiv, schnell und niemals abgeschlossen sein muss. Die Implementierung von Überwachung, Backup, Incident-Response-Pläneund Kommunikations Methoden können die Auswirkungen von Ausfallzeiten und das Vertrauen der Kunden beeinflussen.
Ausfälle von SaaS-Anwendungen können bieten Information für Systembewertung und -anpassung, was die Stabilität und Zuverlässigkeit der Anwendung beeinträchtigen kann.
Bereit anzufangen?
Wir waren dort, wo Sie jetzt sind. Lassen Sie uns unsere 19 Jahre Erfahrung teilen und Ihre globalen Träume Wirklichkeit werden lassen.
FAQ
-
Wenn Projekte auf Probleme stoßen, stehen technische Aspekte oft im Vordergrund. Faktoren wie menschliches Versagen oder externe Einflüsse, wie Cyberangriffe, sind ebenfalls zu berücksichtigen.
-
Die beste Verteidigung gegen Ausfallzeiten ist Prävention, und dies kann durch die Implementierung von Redundanz, die Durchführung regelmäßiger Wartung und gründliche Tests erreicht werden. Zusätzlich sollte Echtzeit-Monitoring eingesetzt werden, um Probleme frühzeitig zu erkennen und zu beheben.
-
Der erste Schritt ist, zuzugeben, dass es ein Problem gibt, und dann offen mit Ihren Kunden über die Situation zu kommunizieren, indem Sie die tatsächliche Zeit angeben, wann das Problem behoben sein wird. Eine Entschuldigung wird im Allgemeinen angeboten, und in Fällen erheblicher Störungen kann eine Entschädigung für die Nutzer geprüft werden.
-
Ein Vorfallreaktionsplan ist sehr wichtig, und dieser Plan sollte Rollen und Verantwortlichkeiten, Eskalationsverfahren und Kommunikationsvorlagen umfassen, um eine schnelle und geordnete Reaktion zu gewährleisten.
-
Nach einem Vorfall sollte eine gründliche Ursachenanalyse (RCA) durchgeführt werden. Dies beinhaltet die Identifizierung der Grundursache des Vorfalls, das Ergreifen von Korrekturmaßnahmen und das Teilen der gewonnenen Erkenntnisse mit dem restlichen Team, um die Wiederholung derselben Fehler zu vermeiden.