Mosaikbild

Umgang mit SaaS-Ausfallzeiten: Eine Schritt-für-Schritt-Anleitung

Autor: Marta Poprotska, Social Media Community Managerin

Geprüft von: Marta Dozorska, VP Product

Zur Vorbereitung auf SaaS-Ausfallzeiten, sollte ein schriftlicher Plan vorhanden sein, der Schritte, sofortige Reaktion auf Vorfälle und klare Kommunikation umfasst.

Dieser Artikel beschreibt Schritte, die hinsichtlich der Auswirkungen von Ausfallzeiten auf das Geschäft und das Kundenvertrauen zu berücksichtigen sind, einschließlich Strategien und Fallstudien.

Konzept-Schnappschuss

  • Inhaltsschnappschuss-Symbol 1

    Kategorie: Vorfallsmanagement, SaaS-Zuverlässigkeit

  • Inhalts-Snapshot-Symbol 2

    Genutzt von: B2B SaaS, digitale Anbieter, SaaS-Plattformen

  • Inhalts-Schnappschuss-Symbol 3

    Hauptzweck:

    Ausfallzeiten minimieren und Kundenvertrauen schützen

  • Inhalts-Schnappschuss-Symbol 4

    Verwandte Konzepte: Service-Lernvereinbarung (SLA), Redundanz, Kundenbindung, Ursachenanalyse (RCA)

  • Inhalts-Schnappschuss-Symbol 5

    Wachstumsphase:

    Skalierung, nach PMF, Enterprise-Readiness

Schritt 1

Einen umfassenden Incident-Response-Plan etablieren

die Incident-Response-Plan ist ein zentraler Bestandteil der Zeitmanagementstrategie und sollte mit dem Fortschritt des Systems und allen früheren Vorfällen gründlich aktualisiert und überarbeitet werden.  

 

  • Definition von Rollen und Verantwortlichkeiten: Weisen Sie den Mitgliedern Ihres Teams klare Rollen zu, wie z.B. den Incident Commander (die für die Leitung der Reaktion zuständige Person), den Technical Lead (die für die Fehlerbehebung und -lösung verantwortliche Person) und den Communication Lead (die für die Kommunikation mit Kunden zuständige Person). Dies trägt dazu bei, spezifische Parameter festzulegen und kann Unklarheiten im Notfall mindern.

 

Beispiel: 

 

Rolle Verantwortlichkeiten
Incident Commander Reaktion koordinieren, Entscheidungen treffen, Ressourcen zuweisen, mit Stakeholdern kommunizieren.
Technischer Leiter Technische Probleme beheben und lösen, bei Bedarf eskalieren.
Leiter Kommunikation Interne und externe Kommunikation verwalten, die Statusseite aktualisieren, Kundenbenachrichtigungen entwerfen und auf Anfragen antworten.
Leiter Kundensupport Kundenanfragen und Beschwerden bearbeiten, Updates bereitstellen und Probleme an die zuständigen Teammitglieder eskalieren.
Fachexperte Fachwissen und Expertise zu spezifischen Bereichen der Anwendung oder Infrastruktur bereitstellen.

 

Eskalationsverfahren darlegen. Einen klaren Eskalationsweg schaffen, um sicherzustellen, dass Probleme von den richtigen Personen effektiv und zeitnah gelöst werden. Verstehen, wann ein Vorfall an Manager höherer Ebene oder externe Support-Teams eskaliert werden muss.

 

Kommunikationsvorlagen erstellen. Erwägen Sie die Erstellung von Vorlagen für verschiedene Vorfallssituationen (z.B. Dienstverschlechterung, Teilausfall, vollständiger Ausfall). Diese Vorlagen sollten relevante Details enthalten, wie die betroffenen Dienste, die geschätzte Zeit zur Problemlösung und die ergriffenen Abhilfemaßnahmen. Stellen Sie sicher, diese Vorlagen für verschiedene Zielgruppen, wie Kunden, interne Stakeholder oder Partnerunternehmen, entsprechend anzupassen.

KOSTENLOSE Checkliste zur Reaktion auf SaaS-Ausfallzeiten

Reagieren Sie schnell auf SaaS-Ausfälle mit dieser Checkliste für Incident Response und Wiederherstellung.

  • Häkchen

    Bereitschaftsprüfungen vor einem Vorfall für Überwachung, Redundanz und Failover

  • Häkchen

    Eine Schritt-für-Schritt-Reaktionssequenz: bestätigen, informieren, beheben, entschädigen.

  • Häkchen

    Eine Ursachenanalyse nach einem Vorfall und eine Liste der Korrekturmaßnahmen.

  • Häkchen

    Felder ausfüllen, um Schweregrad, Ausfallzeiten und betroffene Kunden zu protokollieren

Holen Sie sich Ihre KOSTENLOSE Checkliste
Schritt 2

Echtzeit-Monitoring und Alarmierung einrichten

Die erste Verteidigung gegen Ausfallzeiten ist präventives Monitoring. Ein solches Monitoring kann die rechtzeitige Erkennung von Problemen erleichtern und deren Entwicklung zu vollständigen Ausfällen möglicherweise beeinflussen. 

Wenn Auswahl eines Toolkits, ist es notwendig, die technische Infrastruktur, in der Sie operieren, und auch die entwickelten Anwendungen zu berücksichtigen. Denken Sie an beide Kategorien wie Infrastruktur-Monitoring (Server, Datenbanken, Netzwerk) und Application Performance Monitoring (APM).

 

Legen Sie Schwellenwerte fest für wichtige Metriken wie Antwortzeit, Fehlerraten, CPU-Auslastung und Speicherauslastung. Erstellen Sie außerdem Alarme um Ihr Team zu benachrichtigen, wann immer diese Schwellenwerte überschritten werden. Es ist besser, Benachrichtigungen per E-Mail, SMS oder Slack zu senden, je nach den Präferenzen des Teams.

Hinweis

Solche Praktiken sind bei SaaS-Unternehmen beliebt, viele davon nutzen Datadog um Vorfälle schnell zu erkennen und zu beheben.

KOSTENLOSE Checkliste zur Reaktion auf SaaS-Ausfallzeiten

Reagieren Sie schnell auf SaaS-Ausfälle mit dieser Checkliste für Incident Response und Wiederherstellung.

  • Häkchen

    Bereitschaftsprüfungen vor einem Vorfall für Überwachung, Redundanz und Failover

  • Häkchen

    Eine Schritt-für-Schritt-Reaktionssequenz: bestätigen, informieren, beheben, entschädigen.

  • Häkchen

    Eine Ursachenanalyse nach einem Vorfall und eine Liste der Korrekturmaßnahmen.

  • Häkchen

    Felder ausfüllen, um Schweregrad, Ausfallzeiten und betroffene Kunden zu protokollieren

Holen Sie sich Ihre KOSTENLOSE Checkliste
Schritt 3

Implementieren Sie Redundanz- und Failover-Mechanismen

SaaS-Redundanz bezieht sich auf das Vorhandensein mehrerer Instanzen von Anwendungen, Servern usw. in Ihrer Infrastruktur im Falle eines Ausfalls einer davon. Dieser Ansatz ist mit einer Verkürzung der Dienstwiederherstellungszeit verbunden.

 

  • Um die Leistung und Zuverlässigkeit Ihrer Infrastruktur zu verbessern, können Sie die Implementierung einiger wichtiger Redundanzen in Betracht ziehen. Ein solcher Ansatz besteht darin, zwei oder mehr Webserver einzusetzen und diese an verschiedenen Standorten zu platzieren, wobei geografische Redundanz. Das System ermöglicht eine Lastverteilung, die den kontinuierlichen Betrieb der Website gewährleistet, selbst wenn ein Server ausfällt. 
  • Eine weitere Option ist es, Ihre Datenbanken zu replizieren über mehrere Server oder Verfügbarkeitszonen hinweg, unter Verwendung von Datenbankreplikation. Diese Funktionalität ist darauf ausgelegt, Datenschutz und Zugriffsmöglichkeiten zu unterstützen. 
  • Wenn Sie einen Cloud-Infrastruktur, gibt es mehrere integrierte Redundanzfunktionen die Sie nutzen können, wie zum Beispiel mehrere Verfügbarkeitszonen oder Regionen.

KOSTENLOSE Checkliste zur Reaktion auf SaaS-Ausfallzeiten

Reagieren Sie schnell auf SaaS-Ausfälle mit dieser Checkliste für Incident Response und Wiederherstellung.

  • Häkchen

    Bereitschaftsprüfungen vor einem Vorfall für Überwachung, Redundanz und Failover

  • Häkchen

    Eine Schritt-für-Schritt-Reaktionssequenz: bestätigen, informieren, beheben, entschädigen.

  • Häkchen

    Eine Ursachenanalyse nach einem Vorfall und eine Liste der Korrekturmaßnahmen.

  • Häkchen

    Felder ausfüllen, um Schweregrad, Ausfallzeiten und betroffene Kunden zu protokollieren

Holen Sie sich Ihre KOSTENLOSE Checkliste
Schritt 4

Die Ausfallzeit anerkennen

Transparenz ist sehr wichtig während eines Ausfallereignisses. Eine schnelle öffentliche Benachrichtigung nach der Erkennung eines Ausfalls dient der Anerkennung des Problems und der Einleitung von Lösungsprozessen. Eine solche Kommunikation kann den Aufbau von Vertrauen und die Anpassung von Erwartungen beeinflussen. 

 

Wählen Sie die Kommunikationskanäle:

  • Fügen Sie auf Ihrer Statusseite Informationen zum Ausfall, den betroffenen Diensten, der geschätzten Zeit zur Behebung des Problems und bekannten Problemumgehungen hinzu.
  • Nutzen Sie Social-Media-Plattformen wie Twitter und LinkedIn, um Ihr Publikum zu vergrößern und einen kurzen Überblick über die Situation zu geben.  
  • Senden Sie eine E-Mail an die betroffenen Personen, um eine detaillierte Erklärung und die neuesten Informationen zu geben.

 

Seien Sie ehrlich und transparent. Es ist wichtig, den Umfang des Problems genau zu bewerten und Zusagen zu machen, die eingehalten werden können. Informieren Sie die Kunden über die Ursache des Ausfalls. Dokumentieren Sie die Maßnahmen, die derzeit zur Behebung des Problems ergriffen werden.

 

Geben Sie einen Zeitplan an. Schätzen Sie die Zeit ein, die zur Behebung des Problems benötigt wird (ETR), und geben Sie einen Bereich an, wenn auch nur einen allgemeinen. Aktualisieren Sie dann die ETR erneut mit den neuesten Informationen. Erwartungen ohne ausreichende Begründung zu wecken, kann zu unerwünschten emotionalen Reaktionen führen.

 

Vorlage:

 

“Es liegt eine Störung vor, die [Dienst/Funktion] betrifft. Unser Team arbeitet aktiv an einer Lösung, und wir werden alle [Zeitintervall, z.B. 30 Minuten] Updates bereitstellen, bis das Problem behoben ist. Wir entschuldigen uns für die dadurch entstandenen Unannehmlichkeiten und bitten um Ihr Verständnis.”

 

KOSTENLOSE Checkliste zur Reaktion auf SaaS-Ausfallzeiten

Reagieren Sie schnell auf SaaS-Ausfälle mit dieser Checkliste für Incident Response und Wiederherstellung.

  • Häkchen

    Bereitschaftsprüfungen vor einem Vorfall für Überwachung, Redundanz und Failover

  • Häkchen

    Eine Schritt-für-Schritt-Reaktionssequenz: bestätigen, informieren, beheben, entschädigen.

  • Häkchen

    Eine Ursachenanalyse nach einem Vorfall und eine Liste der Korrekturmaßnahmen.

  • Häkchen

    Felder ausfüllen, um Schweregrad, Ausfallzeiten und betroffene Kunden zu protokollieren

Holen Sie sich Ihre KOSTENLOSE Checkliste
Schritt 5

Regelmäßige Updates bereitstellen

Ein wichtiger Punkt, den es zu beachten gilt, ist, Ihre Kunden auf dem Laufenden zu halten des Statuses der Vorfalllösung. Es ist auch notwendig, eine Schätzung der benötigten Zeit für die vollständige Behebung anzugeben und den Grund für die Ausfallzeit auf einfache Weise zu erläutern.

KOSTENLOSE Checkliste zur Reaktion auf SaaS-Ausfallzeiten

Reagieren Sie schnell auf SaaS-Ausfälle mit dieser Checkliste für Incident Response und Wiederherstellung.

  • Häkchen

    Bereitschaftsprüfungen vor einem Vorfall für Überwachung, Redundanz und Failover

  • Häkchen

    Eine Schritt-für-Schritt-Reaktionssequenz: bestätigen, informieren, beheben, entschädigen.

  • Häkchen

    Eine Ursachenanalyse nach einem Vorfall und eine Liste der Korrekturmaßnahmen.

  • Häkchen

    Felder ausfüllen, um Schweregrad, Ausfallzeiten und betroffene Kunden zu protokollieren

Holen Sie sich Ihre KOSTENLOSE Checkliste
Schritt 6

Entschuldigungen und Entschädigungen anbieten

Entschuldigen und die Begründung für die Fristverlängerung und die damit verbundenen Umstände kommunizieren. Es ist nicht üblich, Rechtfertigungen zu liefern oder anderen Parteien die Verantwortung zuzuschreiben. 

Angebot Service-Gutschriften oder einen Rabatt für Kunden, basierend auf dem Ausmaß des Ausfalls, dessen Dauer und dessen Schwere. Erwägen Sie, andere Vorteile wie kostenlose Testversionen oder Zugang zu Premium-Funktionen mit einem Rabatt anzubieten. Berücksichtigen Sie die Umstände der Kunden und die Entschädigung entsprechend.

KOSTENLOSE Checkliste zur Reaktion auf SaaS-Ausfallzeiten

Reagieren Sie schnell auf SaaS-Ausfälle mit dieser Checkliste für Incident Response und Wiederherstellung.

  • Häkchen

    Bereitschaftsprüfungen vor einem Vorfall für Überwachung, Redundanz und Failover

  • Häkchen

    Eine Schritt-für-Schritt-Reaktionssequenz: bestätigen, informieren, beheben, entschädigen.

  • Häkchen

    Eine Ursachenanalyse nach einem Vorfall und eine Liste der Korrekturmaßnahmen.

  • Häkchen

    Felder ausfüllen, um Schweregrad, Ausfallzeiten und betroffene Kunden zu protokollieren

Holen Sie sich Ihre KOSTENLOSE Checkliste
Schritt 7

Analysieren, Lernen und Verbessern

Das Auftreten eines Produkt- oder Serviceproblems kann zu einer Überprüfung des zugehörigen Prozesses und seiner Effizienz. Indem man den Vorfall detailliert untersucht und die Grundursache identifiziert und diese Erkenntnisse dann anwendet, um ähnliche Situationen in Zukunft zu vermeiden, ist entscheidend, um das Beste aus dieser Art von Analyse herauszuholen. 

 

Eine gründliche Ursachenanalyse (RCA) umfasst die Erstellung einer Zeitleiste der Schlüsselereignisse, die Erläuterung der Auswirkungen des Ereignisses, die Identifizierung der Grundursache und das Vorschlagen von Korrekturmaßnahmen. Dieser Prozess ist mit der Identifizierung grundlegender Probleme und der Auswahl von Lösungen verbunden.  

 

Start Sammeln von Protokollen, Metriken und anderen relevanten Daten von Ihren Überwachungstools, Servern und Anwendungen. Sprechen Sie mit den Personen, die am Vorfalllösungsprozess beteiligt waren, und holen Sie deren Kommentare und Erkenntnisse ein.

 

Eine Bewertung von Kundenfeedback und Support-Tickets ab dem Zeitpunkt der Website-Nichtverfügbarkeit ist eine Option. Ordnen Sie die bereitgestellten Informationen gemäß der chronologischen Abfolge der Ereignisse im Zusammenhang mit dem Ausfall an.

Verwenden Sie die Informationen, um eine Ereignis-Zeitleiste. Verwenden Sie die Daten, um Muster oder ungewöhnliche Aktivitäten zu erkennen, die bei der Ursachenforschung helfen können.

Tipp

Ziehen Sie nicht sofort Schlussfolgerungen. Berücksichtigen Sie alle möglichen Gründe für den Ausfall, sei es technischer, menschlicher, mechanischer oder externer Natur.

Dokumentieren Sie Ihre Ergebnisse. Erstellen Sie einen detaillierten RCA-Bericht, der Folgendes enthält:

  • Chronologie der Ereignisse
  • Auswirkungsanalyse
  • Grundursache(n)
  • Mitwirkende Faktoren
  • Empfohlene Korrekturmaßnahmen

 

Vorlage:

 

Bericht zur Grundursachenanalyse

Vorfall: [Dienst-/Funktionsausfall]

Datum: [Datum des Ausfalls]

Chronologie der Ereignisse:

  • [Ereignis 1]
  • [Ereignis 2]
  • [Ereignis 3]
  • …

Auswirkungsanalyse:

  • [Anzahl betroffener Kunden]
  • [Finanzielle Auswirkungen]
  • [Weitere relevante Auswirkungen]

Grundursache(n):

  • [Grundursache 1]
  • [Grundursache 2]
  • …

Mitwirkende Faktoren:

  • [Faktor 1]
  • [Faktor 2]
  • …

Empfohlene Korrekturmaßnahmen:

  • [Maßnahme 1]
  • [Maßnahme 2]
  • …

 

Korrekturmaßnahmen umsetzen. Basierend auf den Ergebnissen Ihrer RCA ergreifen Sie Maßnahmen, um zukünftige Ausfallzeiten zu vermeiden. Dies kann das Patchen von Software-Fehlern, das Aktualisieren von Konfigurationen, das Hinzufügen von mehr Überwachung und Alarmierung oder die Bereitstellung weiterer Schulungen für Ihr Team umfassen.

 

Gelernte Lektionen kommunizieren. Beziehen Sie die Ergebnisse Ihrer RCA in Ihre Korrekturmaßnahmen und Aktionen mit Ihrem Team und Ihren Kunden ein. Dies kann als Indikator für Engagement in der Entwicklung wahrgenommen werden und das Vertrauen beeinflussen. 

  • Intern: Legen Sie Ihrem Team den RCA-Bericht vor und besprechen Sie die wichtigsten Erkenntnisse. Offene Kommunikation und Feedback schaffen Bedingungen, die eine iterative Verfeinerung unterstützen. Verbreiten Sie Informationen über Best Practices und Erkenntnisse aus Vorfällen, um ähnliche Vorkommnisse zu verhindern.
  • Extern: Fügen Sie einen Abschnitt zu Ihrer Statusseite oder Ihrem Blog hinzu, um die wichtigsten Erkenntnisse aus der RCA zu teilen. Es ist wichtig, der Öffentlichkeit den Grund für den Ausfall zu erläutern und sie über die Behebung auf dem Laufenden zu halten. Erhalten Sie Anerkennung für die Geduld Ihrer Kunden, indem Sie diese würdigen.

 

Für weitere Informationen zu SaaS-Ausfallzeiten und wie man damit umgeht, können Sie sich auf diese Ressourcen beziehen: Wie man ein SLA schreibt.

Schlussfolgerung

Ausfallzeitenmanagement während des Betriebs einer SaaS-Anwendung ist ein ständiger Prozess, der proaktiv, schnell und niemals abgeschlossen sein muss. Die Implementierung von Überwachung, Backup, Incident-Response-Pläneund Kommunikations Methoden können die Auswirkungen von Ausfallzeiten und das Vertrauen der Kunden beeinflussen. 

Ausfälle von SaaS-Anwendungen können bieten Information für Systembewertung und -anpassung, was die Stabilität und Zuverlässigkeit der Anwendung beeinträchtigen kann.

Bereit anzufangen?

Wir waren dort, wo Sie jetzt sind. Lassen Sie uns unsere 19 Jahre Erfahrung teilen und Ihre globalen Träume Wirklichkeit werden lassen.

Mosaikbild

FAQ

de_DEDeutsch