Immagine a mosaico

Come gestire l'interruzione del servizio SaaS: una guida passo passo

Autore: Marta Poprotska, Social Media Community Manager

Revisionato da: Marta Dozorska, VP del Prodotto

Per prepararsi a interruzione del servizio SaaS, dovrebbe esserci un piano scritto che includa passaggi, risposta immediata agli incidenti e comunicazione chiara.

Questo articolo delinea i passaggi da considerare riguardo all'impatto del tempo di inattività sul business e sulla fiducia dei clienti, incorporando strategie e casi di studio.

Panoramica del concetto

  • Icona istantanea del contenuto 1

    Categoria: Gestione degli incidenti, affidabilità del SaaS

  • Icona istantanea del contenuto 2

    Utilizzato da: SaaS B2B, fornitori digitali, piattaforme SaaS

  • Icona snapshot contenuto 3

    Scopo principale:

    Minimizzare il tempo di inattività e proteggere la fiducia dei clienti

  • Icona snapshot contenuto 4

    Concetti correlati: Accordo sul Livello di Servizio (SLA), Ridondanza, Fidelizzazione del cliente, Analisi della Causa Radice (RCA)

  • Icona istantanea contenuto 5

    Fase di crescita:

    Scalabilità, post-PMF, prontezza enterprise

Passaggio 1

Stabilire un Piano di Risposta agli Incidenti Completo

il piano di risposta agli incidenti è una parte fondamentale della strategia di gestione del tempo e dovrebbe essere aggiornato e modificato accuratamente con il progresso del sistema e di eventuali incidenti precedenti.  

 

  • Definire Ruoli e Responsabilità: Assegna ruoli chiari ai membri del tuo team, come il Comandante dell'Incidente (la persona incaricata di dirigere la risposta), il Responsabile Tecnico (la persona responsabile dell'individuazione e risoluzione dei problemi) e il Responsabile delle Comunicazioni (la persona incaricata di comunicare con i clienti). Ciò contribuisce a stabilire parametri specifici e può mitigare l'ambiguità quando si verifica un'emergenza.

 

Esempio: 

 

Ruolo Responsabilità
Comandante dell'Incidente Coordinare la risposta, prendere decisioni, allocare risorse, comunicare con gli stakeholder.
Responsabile tecnico Risolvere problemi tecnici e, se necessario, scalarli.
Responsabile della comunicazione Gestire le comunicazioni interne ed esterne, aggiornare la pagina di stato, redigere le notifiche per i clienti e rispondere alle richieste.
Responsabile del supporto clienti Gestire le richieste e i reclami dei clienti, fornire aggiornamenti e inoltrare i problemi ai membri del team appropriati.
Esperto della materia Fornire conoscenze specialistiche ed expertise su aree specifiche dell'applicazione o dell'infrastruttura.

 

Definire le procedure di escalation. Creare un chiaro percorso di escalation per assicurarsi che i problemi vengano risolti in modo efficace e tempestivo dalle persone giuste. Comprendere quando escalare un incidente a manager di livello superiore o a team di supporto esterni.

 

Creare Modelli di Comunicazione. Valuta la creazione di modelli per varie situazioni che coinvolgono incidenti (ad esempio, degrado del servizio, interruzione parziale, interruzione completa). Questi modelli dovrebbero includere dettagli pertinenti come i servizi interessati, il tempo stimato per risolvere il problema e le misure correttive adottate. Assicurati di modificare questi modelli in modo appropriato per pubblici diversi, come clienti, stakeholder aziendali o aziende partner.

Checklist GRATUITA di risposta ai disservizi SaaS

Reagisci velocemente alle interruzioni SaaS con questa checklist di risposta e recupero dagli incidenti.

  • Segno di spunta

    Verifiche di prontezza pre-incidente per il monitoraggio, la ridondanza e il failover

  • Segno di spunta

    Una sequenza di risposta passo-passo: riconoscere, aggiornare, risolvere, compensare

  • Segno di spunta

    Un'analisi della causa principale post-incidente e un elenco di azioni correttive

  • Segno di spunta

    Compilare i campi per registrare la gravità, i tempi di inattività e i clienti interessati

Ottieni la tua checklist GRATUITA
Fase 2

Configurare il monitoraggio e gli avvisi in tempo reale

La prima difesa contro i tempi di inattività è il monitoraggio preventivo. Tale monitoraggio può facilitare l'individuazione tempestiva dei problemi, influenzando potenzialmente la loro progressione in interruzioni complete. 

Quando la scelta di un toolkit, è necessario tenere conto dell'infrastruttura tecnica in cui si opera e anche delle applicazioni in fase di sviluppo. Considerare entrambe le categorie, come il monitoraggio dell'infrastruttura (server, database, rete) e il monitoraggio delle prestazioni delle applicazioni (APM).

 

Impostare i valori di soglia per metriche importanti come il tempo di risposta, i tassi di errore, l'utilizzo della CPU e l'utilizzo della memoria. Inoltre, creare allarmi per avvisare il tuo team ogni volta che queste soglie vengono superate. È preferibile inviare avvisi via email, SMS o Slack, in base alle preferenze del team.

Nota

Tale pratica è popolare tra le aziende SaaS, molte delle quali utilizzano Datadog per rilevare e risolvere gli incidenti rapidamente.

Checklist GRATUITA di risposta ai disservizi SaaS

Reagisci velocemente alle interruzioni SaaS con questa checklist di risposta e recupero dagli incidenti.

  • Segno di spunta

    Verifiche di prontezza pre-incidente per il monitoraggio, la ridondanza e il failover

  • Segno di spunta

    Una sequenza di risposta passo-passo: riconoscere, aggiornare, risolvere, compensare

  • Segno di spunta

    Un'analisi della causa principale post-incidente e un elenco di azioni correttive

  • Segno di spunta

    Compilare i campi per registrare la gravità, i tempi di inattività e i clienti interessati

Ottieni la tua checklist GRATUITA
Fase 3

Implementare Ridondanza e Meccanismi di Failover

Ridondanza SaaS si riferisce all'avere più istanze di applicazioni, server, ecc., nella propria infrastruttura in caso di guasto di uno. Questo approccio è correlato a una diminuzione del tempo di ripristino del servizio.

 

  • Per migliorare le prestazioni e l'affidabilità della tua infrastruttura, puoi considerare l'implementazione di alcune ridondanze chiave. Un approccio consiste nell'impiegare due o più server web e localizzarli in aree diverse, utilizzando ridondanza geografica. Il sistema consente la distribuzione del carico, che si riferisce al funzionamento continuo del sito web, nonostante un server diventi inoperativo. 
  • Un'altra opzione è quella di replicare i tuoi database su più server o zone di disponibilità, utilizzando la replicazione del database. Questa funzionalità è progettata per supportare la protezione dei dati e le capacità di accesso. 
  • Se stai utilizzando un infrastruttura cloud, ci sono diverse funzionalità di ridondanza integrate di cui puoi avvalerti, come più zone di disponibilità o regioni.

Checklist GRATUITA di risposta ai disservizi SaaS

Reagisci velocemente alle interruzioni SaaS con questa checklist di risposta e recupero dagli incidenti.

  • Segno di spunta

    Verifiche di prontezza pre-incidente per il monitoraggio, la ridondanza e il failover

  • Segno di spunta

    Una sequenza di risposta passo-passo: riconoscere, aggiornare, risolvere, compensare

  • Segno di spunta

    Un'analisi della causa principale post-incidente e un elenco di azioni correttive

  • Segno di spunta

    Compilare i campi per registrare la gravità, i tempi di inattività e i clienti interessati

Ottieni la tua checklist GRATUITA
Fase 4

Riconoscere l'interruzione del servizio

Trasparenza è molto importante durante un'interruzione del servizio. Una tempestiva notifica pubblica in seguito al rilevamento di un'interruzione riguarda il riconoscimento del problema e l'avvio dei processi di risoluzione. Tale comunicazione può influenzare lo sviluppo della fiducia e e l'adeguamento delle aspettative. 

 

Scegliere i canali di comunicazione:

  • Includi nella tua pagina di stato informazioni sull'interruzione, i servizi interessati, il tempo stimato per la risoluzione del problema e qualsiasi soluzione alternativa nota.
  • Utilizza piattaforme di social media come Twitter e LinkedIn per aumentare il tuo pubblico e fornire una breve panoramica della situazione.  
  • Invia un'email alle persone interessate per fornire una spiegazione dettagliata e le ultime informazioni.

 

Sii onesto e trasparente. È importante valutare accuratamente la portata del problema e prendere impegni che possano essere mantenuti. Fornire ai clienti informazioni sull'origine del disservizio. Documentare le azioni attualmente in corso per affrontare la questione.

 

Fornire una tempistica. Stima il tempo necessario per risolvere il problema (ETR) e includi un intervallo, per quanto generico. Quindi, aggiorna nuovamente l'ETR con le informazioni più recenti. Creare aspettative senza una giustificazione sufficiente può portare a risposte emotive negative.

 

Modello:

 

“Stiamo riscontrando un'interruzione che interessa [service/feature]. Il nostro team sta lavorando attivamente a una soluzione e forniremo aggiornamenti ogni [time interval, e.g., 30 minutes] fino a quando il problema non sarà risolto. Ci scusiamo per qualsiasi disagio ciò possa causare e apprezziamo la vostra pazienza.”

 

Checklist GRATUITA di risposta ai disservizi SaaS

Reagisci velocemente alle interruzioni SaaS con questa checklist di risposta e recupero dagli incidenti.

  • Segno di spunta

    Verifiche di prontezza pre-incidente per il monitoraggio, la ridondanza e il failover

  • Segno di spunta

    Una sequenza di risposta passo-passo: riconoscere, aggiornare, risolvere, compensare

  • Segno di spunta

    Un'analisi della causa principale post-incidente e un elenco di azioni correttive

  • Segno di spunta

    Compilare i campi per registrare la gravità, i tempi di inattività e i clienti interessati

Ottieni la tua checklist GRATUITA
Fase 5

Fornire Aggiornamenti Regolari

Una cosa importante da considerare è mantenere informati i tuoi clienti dello stato della risoluzione dell'incidente. È inoltre necessario fornire una stima del tempo richiesto per completare la risoluzione e indicare in modo semplice la ragione del fermo.

Checklist GRATUITA di risposta ai disservizi SaaS

Reagisci velocemente alle interruzioni SaaS con questa checklist di risposta e recupero dagli incidenti.

  • Segno di spunta

    Verifiche di prontezza pre-incidente per il monitoraggio, la ridondanza e il failover

  • Segno di spunta

    Una sequenza di risposta passo-passo: riconoscere, aggiornare, risolvere, compensare

  • Segno di spunta

    Un'analisi della causa principale post-incidente e un elenco di azioni correttive

  • Segno di spunta

    Compilare i campi per registrare la gravità, i tempi di inattività e i clienti interessati

Ottieni la tua checklist GRATUITA
Passaggio 6

Offrire scuse e un risarcimento

Chiedere scusa e comunicare le ragioni dell'estensione dei tempi e le circostanze che essa ha presentato. La prassi non è quella di fornire giustificazioni o attribuire responsabilità ad altre parti. 

Offerta crediti di servizio o uno sconto ai clienti in base all'entità dell'interruzione, alla sua durata e alla sua gravità. Considera di offrire altri vantaggi come prove gratuite o accesso a funzionalità premium con uno sconto. Valuta le circostanze dei clienti e compensa in modo appropriato.

Checklist GRATUITA di risposta ai disservizi SaaS

Reagisci velocemente alle interruzioni SaaS con questa checklist di risposta e recupero dagli incidenti.

  • Segno di spunta

    Verifiche di prontezza pre-incidente per il monitoraggio, la ridondanza e il failover

  • Segno di spunta

    Una sequenza di risposta passo-passo: riconoscere, aggiornare, risolvere, compensare

  • Segno di spunta

    Un'analisi della causa principale post-incidente e un elenco di azioni correttive

  • Segno di spunta

    Compilare i campi per registrare la gravità, i tempi di inattività e i clienti interessati

Ottieni la tua checklist GRATUITA
Fase 7

Analizzare, Imparare e Migliorare

Il verificarsi di un problema di prodotto o servizio può portare a una revisione del processo associato e della sua efficienza. Scomponendo l'incidente e identificandone la causa principale, e quindi applicando tali intuizioni per prevenire situazioni simili in futuro, è fondamentale per trarre il massimo da questo tipo di analisi. 

 

Un'analisi approfondita Analisi della Causa Radice (RCA) comporta la creazione di una cronologia degli eventi chiave, spiegando l'impatto dell'evento, identificando la causa principale e suggerendo misure correttive. Questo processo è associato all'identificazione dei problemi di base e alla selezione delle soluzioni.  

 

Inizia raccogliendo log, metriche e altri dati rilevanti dai tuoi strumenti di monitoraggio, server e applicazioni. Parla con le persone che sono state coinvolte nel processo di risoluzione dell'incidente e raccogli i loro commenti e le loro intuizioni.

 

Una valutazione di feedback dei clienti e ticket di supporto dal momento dell'inaccessibilità del sito web è un'opzione. Organizzare le informazioni fornite in base alla sequenza cronologica degli eventi relativi all'interruzione.

Utilizzare le informazioni per creare una cronologia degli eventi. Utilizzare i dati per identificare schemi o attività insolite che potrebbero aiutare a trovare la causa principale.

Suggerimento

Non trarre conclusioni immediatamente. Considerare tutte le possibili cause dell'interruzione, che sia tecnica, umana, meccanica o esterna.

Documentare i risultati. Preparare un rapporto RCA dettagliato che includa:

  • Cronologia degli eventi
  • Valutazione dell'impatto
  • Causa/e principale/i
  • Fattori che hanno contribuito
  • Azioni correttive raccomandate

 

Modello:

 

Rapporto di Analisi della Causa Radice

Incidente: [Interruzione del Servizio/Funzionalità]

Data: [Data dell'interruzione]

Cronologia degli Eventi:

  • [Evento 1]
  • [Evento 2]
  • [Evento 3]
  • …

Valutazione dell'Impatto:

  • [Numero di clienti interessati]
  • [Impatto finanziario]
  • [Altri impatti rilevanti]

Causa(e) Radice:

  • [Causa radice 1]
  • [Causa radice 2]
  • …

Fattori Contribuenti:

  • [Fattore 1]
  • [Fattore 2]
  • …

Azioni Correttive Raccomandate:

  • [Azione 1]
  • [Azione 2]
  • …

 

Implementare Misure Correttive. In base ai risultati della tua RCA, intraprendi azioni per evitare futuri tempi di inattività. Ciò può includere l'applicazione di patch per bug software, l'aggiornamento delle configurazioni, l'aggiunta di più monitoraggio e allarmi, o la fornitura di maggiore formazione per il tuo team.

 

Comunicare le Lezioni Apprese. Includi i risultati della tua RCA nelle tue azioni correttive e nelle azioni con il tuo team e i clienti. Questo può essere percepito come un indicatore di dedizione allo sviluppo e può influenzare i livelli di fiducia. 

  • Internamente: Presenta il rapporto RCA al tuo team e discuti i punti chiave. La presenza di comunicazione aperta e feedback si collega a condizioni che supportano il perfezionamento iterativo. Diffondi informazioni sulle migliori pratiche e sugli insegnamenti degli incidenti per prevenire occorrenze simili.
  • Esternamente: Aggiungi una sezione alla tua pagina di stato o al tuo blog per condividere i punti salienti della RCA. È importante spiegare al pubblico la ragione dell'interruzione e tenerlo informato sulla risoluzione. Ottieni un po' di credito per la pazienza dei tuoi clienti riconoscendola.

 

Per maggiori informazioni sui tempi di inattività del SaaS e su come gestirli, puoi fare riferimento a queste risorse: Come scrivere un SLA.

Conclusione

Gestione del downtime durante il periodo in cui un'applicazione SaaS è attiva è un processo costante che deve essere proattivo, rapido e mai concluso. Implementare monitoraggio, backup, piani di risposta agli incidentie comunicazione metodi possono influenzare gli effetti del downtime e i livelli di fiducia dei clienti. 

I periodi di inattività delle applicazioni SaaS possono fornire informazioni per la valutazione e l'adeguamento del sistema, il che potrebbe influire sulla stabilità e l'affidabilità dell'applicazione.

Pronto per iniziare?

Siamo stati dove siete voi. Condividiamo i nostri 19 anni di esperienza e trasformiamo i vostri sogni globali in realtà.

Immagine a mosaico

FAQ

it_ITItaliano