Comment gérer les temps d'arrêt SaaS : Un guide étape par étape
Pour se préparer à Temps d'arrêt SaaS, il devrait y avoir un plan écrit en place qui inclut des étapes, une réponse immédiate aux incidents et une communication claire.
Cet article présente les étapes à considérer concernant l'impact des temps d'arrêt sur l'entreprise et la confiance des clients, en intégrant des stratégies et des études de cas.
Aperçu du concept
-
Catégorie : Gestion des incidents, fiabilité du SaaS
-
Utilisé par : SaaS B2B, fournisseurs numériques, plateformes SaaS
-
Objectif principal :
Minimiser les temps d'arrêt et protéger la confiance des clients
-
Concepts associés : Accord de Niveau de Service (SLA), Redondance, Rétention client, Analyse des Causes Fondamentales (RCA)
-
Stade de croissance :
Mise à l'échelle, après l'adéquation produit-marché, préparation à l'entreprise
Établir un plan complet de réponse aux incidents
la plan de réponse aux incidents fait partie intégrante de la stratégie de gestion du temps et il doit être mis à jour et modifié en profondeur avec l'évolution du système et de tout incident antérieur.
- Définition des rôles et des responsabilités : Attribuez des rôles clairs aux membres de votre équipe, tels que le Responsable d'Incident (la personne chargée de diriger la réponse), le Responsable Technique (la personne responsable du dépannage et de la résolution), et le Responsable de la Communication (la personne chargée de communiquer avec les clients). Cela contribue à établir des paramètres spécifiques et peut atténuer l'ambiguïté en cas d'urgence.
Exemple :
| Rôle | Responsabilités |
| Responsable d'Incident | Coordonner la réponse, prendre des décisions, allouer des ressources, communiquer avec les parties prenantes. |
| Responsable technique | Dépanner et résoudre les problèmes techniques, escalader si nécessaire. |
| Responsable de la communication | Gérer les communications internes et externes, mettre à jour la page de statut, rédiger les notifications clients et répondre aux demandes. |
| Responsable du support client | Traiter les demandes et les plaintes des clients, fournir des mises à jour et escalader les problèmes aux membres de l'équipe appropriés. |
| Expert en la matière | Apporter des connaissances et une expertise spécialisées sur des domaines spécifiques de l'application ou de l'infrastructure. |
Définir les procédures d'escalade. Établir une voie d'escalade claire pour s'assurer que les problèmes sont résolus efficacement et en temps voulu par les personnes compétentes. Savoir quand escalader un incident aux responsables de niveau supérieur ou aux équipes de support externes.
Créer des modèles de communication. Pensez à créer des modèles pour diverses situations impliquant des incidents (par exemple, dégradation de service, panne partielle, panne complète). Ces modèles devraient inclure des détails pertinents tels que les services affectés, le temps estimé pour résoudre le problème et les mesures correctives prises. Assurez-vous de modifier ces modèles de manière appropriée pour différents publics, tels que les clients, les parties prenantes de l'entreprise ou les entreprises partenaires.
Le plan de réponse aux incidents par Slack illustre le processus de définition des rôles, d'établissement des canaux de communication et de préparation de modèles pour les mises à jour de statut.
Checklist GRATUITE de réponse aux pannes SaaS
Réagissez rapidement aux pannes SaaS avec cette checklist de réponse et de rétablissement en cas d'incident.
-
Vérifications de préparation pré-incident pour la surveillance, la redondance et le basculement.
-
Une séquence de réponse étape par étape : accuser réception, informer, résoudre, compenser.
-
Une analyse des causes profondes post-incident et une liste d'actions correctives.
-
Remplir les champs pour enregistrer la gravité, les temps d'arrêt et les clients affectés
Mettre en place la surveillance et les alertes en temps réel
La première ligne de défense contre les temps d'arrêt est la surveillance préventive. Une telle surveillance peut faciliter la détection rapide des problèmes, influençant potentiellement leur progression vers des pannes complètes.
Lorsque le choix d'une boîte à outils, il est nécessaire de prendre en compte l'infrastructure technique dans laquelle vous opérez ainsi que les applications en cours de développement. Considérez les deux catégories, telles que la surveillance de l'infrastructure (serveurs, bases de données, réseau) et la surveillance des performances des applications (APM).
Définissez des valeurs seuils pour les métriques importantes telles que le temps de réponse, les taux d'erreur, l'utilisation du CPU et l'utilisation de la mémoire. Créez également des alertes pour notifier votre équipe chaque fois que ces seuils sont dépassés. Il est préférable d'envoyer les alertes par e-mail, SMS ou Slack, selon les préférences de l'équipe.
Une telle pratique est populaire parmi les entreprises SaaS, dont beaucoup utilisent Datadog pour détecter et résoudre rapidement les incidents.
Checklist GRATUITE de réponse aux pannes SaaS
Réagissez rapidement aux pannes SaaS avec cette checklist de réponse et de rétablissement en cas d'incident.
-
Vérifications de préparation pré-incident pour la surveillance, la redondance et le basculement.
-
Une séquence de réponse étape par étape : accuser réception, informer, résoudre, compenser.
-
Une analyse des causes profondes post-incident et une liste d'actions correctives.
-
Remplir les champs pour enregistrer la gravité, les temps d'arrêt et les clients affectés
Mettre en œuvre des mécanismes de redondance et de basculement
Redondance SaaS désigne le fait de disposer de plusieurs instances d'applications, de serveurs, etc., dans votre infrastructure en cas de défaillance de l'une d'entre elles. Cette approche est liée à une diminution du temps de restauration des services.
- Pour améliorer les performances et la fiabilité de votre infrastructure, vous pouvez envisager de mettre en œuvre des redondances clés. Une telle approche consiste à utiliser deux serveurs web ou plus et à les localiser dans différentes zones, en utilisant la redondance géographique. Le système permet la répartition de la charge, ce qui assure le fonctionnement continu du site web, même en cas d'indisponibilité d'un serveur.
- Une autre option est de répliquer vos bases de données sur plusieurs serveurs ou zones de disponibilité, en utilisant la réplication de bases de données. Cette fonctionnalité est conçue pour prendre en charge la protection des données et les capacités d'accès.
- Si vous utilisez un infrastructure cloud, il existe plusieurs fonctionnalités de redondance intégrées dont vous pouvez tirer parti, telles que plusieurs zones de disponibilité ou régions.
Netflix fonctionne avec plusieurs Zones de disponibilité dans AWS, une configuration qui répond à ses objectifs de haute disponibilité et de récupération après incident.
Checklist GRATUITE de réponse aux pannes SaaS
Réagissez rapidement aux pannes SaaS avec cette checklist de réponse et de rétablissement en cas d'incident.
-
Vérifications de préparation pré-incident pour la surveillance, la redondance et le basculement.
-
Une séquence de réponse étape par étape : accuser réception, informer, résoudre, compenser.
-
Une analyse des causes profondes post-incident et une liste d'actions correctives.
-
Remplir les champs pour enregistrer la gravité, les temps d'arrêt et les clients affectés
Reconnaître l'interruption de service
Transparence est très important lors d'un incident d'interruption de service. Une notification publique rapide suite à la détection d'une panne est essentielle pour reconnaître le problème et initier les processus de résolution. Une telle communication peut influencer le développement de la confiance et l'ajustement des attentes.
Choisissez les canaux de communication :
- Incluez sur votre page d'état des informations sur la panne, les services affectés, le temps estimé pour résoudre le problème et toute solution de contournement connue.
- Utilisez les plateformes de médias sociaux comme Twitter et LinkedIn pour élargir votre audience et donner un bref aperçu de la situation.
- Envoyez un e-mail aux personnes concernées pour fournir une explication détaillée et les dernières informations.
Soyez honnête et transparent. Il est important d'évaluer précisément l'étendue du problème et de prendre des engagements qui peuvent être tenus. Présentez des informations aux clients concernant l'origine de l'interruption. Documentez les actions en cours pour résoudre le problème.
Fournissez un calendrier. Estimez le temps nécessaire pour résoudre le problème (ETR) et incluez une fourchette, aussi générale soit-elle. Ensuite, mettez à jour l'ETR à nouveau avec les informations les plus récentes. Le fait de développer des attentes sans justification suffisante peut entraîner des réactions émotionnelles négatives.
Modèle :
| “Nous subissons une panne affectant [service/feature]. Notre équipe travaille activement à une résolution, et nous fournirons des mises à jour toutes les [time interval, e.g., 30 minutes] jusqu'à ce que le problème soit résolu. Nous nous excusons pour tout inconvénient que cela pourrait occasionner et vous remercions de votre patience.” |
Checklist GRATUITE de réponse aux pannes SaaS
Réagissez rapidement aux pannes SaaS avec cette checklist de réponse et de rétablissement en cas d'incident.
-
Vérifications de préparation pré-incident pour la surveillance, la redondance et le basculement.
-
Une séquence de réponse étape par étape : accuser réception, informer, résoudre, compenser.
-
Une analyse des causes profondes post-incident et une liste d'actions correctives.
-
Remplir les champs pour enregistrer la gravité, les temps d'arrêt et les clients affectés
Fournir des mises à jour régulières
Une chose importante à considérer est de tenir vos clients informés de l'état de la résolution de l'incident. Il est également nécessaire de fournir une estimation du temps requis pour achever la résolution et d'expliquer la raison de l'interruption de service de manière simple.
La panne de Facebook en 2021 a montré pourquoi une page de statut doit résider sur une infrastructure indépendante du produit — la leur est tombée en panne avec le service, forçant les mises à jour sur une plateforme tierce.
Checklist GRATUITE de réponse aux pannes SaaS
Réagissez rapidement aux pannes SaaS avec cette checklist de réponse et de rétablissement en cas d'incident.
-
Vérifications de préparation pré-incident pour la surveillance, la redondance et le basculement.
-
Une séquence de réponse étape par étape : accuser réception, informer, résoudre, compenser.
-
Une analyse des causes profondes post-incident et une liste d'actions correctives.
-
Remplir les champs pour enregistrer la gravité, les temps d'arrêt et les clients affectés
Offrir des excuses et une compensation
S'excuser et communiquer la justification de la prolongation de délai et les circonstances qui l'ont motivée. Il n'est pas d'usage de fournir des justifications ou d'attribuer la responsabilité à d'autres parties.
Proposez des crédits de service ou une réduction aux clients en fonction de l'ampleur de la panne, de sa durée et de sa gravité. Envisagez de proposer d'autres avantages tels que des essais gratuits ou un accès à des fonctionnalités premium avec une réduction. Tenez compte des circonstances des clients et adaptez la compensation en conséquence.
En 2019, Salesforce a modifié sa politique de crédit basée sur l'accord de niveau de service (SLA) afin d'accorder un crédit aux clients pour la période durant laquelle le service était indisponible.
Checklist GRATUITE de réponse aux pannes SaaS
Réagissez rapidement aux pannes SaaS avec cette checklist de réponse et de rétablissement en cas d'incident.
-
Vérifications de préparation pré-incident pour la surveillance, la redondance et le basculement.
-
Une séquence de réponse étape par étape : accuser réception, informer, résoudre, compenser.
-
Une analyse des causes profondes post-incident et une liste d'actions correctives.
-
Remplir les champs pour enregistrer la gravité, les temps d'arrêt et les clients affectés
Analyser, Apprendre et Améliorer
La survenance d'un problème de produit ou de service peut entraîner une examen du processus associé et de son efficacité. Le fait de décomposer l'incident et d'identifier la cause racine, puis d'appliquer ces enseignements pour prévenir des situations similaires à l'avenir, est essentiel pour tirer le meilleur parti de ce type d'analyse.
Une analyse approfondie Analyse des Causes Fondamentales (RCA) implique la création d'une chronologie des événements clés, l'explication de l'impact de l'événement, l'identification de la cause profonde et la suggestion de mesures correctives. Ce processus est associé à l'identification des problèmes fondamentaux et à la sélection des solutions.
Démarrer la collecte de journaux, de métriques et d'autres données pertinentes depuis vos outils de surveillance, serveurs et applications. Parlez aux personnes impliquées dans le processus de résolution des incidents et recueillez leurs commentaires et aperçus.
Une évaluation de les retours clients et les tickets d'assistance dès le début de l'inaccessibilité du site web est une option. Organisez les informations fournies selon la séquence chronologique des événements liés à la panne.
Utilisez les informations pour créer une frise chronologique des événements. Utilisez les données pour identifier les schémas ou toute activité inhabituelle susceptible d'aider à trouver la cause profonde.
Ne tirez pas de conclusions immédiates. Considérez toutes les raisons possibles de la panne, qu'elles soient techniques, humaines, mécaniques ou externes.
Documentez vos conclusions. Préparer un rapport RCA détaillé qui comprend :
- Chronologie des événements
- Évaluation de l'impact
- Cause(s) profonde(s)
- Facteurs contributifs
- Actions correctives recommandées
Modèle :
| Rapport d'analyse des causes profondes
Incident : [Panne de service/fonctionnalité] Date : [Date de la panne] Chronologie des événements :
Évaluation de l'impact :
Cause(s) profonde(s) :
Facteurs contributifs :
Actions correctives recommandées :
|
Mettre en œuvre les mesures correctives. Selon les résultats de votre RCA, prenez des mesures pour éviter de futures interruptions de service. Cela peut inclure la correction de bugs logiciels, la mise à jour des configurations, l'ajout de surveillance et d'alertes supplémentaires, ou la formation de votre équipe.
Communiquer les leçons apprises. Intégrez les conclusions de votre RCA dans vos actions correctives et vos actions avec votre équipe et vos clients. Cela peut être perçu comme un indicateur de dévouement au développement et peut affecter les niveaux de confiance.
- En interne : Présentez le rapport RCA à votre équipe et discutez des points clés. La présence d'une communication ouverte et de retours d'information est liée à des conditions qui favorisent l'amélioration itérative. Diffusez les informations sur les meilleures pratiques et les leçons tirées des incidents pour prévenir des occurrences similaires.
- En externe : Ajoutez une section à votre page d'état ou à votre blog pour partager les principaux enseignements de l'RCA. Il est important d'expliquer au public la raison de la panne et de le tenir informé de la résolution. Obtenez un peu de crédit pour la patience de vos clients en la reconnaissant.
Pour plus d'informations sur les temps d'arrêt des SaaS et comment les gérer, vous pouvez consulter ces ressources : Comment rédiger un SLA.
L'expérience de GitHub suggère la pertinence d'apprendre des erreurs. En réponse à une panne majeure en 2018, GitHub a reconfiguré ses outils de basculement pour empêcher la promotion inter-régions et a reconstruit son système de rapport d'état, et ces changements sont considérés comme ayant un impact sur la probabilité d'événements similaires.
Conclusion
Gestion des temps d'arrêt pendant qu'une application SaaS est opérationnelle est un processus constant qui doit être proactif, rapide et qui n'est jamais terminé. Mettre en œuvre suivi, sauvegarde, plans de réponse aux incidentset outil de communication méthodes peuvent influencer les effets des temps d'arrêt et les niveaux de confiance des clients.
Les cas d'indisponibilité d'une application SaaS peuvent servir informations à l'évaluation et à l'ajustement du système, ce qui peut affecter la stabilité et la fiabilité de l’application.
Prêt à commencer ?
Nous sommes passés par là où vous êtes. Partageons nos 19 ans d'expérience et faisons de vos rêves internationaux une réalité.
FAQ
-
Lorsque les projets rencontrent des problèmes, les questions techniques figurent souvent en bonne place. Des facteurs tels que l'erreur humaine ou les influences externes, comme les cyberattaques, sont également à prendre en compte.
-
La meilleure défense contre les interruptions de service est la prévention, et cela peut être réalisé en mettant en œuvre la redondance, en effectuant une maintenance régulière et des tests approfondis. De plus, une surveillance en temps réel doit être utilisée pour détecter et résoudre les problèmes précocement.
-
La première étape est d'admettre qu'il y a un problème et ensuite de communiquer ouvertement avec vos clients sur la situation, en indiquant le moment réel où le problème sera résolu. Des excuses sont généralement présentées, et en cas de perturbation significative, une compensation pour les utilisateurs peut être envisagée.
-
Avoir un plan de réponse aux incidents est très important, et ce plan devrait inclure les rôles et responsabilités, les procédures d'escalade et des modèles de communication afin d'assurer une réponse rapide et ordonnée.
-
Après un incident, une analyse approfondie des causes profondes (RCA) doit être menée. Cela implique d'identifier la cause première de l'incident, de prendre des mesures correctives et de partager les leçons apprises avec le reste de l'équipe afin d'éviter de répéter les mêmes erreurs.