Como Lidar com a Indisponibilidade do SaaS: Um Guia Passo a Passo
Para se preparar para indisponibilidade do SaaS, deve haver um plano escrito que inclua etapas, resposta imediata a incidentes e comunicação clara.
Este artigo descreve os passos a considerar em relação ao impacto do tempo de inatividade nos negócios e na confiança do cliente, incorporando estratégias e estudos de caso.
Visão geral do conceito
-
Categoria: Gestão de incidentes, confiabilidade SaaS
-
Usado por: B2B SaaS, provedores digitais, plataformas SaaS
-
Propósito principal:
Minimize o tempo de inatividade e proteja a confiança do cliente
-
Conceitos relacionados: Acordo de Nível de Serviço (SLA), Redundância, Retenção de Clientes, Análise da Causa Raiz (RCA)
-
Estágio de crescimento:
Escalabilidade, pós-PMF, prontidão empresarial
Estabelecer um Plano Abrangente de Resposta a Incidentes
o plano de resposta a incidentes é uma parte fundamental da estratégia de gerenciamento de tempo e deve ser atualizado e editado minuciosamente com o progresso do sistema e de quaisquer incidentes anteriores.
- Definição de Papéis e Responsabilidades: Atribua funções claras aos membros da sua equipe, como o Comandante de Incidente (a pessoa encarregada de direcionar a resposta), o Líder Técnico (a pessoa responsável pela solução de problemas e resolução) e o Líder de Comunicação (a pessoa encarregada de se comunicar com os clientes). Isso contribui para o estabelecimento de parâmetros específicos e pode mitigar a ambiguidade quando uma emergência ocorre.
Exemplo:
| Função | Responsabilidades |
| Comandante de Incidente | Coordenar a resposta, tomar decisões, alocar recursos, comunicar com as partes interessadas. |
| Líder Técnico | Solucionar e resolver problemas técnicos, escalar conforme necessário. |
| Líder de Comunicação | Gerenciar comunicações internas e externas, atualizar a página de status, elaborar notificações para clientes e responder a solicitações. |
| Líder de Suporte ao Cliente | Lidar com solicitações e reclamações de clientes, fornecer atualizações e escalar problemas para os membros da equipe apropriados. |
| Especialista no Assunto | Fornecer conhecimento especializado e experiência em áreas específicas da aplicação ou infraestrutura. |
Delinear Procedimentos de Escalonamento. Criar uma rota de escalonamento clara para garantir que os problemas sejam resolvidos adequadamente e em tempo hábil pelas pessoas certas. Entender quando escalonar um incidente para gerentes de nível superior ou equipes de suporte externas.
Criar Modelos de Comunicação. Considere criar modelos para diversas situações envolvendo incidentes (por exemplo, degradação do serviço, interrupção parcial, interrupção total). Esses modelos devem incluir detalhes relevantes, como os serviços afetados, o tempo estimado para resolver o problema e as medidas corretivas que estão sendo tomadas. Certifique-se de modificar esses modelos adequadamente para diferentes públicos, como clientes, partes interessadas da empresa ou empresas parceiras.
O plano de resposta a incidentes por Slack ilustra o processo de definição de funções, estabelecimento de canais de comunicação e preparação de modelos para atualizações de status.
Checklist GRATUITO de Resposta a Interrupções de SaaS
Responda a interrupções de SaaS rapidamente com este checklist de resposta e recuperação de incidentes.
-
Verificações de prontidão pré-incidente para monitoramento, redundância e failover
-
Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar
-
Uma análise de causa raiz pós-incidente e lista de ações corretivas
-
Preencher campos para registrar gravidade, tempo de inatividade e clientes afetados
Configurar Monitoramento em Tempo Real e Alertas
A primeira defesa contra o tempo de inatividade é monitoramento preventivo. Tal monitoramento pode facilitar a detecção oportuna de problemas, influenciando potencialmente sua progressão para interrupções completas.
Ao escolher um kit de ferramentas, é necessário levar em consideração a infraestrutura técnica em que você está operando e também as aplicações que estão sendo desenvolvidas. Considere ambas as categorias, como monitoramento de infraestrutura (servidores, bancos de dados, rede) e monitoramento de desempenho de aplicações (APM).
Defina valores de limite para métricas importantes, como tempo de resposta, taxas de erro, uso de CPU e uso de memória. Além disso, crie alertas para notificar sua equipe sempre que esses limiares forem ultrapassados. É melhor enviar alertas por e-mail, SMS ou Slack, de acordo com as preferências da equipe.
Tal prática é popular entre as empresas de SaaS, muitas das quais utilizam Datadog para detectar e resolver incidentes rapidamente.
Checklist GRATUITO de Resposta a Interrupções de SaaS
Responda a interrupções de SaaS rapidamente com este checklist de resposta e recuperação de incidentes.
-
Verificações de prontidão pré-incidente para monitoramento, redundância e failover
-
Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar
-
Uma análise de causa raiz pós-incidente e lista de ações corretivas
-
Preencher campos para registrar gravidade, tempo de inatividade e clientes afetados
Implementar Mecanismos de Redundância e Failover
Redundância SaaS refere-se a ter múltiplas instâncias de aplicações, servidores, etc., em sua infraestrutura em caso de falha de um. Essa abordagem está relacionada a uma diminuição no tempo de restauração do serviço.
- Para aprimorar o desempenho e a confiabilidade da sua infraestrutura, você pode considerar implementar algumas redundâncias-chave. Uma dessas abordagens é empregar dois ou mais servidores web e localizá-los em áreas diferentes, utilizando redundância geográfica. O sistema permite a distribuição de carga, o que se relaciona à operação contínua do site, mesmo que um servidor se torne inoperante.
- Outra opção é replicar seus bancos de dados em múltiplos servidores ou zonas de disponibilidade, utilizando replicação de banco de dados. Essa funcionalidade é projetada para oferecer suporte à proteção de dados e capacidades de acesso.
- Se você estiver usando um Infraestrutura em Nuvem, existem várias recursos de redundância integrados dos quais você pode tirar proveito, como múltiplas zonas de disponibilidade ou regiões.
Netflix opera com múltiplas Zonas de Disponibilidade na AWS, uma configuração que se relaciona com seus objetivos de alta disponibilidade e recuperação de falhas.
Checklist GRATUITO de Resposta a Interrupções de SaaS
Responda a interrupções de SaaS rapidamente com este checklist de resposta e recuperação de incidentes.
-
Verificações de prontidão pré-incidente para monitoramento, redundância e failover
-
Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar
-
Uma análise de causa raiz pós-incidente e lista de ações corretivas
-
Preencher campos para registrar gravidade, tempo de inatividade e clientes afetados
Reconhecer a Indisponibilidade
Transparência é muito importante durante um incidente de indisponibilidade. A notificação pública imediata após a detecção de uma interrupção se relaciona com o reconhecimento do problema e o início dos processos de resolução. Essa comunicação pode influenciar o desenvolvimento da confiança e o ajuste das expectativas.
Escolha os canais de comunicação:
- Inclua em sua página de status informações sobre a interrupção, os serviços afetados, o tempo estimado para resolver o problema e quaisquer soluções alternativas conhecidas.
- Use plataformas de mídia social como Twitter e LinkedIn para aumentar sua audiência e dar uma breve visão geral da situação.
- Envie um e-mail às pessoas afetadas para dar uma explicação detalhada e as informações mais recentes.
Seja honesto e transparente. É importante avaliar o escopo do problema com precisão e assumir compromissos que possam ser cumpridos. Apresente informações aos clientes sobre a origem do tempo de inatividade. Documente as ações em andamento para resolver a questão.
Forneça um cronograma. Estime o tempo necessário para resolver o problema (ETR) e inclua uma estimativa de prazo, por mais geral que seja. Em seguida, atualize o ETR novamente com as informações mais recentes. Criar expectativas sem justificativa suficiente pode levar a respostas emocionais adversas.
Modelo:
| “Estamos enfrentando uma interrupção que afeta [service/feature]. Nossa equipe está trabalhando ativamente em uma resolução, e forneceremos atualizações a cada [time interval, e.g., 30 minutes] até que o problema seja resolvido. Pedimos desculpas por qualquer inconveniente que isso possa causar e agradecemos sua paciência.” |
Checklist GRATUITO de Resposta a Interrupções de SaaS
Responda a interrupções de SaaS rapidamente com este checklist de resposta e recuperação de incidentes.
-
Verificações de prontidão pré-incidente para monitoramento, redundância e failover
-
Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar
-
Uma análise de causa raiz pós-incidente e lista de ações corretivas
-
Preencher campos para registrar gravidade, tempo de inatividade e clientes afetados
Forneça Atualizações Regulares
Uma coisa importante a considerar é manter seus clientes informados do status da resolução do incidente. Também é necessário fornecer uma estimativa do tempo necessário para concluir a resolução e indicar o motivo do tempo de inatividade de forma simples.
A interrupção do Facebook em 2021 mostrou por que uma página de status deve residir em uma infraestrutura independente do produto — a deles caiu junto com o serviço, forçando atualizações para uma plataforma de terceiros.
Checklist GRATUITO de Resposta a Interrupções de SaaS
Responda a interrupções de SaaS rapidamente com este checklist de resposta e recuperação de incidentes.
-
Verificações de prontidão pré-incidente para monitoramento, redundância e failover
-
Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar
-
Uma análise de causa raiz pós-incidente e lista de ações corretivas
-
Preencher campos para registrar gravidade, tempo de inatividade e clientes afetados
Oferecer Desculpas e Compensação
Pedir Desculpas e comunicar a justificativa para a extensão do prazo e as circunstâncias que ela apresentou. A prática não é fornecer justificativas ou atribuir responsabilidade a outras partes.
Oferta créditos de serviço ou um desconto para os clientes com base na extensão da interrupção, sua duração e sua gravidade. Considere oferecer outros benefícios, como testes gratuitos ou acesso a recursos premium com um desconto. Considere as circunstâncias dos clientes e a compensação de forma adequada.
Em 2019, Salesforce alterou sua política de crédito baseada em acordo de nível de serviço (SLA) de forma a conceder crédito aos clientes pelo tempo em que o serviço esteve indisponível.
Checklist GRATUITO de Resposta a Interrupções de SaaS
Responda a interrupções de SaaS rapidamente com este checklist de resposta e recuperação de incidentes.
-
Verificações de prontidão pré-incidente para monitoramento, redundância e failover
-
Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar
-
Uma análise de causa raiz pós-incidente e lista de ações corretivas
-
Preencher campos para registrar gravidade, tempo de inatividade e clientes afetados
Analisar, Aprender e Melhorar
A ocorrência de um problema de produto ou serviço pode levar a um/uma revisão do processo associado e sua eficiência. Ao desmembrar o incidente e identificar a causa raiz, e então aplicar essas percepções para prevenir situações semelhantes no futuro, é fundamental para aproveitar ao máximo esse tipo de análise.
Uma análise aprofundada Análise da Causa Raiz (RCA) envolve a criação de uma linha do tempo dos principais eventos, explicando o impacto do evento, identificando a causa raiz e sugerindo medidas corretivas. Este processo está associado à identificação de problemas básicos e à seleção de soluções.
Começar coletando logs, métricas e outros dados relevantes de suas ferramentas de monitoramento, servidores e aplicativos. Converse com as pessoas que estiveram envolvidas no processo de resolução do incidente e obtenha seus comentários e insights.
Uma avaliação de feedback do cliente e tickets de suporte a partir do momento da inacessibilidade do site é uma opção. Organize as informações fornecidas de acordo com a sequência cronológica dos eventos relacionados à interrupção.
Use as informações para criar uma linha do tempo dos eventosUtilize os dados para identificar padrões ou quaisquer atividades incomuns que possam auxiliar na localização da causa raiz.
Não tire conclusões imediatamente. Considere todas as razões possíveis para a interrupção, seja ela técnica, humana, mecânica ou externa.
Documente suas descobertas. Prepare um relatório RCA detalhado que inclua:
- Linha do tempo dos eventos
- Avaliação de impacto
- Causa(s) raiz
- Fatores contribuintes
- Ações corretivas recomendadas
Modelo:
| Relatório de Análise da Causa Raiz
Incidente: [Interrupção de Serviço/Funcionalidade] Data: [Data da Interrupção] Linha do Tempo dos Eventos:
Avaliação de Impacto:
Causa(s) Raiz:
Fatores Contribuintes:
Ações Corretivas Recomendadas:
|
Implemente Medidas Corretivas. De acordo com os resultados da sua RCA, tome medidas para evitar futuras paralisações. Isso pode incluir a aplicação de patches para bugs de software, atualização de configurações, adição de mais monitoramento e alertas, ou fornecimento de mais treinamento para sua equipe.
Comunicar Lições Aprendidas. Inclua os achados de sua RCA em suas ações corretivas e nas ações com sua equipe e clientes. Isso pode ser percebido como um indicador de dedicação ao desenvolvimento e pode afetar os níveis de confiança.
- Internamente: Apresente o relatório RCA à sua equipe e discuta as principais conclusões. A presença de comunicação aberta e feedback está relacionada a condições que apoiam o refinamento iterativo. Circule informações sobre as melhores práticas e os aprendizados de incidentes para evitar ocorrências semelhantes.
- Externamente: Adicione uma seção à sua página de status ou blog para compartilhar as principais conclusões da RCA. É importante explicar o motivo da interrupção ao público e mantê-los informados sobre a resolução. Ganhe algum crédito pela paciência dos seus clientes ao reconhecê-la.
Para mais informações sobre o tempo de inatividade de SaaS e como gerenciá-lo, você pode consultar estes recursos: Como escrever um SLA.
A experiência de GitHub sugere a relevância de aprender com os erros. Em resposta a uma grande interrupção em 2018, o GitHub reconfigurou suas ferramentas de failover para evitar a promoção entre regiões e reconstruiu seus relatórios de status, e essas mudanças são consideradas capazes de impactar a probabilidade de eventos semelhantes.
Conclusão
Gerenciamento de indisponibilidade durante o período em que uma aplicação SaaS está ativa é um processo constante que precisa ser proativo, rápido e que nunca termina. A implementação monitoramento, backup, planos de resposta a incidentese comunicação métodos podem influenciar os efeitos da indisponibilidade e os níveis de confiança do cliente.
Instâncias de tempo de inatividade de aplicações SaaS podem fornecer clientes para avaliação e ajuste do sistema, o que pode afetar a estabilidade e a confiabilidade da aplicação.
Pronto para começar?
Já estivemos onde você está. Vamos compartilhar nossos 19 anos de experiência e tornar seus sonhos globais realidade.
FAQ
-
Quando projetos encontram problemas, questões técnicas frequentemente se destacam. Fatores como erro humano ou influências externas, como ataques cibernéticos, também devem ser considerados.
-
A melhor defesa contra o tempo de inatividade é a prevenção, e isso pode ser alcançado através da implementação de redundância, realização de manutenção regular e execução de testes rigorosos. Além disso, o monitoramento em tempo real deve ser empregado para detectar e resolver problemas precocemente.
-
O primeiro passo é admitir que existe um problema e, em seguida, comunicar-se abertamente com seus clientes sobre a situação, informando o tempo real em que o problema será resolvido. Geralmente é fornecido um pedido de desculpas e, em casos de interrupção significativa, a compensação para os usuários pode ser avaliada.
-
Ter um plano de resposta a incidentes é muito importante e este plano deve incluir funções e responsabilidades, procedimentos de escalonamento e modelos de comunicação a fim de garantir uma resposta rápida e organizada.
-
Após um incidente, uma análise aprofundada da causa raiz (RCA) deve ser realizada. Isso envolve a identificação da causa raiz do incidente, a tomada de medidas corretivas e o compartilhamento das lições aprendidas com o restante da equipe a fim de evitar a repetição dos mesmos erros.