Como Lidar com a Indisponibilidade do SaaS: Um Guia Passo a Passo
Para se preparar para Indisponibilidade do SaaS, deve haver um plano escrito em vigor que inclua etapas, resposta imediata a incidentes e comunicação clara.
Este artigo apresenta os passos a considerar em relação ao impacto do tempo de inatividade nos negócios e na confiança do cliente, incorporando estratégias e estudos de caso.
Visão geral do conceito
-
Categoria: Gestão de incidentes, Confiabilidade SaaS
-
Usado por: B2B SaaS, provedores digitais, plataformas SaaS
-
Propósito principal:
Minimizar o tempo de inatividade e proteger a confiança do cliente
-
Conceitos relacionados: Acordo de Nível de Serviço (SLA), Redundância, Retenção de Clientes, Análise da Causa Raiz (RCA)
-
Estágio de crescimento:
Escalabilidade, pós-PMF, prontidão empresarial
Estabelecer um Plano Abrangente de Resposta a Incidentes
o plano de resposta a incidentes é uma parte fundamental da estratégia de gestão de tempo e deve ser atualizado e editado minuciosamente com o progresso do sistema e de quaisquer incidentes anteriores.
- Definindo Funções e Responsabilidades: Atribua papéis claros aos membros da sua equipe, como o Comandante de Incidentes (a pessoa responsável por direcionar a resposta), o Líder Técnico (a pessoa responsável pela resolução de problemas e pela solução) e o Líder de Comunicação (a pessoa responsável pela comunicação com os clientes). Isso contribui para o estabelecimento de parâmetros específicos e pode reduzir a ambiguidade em caso de emergência.
Exemplo:
| Função | Responsabilidades |
| Comandante de Incidentes | Coordenar a resposta, tomar decisões, alocar recursos, comunicar com os interessados. |
| Líder Técnico | Solucionar e resolver problemas técnicos, escalar conforme necessário. |
| Líder de Comunicação | Gerenciar comunicações internas e externas, atualizar a página de status, redigir notificações aos clientes e responder a consultas. |
| Líder de Suporte ao Cliente | Lidar com dúvidas e reclamações de clientes, fornecer atualizações e escalar problemas para os membros da equipe apropriados. |
| Especialista no Assunto | Fornecer conhecimento especializado e experiência em áreas específicas da aplicação ou infraestrutura. |
Delinear Procedimentos de Escalonamento. Criar uma rota de escalonamento clara para garantir que os problemas sejam resolvidos adequadamente e em tempo hábil pelas pessoas certas. Compreender quando escalar um incidente para gerentes de nível superior ou equipes de suporte externas.
Criar Modelos de Comunicação. Considere a criação de modelos para várias situações envolvendo incidentes (por exemplo, degradação do serviço, interrupção parcial, interrupção total). Esses modelos devem incluir detalhes relevantes, como os serviços afetados, o tempo estimado para resolver o problema e as medidas corretivas que estão sendo tomadas. Certifique-se de adaptar esses modelos adequadamente para diferentes públicos, como clientes, partes interessadas da empresa ou empresas parceiras.
O plano de resposta a incidentes por Slack ilustra o processo de definição de funções, estabelecimento de canais de comunicação e preparação de modelos para atualizações de status.
Lista de Verificação GRATUITA para Respostas a Indisponibilidade de SaaS
Responda rapidamente a interrupções de SaaS com esta lista de verificação de resposta e recuperação de incidentes.
-
Verificações de prontidão pré-incidente para monitoramento, redundância e failover.
-
Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar.
-
Análise da causa raiz e lista de ações corretivas pós-incidente.
-
Preencher campos para registrar a gravidade, o tempo de inatividade e os clientes afetados
Configurar Monitoramento em Tempo Real e Alerta
A primeira defesa contra o tempo de inatividade é monitoramento preventivo. Tal monitoramento pode facilitar a detecção oportuna de problemas, potencialmente influenciando sua progressão para interrupções completas.
Ao a escolha de um kit de ferramentas, é necessário levar em consideração a infraestrutura técnica em que você está operando e também as aplicações que estão sendo desenvolvidas. Considere ambas as categorias, como monitoramento de infraestrutura (servidores, bancos de dados, rede) e monitoramento de desempenho de aplicações (APM).
Defina valores limite para métricas importantes como tempo de resposta, taxas de erro, uso da CPU e uso de memória. Além disso, crie alertas para notificar sua equipe sempre que esses limites forem excedidos. É melhor enviar alertas por e-mail, SMS ou Slack, de acordo com as preferências da equipe.
Tal prática é popular entre empresas SaaS, muitas das quais usam Datadog para detectar e resolver incidentes rapidamente.
Lista de Verificação GRATUITA para Respostas a Indisponibilidade de SaaS
Responda rapidamente a interrupções de SaaS com esta lista de verificação de resposta e recuperação de incidentes.
-
Verificações de prontidão pré-incidente para monitoramento, redundância e failover.
-
Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar.
-
Análise da causa raiz e lista de ações corretivas pós-incidente.
-
Preencher campos para registrar a gravidade, o tempo de inatividade e os clientes afetados
Implementar Mecanismos de Redundância e Failover
Redundância SaaS refere-se a ter múltiplas instâncias de aplicações, servidores, etc., na sua infraestrutura em caso de falha de um. Esta abordagem está relacionada a uma diminuição no tempo de restauração do serviço.
- Para melhorar o desempenho e a confiabilidade da sua infraestrutura, você pode considerar implementar algumas redundâncias chave. Uma dessas abordagens é empregar dois ou mais servidores web e localizá-los em áreas diferentes, usando redundância geográfica. O sistema permite a distribuição de carga, o que se relaciona com a operação contínua do website, apesar de um servidor se tornar inoperante.
- Outra opção é replicar suas bases de dados em vários servidores ou zonas de disponibilidade, utilizando replicação de bases de dados. Esta funcionalidade foi concebida para suportar a proteção de dados e capacidades de acesso.
- Se estiver usando um infraestrutura de nuvem, existem várias funcionalidades de redundância incorporadas das quais pode tirar partido, como várias zonas de disponibilidade ou regiões.
Netflix opera com múltiplas Zonas de Disponibilidade na AWS, uma configuração que se relaciona com os seus objetivos de alta disponibilidade e recuperação de falhas.
Lista de Verificação GRATUITA para Respostas a Indisponibilidade de SaaS
Responda rapidamente a interrupções de SaaS com esta lista de verificação de resposta e recuperação de incidentes.
-
Verificações de prontidão pré-incidente para monitoramento, redundância e failover.
-
Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar.
-
Análise da causa raiz e lista de ações corretivas pós-incidente.
-
Preencher campos para registrar a gravidade, o tempo de inatividade e os clientes afetados
Reconhecer a Indisponibilidade
Transparência é muito importante durante um incidente de indisponibilidade. A pronta notificação pública após a detecção de uma interrupção relaciona-se com o reconhecimento do problema e o início dos processos de resolução. Tal comunicação pode influenciar o desenvolvimento da confiança e o ajuste das expectativas.
Escolha os canais de comunicação:
- Inclua na sua página de status informações sobre a interrupção, os serviços afetados, o tempo estimado para resolver o problema e quaisquer soluções alternativas conhecidas.
- Utilize plataformas de redes sociais como Twitter e LinkedIn para aumentar sua audiência e fornecer uma breve visão geral da situação.
- Envie um e-mail às pessoas afetadas para fornecer uma explicação detalhada e as informações mais recentes.
Seja honesto e transparente. É importante avaliar o escopo do problema com precisão e assumir compromissos que possam ser cumpridos. Apresente informações aos clientes sobre a origem da paralisação. Documente as ações atualmente em andamento para resolver a questão.
Forneça um cronograma. Estime o tempo que levará para resolver o problema (ETR) e inclua um intervalo, por mais geral que seja. Em seguida, atualize o ETR novamente com as informações mais recentes. Criar expectativas sem justificativa suficiente pode levar a respostas emocionais adversas.
Modelo:
| “Estamos enfrentando uma interrupção que afeta [service/feature]. Nossa equipe está trabalhando ativamente em uma resolução e forneceremos atualizações a cada [time interval, e.g., 30 minutes] até que o problema seja resolvido. Pedimos desculpas por qualquer inconveniente que isso possa causar e agradecemos a sua paciência.” |
Lista de Verificação GRATUITA para Respostas a Indisponibilidade de SaaS
Responda rapidamente a interrupções de SaaS com esta lista de verificação de resposta e recuperação de incidentes.
-
Verificações de prontidão pré-incidente para monitoramento, redundância e failover.
-
Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar.
-
Análise da causa raiz e lista de ações corretivas pós-incidente.
-
Preencher campos para registrar a gravidade, o tempo de inatividade e os clientes afetados
Fornecer Atualizações Regulares
Uma coisa importante a considerar é manter os seus clientes informados do status da resolução do incidente. É também necessário fornecer uma estimativa do tempo necessário para completar a resolução e indicar a razão para a inatividade de forma simples.
A interrupção do Facebook em 2021 mostrou por que uma página de status deve funcionar em uma infraestrutura independente do produto — a deles caiu junto com o serviço, forçando as atualizações para uma plataforma de terceiros.
Lista de Verificação GRATUITA para Respostas a Indisponibilidade de SaaS
Responda rapidamente a interrupções de SaaS com esta lista de verificação de resposta e recuperação de incidentes.
-
Verificações de prontidão pré-incidente para monitoramento, redundância e failover.
-
Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar.
-
Análise da causa raiz e lista de ações corretivas pós-incidente.
-
Preencher campos para registrar a gravidade, o tempo de inatividade e os clientes afetados
Ofereça Desculpas e Compensação
Peça Desculpas e comunicar a justificativa para a prorrogação do prazo e as circunstâncias que ela apresentou. A prática é não fornecer justificativas nem atribuir responsabilidade a outras partes.
Ofereça créditos de serviço ou um desconto aos clientes com base na extensão da interrupção, sua duração e sua gravidade. Considere oferecer outros benefícios, como testes gratuitos ou acesso a recursos premium com desconto. Considere as circunstâncias dos clientes e a compensação de forma apropriada.
Em 2019, Salesforce alterou sua política de crédito baseada no acordo de nível de serviço (SLA) de forma a conceder crédito aos clientes pelo tempo em que o serviço esteve indisponível.
Lista de Verificação GRATUITA para Respostas a Indisponibilidade de SaaS
Responda rapidamente a interrupções de SaaS com esta lista de verificação de resposta e recuperação de incidentes.
-
Verificações de prontidão pré-incidente para monitoramento, redundância e failover.
-
Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar.
-
Análise da causa raiz e lista de ações corretivas pós-incidente.
-
Preencher campos para registrar a gravidade, o tempo de inatividade e os clientes afetados
Analisar, Aprender e Melhorar
A ocorrência de um problema de produto ou serviço pode levar a uma revisão do processo associado e da sua eficiência. Ao analisar o incidente e identificar a causa raiz, e depois aplicar esses conhecimentos para evitar situações semelhantes no futuro, é fundamental para tirar o máximo proveito deste tipo de análise.
Uma minuciosa Análise da Causa Raiz (RCA) envolve a criação de uma linha do tempo dos principais eventos, explicando o impacto do evento, identificando a causa raiz e sugerindo medidas corretivas. Este processo está associado à identificação de problemas básicos e à seleção de soluções.
Iniciar coletando logs, métricas e outros dados relevantes das suas ferramentas de monitoramento, servidores e aplicações. Converse com as pessoas que estiveram envolvidas no processo de resolução do incidente e recolha os seus comentários e percepções.
Uma avaliação de feedback dos clientes e tickets de suporte a partir do momento de inacessibilidade do site é uma opção. Organize as informações fornecidas de acordo com a sequência cronológica dos eventos relacionados à interrupção.
Use as informações para criar um(a) linha do tempo de eventos. Use os dados para identificar padrões ou quaisquer atividades incomuns que possam ajudar a encontrar a causa raiz.
Não tire conclusões imediatamente. Considere todas as razões possíveis para a interrupção, seja ela técnica, humana, mecânica ou externa.
Documente suas descobertas. Preparar um relatório detalhado de RCA que inclua:
- Cronograma de eventos
- Avaliação de impacto
- Causa(s) raiz
- Fatores contribuintes
- Ações corretivas recomendadas
Modelo:
| Relatório de Análise da Causa Raiz
Incidente: [Indisponibilidade de Serviço/Recurso] Data: [Data da Indisponibilidade] Cronograma de Eventos:
Avaliação de Impacto:
Causa(s) Raiz:
Fatores Contribuintes:
Ações Corretivas Recomendadas:
|
Implementar Medidas Corretivas. De acordo com os resultados da sua RCA, tome medidas para evitar futuras indisponibilidades. Isso pode incluir a aplicação de patches para bugs de software, atualização de configurações, adição de mais monitoramento e alarmes, ou o fornecimento de mais treinamento para sua equipe.
Comunicar Lições Aprendidas. Inclua os achados da sua RCA em suas ações corretivas e ações com sua equipe e clientes. Isso pode ser percebido como um indicador de dedicação ao desenvolvimento e pode afetar os níveis de confiança.
- Internamente: Apresente o relatório da RCA à sua equipe e discuta os principais pontos. A presença de comunicação aberta e feedback está relacionada a condições que apoiam o aprimoramento iterativo. Circule informações sobre as melhores práticas e aprendizados de incidentes para prevenir ocorrências semelhantes.
- Externamente: Adicione uma seção à sua página de status ou blog para compartilhar os principais pontos da RCA. É importante explicar o motivo da interrupção ao público e mantê-los informados sobre a resolução. Ganhe algum crédito pela paciência dos seus clientes ao reconhecê-la.
Para mais informações sobre o tempo de inatividade do SaaS e como lidar com ele, você pode consultar estes recursos: Como escrever um SLA.
A experiência de GitHub sugere a relevância de aprender com os erros. Em resposta a uma interrupção grave Em 2018, o GitHub reconfigurou seus mecanismos de failover para prevenir a promoção entre regiões e reconstruiu seu sistema de relatórios de status, e acredita-se que essas mudanças impactam a probabilidade de eventos semelhantes.
Conclusão
Gestão de indisponibilidade durante o tempo em que uma aplicação SaaS está ativa é um processo constante que precisa ser proativo, rápido e que nunca termina. A implementação de monitoramento, backup,, planos de resposta a incidentes,e comunicação e métodos pode influenciar os efeitos da indisponibilidade e os níveis de confiança do cliente.
Instâncias de inatividade de aplicativos SaaS podem proporcionar informações para avaliação e ajuste do sistema, o que pode afetar a estabilidade e confiabilidade da aplicação.
Pronto para começar?
Nós já estivemos onde você está. Vamos compartilhar nossos 19 anos de experiência e tornar seus sonhos globais realidade.
Perguntas frequentes
-
Quando projetos encontram problemas, questões técnicas frequentemente se destacam. Fatores como erro humano ou influências externas, como ataques cibernéticos, também são considerações.
-
A melhor defesa contra o tempo de inatividade é a prevenção, e isso pode ser alcançado através da implementação de redundância, realização de manutenção regular e execução de testes exaustivos. Além disso, o monitoramento em tempo real deve ser utilizado para detectar e resolver problemas precocemente.
-
O primeiro passo é admitir que existe um problema e depois comunicar abertamente com os seus clientes sobre a situação, indicando o tempo real em que o problema será resolvido. Um pedido de desculpas é geralmente feito e, em casos de interrupção significativa, a compensação para os utilizadores pode ser avaliada.
-
Ter um plano de resposta a incidentes é muito importante e este plano deve incluir funções e responsabilidades, procedimentos de escalonamento e modelos de comunicação para garantir uma resposta rápida e ordenada.
-
Após um incidente, uma análise de causa raiz (RCA) aprofundada deve ser realizada. Isso envolve identificar a causa raiz do incidente, tomar medidas corretivas e compartilhar as lições aprendidas com o restante da equipe, a fim de evitar a repetição dos mesmos erros.