Imagem em Mosaico

Como Lidar com a Indisponibilidade do SaaS: Um Guia Passo a Passo

Autor: Marta Poprotska, Gerente de Comunidade de Mídias Sociais

Revisado por: Marta Dozorska, VP de Produto

Para se preparar para indisponibilidade do SaaS, deve haver um plano escrito que inclua etapas, resposta imediata a incidentes e comunicação clara.

Este artigo descreve os passos a considerar em relação ao impacto do tempo de inatividade nos negócios e na confiança do cliente, incorporando estratégias e estudos de caso.

Visão geral do conceito

  • Ícone de captura de conteúdo 1

    Categoria: Gestão de incidentes, confiabilidade SaaS

  • Ícone de instantâneo de conteúdo 2

    Usado por: B2B SaaS, provedores digitais, plataformas SaaS

  • Ícone de instantâneo de conteúdo 3

    Propósito principal:

    Minimize o tempo de inatividade e proteja a confiança do cliente

  • Ícone de instantâneo de conteúdo 4

    Conceitos relacionados: Acordo de Nível de Serviço (SLA), Redundância, Retenção de Clientes, Análise da Causa Raiz (RCA)

  • Ícone de instantâneo de conteúdo 5

    Estágio de crescimento:

    Escalabilidade, pós-PMF, prontidão empresarial

Etapa 1

Estabelecer um Plano Abrangente de Resposta a Incidentes

o plano de resposta a incidentes é uma parte fundamental da estratégia de gerenciamento de tempo e deve ser atualizado e editado minuciosamente com o progresso do sistema e de quaisquer incidentes anteriores.  

 

  • Definição de Papéis e Responsabilidades: Atribua funções claras aos membros da sua equipe, como o Comandante de Incidente (a pessoa encarregada de direcionar a resposta), o Líder Técnico (a pessoa responsável pela solução de problemas e resolução) e o Líder de Comunicação (a pessoa encarregada de se comunicar com os clientes). Isso contribui para o estabelecimento de parâmetros específicos e pode mitigar a ambiguidade quando uma emergência ocorre.

 

Exemplo: 

 

Função Responsabilidades
Comandante de Incidente Coordenar a resposta, tomar decisões, alocar recursos, comunicar com as partes interessadas.
Líder Técnico Solucionar e resolver problemas técnicos, escalar conforme necessário.
Líder de Comunicação Gerenciar comunicações internas e externas, atualizar a página de status, elaborar notificações para clientes e responder a solicitações.
Líder de Suporte ao Cliente Lidar com solicitações e reclamações de clientes, fornecer atualizações e escalar problemas para os membros da equipe apropriados.
Especialista no Assunto Fornecer conhecimento especializado e experiência em áreas específicas da aplicação ou infraestrutura.

 

Delinear Procedimentos de Escalonamento. Criar uma rota de escalonamento clara para garantir que os problemas sejam resolvidos adequadamente e em tempo hábil pelas pessoas certas. Entender quando escalonar um incidente para gerentes de nível superior ou equipes de suporte externas.

 

Criar Modelos de Comunicação. Considere criar modelos para diversas situações envolvendo incidentes (por exemplo, degradação do serviço, interrupção parcial, interrupção total). Esses modelos devem incluir detalhes relevantes, como os serviços afetados, o tempo estimado para resolver o problema e as medidas corretivas que estão sendo tomadas. Certifique-se de modificar esses modelos adequadamente para diferentes públicos, como clientes, partes interessadas da empresa ou empresas parceiras.

Checklist GRATUITO de Resposta a Interrupções de SaaS

Responda a interrupções de SaaS rapidamente com este checklist de resposta e recuperação de incidentes.

  • Marca de verificação

    Verificações de prontidão pré-incidente para monitoramento, redundância e failover

  • Marca de verificação

    Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar

  • Marca de verificação

    Uma análise de causa raiz pós-incidente e lista de ações corretivas

  • Marca de verificação

    Preencher campos para registrar gravidade, tempo de inatividade e clientes afetados

Obtenha sua lista de verificação GRATUITA
Etapa 2

Configurar Monitoramento em Tempo Real e Alertas

A primeira defesa contra o tempo de inatividade é monitoramento preventivo. Tal monitoramento pode facilitar a detecção oportuna de problemas, influenciando potencialmente sua progressão para interrupções completas. 

Ao escolher um kit de ferramentas, é necessário levar em consideração a infraestrutura técnica em que você está operando e também as aplicações que estão sendo desenvolvidas. Considere ambas as categorias, como monitoramento de infraestrutura (servidores, bancos de dados, rede) e monitoramento de desempenho de aplicações (APM).

 

Defina valores de limite para métricas importantes, como tempo de resposta, taxas de erro, uso de CPU e uso de memória. Além disso, crie alertas para notificar sua equipe sempre que esses limiares forem ultrapassados. É melhor enviar alertas por e-mail, SMS ou Slack, de acordo com as preferências da equipe.

Observação

Tal prática é popular entre as empresas de SaaS, muitas das quais utilizam Datadog para detectar e resolver incidentes rapidamente.

Checklist GRATUITO de Resposta a Interrupções de SaaS

Responda a interrupções de SaaS rapidamente com este checklist de resposta e recuperação de incidentes.

  • Marca de verificação

    Verificações de prontidão pré-incidente para monitoramento, redundância e failover

  • Marca de verificação

    Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar

  • Marca de verificação

    Uma análise de causa raiz pós-incidente e lista de ações corretivas

  • Marca de verificação

    Preencher campos para registrar gravidade, tempo de inatividade e clientes afetados

Obtenha sua lista de verificação GRATUITA
Etapa 3

Implementar Mecanismos de Redundância e Failover

Redundância SaaS refere-se a ter múltiplas instâncias de aplicações, servidores, etc., em sua infraestrutura em caso de falha de um. Essa abordagem está relacionada a uma diminuição no tempo de restauração do serviço.

 

  • Para aprimorar o desempenho e a confiabilidade da sua infraestrutura, você pode considerar implementar algumas redundâncias-chave. Uma dessas abordagens é empregar dois ou mais servidores web e localizá-los em áreas diferentes, utilizando redundância geográfica. O sistema permite a distribuição de carga, o que se relaciona à operação contínua do site, mesmo que um servidor se torne inoperante. 
  • Outra opção é replicar seus bancos de dados em múltiplos servidores ou zonas de disponibilidade, utilizando replicação de banco de dados. Essa funcionalidade é projetada para oferecer suporte à proteção de dados e capacidades de acesso. 
  • Se você estiver usando um Infraestrutura em Nuvem, existem várias recursos de redundância integrados dos quais você pode tirar proveito, como múltiplas zonas de disponibilidade ou regiões.

Checklist GRATUITO de Resposta a Interrupções de SaaS

Responda a interrupções de SaaS rapidamente com este checklist de resposta e recuperação de incidentes.

  • Marca de verificação

    Verificações de prontidão pré-incidente para monitoramento, redundância e failover

  • Marca de verificação

    Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar

  • Marca de verificação

    Uma análise de causa raiz pós-incidente e lista de ações corretivas

  • Marca de verificação

    Preencher campos para registrar gravidade, tempo de inatividade e clientes afetados

Obtenha sua lista de verificação GRATUITA
Etapa 4

Reconhecer a Indisponibilidade

Transparência é muito importante durante um incidente de indisponibilidade. A notificação pública imediata após a detecção de uma interrupção se relaciona com o reconhecimento do problema e o início dos processos de resolução. Essa comunicação pode influenciar o desenvolvimento da confiança e o ajuste das expectativas. 

 

Escolha os canais de comunicação:

  • Inclua em sua página de status informações sobre a interrupção, os serviços afetados, o tempo estimado para resolver o problema e quaisquer soluções alternativas conhecidas.
  • Use plataformas de mídia social como Twitter e LinkedIn para aumentar sua audiência e dar uma breve visão geral da situação.  
  • Envie um e-mail às pessoas afetadas para dar uma explicação detalhada e as informações mais recentes.

 

Seja honesto e transparente. É importante avaliar o escopo do problema com precisão e assumir compromissos que possam ser cumpridos. Apresente informações aos clientes sobre a origem do tempo de inatividade. Documente as ações em andamento para resolver a questão.

 

Forneça um cronograma. Estime o tempo necessário para resolver o problema (ETR) e inclua uma estimativa de prazo, por mais geral que seja. Em seguida, atualize o ETR novamente com as informações mais recentes. Criar expectativas sem justificativa suficiente pode levar a respostas emocionais adversas.

 

Modelo:

 

“Estamos enfrentando uma interrupção que afeta [service/feature]. Nossa equipe está trabalhando ativamente em uma resolução, e forneceremos atualizações a cada [time interval, e.g., 30 minutes] até que o problema seja resolvido. Pedimos desculpas por qualquer inconveniente que isso possa causar e agradecemos sua paciência.”

 

Checklist GRATUITO de Resposta a Interrupções de SaaS

Responda a interrupções de SaaS rapidamente com este checklist de resposta e recuperação de incidentes.

  • Marca de verificação

    Verificações de prontidão pré-incidente para monitoramento, redundância e failover

  • Marca de verificação

    Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar

  • Marca de verificação

    Uma análise de causa raiz pós-incidente e lista de ações corretivas

  • Marca de verificação

    Preencher campos para registrar gravidade, tempo de inatividade e clientes afetados

Obtenha sua lista de verificação GRATUITA
Etapa 5

Forneça Atualizações Regulares

Uma coisa importante a considerar é manter seus clientes informados do status da resolução do incidente. Também é necessário fornecer uma estimativa do tempo necessário para concluir a resolução e indicar o motivo do tempo de inatividade de forma simples.

Checklist GRATUITO de Resposta a Interrupções de SaaS

Responda a interrupções de SaaS rapidamente com este checklist de resposta e recuperação de incidentes.

  • Marca de verificação

    Verificações de prontidão pré-incidente para monitoramento, redundância e failover

  • Marca de verificação

    Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar

  • Marca de verificação

    Uma análise de causa raiz pós-incidente e lista de ações corretivas

  • Marca de verificação

    Preencher campos para registrar gravidade, tempo de inatividade e clientes afetados

Obtenha sua lista de verificação GRATUITA
Etapa 6

Oferecer Desculpas e Compensação

Pedir Desculpas e comunicar a justificativa para a extensão do prazo e as circunstâncias que ela apresentou. A prática não é fornecer justificativas ou atribuir responsabilidade a outras partes. 

Oferta créditos de serviço ou um desconto para os clientes com base na extensão da interrupção, sua duração e sua gravidade. Considere oferecer outros benefícios, como testes gratuitos ou acesso a recursos premium com um desconto. Considere as circunstâncias dos clientes e a compensação de forma adequada.

Checklist GRATUITO de Resposta a Interrupções de SaaS

Responda a interrupções de SaaS rapidamente com este checklist de resposta e recuperação de incidentes.

  • Marca de verificação

    Verificações de prontidão pré-incidente para monitoramento, redundância e failover

  • Marca de verificação

    Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar

  • Marca de verificação

    Uma análise de causa raiz pós-incidente e lista de ações corretivas

  • Marca de verificação

    Preencher campos para registrar gravidade, tempo de inatividade e clientes afetados

Obtenha sua lista de verificação GRATUITA
Etapa 7

Analisar, Aprender e Melhorar

A ocorrência de um problema de produto ou serviço pode levar a um/uma revisão do processo associado e sua eficiência. Ao desmembrar o incidente e identificar a causa raiz, e então aplicar essas percepções para prevenir situações semelhantes no futuro, é fundamental para aproveitar ao máximo esse tipo de análise. 

 

Uma análise aprofundada Análise da Causa Raiz (RCA) envolve a criação de uma linha do tempo dos principais eventos, explicando o impacto do evento, identificando a causa raiz e sugerindo medidas corretivas. Este processo está associado à identificação de problemas básicos e à seleção de soluções.  

 

Começar coletando logs, métricas e outros dados relevantes de suas ferramentas de monitoramento, servidores e aplicativos. Converse com as pessoas que estiveram envolvidas no processo de resolução do incidente e obtenha seus comentários e insights.

 

Uma avaliação de feedback do cliente e tickets de suporte a partir do momento da inacessibilidade do site é uma opção. Organize as informações fornecidas de acordo com a sequência cronológica dos eventos relacionados à interrupção.

Use as informações para criar uma linha do tempo dos eventosUtilize os dados para identificar padrões ou quaisquer atividades incomuns que possam auxiliar na localização da causa raiz.

Dica

Não tire conclusões imediatamente. Considere todas as razões possíveis para a interrupção, seja ela técnica, humana, mecânica ou externa.

Documente suas descobertas. Prepare um relatório RCA detalhado que inclua:

  • Linha do tempo dos eventos
  • Avaliação de impacto
  • Causa(s) raiz
  • Fatores contribuintes
  • Ações corretivas recomendadas

 

Modelo:

 

Relatório de Análise da Causa Raiz

Incidente: [Interrupção de Serviço/Funcionalidade]

Data: [Data da Interrupção]

Linha do Tempo dos Eventos:

  • [Evento 1]
  • [Evento 2]
  • [Evento 3]
  • …

Avaliação de Impacto:

  • [Número de clientes afetados]
  • [Impacto financeiro]
  • [Outros impactos relevantes]

Causa(s) Raiz:

  • [Causa raiz 1]
  • [Causa raiz 2]
  • …

Fatores Contribuintes:

  • [Fator 1]
  • [Fator 2]
  • …

Ações Corretivas Recomendadas:

  • [Ação 1]
  • [Ação 2]
  • …

 

Implemente Medidas Corretivas. De acordo com os resultados da sua RCA, tome medidas para evitar futuras paralisações. Isso pode incluir a aplicação de patches para bugs de software, atualização de configurações, adição de mais monitoramento e alertas, ou fornecimento de mais treinamento para sua equipe.

 

Comunicar Lições Aprendidas. Inclua os achados de sua RCA em suas ações corretivas e nas ações com sua equipe e clientes. Isso pode ser percebido como um indicador de dedicação ao desenvolvimento e pode afetar os níveis de confiança. 

  • Internamente: Apresente o relatório RCA à sua equipe e discuta as principais conclusões. A presença de comunicação aberta e feedback está relacionada a condições que apoiam o refinamento iterativo. Circule informações sobre as melhores práticas e os aprendizados de incidentes para evitar ocorrências semelhantes.
  • Externamente: Adicione uma seção à sua página de status ou blog para compartilhar as principais conclusões da RCA. É importante explicar o motivo da interrupção ao público e mantê-los informados sobre a resolução. Ganhe algum crédito pela paciência dos seus clientes ao reconhecê-la.

 

Para mais informações sobre o tempo de inatividade de SaaS e como gerenciá-lo, você pode consultar estes recursos: Como escrever um SLA.

Conclusão

Gerenciamento de indisponibilidade durante o período em que uma aplicação SaaS está ativa é um processo constante que precisa ser proativo, rápido e que nunca termina. A implementação monitoramento, backup, planos de resposta a incidentese comunicação métodos podem influenciar os efeitos da indisponibilidade e os níveis de confiança do cliente. 

Instâncias de tempo de inatividade de aplicações SaaS podem fornecer clientes para avaliação e ajuste do sistema, o que pode afetar a estabilidade e a confiabilidade da aplicação.

Pronto para começar?

Já estivemos onde você está. Vamos compartilhar nossos 19 anos de experiência e tornar seus sonhos globais realidade.

Imagem em Mosaico

FAQ

pt_BRPortuguês do Brasil