Imagem Mosaico

Como Lidar com a Indisponibilidade do SaaS: Um Guia Passo a Passo

Autor: Marta Poprotska, Gerente de Comunidade de Mídias Sociais

Revisado por: Marta Dozorska, VP de Produto

Para se preparar para Indisponibilidade do SaaS, deve haver um plano escrito em vigor que inclua etapas, resposta imediata a incidentes e comunicação clara.

Este artigo apresenta os passos a considerar em relação ao impacto do tempo de inatividade nos negócios e na confiança do cliente, incorporando estratégias e estudos de caso.

Visão geral do conceito

  • Ícone de instantâneo de conteúdo 1

    Categoria: Gestão de incidentes, Confiabilidade SaaS

  • Ícone de instantâneo de conteúdo 2

    Usado por: B2B SaaS, provedores digitais, plataformas SaaS

  • Ícone de instantâneo de conteúdo 3

    Propósito principal:

    Minimizar o tempo de inatividade e proteger a confiança do cliente

  • Ícone de instantâneo de conteúdo 4

    Conceitos relacionados: Acordo de Nível de Serviço (SLA), Redundância, Retenção de Clientes, Análise da Causa Raiz (RCA)

  • Instantâneo de conteúdo ícone 5

    Estágio de crescimento:

    Escalabilidade, pós-PMF, prontidão empresarial

Etapa 1

Estabelecer um Plano Abrangente de Resposta a Incidentes

o plano de resposta a incidentes é uma parte fundamental da estratégia de gestão de tempo e deve ser atualizado e editado minuciosamente com o progresso do sistema e de quaisquer incidentes anteriores.  

 

  • Definindo Funções e Responsabilidades: Atribua papéis claros aos membros da sua equipe, como o Comandante de Incidentes (a pessoa responsável por direcionar a resposta), o Líder Técnico (a pessoa responsável pela resolução de problemas e pela solução) e o Líder de Comunicação (a pessoa responsável pela comunicação com os clientes). Isso contribui para o estabelecimento de parâmetros específicos e pode reduzir a ambiguidade em caso de emergência.

 

Exemplo: 

 

Função Responsabilidades
Comandante de Incidentes Coordenar a resposta, tomar decisões, alocar recursos, comunicar com os interessados.
Líder Técnico Solucionar e resolver problemas técnicos, escalar conforme necessário.
Líder de Comunicação Gerenciar comunicações internas e externas, atualizar a página de status, redigir notificações aos clientes e responder a consultas.
Líder de Suporte ao Cliente Lidar com dúvidas e reclamações de clientes, fornecer atualizações e escalar problemas para os membros da equipe apropriados.
Especialista no Assunto Fornecer conhecimento especializado e experiência em áreas específicas da aplicação ou infraestrutura.

 

Delinear Procedimentos de Escalonamento. Criar uma rota de escalonamento clara para garantir que os problemas sejam resolvidos adequadamente e em tempo hábil pelas pessoas certas. Compreender quando escalar um incidente para gerentes de nível superior ou equipes de suporte externas.

 

Criar Modelos de Comunicação. Considere a criação de modelos para várias situações envolvendo incidentes (por exemplo, degradação do serviço, interrupção parcial, interrupção total). Esses modelos devem incluir detalhes relevantes, como os serviços afetados, o tempo estimado para resolver o problema e as medidas corretivas que estão sendo tomadas. Certifique-se de adaptar esses modelos adequadamente para diferentes públicos, como clientes, partes interessadas da empresa ou empresas parceiras.

Lista de Verificação GRATUITA para Respostas a Indisponibilidade de SaaS

Responda rapidamente a interrupções de SaaS com esta lista de verificação de resposta e recuperação de incidentes.

  • Marca de verificação

    Verificações de prontidão pré-incidente para monitoramento, redundância e failover.

  • Marca de verificação

    Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar.

  • Marca de verificação

    Análise da causa raiz e lista de ações corretivas pós-incidente.

  • Marca de verificação

    Preencher campos para registrar a gravidade, o tempo de inatividade e os clientes afetados

Obtenha sua lista de verificação GRATUITA
Etapa 2

Configurar Monitoramento em Tempo Real e Alerta

A primeira defesa contra o tempo de inatividade é monitoramento preventivo. Tal monitoramento pode facilitar a detecção oportuna de problemas, potencialmente influenciando sua progressão para interrupções completas. 

Ao a escolha de um kit de ferramentas, é necessário levar em consideração a infraestrutura técnica em que você está operando e também as aplicações que estão sendo desenvolvidas. Considere ambas as categorias, como monitoramento de infraestrutura (servidores, bancos de dados, rede) e monitoramento de desempenho de aplicações (APM).

 

Defina valores limite para métricas importantes como tempo de resposta, taxas de erro, uso da CPU e uso de memória. Além disso, crie alertas para notificar sua equipe sempre que esses limites forem excedidos. É melhor enviar alertas por e-mail, SMS ou Slack, de acordo com as preferências da equipe.

Observação

Tal prática é popular entre empresas SaaS, muitas das quais usam Datadog para detectar e resolver incidentes rapidamente.

Lista de Verificação GRATUITA para Respostas a Indisponibilidade de SaaS

Responda rapidamente a interrupções de SaaS com esta lista de verificação de resposta e recuperação de incidentes.

  • Marca de verificação

    Verificações de prontidão pré-incidente para monitoramento, redundância e failover.

  • Marca de verificação

    Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar.

  • Marca de verificação

    Análise da causa raiz e lista de ações corretivas pós-incidente.

  • Marca de verificação

    Preencher campos para registrar a gravidade, o tempo de inatividade e os clientes afetados

Obtenha sua lista de verificação GRATUITA
Etapa 3

Implementar Mecanismos de Redundância e Failover

Redundância SaaS refere-se a ter múltiplas instâncias de aplicações, servidores, etc., na sua infraestrutura em caso de falha de um. Esta abordagem está relacionada a uma diminuição no tempo de restauração do serviço.

 

  • Para melhorar o desempenho e a confiabilidade da sua infraestrutura, você pode considerar implementar algumas redundâncias chave. Uma dessas abordagens é empregar dois ou mais servidores web e localizá-los em áreas diferentes, usando redundância geográfica. O sistema permite a distribuição de carga, o que se relaciona com a operação contínua do website, apesar de um servidor se tornar inoperante. 
  • Outra opção é replicar suas bases de dados em vários servidores ou zonas de disponibilidade, utilizando replicação de bases de dados. Esta funcionalidade foi concebida para suportar a proteção de dados e capacidades de acesso. 
  • Se estiver usando um infraestrutura de nuvem, existem várias funcionalidades de redundância incorporadas das quais pode tirar partido, como várias zonas de disponibilidade ou regiões.

Lista de Verificação GRATUITA para Respostas a Indisponibilidade de SaaS

Responda rapidamente a interrupções de SaaS com esta lista de verificação de resposta e recuperação de incidentes.

  • Marca de verificação

    Verificações de prontidão pré-incidente para monitoramento, redundância e failover.

  • Marca de verificação

    Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar.

  • Marca de verificação

    Análise da causa raiz e lista de ações corretivas pós-incidente.

  • Marca de verificação

    Preencher campos para registrar a gravidade, o tempo de inatividade e os clientes afetados

Obtenha sua lista de verificação GRATUITA
Etapa 4

Reconhecer a Indisponibilidade

Transparência é muito importante durante um incidente de indisponibilidade. A pronta notificação pública após a detecção de uma interrupção relaciona-se com o reconhecimento do problema e o início dos processos de resolução. Tal comunicação pode influenciar o desenvolvimento da confiança e o ajuste das expectativas. 

 

Escolha os canais de comunicação:

  • Inclua na sua página de status informações sobre a interrupção, os serviços afetados, o tempo estimado para resolver o problema e quaisquer soluções alternativas conhecidas.
  • Utilize plataformas de redes sociais como Twitter e LinkedIn para aumentar sua audiência e fornecer uma breve visão geral da situação.  
  • Envie um e-mail às pessoas afetadas para fornecer uma explicação detalhada e as informações mais recentes.

 

Seja honesto e transparente. É importante avaliar o escopo do problema com precisão e assumir compromissos que possam ser cumpridos. Apresente informações aos clientes sobre a origem da paralisação. Documente as ações atualmente em andamento para resolver a questão.

 

Forneça um cronograma. Estime o tempo que levará para resolver o problema (ETR) e inclua um intervalo, por mais geral que seja. Em seguida, atualize o ETR novamente com as informações mais recentes. Criar expectativas sem justificativa suficiente pode levar a respostas emocionais adversas.

 

Modelo:

 

“Estamos enfrentando uma interrupção que afeta [service/feature]. Nossa equipe está trabalhando ativamente em uma resolução e forneceremos atualizações a cada [time interval, e.g., 30 minutes] até que o problema seja resolvido. Pedimos desculpas por qualquer inconveniente que isso possa causar e agradecemos a sua paciência.”

 

Lista de Verificação GRATUITA para Respostas a Indisponibilidade de SaaS

Responda rapidamente a interrupções de SaaS com esta lista de verificação de resposta e recuperação de incidentes.

  • Marca de verificação

    Verificações de prontidão pré-incidente para monitoramento, redundância e failover.

  • Marca de verificação

    Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar.

  • Marca de verificação

    Análise da causa raiz e lista de ações corretivas pós-incidente.

  • Marca de verificação

    Preencher campos para registrar a gravidade, o tempo de inatividade e os clientes afetados

Obtenha sua lista de verificação GRATUITA
Etapa 5

Fornecer Atualizações Regulares

Uma coisa importante a considerar é manter os seus clientes informados do status da resolução do incidente. É também necessário fornecer uma estimativa do tempo necessário para completar a resolução e indicar a razão para a inatividade de forma simples.

Lista de Verificação GRATUITA para Respostas a Indisponibilidade de SaaS

Responda rapidamente a interrupções de SaaS com esta lista de verificação de resposta e recuperação de incidentes.

  • Marca de verificação

    Verificações de prontidão pré-incidente para monitoramento, redundância e failover.

  • Marca de verificação

    Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar.

  • Marca de verificação

    Análise da causa raiz e lista de ações corretivas pós-incidente.

  • Marca de verificação

    Preencher campos para registrar a gravidade, o tempo de inatividade e os clientes afetados

Obtenha sua lista de verificação GRATUITA
Etapa 6

Ofereça Desculpas e Compensação

Peça Desculpas e comunicar a justificativa para a prorrogação do prazo e as circunstâncias que ela apresentou. A prática é não fornecer justificativas nem atribuir responsabilidade a outras partes. 

Ofereça créditos de serviço ou um desconto aos clientes com base na extensão da interrupção, sua duração e sua gravidade. Considere oferecer outros benefícios, como testes gratuitos ou acesso a recursos premium com desconto. Considere as circunstâncias dos clientes e a compensação de forma apropriada.

Lista de Verificação GRATUITA para Respostas a Indisponibilidade de SaaS

Responda rapidamente a interrupções de SaaS com esta lista de verificação de resposta e recuperação de incidentes.

  • Marca de verificação

    Verificações de prontidão pré-incidente para monitoramento, redundância e failover.

  • Marca de verificação

    Uma sequência de resposta passo a passo: reconhecer, atualizar, resolver, compensar.

  • Marca de verificação

    Análise da causa raiz e lista de ações corretivas pós-incidente.

  • Marca de verificação

    Preencher campos para registrar a gravidade, o tempo de inatividade e os clientes afetados

Obtenha sua lista de verificação GRATUITA
Etapa 7

Analisar, Aprender e Melhorar

A ocorrência de um problema de produto ou serviço pode levar a uma revisão do processo associado e da sua eficiência. Ao analisar o incidente e identificar a causa raiz, e depois aplicar esses conhecimentos para evitar situações semelhantes no futuro, é fundamental para tirar o máximo proveito deste tipo de análise. 

 

Uma minuciosa Análise da Causa Raiz (RCA) envolve a criação de uma linha do tempo dos principais eventos, explicando o impacto do evento, identificando a causa raiz e sugerindo medidas corretivas. Este processo está associado à identificação de problemas básicos e à seleção de soluções.  

 

Iniciar coletando logs, métricas e outros dados relevantes das suas ferramentas de monitoramento, servidores e aplicações. Converse com as pessoas que estiveram envolvidas no processo de resolução do incidente e recolha os seus comentários e percepções.

 

Uma avaliação de feedback dos clientes e tickets de suporte a partir do momento de inacessibilidade do site é uma opção. Organize as informações fornecidas de acordo com a sequência cronológica dos eventos relacionados à interrupção.

Use as informações para criar um(a) linha do tempo de eventos. Use os dados para identificar padrões ou quaisquer atividades incomuns que possam ajudar a encontrar a causa raiz.

Dica

Não tire conclusões imediatamente. Considere todas as razões possíveis para a interrupção, seja ela técnica, humana, mecânica ou externa.

Documente suas descobertas. Preparar um relatório detalhado de RCA que inclua:

  • Cronograma de eventos
  • Avaliação de impacto
  • Causa(s) raiz
  • Fatores contribuintes
  • Ações corretivas recomendadas

 

Modelo:

 

Relatório de Análise da Causa Raiz

Incidente: [Indisponibilidade de Serviço/Recurso]

Data: [Data da Indisponibilidade]

Cronograma de Eventos:

  • [Evento 1]
  • [Evento 2]
  • [Evento 3]
  • …

Avaliação de Impacto:

  • [Número de clientes afetados]
  • [Impacto financeiro]
  • [Outros impactos relevantes]

Causa(s) Raiz:

  • [Causa raiz 1]
  • [Causa raiz 2]
  • …

Fatores Contribuintes:

  • [Fator 1]
  • [Fator 2]
  • …

Ações Corretivas Recomendadas:

  • [Ação 1]
  • [Ação 2]
  • …

 

Implementar Medidas Corretivas. De acordo com os resultados da sua RCA, tome medidas para evitar futuras indisponibilidades. Isso pode incluir a aplicação de patches para bugs de software, atualização de configurações, adição de mais monitoramento e alarmes, ou o fornecimento de mais treinamento para sua equipe.

 

Comunicar Lições Aprendidas. Inclua os achados da sua RCA em suas ações corretivas e ações com sua equipe e clientes. Isso pode ser percebido como um indicador de dedicação ao desenvolvimento e pode afetar os níveis de confiança. 

  • Internamente: Apresente o relatório da RCA à sua equipe e discuta os principais pontos. A presença de comunicação aberta e feedback está relacionada a condições que apoiam o aprimoramento iterativo. Circule informações sobre as melhores práticas e aprendizados de incidentes para prevenir ocorrências semelhantes.
  • Externamente: Adicione uma seção à sua página de status ou blog para compartilhar os principais pontos da RCA. É importante explicar o motivo da interrupção ao público e mantê-los informados sobre a resolução. Ganhe algum crédito pela paciência dos seus clientes ao reconhecê-la.

 

Para mais informações sobre o tempo de inatividade do SaaS e como lidar com ele, você pode consultar estes recursos: Como escrever um SLA.

Conclusão

Gestão de indisponibilidade durante o tempo em que uma aplicação SaaS está ativa é um processo constante que precisa ser proativo, rápido e que nunca termina. A implementação de monitoramento, backup,, planos de resposta a incidentes,e comunicação e métodos pode influenciar os efeitos da indisponibilidade e os níveis de confiança do cliente. 

Instâncias de inatividade de aplicativos SaaS podem proporcionar informações para avaliação e ajuste do sistema, o que pode afetar a estabilidade e confiabilidade da aplicação.

Pronto para começar?

Nós já estivemos onde você está. Vamos compartilhar nossos 19 anos de experiência e tornar seus sonhos globais realidade.

Imagem em mosaico

Perguntas frequentes

pt_PTPortuguês