Uma alteração na tabela de roteamento de um provedor de nuvem isolou temporariamente dois nós de um cluster de armazenamento distribuído. O evento expôs uma falha sutil na implementação do protocolo de eleição de líder que resultou em gravações conflitantes.
A sequência de eventos e a perda de quórum
O problema teve início quando pacotes UDP de sinalização começaram a ser descartados arbitrariamente na interface primária de rede. O nó seguidor interpretou o atraso como inatividade do líder e iniciou uma nova rodada de votação antes do tempo limite configurado.
Como o nó principal anterior continuou recebendo requisições de escrita por uma rota secundária, ambos os nós processaram operações simultâneas sem o devido consentimento do quórum de maioria.
Medidas corretivas e reconfiguração de temporizadores
A resolução definitiva exigiu a reconfiguração dos temporizadores de reconexão e a implementação de validação estrita baseada em relógios monotônicos para invalidar concessões expiradas.
Ambientes de produção críticos exigem testes de caos contínuos que simulem partições de rede de forma assimétrica para validar a robustez de sistemas de tolerância a falhas.
