O RAID 5 rebuild falha com mais frequência do que os fabricantes de storage admitem — e o motivo é estatístico, não acidental. Assim que um disco do array para, o RAID 5 entra em modo degradado: continua funcionando, mas cada leitura recalcula os dados a partir da paridade dos discos restantes. Trocar o disco defeituoso dispara o rebuild, que precisa ler 100% dos setores de todos os discos sobreviventes para reconstruir o disco novo. É exatamente nessa janela que o segundo disco falha — e o array cai por completo.

Por que o RAID 5 rebuild falha tanto em discos grandes

Quanto maior o disco, mais tempo o rebuild leva e maior a janela de risco. Em discos de 8 TB ou mais, uma reconstrução pode levar de 10 a 30 horas dependendo da controladora e da carga do servidor em produção. Durante esse período inteiro, o array opera sem nenhuma tolerância a falhas — qualquer erro de leitura em qualquer disco restante interrompe o processo.

Em arrays com discos da mesma marca, modelo e lote, comprados e instalados juntos, o desgaste é praticamente idêntico. O rebuild impõe uma carga de leitura sequencial completa e sustentada — o tipo de estresse que expõe setores fracos que nunca receberam leitura em uso normal. Quando o segundo disco falha antes do rebuild terminar, o RAID 5 perde a paridade necessária para reconstruir qualquer coisa.

O fenômeno tem nome: URE — Uncorrectable Read Error. A especificação SATA para discos de uso geral admite 1 URE a cada 10^14 bits lidos. Em um array RAID 5 de quatro discos de 4 TB cada, a probabilidade de encontrar pelo menos um URE durante um rebuild completo passa de 50%. Essa probabilidade dobra a cada geração de discos maiores. Veja mais sobre como a estrutura física dos discos afeta a recuperação em recuperação de HD e SSD.

Sinais de que o rebuild está prestes a falhar:

  • Velocidade do rebuild cai abruptamente ou o progresso trava numa porcentagem fixa
  • A controladora reporta erros de leitura (URE) nos discos sobreviventes
  • Logs do sistema mostram timeouts ou realocação de setores durante o processo

O que fazer quando o RAID 5 cai no meio do rebuild

O primeiro impulso é tentar reiniciar o rebuild ou trocar mais um disco — e é exatamente isso que transforma um caso recuperável em perda definitiva. Cada nova tentativa de escrita na controladora sobrescreve metadados e mapas de paridade que ainda preservam parte dos dados originais.

O procedimento correto começa pela clonagem setor a setor de todos os discos do array antes de qualquer nova tentativa, isolando o processo do RAID original. A partir das imagens clonadas, é possível reconstruir a ordem e o offset do array, recalcular a paridade original e remontar o sistema de arquivos em ambiente controlado — sem depender da controladora que já demonstrou falha. Para entender como funciona esse processo, veja recuperação de RAID.

Se o banco de dados estava hospedado no array — SQL Server, MySQL, PostgreSQL ou Oracle — a recuperação forense acessa as páginas de dados diretamente nos discos, sem depender do volume montado. Veja como funciona a recuperação de banco de dados após falha de RAID.

A Crowdertech já atendeu dezenas de casos de RAID 5 degradado com falha no rebuild, incluindo arrays onde a controladora original havia queimado no meio do processo.

Perguntas frequentes

O RAID 5 rebuild falha sempre com dois discos do mesmo lote? Não sempre, mas a probabilidade é significativamente maior. Além disso, o rebuild de um RAID 5 degradado impõe o maior estresse de leitura que os discos sobreviventes já sofreram — expondo exatamente as fraquezas que o uso normal nunca revelou.

Posso usar o servidor normalmente durante o rebuild? Não é recomendado. A carga de produção competindo com o rebuild aumenta o tempo total e, consequentemente, a janela de risco para falha do segundo disco.

O rebuild travou em 38% há dois dias — o que fazer? Desligue a controladora e não tente reiniciar. Cada tentativa adicional pode sobrescrever paridade ainda recuperável. Acione especialistas antes de qualquer ação.

Conclusão

O RAID 5 rebuild falha com o segundo disco porque a janela de rebuild é o momento de maior estresse nos discos sobreviventes — e discos de mesmo lote têm desgaste idêntico. Além disso, cada tentativa de reiniciar o processo sem clonar os discos primeiro reduz irreversivelmente o que ainda é recuperável. Em resumo, pare, clone e acione especialistas. A Crowdertech recupera RAID 5 com falha no rebuild — (11) 99630-0675.

Fontes: NIST SP 800-34r1 · Backblaze Hard Drive Stats · CERT.br.