VMware ESXi com VMDK corrompido ou datastore inacessível paralisa todas as VMs hospedadas naquele storage — frequentemente dezenas de máquinas de uma vez. Além disso, as mensagens de erro do vSphere — “cannot open the disk”, “file not found”, “failed to lock the file” — são genéricas o suficiente para confundir até administradores experientes sobre a causa real. Por isso, identificar corretamente o tipo de falha antes de qualquer ação é o que determina se as VMs voltam ou se os dados são perdidos.

Como o VMware ESXi armazena dados no VMFS

Para entender as causas de falha, é essencial entender como o ESXi organiza os dados. O VMware File System (VMFS) é o sistema de arquivos de cluster que o ESXi usa em datastores compartilhados. Além disso, cada VM ocupa um diretório no datastore com vários arquivos:

Arquivo .vmx: configuração da VM — CPU, memória, discos conectados, rede. Quando corrompe, a VM some do inventário do vSphere mas o VMDK permanece no datastore.

Arquivo .vmdk (descritor): cabeçalho que descreve o disco virtual — tamanho, formato, cadeia de snapshots. Além disso, é o arquivo menor do par — tipicamente alguns kilobytes. Quando corrompe, o ESXi não consegue montar o disco mesmo que o arquivo de dados esteja íntegro.

Arquivo -flat.vmdk (dados): onde os dados reais da VM vivem — o equivalente a um disco físico em formato virtual. Portanto, mesmo quando o descritor corrompe, os dados existem nesse arquivo e a recuperação forense os acessa diretamente.

Arquivos -delta.vmdk (snapshots): cada snapshot cria um arquivo delta que registra as mudanças desde o ponto anterior. Além disso, a consolidação desses arquivos em estado de corrupção é uma das causas mais comuns de perda de dados em VMware.

As causas mais comuns de VMDK corrompido e datastore inacessível

Queda de energia durante operação de escrita: o ESXi mantém metadados do VMFS em cache. Quando a energia cai sem UPS ou com UPS insuficiente, esses metadados ficam inconsistentes. Portanto, o datastore pode aparecer como inacessível no próximo boot do ESXi.

Falha de disco no storage subjacente: quando um disco do RAID subjacente falha enquanto o ESXi está escrevendo no datastore, os blocos que estavam sendo escritos ficam corrompidos. Além disso, se esses blocos fazem parte do VMFS ou do descritor de um VMDK, o datastore pode ficar inacessível mesmo com os discos restantes íntegros.

Snapshot consolidation failed: o processo de consolidação de snapshots faz merge dos arquivos delta no VMDK base. Quando esse processo falha no meio — por falta de espaço, timeout ou interrupção — a cadeia de snapshots fica em estado inconsistente. Por isso, o erro “snapshot consolidation failed” frequentemente resulta em VM que não inicia mesmo com os discos físicos íntegros.

Conexão de rede interrompida em datastores NFS/iSCSI: datastores conectados via rede — NFS ou iSCSI — ficam inacessíveis quando a conexão de rede cai enquanto o ESXi está escrevendo. Além disso, o ESXi tenta reconectar automaticamente, mas VMs em execução no momento da queda podem ter arquivos VMDK parcialmente escritos.

O que nunca fazer quando o VMDK corrompe

Não force snapshot consolidation quando o datastore está com erro: o botão “Consolidate” no vSphere tenta resolver automaticamente cadeias de snapshots inconsistentes. Contudo, quando o datastore tem erros subjacentes, a consolidação forçada pode sobrescrever dados válidos com zeros. Por isso, esse é o erro mais destrutivo e mais comum em ambientes VMware.

Não delete os arquivos de snapshot manualmente: arquivos -delta.vmdk deletados manualmente deixam a cadeia de snapshots quebrada sem possibilidade de reconstrução automática. Além disso, os dados que estavam nesses deltas são perdidos permanentemente.

Não registre uma nova VM apontando para o VMDK antigo sem avaliar a cadeia: criar uma nova VM e apontar para o VMDK existente sem entender o estado dos snapshots pode fazer o ESXi sobrescrever o delta mais recente. Portanto, avalie a cadeia completa antes de qualquer registro.

Não reinstale o ESXi no mesmo storage: a reinstalação do ESXi cria um novo VMFS no mesmo dispositivo, sobrescrevendo os metadados que o especialista usaria para remontar o datastore original.

Como a Crowdertech recupera VMDKs e datastores VMware

Imagem forense dos discos: a Crowdertech clona cada disco do storage subjacente antes de qualquer outra ação. Dessa forma, o ambiente original fica protegido durante toda a análise.

Reconstrução do VMFS: quando os metadados do VMFS estão corrompidos, a Crowdertech os reconstrói usando os backups automáticos que o próprio VMFS mantém nos primeiros blocos de cada dispositivo. Portanto, datastores que o ESXi não monta voltam a ser acessíveis sem formatar o storage.

Reconstrução da cadeia de snapshots: a Crowdertech mapeia todos os arquivos -delta.vmdk do datastore e reconstrói a cadeia na ordem correta. Além disso, quando algum delta está corrompido, a recuperação extrai os dados dos deltas íntegros anteriores e posteriores ao ponto corrompido.

Extração direta do -flat.vmdk: quando o descritor .vmdk corrompe mas o arquivo de dados está íntegro, a Crowdertech reconstrói o descritor manualmente e monta o disco virtual. Portanto, a VM volta com todos os dados sem necessidade de reinstalação do guest.

Perguntas frequentes

VMware ESXi com “cannot open the disk” — significa perda de dados? Não. Esse erro geralmente indica descritor .vmdk corrompido ou caminho quebrado para um arquivo de snapshot. A Crowdertech reconstrói o descritor e remonta o disco sem perda de dados.

Datastore inacessível após falha de rede iSCSI — o que fazer? Não tente reconectar o iSCSI antes de verificar o estado dos VMDKs. Além disso, acione especialistas antes de qualquer operação de storage para evitar sobrescrita de dados ainda recuperáveis.

VMware com “snapshot consolidation failed” repetindo — como resolver sem perder dados? Não force a consolidação pelo vSphere. A Crowdertech realiza a consolidação sobre imagens forenses, fora do ambiente de produção, sem risco para os dados originais.

Quanto tempo leva a recuperação de VMware com VMDK corrompido? Para casos de descritor corrompido ou cadeia de snapshots quebrada: 24 a 48 horas. Para datastores com VMFS inacessível: 48 a 72 horas dependendo do volume de VMs.

Conclusão

VMware ESXi com VMDK corrompido ou datastore inacessível tem alta taxa de recuperação — desde que a equipe evite as ações destrutivas antes do diagnóstico especializado. Além disso, a Crowdertech atende esse cenário de forma 100% remota, sem necessidade de deslocar o servidor. Em resumo, não force consolidação, não delete snapshots e acione especialistas. A Crowdertech recupera VMware ESXi de forma 100% remota — (11) 99630-0675. Veja também recuperação de máquina virtual e recuperação de banco de dados.

Fontes: VMware KB · NIST SP 800-86.