Guias

Como encontrar ficheiros duplicados de forma fiável

Dois ficheiros podem ter o mesmo nome e conteúdo diferente, ou nomes diferentes e conteúdo idêntico. Eis como encontrar duplicados reais de forma fiável, por tamanho e por impressão, em vez de adivinhar pelo nome.


Sabe que há ficheiros duplicados a comer o seu espaço, mas encontrá-los à mão é uma causa perdida. O instinto é ordenar uma pasta por nome e procurar repetições. É aí mesmo que a maioria das caças aos duplicados corre mal, porque um nome de ficheiro não diz quase nada sobre o que está lá dentro.

O nome engana nos dois sentidos

Quando copia um ficheiro, o seu sistema renomeia-o: foto (1).jpg, foto cópia.jpg, foto-final-v2.jpg. O conteúdo é idêntico, mas os nomes diferem todos, por isso ordenar por nome passa ao lado. Ao contrário também acontece. Dois ficheiros sem qualquer relação podem chamar-se ambos scan.pdf ou IMG_0042.jpg. Confie no nome e vai assinalar ficheiros que não têm nada em comum.

O tamanho é um filtro, não uma resposta

Comparar tamanhos é um bom primeiro passo. Se dois ficheiros diferem num só byte, não são idênticos: pode saltar a comparação. Mas um tamanho igual não prova nada por si só. Muitos ficheiros diferentes pesam o mesmo, sobretudo os pequenos. O tamanho serve para reduzir depressa o monte, para que a verificação real só corra sobre candidatos que possam mesmo coincidir.

A impressão decide

A única forma fiável de saber que dois ficheiros são iguais é olhar para o seu conteúdo. Uma boa ferramenta lê os bytes e calcula deles uma impressão curta. Mesmo conteúdo dá a mesma impressão, sempre, chame-se o ficheiro como se chamar. Conteúdo diferente dá uma impressão diferente: nada é emparelhado por erro. É isto que separa uma cópia verdadeira de um ficheiro que apenas se parece, e a diferença vale a pena: veja duplicado exato contra ficheiro semelhante.

Fazê-lo num NAS

Num NAS vale a mesma lógica, mas os ficheiros estão por trás de uma pasta de rede. O NAS Ranger liga-se pelo protocolo padrão SMB, filtra primeiro por tamanho, depois confirma por impressão, sobre pastas inteiras de uma vez. Obtém uma lista limpa de verdadeiros grupos de duplicados com o espaço exato que cada um libertaria, e decide o que sai.

Experimente grátis: aponte-o ao seu NAS, deixe-o encontrar cada duplicado real por conteúdo, e veja o que pode recuperar antes de tocar em nada.

FAQ

Porque não posso ordenar por nome para encontrar duplicados?
Porque o nome engana nos dois sentidos. Uma cópia é muitas vezes renomeada para foto (1).jpg ou foto-final.jpg: ficheiros idênticos ficam com nomes diferentes. E dois documentos totalmente diferentes podem partilhar um nome como scan.pdf. Ordenar por nome perde o primeiro caso e assinala por erro o segundo.
Comparar o tamanho dos ficheiros chega?
O tamanho é um bom primeiro filtro, não um veredito. Muitos ficheiros diferentes partilham por acaso o mesmo número de bytes, e um só píxel alterado dá a duas fotos quase idênticas tamanhos diferentes. O tamanho estreita depressa, e depois uma verificação de conteúdo confirma.
O que significa na prática 'encontrar por conteúdo'?
A ferramenta lê os bytes de cada ficheiro e calcula deles uma impressão curta. Dois ficheiros com a mesma impressão têm o mesmo conteúdo, chamem-se como se chamarem. É o único método ao mesmo tempo certo e rápido em grande escala.
Isto funciona para ficheiros num NAS?
Sim. O NAS Ranger liga-se ao seu NAS pelo protocolo padrão SMB e aplica o mesmo método de tamanho e depois impressão a pastas inteiras: encontra duplicados através da rede, não só no seu disco local.