Preservação de dados não é só fazer backup
A maioria das pessoas confunde os dois conceitos na hora de colocar em prática. Fazer backup significa copiar arquivos de um lugar para outro. Preservação significa garantir que esses arquivos continuam legíveis e acessíveis daqui dez, vinte, trinta anos. São coisas relacionadas, mas completamente diferentes no que tange ao trabalho necessário.
o que é preservaçao no contexto digital
No fundo, preservação digital é o conjunto de técnicas que evitam que informações se tornem ilegíveis com o passar do tempo. Isso acontece por causa da degradação física dos suportes, da obsolescência de formatos e codecs, ou da simples descontinuidade de softwares capazes de abrir determinados arquivos. Eu já vi gente guardar terabytes em HDs internos de notebook e depois ficar chateada quando os drives morriam em três anos sem nenhum plano de migração. O problema é que isso é estrutural, não acidental. Midia magnética tem vida útil mesmo em condições ideais. SSDs perdem carga nas células de memória após alguns anos sem energia. Fitas LTO funcionam bem se você atualizar a biblioteca a cada geração, senão vira um jogo de roleta rusa toda vez que você tenta ler algo antigo.
Na prática, a preservação funciona assim. Você identifica quais ativos digitais são importantes, mapeia os formatos que estão usando, define intervalos de verificação com checksums e planeja a migração periódica para novos suportes e, quando necessário, novos formatos. Tudo documentado. Sem documentação, você perde o rastro do que foi feito e quando, e aí vira um caos na primeira emergência. Um exemplo concreto que eu tive recentemente envolveu arquivos de projetos em .fig e .sketch que uma equipe guardava em um NAS com RAID 5. Quando fui verificar a integridade dos dados depois de dezoito meses sem manutenção ativa, os checksums md5 de cerca de doze gigabytes tinham corrompido silenciosamente. O RAID não protege contra corrupção de dados, só contra falha de disco. A solução foi restaurar a partir de cópias em fita LTO-9 que estavam armazenadas fora do site, algo que demorou duas semanas de recuperação porque ninguém havia testado a leitura dos fitas anteriormente. Esse é o tipo de coisa que ninguém considera até acontecer.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Se você quer começar com algo prático e funcional, o caminho mais simples é: manter pelo menos três cópias dos dados, em dois formatos de mídia diferentes, com uma verificando integridade periodicamente. Ferramentas como rsync para espelhamento, bagit para empacotamento descritivo, e scripts automatizados de verificação SHA-256 resolvem a maior parte do problema para pequenos e médios acervos. O formato também merece atenção. Arquivos TIFF para imagens, PDF/A para documentos, WAV para áudio e MOV com códecs abertos como ProRes para vídeo são escolhas razoáveis porque têm especificações públicas e são amplamente suportados. Formatos proprietários ou com compressão lossy problemática, como JPEG de alta compressão ou certos formatos de editores específicos, tendem a criar dívida técnica que você paga depois.
Tem limitação importante aqui que precisa ser dita claramente. Preservação total de um acervo digital grande é caro e demorado. Não existe solução barata que resolva tudo. Se você tem mais de cinqüenta terabytes de dados variados, contratar um serviço especializado ou investir em infraestrutura própria de fita é praticamente obrigatório. Tentar improvisar com nuvem e HDs externos geralmente resulta em custos maiores e menos confiabilidade do que parece. Outro ponto que muitos negligenciam é a metadata. Sem metadados descritivos e técnicos bem estruturados, você pode preservar o arquivo mas não conseguir entender o que ele é, como foi gerado, ou qual versão é a correta. Metadados padrão como EXIF, XMP e Dublin Core cobrem a maioria dos casos sem complicação desnecessária.
Se o seu objetivo é preservação de conteúdo cultural ou institucional, o modelo OAIS (Open Archival Information System) é o framework mais consolidado, apesar de parecer burocrático numa primeira leitura. Ele define claramente os fluxos entre produtor, repositório e consumidor de informação, e evita que decisões importantes sejam tomadas de forma ad hoc. O básico para quem está começando agora é: pare de confiar que o disco vai durar para sempre, escolha formatos abertos quando possível, verifique integridade regularmente e documente tudo. O resto é escala e orçamento.