Saltar al contenido principal
ActivePapers Almacena tus datos como documentos recomputables para que cualquier resultado publicado pueda ejecutarse de nuevo, verificarse y preservarse.

Algunos enlaces de este sitio son de afiliados: si compras a través de ellos, es posible que recibamos una comisión sin coste adicional para ti. Esto nunca afecta a nuestras recomendaciones. Consulta nuestra declaración de afiliados para más detalles. Divulgación de afiliados.

El mejor software de archivo de datos: mejores opciones comparadas

El software de archivo de datos abarca cuatro categorías distintas: herramientas de respaldo, administración de almacenamiento jerárquico (HSM), repositorios de datos de investigación y plataformas de archivo empresarial, cada una de las cuales resuelve un problema diferente. La elección correcta depende de si necesita recuperación en un momento dado, preservación a nivel de bits a largo plazo o retención regulatoria. Los criterios decisivos para los grupos de investigación son la apertura del formato, la verificación de la suma de comprobación (checksum), la captura de metadatos y el coste a partir de 10 TB, no el reconocimiento de la marca.

  • El archivado y la copia de seguridad resuelven problemas diferentes: la copia de seguridad restaura un estado reciente después de un fallo; el archivado mantiene una versión específica e inalterable durante años o décadas.
  • Para los grupos de investigación, los criterios decisivos son la apertura del formato, la verificación de la suma de comprobación, la captura de metadatos y el coste a partir de 10 TB, no el reconocimiento de la marca.
  • Las herramientas de software de código abierto (BagIt, DVC, iRODS, Archivematica, restic, Borg) cubren la mayoría de las necesidades de archivo científico sin cuotas de licencia, pero requieren un esfuerzo operativo.
  • Las plataformas empresariales (IBM, Dell EMC, Veritas, Commvault) añaden motores de políticas, retención legal e informes de cumplimiento que los laboratorios rara vez necesitan.
  • El módulo de archivo de SAP (SAP ArchiveLink / Archivo de datos, ahora parte de SAP Information Lifecycle Management) es un mecanismo de descarga de bases de datos, no un archivo de archivos de propósito general.
  • Pruebe la restauración antes de confiar en un archivo; un archivo no verificado es una hipótesis, no una garantía.

¿Qué es el software de copia de seguridad de datos?

El software de copia de seguridad de datos crea una copia recuperable del estado actual o reciente de un sistema para que un fallo (avería del disco, ransomware, eliminación accidental) pueda deshacerse. Las herramientas de respaldo optimizan el tiempo de recuperación y el punto de recuperación: qué tan rápido puede restaurar y cuántos datos puede permitirse perder.

Productos como Veeam, Bacula, restic y BorgBackup se ajustan a esta definición. Las copias de seguridad suelen ser cíclicas: los mismos datos se copian repetidamente, y las copias antiguas caducan según un cronograma de retención.

La distinción es importante porque la copia de seguridad y el archivado tienen aspectos económicos opuestos. El almacenamiento de respaldo es costoso por byte porque debe admitir lecturas aleatorias rápidas y reescrituras frecuentes.

El almacenamiento de archivo es económico por byte porque se escribe una vez y se lee con poca frecuencia: cinta, almacenamiento de objetos con niveles fríos o medios ópticos. Una copia de seguridad que dura diez años no es un archivo; es una copia de seguridad con una ventana de retención prolongada y heredará cada corrupción silenciosa acumulada por el sistema fuente.

Para los científicos computacionales, la implicación práctica es que un rsync nocturno a un NAS de laboratorio constituye una copia de seguridad, no un archivado. Si un archivo de entrada de simulación se corrompió silenciosamente hace tres años y cada copia de seguridad posterior copió la versión corrupta, ninguna generación de copia de seguridad lo salvará. Un archivo con sumas de comprobación por archivo y semántica de escritura única sí lo hará.

Relacionado: — Rutas de ciencia de datos basadas en proyectos con una terminal guiada y conjuntos de datos reales.

¿Qué es archivar datos?

Archivar datos significa mover datos que ya no se utilizan activamente a un almacenamiento separado a largo plazo donde se mantienen intactos y se pueden recuperar más adelante. Las propiedades determinantes son la inmutabilidad (el objeto archivado no cambia), la verificación de integridad (sumas de comprobación o comprobaciones de fijación) y la política de retención (por cuánto tiempo y qué desencadena la eliminación). El archivado es una decisión del ciclo de vida: los datos pasan del almacenamiento en caliente, al templado, al frío y, finalmente, a su eliminación o preservación permanente.

Los estándares y convenciones sustentan este trabajo. El modelo de referencia del Sistema Abierto de Información de Archivos (OAIS), publicado como ISO 14721, define las entidades funcionales (ingesta, almacenamiento de archivos, gestión de datos, acceso) que implementa cualquier archivo serio.

La especificación BagIt (RFC 8493) define una estructura de directorio simple y autodescriptiva para transferir archivos arbitrarios con manifiestos y sumas de comprobación. Los principios FAIR (Findable, Accessible, Interoperable, Reusable) rigen cómo los archivos de investigación deben exponer los metadatos. Las herramientas que implementan estos estándares interoperan; las herramientas que inventan su propio formato de contenedor crean un bloqueo del proveedor (lock-in).

Vale la pena echarle un vistazo: — Una suscripción para certificados de ciencia de datos y Python respaldados por la universidad.

Tres modelos de archivo dominan la práctica científica:

  1. Archivo a nivel de archivo: un árbol de directorios junto con manifiestos y sumas de comprobación, almacenados en cinta o en almacenamiento de objetos. BagIt y tar + sha256sum son las versiones mínimas.
  2. Archivo de repositorio: un servicio administrado (Zenodo, Dryad, repositorios institucionales, Dataverse) que asigna DOI, aplica esquemas de metadatos y gestiona la preservación.
  3. Archivo de aplicación: datos exportados desde un sistema activo en formato de solo lectura, como el archivado de datos de SAP o el nivel de almacenamiento en frío de una base de datos.

Cada modelo tiene un modo de fallo diferente. Los archivos a nivel de archivo fallan debido a la degradación de bits (bit rot) y la pérdida de documentación. Los archivos de repositorio fallan debido a cambios de políticas y pérdidas de financiación. Los archivos de aplicación fallan debido a cambios de formato del proveedor.

¿Qué es el archivado de datos en SAP?

El archivado de datos en SAP implica eliminar documentos comerciales completados y datos maestros de la base de datos activa hacia archivos de archivo, mientras se mantienen legibles desde las transacciones de SAP. El mecanismo lo proporcionan SAP Data Archiving (transacción SARA y objetos de archivo asociados) y SAP ArchiveLink, que vincula los documentos archivados con las aplicaciones que los muestran. En las versiones actuales de SAP, esta funcionalidad se encuentra bajo SAP Information Lifecycle Management (ILM), que añade reglas de retención, retención legal y gestión de destrucción.

La motivación es el rendimiento y el coste. Una base de datos de producción de SAP ERP o S/4HANA que acumula años de órdenes de compra, documentos de materiales y registros de cambios crece hasta que las consultas y las copias de seguridad se ralentizan.

El archivado escribe estos registros en archivos de archivo —históricamente en medios ópticos o cinta, ahora a menudo en repositorios de contenido o almacenamiento de objetos en la nube— y los elimina de la base de datos. Los registros siguen siendo accesibles a través de las mismas transacciones, por lo que los usuarios no ven ninguna diferencia funcional.

Por lo tanto, el archivado de SAP es un archivo especializado acoplado a una aplicación, y no un archivo de archivos general. Vale la pena entender esto incluso fuera de los entornos SAP, porque ilustra el patrón general: archivar moviendo los registros fríos fuera del almacén transaccional, mantener un puntero y un lector, y aplicar la retención de manera centralizada.

Relacionado: — Una amplia biblioteca técnica de libros, vídeos y formación en directo sobre informática científica..

Si su grupo utiliza SAP para adquisiciones o RR. HH. junto con su informática de investigación, las dos estrategias de archivado deben compartir la política de almacenamiento, pero no las herramientas.

Tabla comparativa: herramientas de archivo por caso de uso

HerramientaCategoríaLicenciaIdeal paraCuidado con
BagIt (Library of Congress)Empaquetado a nivel de archivoDominio público / código abiertoEmpaquetar conjuntos de datos para depósito o cintaSin interfaz de usuario integrada de almacenamiento o recuperación
ArchivematicaCanal de preservación digitalCódigo abierto (AGPL)Bibliotecas, archivos, cumplimiento de OAIS a largo plazoPila pesada (Docker, Elasticsearch); configuración compleja
iRODSCuadrícula de datos / archivo basado en políticasCódigo abierto (BSD)Datos de investigación multisitio con reglas de metadatosRequiere compromiso del administrador del sistema
DVCControl de versiones de datosCódigo abierto (Apache 2.0)Versionar conjuntos de datos junto con código GitNo es un sistema de preservación; el remoto es su responsabilidad
restic / BorgBackupCopia de seguridad con deduplicaciónCódigo abierto (BSD)Instantáneas cifradas y deduplicadasSemántica de copia de seguridad, no archivo de grado de retención
Zenodo / Dryad / DataverseRepositorioServicio alojadoPublicación de conjuntos de datos citables respaldados por DOILímites de tamaño; restricciones del esquema de metadatos
IBM Storage Archive / ILMArchivo empresarialComercialRetención regulada, retención legal, estratificaciónCoste y complejidad para laboratorios pequeños
Veritas Enterprise VaultArchivo empresarialComercialArchivado de cumplimiento de archivos y correos electrónicosModelo de licencia; fricción migratoria
CommvaultPlataforma de copia de seguridad + archivoComercialPolítica unificada en grandes infraestructurasExcesivo para menos de unos cientos de TB

Al seleccionar software de archivo de datos, los usuarios suelen elegir entre productos comerciales y software de código abierto. Dependiendo del entorno, uno podría buscar software de código abierto para PC o software específico en comunidades de código abierto.

Si bien IBM proporciona herramientas empresariales, también contribuye a las iniciativas de software de código abierto de IBM. Para quienes exploran la historia del campo, pueden investigar los primeros ejemplos de software de código abierto que allanaron el camino para las herramientas actuales.

Si estás de compras: — Cursos interactivos de Python y ciencia de datos que codifica directamente en el navegador.

Cómo elegir: criterios que realmente importan

Apertura del formato. Un archivo que no podrá leer en veinte años es un lastre. Prefiera archivos simples, esquemas documentados y contenedores estándar (BagIt, tar, Parquet, HDF5 con especificaciones publicadas) frente a paquetes propietarios. HDF5 y NetCDF son autodescriptivos y cuentan con un amplio soporte, razón por la cual dominan los resultados de simulación.

Comprobación de integridad. Exija sumas de comprobación al escribir y comprobaciones de fijación periódicas. Los manifiestos sha256, el manifest-sha256.txt de BagIt y los servicios de fijación del lado del repositorio son aptos. Sin verificación, la corrupción silenciosa es indetectable hasta que necesite los datos.

Captura de metadatos. Un archivo sin procedencia es una pila de bytes. Capture la versión del software, los parámetros de entrada, las semillas aleatorias y el entorno (resumen de imagen del contenedor o archivo de bloqueo de conda) junto con los datos. Aquí es donde los archivos de investigación difieren de los archivos de TI.

Coste a escala. La cinta sigue siendo el medio más barato por terabyte para datos fríos; los niveles fríos de la nube (por ejemplo, clases de archivo de almacenamiento de objetos) intercambian un coste más alto por byte por una sobrecarga operativa nula. Modele su coste a 10 TB y 100 TB, no a 1 TB.

Retención y eliminación. Decida explícitamente qué se eliminará y cuándo. Las solicitudes de borrado al estilo GDPR y los mandatos de retención de los financiadores (a menudo de 5 a 10 años, a veces más) se aplican a los datos de investigación; un motor de políticas ayuda.

Prueba de restauración. Programe un ejercicio de restauración. Restaurar una muestra aleatoria de archivos y verificar las sumas de comprobación es la única prueba de que el archivo está funcionando.

Opciones de código abierto y su lugar

El software de código abierto domina el archivado científico por una buena razón: la fuente es verificable, los formatos están documentados y no hay coste por licencia de usuario. El modelo de código abierto en sí tiene una larga historia: el término fue acuñado en 1998, y la práctica de compartir el código fuente es anterior en décadas, con ejemplos tempranos como el Proyecto GNU (1983) y, antes de eso, el intercambio de código académico y de la era ARPANET. Hoy en día, la pila de software de código abierto común de un grupo de investigación incluye normalmente Linux, Python, Git y un gestor de paquetes, con herramientas de archivado superpuestas.

Para un laboratorio, un archivo de código abierto viable podría ser: DVC o Git LFS para versionar conjuntos de datos activos, BagIt para empaquetar conjuntos de datos congelados, restic o BorgBackup para copias cifradas externas y Zenodo para la publicación respaldada por DOI del subconjunto que debe ser citable. iRODS o Archivematica entran en juego cuando necesita una estratificación basada en políticas o el cumplimiento formal de OAIS en varios sitios. Tenga en cuenta que el “software de código abierto para PC” para archivado es más limitado que en otras categorías: las herramientas de archivado más maduras son del lado del servidor o priorizan la CLI, y las opciones de GUI de escritorio suelen ser interfaces comerciales para motores de código abierto.

Una advertencia debe quedar clara: el código abierto traslada el coste de las licencias a la mano de obra. Un grupo sin un ingeniero de software de investigación debería dar más peso a los repositorios alojados, porque una instancia de iRODS sin mantenimiento es peor que un servicio de pago.

Fuentes y lecturas adicionales

  • Research data archiving — Wikipedia: El archivado de datos de investigación es el almacenamiento a largo plazo de datos de investigación académica, incluidas las ciencias naturales, las ciencias sociales y las ciencias de la vida. Los diversos académicos…
  • Open-source software — Wikipedia: El software de código abierto (OSS) es software informático cuyo código fuente está disponible públicamente, lo que permite a los usuarios usarlo, estudiarlo, modificarlo y distribuirlo, a diferencia de…
  • Open source — Wikipedia: El código abierto es la práctica de publicar recursos digitales públicamente junto con su código fuente o archivos fuente, permitiendo su uso, estudio, modificación y redistribución…
  • Study software — Wikipedia: El software de estudio se refiere a programas informáticos diseñados para mejorar la eficacia del aprendizaje mejorando la forma en que los estudiantes interactúan, procesan y retienen la información…

Preguntas frecuentes

¿Qué es el software de copia de seguridad de datos?

El software de copia de seguridad de datos copia el estado actual de un sistema para que pueda restaurarse después de un fallo, corrupción o eliminación. Se optimiza para una recuperación rápida y ventanas de retención cortas, y normalmente reescribe los mismos datos repetidamente. Los ejemplos incluyen Veeam, Bacula, restic y BorgBackup. La copia de seguridad es un mecanismo de recuperación y no un mecanismo de preservación.

¿Qué es archivar datos?

El archivado de datos implica mover datos inactivos a un almacén separado a largo plazo donde se mantienen inmutables, se verifica su integridad y se pueden recuperar bajo una política de retención. Los archivos siguen estándares como OAIS (ISO 14721) y BagIt (RFC 8493) y priorizan la durabilidad sobre la velocidad de acceso. El objetivo es preservar una versión específica y no recuperar el estado más reciente.

¿Qué es el archivado de datos en SAP?

El archivado de datos en SAP elimina los documentos comerciales finalizados de la base de datos en vivo y los guarda en archivos mientras los mantiene legibles a través de las transacciones de SAP. Se implementa a través de SAP Data Archiving (transacción SARA), ArchiveLink y, en las versiones actuales, SAP Information Lifecycle Management para retención y bloqueo legal. El objetivo es el rendimiento de la base de datos y el control de costos, no la preservación general de archivos.

¿El software de archivado de código abierto es lo suficientemente bueno para los datos de investigación?

Bibliotecas, archivos y grupos de investigación informática utilizan herramientas de código abierto como BagIt, Archivematica, iRODS, DVC, restic y BorgBackup en entornos de producción. Cumplen con los estándares de preservación y evitan costos de licencia, pero requieren experiencia operativa. Los grupos sin personal de sistemas dedicado a menudo combinan herramientas de empaquetado de código abierto con un repositorio alojado para el depósito final.

¿En qué se diferencia el archivado de la copia de seguridad?

La copia de seguridad restaura un estado reciente después de una falla; el archivado conserva una versión específica durante años o décadas. El almacenamiento de copias de seguridad debe ser rápido y reescribirse con frecuencia; El almacenamiento de archivado es económico, se escribe una sola vez y rara vez se lee. Una copia de seguridad de larga duración no es un archivo porque propaga una corrupción silenciosa en lugar de congelar una copia verificada.

¿Con qué frecuencia debo verificar un archivo?

La frecuencia de las comprobaciones depende del medio y de la tolerancia al riesgo, pero una práctica común es ejecutar controles de integridad de forma programada (trimestralmente o anualmente para el almacenamiento de cintas y objetos) y siempre después de la migración de los medios. Cada auditoría debe comparar las sumas de verificación almacenadas con las recalculadas y registrar las discrepancias para su investigación. Los simulacros de restauración deben acompañar a la verificación y no reemplazarla.

Preguntas frecuentes

¿Qué es el software de copia de seguridad de datos?

El software de copia de seguridad de datos copia el estado actual de un sistema para que pueda restaurarse después de una falla, corrupción o eliminación. Se optimiza para una recuperación rápida y períodos de retención cortos y, por lo general, reescribe los mismos datos repetidamente. Los ejemplos incluyen Veeam, Bacula, restic y BorgBackup. La copia de seguridad es un mecanismo de recuperación y no un mecanismo de preservación.

¿Qué es archivar datos?

El archivado de datos implica mover datos inactivos a un almacén separado a largo plazo donde se mantienen inmutables, se verifica su integridad y se pueden recuperar según una política de retención. Los archivos siguen estándares como OAIS (ISO 14721) y BagIt (RFC 8493) y priorizan la durabilidad sobre la velocidad de acceso. El objetivo es preservar una versión específica y no recuperar el estado más reciente.

¿Qué es el archivo de datos en SAP?

El archivado de datos en SAP elimina los documentos comerciales completos de la base de datos en vivo y los guarda en archivos mientras los mantiene legibles a través de las transacciones de SAP. Se implementa a través de SAP Data Archiving (transacción SARA), ArchiveLink y, en las versiones actuales, SAP Information Lifecycle Management para retención y retención legal. El objetivo es el rendimiento de la base de datos y el control de costos, no la preservación general de archivos.

¿Es el software de archivo de código abierto lo suficientemente bueno para los datos de investigación?

Bibliotecas, archivos y grupos de investigación informática utilizan herramientas de código abierto como BagIt, Archivematica, iRODS, DVC, restic y BorgBackup en la producción. Cumplen con los estándares de preservación y evitan costos de licencia, pero requieren experiencia operativa. Los grupos sin personal de sistemas dedicado a menudo combinan herramientas de empaquetado de código abierto con un repositorio alojado para el depósito final.

¿En qué se diferencia el archivado de la copia de seguridad?

La copia de seguridad restaura un estado reciente después de una falla; El archivo conserva una versión específica durante años o décadas. El almacenamiento de copias de seguridad debe ser rápido y reescribirse con frecuencia; El almacenamiento de archivos es económico, se escribe una sola vez y rara vez se lee. Una copia de seguridad de larga duración no es un archivo porque propaga una corrupción silenciosa en lugar de congelar una copia verificada.

¿Con qué frecuencia debo verificar un archivo?

La frecuencia de las comprobaciones depende del medio y de la tolerancia al riesgo, pero una práctica común es ejecutar comprobaciones de fijación de forma programada (trimestralmente o anualmente para el almacenamiento de cintas y objetos) y siempre después de la migración de los medios. Cada auditoría debe comparar las sumas de verificación almacenadas con las recalculadas y registrar las discrepancias para su investigación. Los simulacros de restauración deben acompañar a la verificación y no reemplazarla.


Aprenda Python codificando en su navegador

Cursos interactivos de Python y ciencia de datos que codifica directamente en el navegador