Aller au contenu principal
ActivePapers Stockez vos données sous forme de documents recalculables : tout résultat publié peut ainsi être relancé, vérifié et préservé.

Certains liens de ce site sont des liens d'affiliation : si vous effectuez un achat via ceux-ci, nous pouvons percevoir une commission sans frais supplémentaires pour vous. Cela n'influence jamais nos recommandations. Consultez notre divulgation d'affiliation pour plus de détails. Divulgation d'affiliation.

Meilleur logiciel d'archivage de données : meilleurs choix comparés

Les logiciels d’archivage de données couvrent quatre catégories distinctes : les outils de sauvegarde, la gestion hiérarchique du stockage (HSM), les référentiels de données de recherche et les plates-formes d’archivage d’entreprise, chacune résolvant un problème différent. Le bon choix dépend de si vous avez besoin d’une récupération ponctuelle, d’une préservation au niveau des bits à long terme ou d’une conservation réglementaire. Les critères décisifs pour les groupes de recherche sont l’ouverture du format, la vérification de la somme de contrôle, la capture des métadonnées et le coût à partir de 10 To – et non la reconnaissance de la marque.

  • L’archivage et la sauvegarde résolvent différents problèmes : la sauvegarde restaure un état récent après une panne ; l’archivage conserve une version spécifique et inchangée pendant des années ou des décennies.
  • Pour les groupes de recherche, les critères décisifs sont l’ouverture du format, la vérification de la somme de contrôle, la capture des métadonnées et le coût à partir de 10 To – et non la reconnaissance de la marque.
  • Les outils logiciels open source (BagIt, DVC, iRODS, Archivematica, restic, Borg) couvrent la plupart des besoins d’archivage scientifique sans frais de licence, mais nécessitent un effort opérationnel.
  • Les plates-formes d’entreprise (IBM, Dell EMC, Veritas, Commvault) ajoutent des moteurs de stratégie, une conservation légale et des rapports de conformité dont les laboratoires ont rarement besoin.
  • Le module d’archivage de SAP (SAP ArchiveLink / Data Archiving, qui fait désormais partie de SAP Information Lifecycle Management) est un mécanisme de déchargement de base de données, et non une archive de fichiers à usage général.
  • Testez la restauration avant de faire confiance à une archive ; une archive non vérifiée est une hypothèse, pas une garantie.

Qu’est-ce qu’un logiciel de sauvegarde de données ?

Le logiciel de sauvegarde des données crée une copie récupérable de l’état actuel ou récent d’un système afin qu’une panne (mort du disque, ransomware, suppression accidentelle) puisse être annulée. Les outils de sauvegarde optimisent le temps et le point de récupération : la rapidité avec laquelle vous pouvez restaurer et la quantité de données que vous pouvez vous permettre de perdre.

Des produits comme Veeam, Bacula, restic et BorgBackup correspondent à cette définition. Les sauvegardes sont généralement cycliques : les mêmes données sont copiées à plusieurs reprises, les anciennes copies expirant selon un calendrier de conservation.

La distinction est importante car la sauvegarde et l’archivage ont des aspects économiques opposés. Le stockage de sauvegarde est coûteux par octet car il doit prendre en charge des lectures aléatoires rapides et des réécritures fréquentes.

Le stockage d’archives est bon marché par octet car il est écrit une seule fois et lu rarement : bande, stockage d’objets avec niveaux froids ou support optique. Une sauvegarde qui dure dix ans n’est pas une archive ; il s’agit d’une sauvegarde avec une longue fenêtre de conservation et héritera de toutes les corruptions silencieuses accumulées par le système source.

Pour les informaticiens, l’implication pratique est qu’une « rsync » nocturne sur un NAS de laboratoire constitue une sauvegarde et non un archivage. Si un fichier d’entrée de simulation a été corrompu silencieusement il y a trois ans et que chaque sauvegarde ultérieure a copié la version corrompue, aucune génération de sauvegarde ne vous sauvera. Une archive avec des sommes de contrôle par fichier et une sémantique d’écriture unique le fera.

Connexes : — Cours interactifs Python et science des données que vous codez directement dans le navigateur.

Qu’est-ce que l’archivage des données ?

L’archivage des données consiste à déplacer les données qui ne sont plus activement utilisées vers un stockage distinct à long terme où elles sont conservées intactes et peuvent être récupérées ultérieurement. Les propriétés déterminantes sont l’immuabilité (l’objet archivé ne change pas), la vérification de l’intégrité (sommes de contrôle ou contrôles de fixité) et la politique de conservation (combien de temps et ce qui déclenche la suppression). L’archivage est une décision liée au cycle de vie : les données passent du stockage à chaud, au stockage au chaud, au stockage à froid, et enfin à l’élimination ou à la conservation permanente.

Des normes et conventions ancrent ce travail. Le modèle de référence Open Archival Information System (OAIS), publié sous le nom ISO 14721, définit les entités fonctionnelles (ingest, stockage d’archives, gestion des données, accès) que toute archive sérieuse implémente.

La spécification BagIt (RFC 8493) définit une structure de répertoires simple et auto-descriptive pour transférer des fichiers arbitraires avec des manifestes et des sommes de contrôle. Les principes FAIR (Findable, Accessible, Interoperable, Réutilisables) régissent la manière dont les archives de recherche doivent exposer les métadonnées. Les outils qui mettent en œuvre ces normes interagissent ; les outils qui inventent leur propre format de conteneur créent du verrouillage.

Coup de cœur des lecteurs : — Parcours de science des données basés sur des projets avec un terminal guidé et des ensembles de données réels.

Trois modèles d’archivage dominent la pratique scientifique :

  1. Archive au niveau fichier : une arborescence de répertoires avec des manifestes et des sommes de contrôle, stockés sur bande ou sur stockage d’objets. BagIt et tar + sha256sum sont les versions minimales.
  2. Repository Archive — un service géré (Zenodo, Dryad, référentiels institutionnels, Dataverse) qui attribue des DOI, applique les schémas de métadonnées et gère la conservation.
  3. Application Archive : données exportées à partir d’un système actif sous une forme en lecture seule, telle que l’archivage de données SAP ou le niveau de stockage froid d’une base de données.

Chaque modèle a un mode de défaillance différent. Les archives au niveau des fichiers échouent en raison de la pourriture des bits et de la perte de documentation. Les archives du référentiel échouent en raison de changements de politique et de pertes de financement. Les archives d’application échouent en raison de modifications de format du fournisseur.

Qu’est-ce que l’archivage des données dans SAP ?

L’archivage des données dans SAP implique la suppression des documents commerciaux terminés et des données de base de la base de données active pour archiver les fichiers, tout en les gardant lisibles à partir des transactions SAP. Le mécanisme est délivré par SAP Data Archiving (transaction SARA et objets d’archivage associés) et SAP ArchiveLink, qui relie les documents archivés aux applications qui les affichent. Dans les versions SAP actuelles, cette fonctionnalité se trouve sous SAP Information Lifecycle Management (ILM), qui ajoute des règles de conservation, une conservation légale et une gestion de la destruction.

La motivation est la performance et le coût. Une base de données de production SAP ERP ou S/4HANA qui accumule des années de bons de commande, de documents matériels et de journaux de modifications se développe jusqu’à ce que les requêtes et les sauvegardes ralentissent.

L’archivage écrit ces enregistrements dans des fichiers d’archives – historiquement sur des supports optiques ou sur bande, désormais souvent sur des référentiels de contenu ou sur un stockage d’objets cloud – et les supprime de la base de données. Les enregistrements restent accessibles via les mêmes transactions, les utilisateurs ne voient donc aucune différence fonctionnelle.

L’archivage SAP est donc une archive spécialisée couplée à une application, et non une archive générale de fichiers. Cela vaut la peine d’être compris même en dehors des boutiques SAP, car cela illustre le modèle général : archiver en déplaçant les enregistrements froids hors du magasin transactionnel, maintenir un pointeur et un lecteur et appliquer la conservation de manière centralisée. Si votre groupe utilise SAP pour les achats ou les RH parallèlement à votre informatique de recherche, les deux stratégies d’archivage doivent partager la politique de stockage mais pas les outils.

Connexes : — Une bibliothèque technique approfondie de livres, de vidéos et de formations en informatique scientifique.

Tableau comparatif : outils d’archivage par cas d’utilisation

OutilCatégorieLicenceIdéal pourAttention à
BagIt (Bibliothèque du Congrès)Emballage au niveau du fichierDomaine public / open sourceEnsembles de données d’emballage pour dépôt ou bandeAucune interface utilisateur de stockage ou de récupération intégrée
ArchivematicaPipeline de préservation numériqueSource ouverte (AGPL)Bibliothèques, archives, conformité OAIS à long termePile lourde (Docker, Elasticsearch); mise en œuvre complexe
iRODSGrille de données / archives basées sur des politiquesSource ouverte (BSD)Données de recherche multi-sites avec règles de métadonnéesNécessite un engagement de l’administrateur système
DVCContrôle de version des donnéesSource ouverte (Apache 2.0)Gestion des versions des ensembles de données avec le code GitIl ne s’agit pas d’un système de préservation ; le stockage distant est sous votre responsabilité
restic / BorgBackupSauvegarde avec déduplicationSource ouverte (BSD)Instantanés cryptés et dédupliquésSémantique de sauvegarde, pas d’archive de niveau de rétention
Zenodo / Dryad / DataverseRéférentielService hébergéPublication d’ensembles de données citables et soutenues par DOILimites de taille ; contraintes du schéma de métadonnées
Archives de stockage IBM/ILMArchives d’entrepriseCommercialeRétention réglementée, conservation légale, hiérarchisationCoût et complexité pour les petits laboratoires
Veritas Enterprise VaultArchives d’entrepriseCommercialeArchivage de conformité des emails et des fichiersModèle de licence ; frictions migratoires
CommvaultPlateforme de sauvegarde + archivageCommercialePolitique unifiée dans les grands domainesSurdimensionné pour moins de quelques centaines de To

Lors de la sélection d’un logiciel d’archivage de données, les utilisateurs choisissent souvent entre des produits commerciaux et des logiciels open source. Selon l’environnement, on peut rechercher des logiciels PC open source ou des logiciels spécifiques dans les communautés open source. Bien qu’IBM fournisse des outils d’entreprise, ils contribuent également aux initiatives logicielles open source d’IBM. Pour ceux qui explorent l’histoire du domaine, ils pourront se pencher sur les premiers exemples de logiciels open source qui ont ouvert la voie aux outils d’aujourd’hui.

Comment choisir : des critères qui comptent vraiment

Ouverture du format. Une archive qu’on ne pourra pas lire dans vingt ans est un handicap. Préférez les fichiers simples, les schémas documentés et les conteneurs standards (BagIt, tar, Parquet, HDF5 avec spécifications publiées) aux bundles propriétaires. HDF5 et NetCDF sont auto-descriptifs et largement pris en charge, c’est pourquoi ils dominent les résultats de simulation.

Vérification de l’intégrité. Exiger des sommes de contrôle au moment de l’écriture et des contrôles de fixité périodiques. Les manifestes « sha256 », le « manifeste-sha256.txt » de BagIt et les services de fixité côté référentiel sont tous éligibles. Sans vérification, la corruption silencieuse est indétectable jusqu’à ce que vous ayez besoin des données.

Ça vaut le coup d'oeil : — Un abonnement pour les certificats Python et de science des données soutenus par l'université.

Capture de métadonnées. Une archive sans provenance est une pile d’octets. Capturez la version du logiciel, les paramètres d’entrée, les graines aléatoires et l’environnement (résumé de l’image du conteneur ou fichier de verrouillage « conda ») à côté des données. C’est là que les archives de recherche diffèrent des archives informatiques.

Coût à grande échelle. La bande reste le support le moins cher par téraoctet pour les données froides ; Les niveaux froids du cloud (par exemple, les classes d’archives de stockage d’objets) échangent un coût par octet plus élevé pour une surcharge opérationnelle nulle. Modélisez votre coût à 10 To et 100 To, et non à 1 To.

Conservation et suppression. Décidez explicitement de ce qui sera supprimé et quand. Les demandes d’effacement de type RGPD et les mandats de rétention des bailleurs de fonds (souvent de 5 à 10 ans, parfois plus) s’appliquent tous deux aux données de recherche ; un moteur de politique aide.

Test de restauration. Planifiez un exercice de restauration. La restauration d’un échantillon aléatoire de fichiers et la vérification des sommes de contrôle sont la seule preuve que l’archive fonctionne.

Options open source et leur place

Les logiciels open source dominent l’archivage scientifique pour une bonne raison : la source est vérifiable, les formats sont documentés et il n’y a aucun coût par utilisateur. Le modèle open source lui-même a une longue histoire – le terme a été inventé en 1998, et la pratique du partage de code source est antérieure de plusieurs décennies, avec des premiers exemples comme le projet GNU (1983) et, avant cela, le partage de code académique et de l’ère ARPANET. Aujourd’hui, la pile logicielle open source commune d’un groupe de recherche comprend généralement Linux, Python, Git et un gestionnaire de packages, avec des outils d’archivage superposés.

Pour un laboratoire, une archive open source exploitable peut être : DVC ou Git LFS pour la gestion des versions des ensembles de données actifs, BagIt pour le packaging des ensembles de données gelés, restic ou BorgBackup pour les copies cryptées hors site et Zenodo pour la publication soutenue par DOI du sous-ensemble qui doit être citable. iRODS ou Archivematica entrent en jeu lorsque vous avez besoin d’une hiérarchisation basée sur des politiques ou d’une conformité OAIS formelle sur plusieurs sites. Notez que les « logiciels PC open source » pour l’archivage sont moins nombreux que pour les autres catégories : les outils d’archivage les plus matures sont d’abord côté serveur ou CLI, et les options d’interface graphique de bureau sont souvent des interfaces commerciales pour les moteurs open source.

Une mise en garde doit être clairement formulée : l’open source déplace le coût des licences vers la main d’œuvre. Un groupe sans ingénieur en génie logiciel de recherche devrait accorder plus d’importance aux référentiels hébergés, car une instance iRODS non entretenue est pire qu’un service payant.

Sources et lectures complémentaires

  • Archivage des données de recherche — Wikipédia : L’archivage des données de recherche est le stockage à long terme des données de recherche scientifique, y compris les sciences naturelles, les sciences sociales et les sciences de la vie. Les différents universitaires…
  • Logiciel open source — Wikipédia : Un logiciel open source (OSS) est un logiciel informatique dont le code source est accessible au public, permettant aux utilisateurs de l’utiliser, de l’étudier, de le modifier et de le distribuer — contrairement à…
  • Open source — Wikipédia : L’open source est la pratique consistant à publier publiquement des ressources numériques avec leur code source ou leurs fichiers sources, permettant leur utilisation, leur étude, leur modification et leur redistribution…
  • Logiciel d’étude — Wikipédia : Les logiciels d’étude font référence à des programmes informatiques conçus pour améliorer l’efficacité de l’apprentissage en améliorant la façon dont les étudiants interagissent avec, traitent et conservent les informations…

Questions fréquemment posées

Qu’est-ce qu’un logiciel de sauvegarde de données ?

Un logiciel de sauvegarde de données copie l’état actuel d’un système afin qu’il puisse être restauré après une panne, une corruption ou une suppression. Il optimise une récupération rapide et des fenêtres de conservation courtes, et réécrit généralement les mêmes données à plusieurs reprises. Les exemples incluent Veeam, Bacula, restic et BorgBackup. La sauvegarde est un mécanisme de récupération et non un mécanisme de préservation.

Qu’est-ce que l’archivage des données ?

L’archivage des données implique le déplacement des données inactives vers un magasin à long terme distinct où elles sont conservées immuables, dont l’intégrité est vérifiée et récupérables dans le cadre d’une politique de rétention. Les archives suivent des normes telles que OAIS (ISO 14721) et BagIt (RFC 8493) et privilégient la durabilité plutôt que la vitesse d’accès. Le but est de conserver une version spécifique et non de récupérer le dernier état.

Qu’est-ce que l’archivage des données dans SAP ?

L’archivage des données dans SAP déplace les documents commerciaux terminés de la base de données active vers des fichiers d’archives tout en les gardant lisibles via les transactions SAP. Il est mis en œuvre via SAP Data Archiving (transaction SARA), ArchiveLink et, dans les versions actuelles, SAP Information Lifecycle Management pour la rétention et le gel légal. L’objectif est la performance de la base de données et le contrôle des coûts, et non la préservation générale des fichiers.

Les logiciels d’archivage open source sont-ils suffisamment performants pour les données de recherche ?

Des outils open source tels que BagIt, Archivematica, iRODS, DVC, restic et BorgBackup sont utilisés en production par les bibliothèques, les archives et les groupes informatiques de recherche. Ils répondent aux normes de préservation et évitent les coûts de licence, mais nécessitent une expertise opérationnelle. Les groupes sans personnel système dédié combinent souvent des outils de packaging open source avec un référentiel hébergé pour le dépôt final.

En quoi l’archivage est-il différent de la sauvegarde ?

La sauvegarde restaure un état récent après un échec ; l’archivage conserve une version spécifique pendant des années ou des décennies. Le stockage de sauvegarde doit être rapide et est réécrit fréquemment ; Le stockage des archives est bon marché, en écriture unique et rarement lu. Une sauvegarde de longue durée n’est pas une archive car elle propage une corruption silencieuse plutôt que de geler une copie vérifiée.

À quelle fréquence dois-je vérifier une archive ?

La fréquence des vérifications dépend du support et de la tolérance au risque, mais une pratique courante consiste à exécuter des contrôles de fixité de manière planifiée (trimestrielle ou annuelle pour le stockage sur bande et sur objets) et toujours après la migration des supports. Chaque audit doit comparer les sommes de contrôle stockées avec celles recalculées et enregistrer les incohérences pour enquête. Des exercices de restauration doivent accompagner la vérification et non la remplacer.

Questions fréquentes

Qu'est-ce qu'un logiciel de sauvegarde de données ?

Un logiciel de sauvegarde de données copie l'état actuel d'un système afin qu'il puisse être restauré après une panne, une corruption ou une suppression. Il optimise une récupération rapide et des fenêtres de conservation courtes, et réécrit généralement les mêmes données à plusieurs reprises. Les exemples incluent Veeam, Bacula, restic et BorgBackup. La sauvegarde est un mécanisme de récupération et non un mécanisme de préservation.

Qu’est-ce que l’archivage des données ?

L'archivage des données implique le déplacement des données inactives vers un magasin à long terme distinct où elles sont conservées immuables, dont l'intégrité est vérifiée et récupérables dans le cadre d'une politique de rétention. Les archives suivent des normes telles que OAIS (ISO 14721) et BagIt (RFC 8493) et privilégient la durabilité plutôt que la vitesse d'accès. Le but est de conserver une version spécifique et non de récupérer le dernier état.

Qu’est-ce que l’archivage des données dans SAP ?

L'archivage des données dans SAP supprime les documents commerciaux terminés de la base de données en direct dans des fichiers d'archives tout en les gardant lisibles via les transactions SAP. Il est mis en œuvre via SAP Data Archiving (transaction SARA), ArchiveLink et, dans les versions actuelles, SAP Information Lifecycle Management pour la conservation et la conservation légale. L'objectif est la performance de la base de données et le contrôle des coûts, et non la préservation générale des fichiers.

Les logiciels d’archivage open source sont-ils suffisants pour les données de recherche ?

Des outils open source tels que BagIt, Archivematica, iRODS, DVC, restic et BorgBackup sont utilisés en production par les bibliothèques, les archives et les groupes informatiques de recherche. Ils répondent aux normes de préservation et évitent les coûts de licence, mais nécessitent une expertise opérationnelle. Les groupes sans personnel système dédié combinent souvent des outils de packaging open source avec un référentiel hébergé pour le dépôt final.

En quoi l’archivage est-il différent de la sauvegarde ?

La sauvegarde restaure un état récent après un échec ; l'archivage conserve une version spécifique pendant des années ou des décennies. Le stockage de sauvegarde doit être rapide et est réécrit fréquemment ; Le stockage des archives est bon marché, en écriture unique et rarement lu. Une sauvegarde de longue durée n'est pas une archive car elle propage une corruption silencieuse plutôt que de geler une copie vérifiée.

À quelle fréquence dois-je vérifier une archive ?

La fréquence des vérifications dépend du support et de la tolérance au risque, mais une pratique courante consiste à exécuter des contrôles de fixité sur une base planifiée (trimestrielle ou annuelle pour le stockage sur bande et sur objets) et toujours après la migration des supports. Chaque audit doit comparer les sommes de contrôle stockées avec celles recalculées et enregistrer les incohérences pour enquête. Des exercices de restauration doivent accompagner la vérification et non la remplacer.


Gagnez des certificats de vraies universités

Un abonnement pour les certificats Python et de science des données soutenus par l'université