Services d'archivage de données : un guide pratique
Les services d’archivage de données déplacent les données de recherche du stockage actif vers un stockage à long terme géré de manière indépendante avec des contrôles d’intégrité, des identifiants persistants et des politiques de conservation documentées, couvrant environ quatre catégories : référentiels institutionnels, archives spécifiques à un domaine, niveaux de cloud commerciaux et systèmes auto-hébergés. Le modèle de référence OAIS (ISO 14721) définit les rôles fonctionnels d’une archive, et il est important de choisir avec soin car une trajectoire de dynamique moléculaire ou une sortie de pipeline HDF5 qui ne peut pas être relue dans cinq ans est effectivement perdue.
- L’archivage des données n’est pas une sauvegarde : les sauvegardes restaurent un système fonctionnel, les archives préservent un artefact fixe et citable pendant des années ou des décennies.
- Les critères déterminants pour les services d’archivage de données sont la garantie de conservation, la vérification de la fixité, les identifiants persistants, les normes de métadonnées et la stratégie de sortie – et non le prix brut du stockage.
- Les archives de domaine (PDB, GenBank, Zenodo, Dryad) vous offrent une création gratuite de DOI et des métadonnées communautaires ; Les niveaux froids de cloud à usage général vous offrent une évolutivité mais vous laissent la gestion de la curation.
- Les principes FAIR et le modèle de référence OAIS sont les deux cadres auxquels se réfèrent la plupart des bailleurs de fonds et des référentiels.
- Testez la restauration avant de la valider : une archive que vous n’avez jamais relue est une supposition, pas une garantie.
Qu’est-ce que l’archivage de données et en quoi diffère-t-il de la sauvegarde ?
L’archivage des données consiste à placer une copie finalisée et immuable d’un ensemble de données dans un magasin géré dont le travail est la préservation plutôt que la disponibilité. Une sauvegarde existe afin que vous puissiez récupérer après une suppression, une corruption ou une panne matérielle ; elle est généralement versionnée, fréquemment écrasé et se trouve à proximité du système de travail. Une archive existe pour qu’une version spécifique d’un ensemble de données spécifique reste lisible et citable une fois le projet, l’étudiant et éventuellement le laboratoire passés à autre chose.
Pour les informaticiens, cette distinction a du poids. Une trajectoire GROMACS de 2 To définie sur une matrice RAID de laboratoire est sauvegardée si rsync la copie la nuit sur un deuxième serveur.
Elle est archivée uniquement lorsqu’une copie gelée se trouve dans un système avec une conservation documentée, des sommes de contrôle et un identifiant persistant tel qu’un DOI. Le premier vous protège contre la mort d’un disque cette semaine ; la seconde protège un lecteur de 2029 qui souhaite reproduire votre article de 2024.
Les quatre catégories de services d’archivage de données
Les services d’archivage de données se répartissent en quatre groupes pratiques, et la plupart des groupes de recherche finissent par en utiliser deux ou trois pour différentes classes de données.
Référentiels institutionnels. Les universités et les laboratoires nationaux gèrent généralement des référentiels basés sur DSpace, Dataverse ou Figshare. Le stockage est généralement gratuit pour les chercheurs affiliés, les métadonnées sont conservées par les bibliothécaires et les DOI sont créés. Les limites de taille de fichier et le quota total varient considérablement, alors vérifiez avant de planifier un dépôt de plusieurs téraoctets.
Connexes : — Parcours de science des données basés sur des projets avec un terminal guidé et des ensembles de données réels.
Archives spécifiques au domaine. Les disciplines ayant une forte culture des données maintiennent leurs propres archives : la Protein Data Bank et GenBank en biologie structurale et génomique, le Materials Project et NOMAD en science des matériaux, Zenodo et Dryad comme options inter-domaines à usage général, et les archives NASA/PDS ou ESA pour les données d’observation des planètes et de la Terre. Ces archives apportent des schémas de métadonnées communautaires, une validation lors de l’ingestion et de longs engagements institutionnels.
Niveaux d’archives cloud commerciaux. Les classes de stockage AWS S3 Glacier et Glacier Deep Archive, Azure Archive Storage et Google Cloud Archive offrent des coûts de stockage par téraoctet très faibles avec une latence de récupération mesurée en minutes ou en heures et des frais de récupération qui peuvent dominer la facture. Ils sont excellents pour les grands ensembles de données brutes que vous touchez rarement, et médiocres en tant qu’archive unique car ils ne fournissent aucune conservation, aucun DOI et aucune politique de préservation.
Systèmes d’archivage de données auto-hébergés. Certains groupes exécutent leurs propres configurations iRODS, Archivematica ou simples magasin d’objets plus manifeste. Cela donne un contrôle total et peut être la seule option pour les données sensibles ou dont l’exportation est contrôlée, mais cela rend votre équipe responsable de la migration des médias, de la migration des formats et du problème de continuité institutionnelle : qui fait fonctionner le serveur après la fin de la subvention ?
Ça vaut le coup d'oeil : — Un abonnement pour les certificats Python et de science des données soutenus par l'université.
Critères de choix d’un service d’archivage de données
La comparaison ci-dessous reflète les questions qui déterminent réellement si les services d’archivage de données survivent au contact avec un bailleur de fonds, un évaluateur ou un futur lecteur.
| Critère | Que demander | Pourquoi c’est important |
|---|---|---|
| Garantie de conservation | Existe-t-il une politique de rétention publiée et qui la finance ? | Les revendications « pour toujours » sans dotation ni mandat sont ambitieuses |
| Vérification de la fixité | Les sommes de contrôle sont-elles vérifiées lors de l’ingestion et selon un calendrier ? | La pourriture silencieuse est le mode de défaillance que vous ne pouvez pas voir |
| Identifiants persistants | Est-ce qu’il crée des DOI ou équivalent ? | Les citations et la conformité des bailleurs de fonds dépendent de liens stables |
| Norme de métadonnées | Accepte-t-il ou nécessite-t-il des schémas de domaine ? | Découvrabilité et lisibilité machine |
| Politique de format | Recommande-t-il ou exige-t-il des formats ouverts ? | Les formats binaires propriétaires vieillissent mal |
| Contrôle d’accès | Pouvez-vous imposer un embargo, restreindre ou définir une licence ? | Les données sur les sujets humains et les données exclusives en ont besoin |
| Stratégie de sortie | Pouvez-vous exporter en masse l’enregistrement complet avec les métadonnées ? | Empêche le verrouillage |
| Modèle de coût | Frais d’ingestion, de stockage, de récupération, de sortie et de suppression | La récupération et la sortie éclipsent souvent le stockage |
Une discipline utile consiste à évaluer les archives des candidats par rapport à cette liste avant de déposer quoi que ce soit et à enregistrer la décision dans votre plan de gestion des données. Les bailleurs de fonds exigent de plus en plus exactement ce raisonnement.
Stockage et archivage des données : là où se situe la frontière
Le stockage et l’archivage des données sont souvent confondus car tous deux impliquent des disques, mais la limite opérationnelle est le point auquel un ensemble de données cesse de changer. Le stockage actif contient les données que vous lisez et écrivez ; le stockage de proximité contient les données auxquelles vous accédez occasionnellement ; le stockage d’archives contient des données que vous avez l’intention de conserver mais que vous touchez rarement. Une disposition à trois niveaux – scratch rapide, stockage de projet, archivage – s’adapte clairement à cela et évite l’échec courant lié au traitement d’un lecteur réseau partagé comme une archive.
Les choix de stockage des données d’archives interagissent également avec les formats de fichiers. Les formats compressés NumPy .npz, HDF5, NetCDF, Parquet et texte brut restent lisibles avec des outils ouverts dans un avenir prévisible.
Les fichiers de point de contrôle provenant d’une version spécifique du code de simulation, les formats d’instruments propriétaires et les dumps binaires non documentés sont ceux qui nécessitent soit une conversion, soit un lecteur intégré. Une règle de base : si vous ne parvenez pas à ouvrir le fichier avec un outil existant en dehors de votre laboratoire, convertissez-le avant de l’archiver.
Comment archiver un ensemble de données : un workflow reproductible
Un flux de travail d’archivage de données qui résiste à l’examen comporte six étapes.
- Gelez l’ensemble de données. Définissez exactement quels fichiers constituent l’artefact archivé, y compris les entrées, la version du code, la spécification de l’environnement et les sorties. Enregistrez un manifeste avec les tailles et les sommes de contrôle.
- Document. Rédigez un README couvrant la provenance, les versions du logiciel, les unités et les limitations connues. Il s’agit de l’heure la plus rentable que vous passerez.
- Choisissez l’archive. Faites correspondre la classe de données aux services d’archivage de données : lectures de séquençage brut dans une archive de séquence, structures dans la PDB, tout le reste dans un référentiel institutionnel ou général et copies froides en masse vers un niveau d’archive cloud.
- Déposez et validez. Téléchargez, laissez l’archive effectuer ses vérifications et confirmez que les sommes de contrôle correspondent à votre manifeste.
- Imprimez et enregistrez l’ID. Mettez le DOI dans le papier, le cahier de laboratoire et votre plan de gestion des données.
- Test de récupération. Téléchargez un échantillon, vérifiez les sommes de contrôle et ouvrez les fichiers dans un environnement propre. Faites-le une fois, au moment du dépôt, et non dans cinq ans.
Les étapes 1 et 6 sont celles qui sont le plus souvent ignorées et qui permettent de détecter les problèmes réels.
Meilleures pratiques et modes de défaillance courants
Les meilleures pratiques en matière d’archivage de données concernent moins la technologie que les habitudes. Versionnez explicitement vos ensembles de données plutôt que de les écraser, afin qu’un DOI pointe vers un artefact fixe.
Conservez la copie d’archive en lecture seule. Stockez le manifeste et le README avec les données, pas dans un wiki séparé. Préférez les formats ouverts et documentez ceux qui ne le sont pas. Et séparez la question « où sont les données ? de “comment les récupérer ?” — c’est la deuxième question qui compte.
Les modes de défaillance courants sont prévisibles. Le traitement d’un dossier cloud synchronisé comme une archive échoue car la synchronisation propage les suppressions. S’appuyer sur un seul niveau commercial échoue lorsque les frais de récupération rendent la récupération peu pratique. Le dépôt sans métadonnées échoue car les données deviennent introuvables. Et en supposant que la continuité institutionnelle échoue lorsqu’un laboratoire ferme et que personne ne sait quel serveur détenait la seule copie. Chacun de ces problèmes est peu coûteux à prévenir au moment du dépôt et coûteux à réparer ultérieurement. Lorsque vous sélectionnez des services d’archivage de données, gardez ces risques à l’esprit.
Normes et cadres à connaître
Deux cadres reviennent à plusieurs reprises dans la documentation des bailleurs de fonds et des référentiels pour les services d’archivage de données. Le modèle de référence OAIS (ISO 14721) définit les rôles fonctionnels d’une archive (ingestion, stockage d’archives, gestion des données, accès et planification de la préservation) et constitue le vocabulaire utilisé par la plupart des logiciels de référentiel. Les principes FAIR (Findable, Accessible, Interoperable, Réutilisable) décrivent ce qu’un ensemble de données bien archivé devrait offrir au lecteur et sont référencés par de nombreux bailleurs de fonds et revues. La Research Data Alliance et la Digital Preservation Coalition publient des conseils pratiques sur la conservation, la migration des formats et la certification ; CoreTrustSeal est une certification qui signale qu’un référentiel répond aux critères de préservation de base. Vérifier si une archive de candidats possède la certification CoreTrustSeal ou un équivalent est un moyen rapide de filtrer les options.
Sources et lectures complémentaires
- Archivage des données de recherche — Wikipédia : L’archivage des données de recherche est le stockage à long terme des données de recherche scientifique, y compris les sciences naturelles, les sciences sociales et les sciences de la vie. Les différents universitaires…
Questions fréquemment posées
Qu’est-ce que l’archivage de données en termes simples ?
L’archivage des données consiste à placer une copie finalisée et inchangée d’un ensemble de données dans un magasin géré à long terme afin qu’il reste lisible et citable pendant des années. Cela diffère de la sauvegarde, qui existe pour restaurer un système fonctionnel après une panne. Une archive est une question de préservation et de provenance ; une sauvegarde concerne la récupération.
Les services gratuits d’archivage de données sont-ils suffisants pour les données de recherche ?
Les services d’archivage de données gratuits tels que les référentiels institutionnels, Zenodo et Domain Archives sont souvent parfaits pour les données de recherche, car ils ajoutent gratuitement la conservation, les DOI et les métadonnées de la communauté. Leurs limites sont généralement la taille des fichiers, le quota total et la politique de format plutôt que la qualité. Pour les ensembles de données brutes de plusieurs téraoctets, une archive gratuite devra peut-être être combinée avec un niveau de stockage froid payant.
Combien de temps les données de recherche doivent-elles être archivées ?
Les exigences de conservation varient selon le bailleur de fonds, la revue et l’institution, et vont généralement de quelques années après la fin du projet à une décennie ou plus pour certains types de données. Plutôt que de deviner, vérifiez la politique en matière de données de votre bailleur de fonds et le calendrier de conservation des documents de votre institution, et enregistrez la période de conservation requise dans votre plan de gestion des données.
Quelle est la différence entre l’archivage et le stockage de données ?
Le stockage de données est la capacité générale à conserver des données, qu’elles soient actives, quasi-en ligne ou archivées. L’archivage des données est la pratique spécifique consistant à préserver un ensemble fixe de données avec des contrôles d’intégrité, des métadonnées et un engagement de conservation. Le stockage est une ressource ; l’archivage est un processus assorti de garanties.
Puis-je archiver des données dans le cloud ?
Les niveaux d’archives cloud tels que S3 Glacier, Azure Archive Storage et la classe de stockage Google Cloud Archive sont viables pour les grands ensembles de données rarement consultés. Ils offrent une durabilité et un faible coût de stockage, mais pas de curation, pas de DOI et des frais de récupération ou de sortie qui peuvent être substantiels. La plupart des groupes de recherche les utilisent comme copie en masse aux côtés d’un référentiel organisé (curated) qui contient le dossier citable.
Comment choisir une entreprise ou un fournisseur d’archivage de données ?
Partez du tableau de critères ci-dessus : politique de rétention, vérification de la fixité, identifiants persistants, prise en charge des métadonnées, contrôle d’accès, stratégie de sortie et modèle de coût complet, y compris la récupération. Faites ensuite correspondre le fournisseur à votre classe de données : archives de domaine pour les données spécifiques à une discipline, référentiels institutionnels pour les résultats de recherche généraux et niveaux commerciaux pour les copies froides en masse. Testez la récupération avant de valider.
Questions fréquentes
Qu’est-ce que l’archivage de données en termes simples ?
L'archivage des données consiste à placer une copie finalisée et inchangée d'un ensemble de données dans un magasin géré à long terme afin qu'il reste lisible et citable pendant des années. Cela diffère de la sauvegarde, qui existe pour restaurer un système fonctionnel après une panne. Une archive est une question de préservation et de provenance ; une sauvegarde concerne la récupération.
Les services gratuits d’archivage de données sont-ils suffisants pour les données de recherche ?
Les services d'archivage de données gratuits tels que les référentiels institutionnels, Zenodo et Domain Archives sont souvent parfaits pour les données de recherche, car ils ajoutent gratuitement la conservation, les DOI et les métadonnées de la communauté. Leurs limites sont généralement la taille des fichiers, le quota total et la politique de format plutôt que la qualité. Pour les ensembles de données brutes de plusieurs téraoctets, une archive gratuite devra peut-être être combinée avec un niveau de stockage froid payant.
Combien de temps les données de recherche doivent-elles être archivées ?
Les exigences de conservation varient selon le bailleur de fonds, la revue et l'institution, et vont généralement de quelques années après la fin du projet à une décennie ou plus pour certains types de données. Plutôt que de deviner, vérifiez la politique en matière de données de votre bailleur de fonds et le calendrier des enregistrements de votre institution, et enregistrez la période de conservation requise dans votre plan de gestion des données.
Quelle est la différence entre l'archivage et le stockage de données ?
Le stockage de données est la capacité générale à conserver des données, qu'elles soient actives, quasi-en ligne ou archivées. L'archivage des données est la pratique spécifique consistant à préserver un ensemble fixe de données avec des contrôles d'intégrité, des métadonnées et un engagement de conservation. Le stockage est une ressource ; l'archivage est un processus assorti de garanties.
Puis-je archiver des données dans le cloud ?
Les niveaux d'archives cloud tels que S3 Glacier, Azure Archive Storage et la classe de stockage Google Cloud Archive sont viables pour les grands ensembles de données rarement consultés. Ils offrent une durabilité et un faible coût de stockage, mais pas de curation, pas de DOI et des frais de récupération ou de sortie qui peuvent être substantiels. La plupart des groupes de recherche les utilisent comme copie en masse aux côtés d'un référentiel organisé qui contient le dossier citable.
Comment choisir une entreprise ou un fournisseur d’archivage de données ?
Partez du tableau de critères ci-dessus : politique de rétention, vérification de la fixité, identifiants persistants, prise en charge des métadonnées, contrôle d'accès, stratégie de sortie et modèle de coût complet, y compris la récupération. Faites ensuite correspondre le fournisseur à votre classe de données : archives de domaine pour les données spécifiques à une discipline, référentiels institutionnels pour les résultats de recherche généraux et niveaux commerciaux pour les copies froides en masse. Testez la récupération avant de valider.
Apprenez Python en codant dans votre navigateur
Cours interactifs Python et science des données que vous codez directement dans le navigateur