Meilleurs outils d'archivage de données comparés pour la recherche (2026)
L’archivage des données est la relocalisation, basée sur des politiques, de données inactives vers un niveau de stockage distinct et moins coûteux à des fins de conservation, de conformité ou de réutilisation à long terme. Une configuration d’archivage complète combine généralement quatre couches : un système de fichiers ou un magasin d’objets, un outil de somme de contrôle/vérification, un catalogue de métadonnées et une politique de rétention. Pour les informaticiens, cela signifie généralement des disques de travail à chaud hiérarchisés, un stockage de projet tiède et un stockage d’objets froids tels qu’une bande ou S3 Glacier.
Le stockage au niveau de la couche physique fonctionne en codant les bits comme un état mesurable (domaines magnétiques sur un plateau en rotation, charge piégée dans des cellules flash NAND ou géométrie de phase/puits sur un support optique), puis en lisant cet état via un contrôleur qui gère la correction d’erreurs. Un disque dur (HDD) écrit les données sur des pistes concentriques sur des plateaux rotatifs via une tête de lecture/écriture mobile ; un disque SSD (Solid State Drive) stocke la charge dans des transistors à grille flottante sans pièces mobiles, c’est pourquoi les SSD ont une latence plus faible mais une endurance d’écriture limitée. Les lecteurs de bande écrivent des pistes linéaires sur une bande magnétique et restent le support le moins cher par téraoctet pour les données froides.
Au-dessus de la couche physique se trouve la couche logique. Les systèmes de fichiers tels que ext4, XFS, ZFS et Lustre mappent les fichiers aux blocs et conservent les métadonnées (inodes, répertoires, autorisations).
Les magasins d’objets tels que Ceph RADOS, MinIO et Amazon S3 abandonnent l’arborescence de répertoires au profit d’espaces de noms plats où chaque objet possède une clé, un flux d’octets et des métadonnées arbitraires. Cette distinction est extrêmement importante pour l’archivage des données : le stockage d’objets s’adapte à des milliards d’objets et prend en charge les règles d’immuabilité et de cycle de vie de manière native, tandis que les systèmes de fichiers POSIX sont plus faciles à monter et à utiliser pour créer des scripts, mais se dégradent avec un très grand nombre de répertoires.
Lors de l’évaluation des solutions d’archivage de données à long terme, ces différences structurelles sont essentielles.
L’intégrité des données est la troisième couche. La pourriture silencieuse – une corruption non détectée due à une dégradation des supports, aux rayons cosmiques ou à des bugs du micrologiciel – est le véritable ennemi de l’archiviste.
Connexes : — Parcours de science des données basés sur des projets avec un terminal guidé et des ensembles de données réels.
Les sommes de contrôle (MD5, SHA-256, BLAKE3) calculées au moment de l’écriture et revérifiées lors de la lecture ou selon un calendrier le détectent. ZFS et Btrfs le font automatiquement avec des sommes de contrôle par bloc et une auto-réparation en cas de redondance ; sur un système ext4 classique, vous devez exécuter votre propre passe de vérification, par exemple avec « sha256sum -c » sur un manifeste, ou utiliser un outil comme « par2 » pour générer des blocs de récupération. Les services professionnels des sociétés d’archivage de données mettent souvent en œuvre ces contrôles pour garantir l’archivage des données à long terme.
Enfin, la redondance et la géographie déterminent la durabilité. RAID protège contre les pannes de disque unique, mais pas contre les pannes de contrôleur, les incendies ou les ransomwares. La règle 3-2-1 – trois copies, deux supports différents, un hors site – reste la base, et la variante 3-2-1-1-0 ajoute une copie hors ligne/immuable et zéro erreur lors de la vérification de la restauration. Les magasins d’objets cloud annoncent des chiffres de durabilité de l’ordre de « onze neuf » (99,999999999 %), mais ce nombre décrit la durabilité des objets stockés, et non la disponibilité du service ou la sécurité contre une suppression accidentelle par un utilisateur autorisé. Pour ceux qui recherchent des avis sur les sociétés d’archivage de données, il est important de voir comment les solutions des sociétés d’archivage de données gèrent ces compromis spécifiques en matière de durabilité et de disponibilité.
comment stocker les données
Les questions « Comment stocker les données » se transforment généralement en une décision pratique : où se trouve un ensemble de données donné à chaque étape de sa vie ? Un modèle de travail pour un groupe de simulation ressemble à ceci.
Ça vaut le coup d'oeil : — Un abonnement pour les certificats Python et de science des données soutenus par l'université.
Les exécutions actives écrivent dans le scratch NVMe local du nœud. Les analyses terminées sont déplacées vers un système de fichiers parallèle partagé (Lustre, GPFS ou un montage BeeGFS) pour analyse. Les ensembles de données publiés ou remplacés sont regroupés (souvent dans HDF5, NetCDF ou dans un fichier tar compressé avec un manifeste de somme de contrôle) et déplacés vers un niveau d’archive.
Les mécanismes de cette poussée finale comptent. Une étape typique d’archive en ligne de commande pour un ensemble de trajectoires de dynamique moléculaire pourrait être :
tar --use-compress-program="zstd -T0 -19" -cf run42.tar.zst run42/
sha256sum run42.tar.zst > run42.tar.zst.sha256
rclone copy run42.tar.zst distant:archive/run42/ --checksum
L’indicateur --checksum sur rclone force une comparaison de hachage plutôt que de se fier à la taille et au temps de modification, ce qui est essentiel lorsque la destination est le stockage d’objets. Pour la sortie HDF5, des outils comme « h5repack » avec compression gzip ou SZIP peuvent réduire considérablement les fichiers sans modifier l’API utilisée par votre code d’analyse.
La récupération est la partie sous-planifiée par les équipes. Les niveaux froids ont une latence : les archives sur bande peuvent prendre de quelques minutes à quelques heures pour préparer un fichier, et les classes d’archives dans le cloud telles que S3 Glacier Flexible Retrieval ou Deep Archive facturent une récupération accélérée et imposent des durées de stockage minimales. Un ensemble de données que vous ne pouvez pas récupérer dans les délais impartis est effectivement perdu. Testez une restauration sur un échantillon aléatoire chaque trimestre et notez combien de temps cela a pris.
qu’est-ce que l’archivage des données
L’archivage des données est la relocalisation délibérée et motivée par des politiques de données inactives des systèmes principaux vers un stockage secondaire optimisé pour le coût et la longévité plutôt que pour la vitesse. Son objectif diffère de celui de la sauvegarde : la sauvegarde existe pour restaurer un système après une panne ou une corruption et est généralement versionnée et à court terme, tandis que l’archivage existe pour préserver un ensemble spécifique de données pendant des années ou des décennies et est souvent immuable. Cela diffère également de la suppression : l’archivage est une décision de conservation et non une décision d’élimination, bien qu’une bonne politique définisse le moment où les données archivées sont finalement détruites.
Les définitions d’entreprise de fournisseurs tels que Snowflake et Datacore mettent l’accent sur les facteurs de conformité : des réglementations telles que HIPAA, GDPR, SEC Rule 17a-4 et 21 CFR Part 11 de la FDA exigent que certains enregistrements soient conservés, inchangés et récupérables pendant des périodes de temps définies. La recherche a ses propres moteurs. Les bailleurs de fonds, notamment la NSF, le NIH et la Commission européenne, exigent de plus en plus des plans de gestion des données précisant où les données seront archivées et pendant combien de temps, et les revues exigent que les données sous-jacentes à une publication soient disponibles. Pour un laboratoire, la définition pratique de l’archivage est la suivante : l’ensemble de données est écrit une seule fois, vérifié, catalogué avec suffisamment de métadonnées pour être interprétable sans l’auteur original et stocké dans un emplacement qui survit à l’obtention du diplôme du doctorant qui l’a créé.
stratégie d’archivage des données
Une stratégie d’archivage viable repose sur cinq décisions, et les mettre dans le bon ordre évite des années de souffrance.
1. Classer par valeur et obligation. Toutes les données ne méritent pas le même traitement. Les résultats bruts des instruments, les intermédiaires traités et les ensembles de données finaux publiés ont des exigences de conservation différentes. Un système de priorisation (par exemple conserver les données brutes pendant 10 ans, les données intermédiaires pendant 1 an et les résultats publiés indéfiniment) évite la prolifération des archives.
2. Choisissez le support et le fournisseur. Les options vont du stockage institutionnel (silos à bandes du centre HPC universitaire, souvent gratuits ou peu coûteux pour les chercheurs affiliés) aux classes d’archivage cloud commerciaux en passant par les sociétés d’archivage dédiées à long terme. Chacun a une courbe de coûts et un profil de verrouillage différents.
3. Définissez le format du package. Les formats auto-descriptifs battent les formats propriétaires. HDF5, NetCDF4, Parquet et le texte brut avec schéma survivent mieux qu’un blob binaire dont le lecteur a été compilé pour la dernière fois en 2014. Incluez un fichier README, un manifeste de somme de contrôle et une copie des scripts d’analyse.
4. Automatisez la vérification. Planifiez des audits périodiques de la somme de contrôle. Un ensemble de données qui n’a jamais été examiné est un ensemble de données dont vous ne savez pas qu’il existe encore.
5. Documentez le chemin de récupération. Notez, dans le plan de gestion des données et dans l’archive elle-même, exactement comment quelqu’un en 2035 récupère et ouvre ces données. Incluez les versions des outils.
qu’est-ce que l’archivage dans l’analyse des données
Archiver en analyse de données signifie figer un état analytique spécifique afin que les résultats puissent être reproduits. Cela inclut les données d’entrée, le code qui les a transformées, l’environnement (image du conteneur, fichier d’environnement conda ou requirements.txt avec les versions épinglées) et les sorties.
En pratique, c’est là qu’interviennent des outils comme DVC, Git LFS et les journaux de provenance Snakemake/Nextflow : ils vous permettent d’archiver les entrées et sorties d’un pipeline par hachage de contenu plutôt que par nom de fichier, de sorte qu’une réexécution reproduise les octets exacts ou échoue bruyamment. Pour un pipeline d’appel de variantes bioinformatiques, cela peut impliquer d’archiver le FASTA de référence, les fichiers BAM, le VCF, le résumé du conteneur et la définition du flux de travail ensemble dans un seul package versionné.
### bonnes pratiques en matière d’archivage de données
Bonnes pratiques pour l’archivage des données à long terme qui persistent dans toutes les disciplines :
- Vérifiez tout au moment de l’écriture et stockez les manifestes à côté des données, pas dans un système séparé qui peut dériver. - Utilisez des formats ouverts et auto-descriptifs avec des unités et des métadonnées intégrées ; évitez les formats liés à la licence d’un seul fournisseur.
- Suivez la règle 3-2-1-1-0 et conservez au moins une copie hors ligne ou immuable (verrouillage d’objet, bande WORM ou disque air-gapped) pour survivre aux ransomwares.
- Écrivez des métadonnées pour un inconnu. Supposons que la personne qui les lit ne vous a jamais rencontré et ne connaît pas vos conventions de dénomination.
- Attribuez des identifiants persistants. Un DOI via Zenodo, Dryad ou un référentiel institutionnel rend un ensemble de données citable et lui donne une page de destination stable.
- Testez les restaurations selon un calendrier et enregistrez les résultats ; une archive non testée est une hypothèse, pas une garantie.
- Prévoir la fin de la subvention. Les bailleurs de fonds cessent de payer ; décidez maintenant si les données sont transférées vers un stockage institutionnel ou supprimées.
quel stockage de données dure le plus longtemps
Aucun support numérique n’est éternel, et la réponse honnête est que la longévité vient de la migration, et non du support lui-même. Parmi les supports couramment utilisés, la bande magnétique (LTO) a une durée de vie archivistique souvent citée entre 15 et 30 ans sous un contrôle approprié de température et d’humidité, et elle reste la norme pour les archives nationales et les centres HPC.
Les supports optiques varient considérablement : les disques pressés et les DVD/Blu-ray d’archives de type M-DISC sont commercialisés pendant des décennies, tandis que les CD et DVD gravés ordinaires se dégradent au fil des ans. Les disques durs d’entreprise sont généralement conçus pour environ cinq ans de service continu, et les disques SSD ont des limites de rétention qui s’aggravent lorsqu’ils ne sont pas alimentés : la charge des cellules fuit au fil du temps, donc un SSD laissé dans un tiroir pendant des années constitue une mauvaise archive.
Le stockage d’objets dans le cloud est totalement indépendant du support et repose sur une migration continue en arrière-plan. C’est pourquoi les fournisseurs peuvent promettre une durabilité extrême sans promettre la survie d’un disque spécifique.
Ce qu’il faut retenir d’un point de vue pratique : lorsque vous évaluez des solutions d’archivage de données à long terme ou lisez les avis des sociétés d’archivage de données, choisissez un média avec un chemin de migration documenté et un fournisseur ou une institution déterminé à le rafraîchir, plutôt que de rechercher un lecteur « permanent ».
quel stockage de données
Les requêtes « Quel stockage de données » signifient généralement « quel stockage dois-je utiliser pour X ? » Un petit guide de décision :
- Analyse active, accès aléatoire, IOPS élevées : système de fichiers parallèle ou scratch NVMe.
- Données de projet partagées, accès modéré : système de fichiers en réseau avec instantanés (ZFS, Isilon ou un service de fichiers cloud).
- Les archives froides, rarement lues, doivent être bon marché : classes d’archives sur bande (LTO) ou cloud. Si vous recherchez l’aide d’un professionnel, recherchez les services d’une entreprise d’archivage de données.
- Données qui doivent être immuables pour des raisons de conformité : stockage d’objets avec verrouillage d’objet/WORM. Il s’agit d’une caractéristique commune aux solutions d’archivage de données des entreprises.
- Petits ensembles de données liés à une publication : un référentiel comme Zenodo ou Dryad, qui gère le minting DOI et l’hébergement longue durée.
Comparaison : options d’archivage des données pour les groupes de recherche
| Options | Profil de coût typique | Latence d’accès | Idéal pour | Mise en garde principale |
|---|---|---|---|---|
| Bande HPC institutionnelle | Faible/gratuit pour les affiliés | Minutes en heures | Grands ensembles de données brutes | Lié à l’institution; la politique peut changer |
| Classe d’archive cloud (par exemple, S3 Glacier) | Faible stockage, sortie/récupération élevée | Minutes en heures | Copies élastiques hors site | Frais de récupération et durées minimales |
| Stockage d’objets standard dans le cloud | Modéré | Millisecondes | Archives fréquemment réutilisées | Le coût augmente avec le volume |
| Services dédiés de sociétés d’archivage de données | Abonnement/contrat | Varie | Organisations fortement liées à la conformité | Verrouillage ; moins de contrôle sur le format |
| Disque local/NAS + copie hors site | Coût du matériel | Millisecondes | Petits laboratoires, restaurations rapides | Vous êtes propriétaire de la migration et de la vérification |
| Référentiel de données publiques | Libre à faible | Téléchargement immédiat | Ensembles de données publiés | Limites de taille ; pas pour les données privées |
Lors de l’évaluation des solutions d’archivage de données à long terme, les groupes de recherche devraient prendre en compte ces différentes solutions d’archivage de données des entreprises. Même si les avis des sociétés d’archivage de données peuvent donner un aperçu de fournisseurs spécifiques, le meilleur choix pour l’archivage de données à long terme dépend des besoins spécifiques du laboratoire. ## entreprises et services d’archivage de données
Le paysage commercial des services d’archivage de données des entreprises se divise en trois groupes, et savoir de quel groupe vous avez besoin évite des évaluations inutiles.
Les fournisseurs d’Enterprise Information Archiving (EIA), notamment Proofpoint, Barracuda, Mimecast et Jatheon, se concentrent sur les données de courrier électronique, de messagerie et de collaboration à des fins de conformité et de découverte juridique. Leurs points forts résident dans les moteurs de politique de rétention, la conservation légale et les pistes d’audit. Ce ne sont généralement pas les bonnes solutions d’archivage de données à long terme pour les ensembles de données scientifiques.
Fournisseurs d’infrastructure cloud — Amazon Web Services (S3 Glacier et Deep Archive), Microsoft Azure (niveau Archive), Google Cloud (Archive et Coldline) — vendent des primitives de stockage plutôt que un archivage clé en main. Vous apportez les outils : règles de cycle de vie, vérification de la somme de contrôle et un catalogue. Pour les ingénieurs logiciels de recherche, il s’agit généralement de la voie la plus flexible et la plus transparente en termes de coûts pour l’archivage de données à long terme.
Référentiels de données de recherche et services de préservation – Zenodo (exploité par le CERN), Dryad, Figshare, Internet Archive et les référentiels institutionnels – gèrent l’attribution des DOI, les normes de métadonnées et la préservation des bits à long terme pour les ensembles de données destinés au partage. Ils ne sont pas conçus pour des archives privées de plusieurs pétaoctets.
Lorsque vous effectuez des examens auprès des sociétés d’archivage de données, posez quatre questions : Quels sont la latence de récupération et le coût de la récupération ? Quelles garanties de format offrent-ils, et pouvez-vous tout exporter si vous partez ? Quelle vérification d’intégrité effectuent-ils et pouvez-vous voir les rapports ? Et qu’arrive-t-il à vos données en cas de rachat ou de fermeture de l’entreprise ? Un fournisseur de solutions d’entreprise d’archivage de données qui ne peut pas répondre à la question de sortie est un risque, pas une solution.
Points clés à retenir
- L’archivage des données se distingue de la sauvegarde : il préserve des ensembles de données spécifiques sur le long terme, souvent de manière immuable, tandis que la sauvegarde restaure les systèmes après une panne.
- La longévité vient de la migration et de la vérification, pas d’un seul support « permanent » ; Le stockage d’objets sur bande et dans le cloud domine les niveaux froids.
- La règle 3-2-1-1-0 et les audits de somme de contrôle programmés sont les deux pratiques qui préviennent le plus efficacement la perte de données.
- Des formats auto-descriptifs (HDF5, NetCDF, Parquet) ainsi qu’un README et un environnement épinglé rendent une archive reproductible des années plus tard.
- L’archivage commercial se divise en fournisseurs EIA axés sur la conformité, primitives de stockage cloud et référentiels de recherche – sélectionnés par cas d’utilisation et non par marque.
- Testez toujours une restauration avant de faire confiance à une archive.
Sources et lectures complémentaires
- Archivage des données de recherche — Wikipédia : L’archivage des données de recherche est le stockage à long terme des données de recherche scientifique, y compris les sciences naturelles, les sciences sociales et les sciences de la vie. Les différents universitaires…
Questions fréquemment posées
Qu’est-ce que l’archivage des données ?
L’archivage des données est le déplacement, motivé par des politiques, de données inactives vers un stockage secondaire conçu pour une conservation à long terme plutôt que pour un accès rapide. Il préserve un ensemble défini de données – souvent de manière immuable – à des fins de conformité, de reproductibilité ou de réutilisation future, et se distingue de la sauvegarde, qui existe pour restaurer les systèmes après une panne. Les archives sont généralement vérifiées avec des sommes de contrôle et cataloguées avec des métadonnées afin qu’elles restent interprétables sans leur créateur d’origine.
Comment fonctionne le stockage des données ?
Le stockage code les bits en tant qu’état physique (domaines magnétiques sur disque ou bande, charges piégées dans la mémoire flash) et les relit via un contrôleur qui applique une correction d’erreur. En plus du matériel, les systèmes de fichiers mappent les fichiers aux blocs tandis que les magasins d’objets mappent les clés aux flux d’octets avec des métadonnées. L’intégrité dépend des sommes de contrôle calculées au moment de l’écriture et revérifiées ultérieurement, car la corruption silencieuse constitue la principale menace à long terme.
Qu’est-ce qu’une bonne stratégie d’archivage de données ?
Une bonne stratégie d’archivage des données à long terme classe les données par valeur et obligation, choisit un support et un fournisseur, définit un format de package auto-descriptif, automatise la vérification de la somme de contrôle et documente le chemin de récupération. Il suit également la règle 3-2-1-1-0 et prédit ce qui se passera lorsque la subvention prendra fin. Rédiger des instructions de récupération pour un futur inconnu est l’étape que la plupart des équipes sautent et regrettent le plus.
Qu’est-ce que l’archivage dans l’analyse des données ?
L’archivage dans l’analyse des données signifie geler un état analytique complet (données d’entrée, code, environnement épinglé et sorties) afin que les résultats puissent être reproduits octet par octet. Des outils tels que DVC, Git LFS et des gestionnaires de flux de travail tels que Snakemake et Nextflow archivent en hachant le contenu, ce qui rend la reproduction vérifiable plutôt qu’approximative.
Quel stockage de données dure le plus longtemps ?
La bande magnétique (LTO) est généralement considérée comme ayant la durée de vie archivistique la plus longue parmi les supports courants, souvent citée entre 15 et 30 ans dans des conditions contrôlées, et elle reste l’épine dorsale des archives nationales. Les disques optiques d’archives sont sur le marché depuis des décennies, mais leur durabilité réelle varie considérablement, tandis que les disques durs et surtout les SSD non alimentés sont de mauvais choix à long terme. En pratique, la longévité dépend davantage d’un calendrier de migration engagé que du support.
Quelles sociétés d’archivage de données un groupe de recherche devrait-il envisager ?
Lorsqu’ils examinent les services d’entreprise d’archivage de données et les solutions d’archivage de données à long terme, les groupes de recherche tirent généralement le meilleur parti du stockage sur bande HPC institutionnel, des niveaux d’archivage cloud d’AWS, Azure ou Google Cloud et des référentiels publics comme Zenodo ou Dryad pour les ensembles de données publiés. Les solutions d’archivage de données d’entreprise proposées par des fournisseurs tels que Proofpoint et Mimecast ciblent les enregistrements de courrier électronique et de conformité plutôt que les données scientifiques. Lorsque vous lisez les avis des sociétés d’archivage de données, évaluez n’importe quel fournisseur sur le coût de récupération, le format d’exportation, les rapports d’intégrité et les conditions de sortie.
Pour obtenir des informations faisant autorité, consultez les entrées Wikipédia sur l’archivage des données, la préservation numérique et la norme de bande LTO Ultrium, ainsi que la norme de Préservation numérique Coalition manuel pour des conseils de gestion à long terme.
Questions fréquentes
Qu’est-ce que l’archivage des données ?
L'archivage des données est le déplacement, motivé par des politiques, de données inactives vers un stockage secondaire conçu pour une conservation à long terme plutôt que pour un accès rapide. Il préserve un ensemble défini de données – souvent de manière immuable – à des fins de conformité, de reproductibilité ou de réutilisation future, et se distingue de la sauvegarde, qui existe pour restaurer les systèmes après une panne. Les archives sont généralement vérifiées avec des sommes de contrôle et cataloguées avec des métadonnées afin qu'elles restent interprétables sans leur créateur d'origine.
Comment fonctionne le stockage des données ?
Le stockage code les bits en tant qu'état physique (domaines magnétiques sur disque ou bande, charges piégées dans la mémoire flash) et les relit via un contrôleur qui applique une correction d'erreur. En plus du matériel, les systèmes de fichiers mappent les fichiers aux blocs tandis que les magasins d'objets mappent les clés aux flux d'octets avec des métadonnées. L'intégrité dépend des sommes de contrôle calculées au moment de l'écriture et revérifiées ultérieurement, car la corruption silencieuse constitue la principale menace à long terme.
Qu'est-ce qu'une bonne stratégie d'archivage de données ?
Une bonne stratégie d'archivage des données à long terme classe les données par valeur et obligation, choisit un support et un fournisseur, définit un format de package auto-descriptif, automatise la vérification de la somme de contrôle et documente le chemin de récupération. Il suit également la règle 3-2-1-1-0 et prédit ce qui se passera lorsque la subvention prendra fin. Rédiger des instructions de récupération pour un futur inconnu est l’étape que la plupart des équipes sautent et regrettent le plus.
Qu’est-ce que l’archivage dans l’analyse des données ?
L'archivage dans l'analyse des données signifie geler un état analytique complet (données d'entrée, code, environnement épinglé et sorties) afin que les résultats puissent être reproduits octet par octet. Des outils tels que DVC, Git LFS et des gestionnaires de flux de travail tels que Snakemake et Nextflow archivent en hachant le contenu, ce qui rend la reproduction vérifiable plutôt qu'approximative.
Quel stockage de données dure le plus longtemps ?
La bande magnétique (LTO) est généralement considérée comme ayant la durée de vie archivistique la plus longue parmi les supports courants, souvent citée entre 15 et 30 ans dans des conditions contrôlées, et elle reste l'épine dorsale des archives nationales. Les disques optiques d'archives sont sur le marché depuis des décennies, mais leur durabilité réelle varie considérablement, tandis que les disques durs et surtout les SSD non alimentés sont de mauvais choix à long terme. En pratique, la longévité dépend davantage d’un calendrier de migration engagé que du support.
Quelles sociétés d’archivage de données un groupe de recherche devrait-il envisager ?
Lorsqu'ils examinent les services d'entreprise d'archivage de données et les solutions d'archivage de données à long terme, les groupes de recherche tirent généralement le meilleur parti du stockage sur bande HPC institutionnel, des niveaux d'archivage cloud d'AWS, Azure ou Google Cloud et des référentiels publics comme Zenodo ou Dryad pour les ensembles de données publiés. Les solutions d'archivage de données d'entreprise proposées par des fournisseurs tels que Proofpoint et Mimecast ciblent les enregistrements de courrier électronique et de conformité plutôt que les données scientifiques. Lorsque vous lisez les avis des sociétés d’archivage de données, évaluez n’importe quel fournisseur sur le coût de récupération, le format d’exportation, les rapports d’intégrité et les conditions de sortie. Pour faire autorité, je
Apprenez Python en codant dans votre navigateur
Cours interactifs Python et science des données que vous codez directement dans le navigateur