Zum Hauptinhalt springen
ActivePapers Speichern Sie Ihre Daten als recomputable documents – damit jedes veröffentlichte Ergebnis erneut ausgeführt, verifiziert und archiviert werden kann.

Einige Links auf dieser Website sind Affiliate-Links: Wenn Sie über diese kaufen, erhalten wir unter Umständen eine Provision, ohne dass für Sie zusätzliche Kosten entstehen. Dies beeinflusst niemals unsere Empfehlungen. Details finden Sie in unserer Affiliate-Offenlegung. Offenlegung der Affiliate-Partnerschaft.

Beste Datenarchivierungstools im Vergleich für die Forschung (2026)

Datenarchivierung ist die richtlinienbasierte Verlagerung inaktiver Daten auf eine separate, kostengünstigere Speicherebene zur langfristigen Aufbewahrung, Compliance oder Wiederverwendung. Ein vollständiges Archivierungssetup kombiniert typischerweise vier Schichten: ein Dateisystem oder einen Objektspeicher, ein Prüfsummen-/Verifikationstool, einen Metadatenkatalog und eine Aufbewahrungsrichtlinie. Für Computational Scientists bedeutet dies in der Regel gestufte Hot-Scratch-Disks, Warm-Projektspeicher und Cold-Objektspeicher wie Tape oder S3 Glacier.

Speicher auf der physischen Ebene funktioniert, indem Bits als ein messbarer Zustand kodiert werden (magnetische Domänen auf einem rotierenden Platter, in NAND-Flash-Zellen eingeschlossene Ladung oder Phasen-/Pit-Geometrie auf optischen Medien) und dieser Zustand dann über einen Controller gelesen wird, der die Fehlerkorrektur übernimmt. Eine Hard Disk Drive (HDD) schreibt Daten über einen beweglichen Lese-/Schreibkopf auf konzentrische Spuren rotierender Platter; eine Solid State Drive (SSD) speichert Ladung in Floating-Gate-Transistoren ohne bewegliche Teile, weshalb SSDs eine geringere Latenz, aber eine endliche Schreibausdauer haben. Tape-Laufwerke schreiben lineare Spuren auf Magnetband und bleiben das günstigste Medium pro Terabyte für Cold Data.

Über der physischen Ebene liegt die logische Ebene. Dateisysteme wie ext4, XFS, ZFS und Lustre bilden Dateien auf Blöcke ab und pflegen Metadaten (Inodes, Verzeichnisse, Berechtigungen).

Objektspeicher wie Ceph RADOS, MinIO und Amazon S3 verzichten auf den Verzeichnisbaum zugunsten flacher Namespaces, in denen jedes Objekt einen Key, einen Byte-Stream und beliebige Metadaten hat. Dieser Unterschied ist für die Datenarchivierung extrem wichtig: Objektspeicher skaliert auf Milliarden von Objekten und unterstützt Immutability und Lifecycle-Regeln nativ, während POSIX-Dateisysteme einfacher zu mounten und zu skripten sind, aber bei sehr großen Verzeichniszahlen an Leistung verlieren.

Bei der Bewertung von long term data archiving solutions sind diese strukturellen Unterschiede entscheidend.

Datenintegrität ist die dritte Ebene. Silent Bit Rot – unentdeckte Korruption durch Medienalterung, kosmische Strahlung oder Firmware-Bugs – ist der wahre Feind des Archivars.

Verwandte: — Interaktive Python- und Data-Science-Kurse, bei denen Sie direkt im Browser programmieren.

Prüfsummen (MD5, SHA-256, BLAKE3), die beim Schreiben berechnet und beim Lesen oder nach einem Zeitplan erneut verifiziert werden, erkennen dies. ZFS und Btrfs tun dies automatisch mit Prüfsummen pro Block und Self-Healing, wenn Redundanz vorhanden ist; auf reinem ext4 müssen Sie einen eigenen Verifikationslauf durchführen, zum Beispiel mit sha256sum -c gegen ein Manifest, oder ein Tool wie par2 verwenden, um Recovery-Blöcke zu erzeugen. Professionelle Data Archiving Company Services implementieren diese Prüfungen oft, um Long Term Data Archiving sicherzustellen.

Schließlich bestimmen Redundanz und Geografie die Haltbarkeit. RAID schützt gegen einzelne Disk-Ausfälle, aber nicht gegen Controller-Ausfälle, Brände oder Ransomware. Die 3-2-1-Regel – drei Kopien, zwei verschiedene Medien, eine Offsite – bleibt die Grundlage, und die 3-2-1-1-0-Variante ergänzt eine Offline-/Immutability-Kopie und null Fehler bei der Verifikation des Restores. Cloud-Objektspeicher werben mit Haltbarkeitswerten im Bereich von „Eleven Nines“ (99,999999999 %), aber diese Zahl beschreibt die Haltbarkeit der gespeicherten Objekte, nicht die Verfügbarkeit des Dienstes oder die Sicherheit vor versehentlichem Löschen durch einen autorisierten Nutzer. Für diejenigen, die Data Archiving Companies Reviews recherchieren, ist es wichtig zu sehen, wie Data Archiving Company Solutions diese spezifischen Trade-offs zwischen Haltbarkeit und Verfügbarkeit handhaben.

how data storage

Fragen zu „How to store data“ laufen meist auf eine praktische Entscheidung hinaus: Wo befindet sich ein gegebenes Dataset in jeder Phase seines Lebenszyklus? Ein Arbeitsmodell für eine Simulationsgruppe sieht so aus.

Leserfavorit: — Projektbasierte Data-Science-Pfade mit geführtem Terminal und realen Datensätzen.

Aktive Ausführungen schreiben auf den lokalen NVMe-Scratch des Nodes. Abgeschlossene Runs werden für die Analyse auf ein gemeinsames paralleles Dateisystem (Lustre, GPFS oder ein BeeGFS-Mount) verschoben. Veröffentlichte oder abgelöste Datasets werden paketiert (oft in HDF5, NetCDF oder einem komprimierten Tar mit Prüfsummen-Manifest) und auf eine Archivierungsebene verschoben.

Die Mechanik dieses letzten Schritts ist wichtig. Ein typischer Kommandozeilen-Archivierungsschritt für eine Reihe von Molekulardynamik-Trajektorien könnte so aussehen:

tar --use-compress-program="zstd -T0 -19" -cf run42.tar.zst run42/
sha256sum run42.tar.zst > run42.tar.zst.sha256
rclone copy run42.tar.zst remote:archive/run42/ --checksum

Das Flag --checksum bei rclone erzwingt einen Hash-Vergleich, anstatt sich auf Größe und Änderungszeit zu verlassen, was essenziell ist, wenn das Ziel Objektspeicher ist. Bei HDF5-Output können Tools wie h5repack mit gzip- oder SZIP-Kompression Dateien erheblich verkleinern, ohne die API zu ändern, die Ihr Analyse-Code verwendet.

Recovery ist der Teil, der von den Teams zu wenig geplant wird. Cold Tiers haben Latenz: Tape-Archive können Minuten bis Stunden brauchen, um eine Datei zu stagen, und Cloud-Archive-Klassen wie S3 Glacier Flexible Retrieval oder Deep Archive berechnen Gebühren für beschleunigten Abruf und erzwingen Mindestspeicherdauern. Ein Dataset, das Sie nicht innerhalb Ihrer Deadline wiederherstellen können, ist effektiv verloren. Testen Sie jedes Quartal die Wiederherstellung einer Zufallsstichprobe und dokumentieren Sie, wie lange sie gedauert hat.

what is data archiving

Datenarchivierung ist die bewusste, richtlinienbasierte Verlagerung inaktiver Daten von Primärsystemen auf Sekundärspeicher, der auf Kosten und Langlebigkeit statt auf Geschwindigkeit optimiert ist. Ihr Zweck unterscheidet sich von dem eines Backups: Backup existiert, um ein System nach einem Ausfall oder einer Korruption wiederherzustellen, und ist typischerweise versioniert und kurzfristig, während Archivierung existiert, um einen bestimmten Datensatz über Jahre oder Jahrzehnte zu bewahren, und oft unveränderlich ist. Dies unterscheidet sich auch von Löschung: Archivierung ist eine Aufbewahrungsentscheidung, keine Entsorgungsentscheidung, obwohl eine gute Richtlinie definiert, wann archivierte Daten letztendlich vernichtet werden.

Enterprise-Definitionen von Anbietern wie Snowflake und Datacore betonen Compliance-Faktoren: Vorschriften wie HIPAA, DSGVO, SEC Rule 17a-4 und FDA’s 21 CFR Part 11 verlangen, dass bestimmte Aufzeichnungen über definierte Zeiträume aufbewahrt, unverändert und abrufbar sind. Die Forschung hat ihre eigenen Treiber. Fördergeber, darunter die NSF, NIH und die Europäische Kommission, verlangen zunehmend Datenmanagementpläne, die angeben, wo Daten archiviert werden und für wie lange, und Journals verlangen, dass die einer Publikation zugrunde liegenden Daten verfügbar sind. Für ein Labor lautet die Arbeitsdefinition von Archivierung: Das Dataset wird einmal geschrieben, verifiziert, mit genügend Metadaten katalogisiert, um ohne den ursprünglichen Autor interpretierbar zu sein, und an einem Ort gespeichert, der die Graduierung des PhD-Studenten überlebt, der es erstellt hat.

Verwandte: — Eine umfassende technische Bibliothek mit Büchern, Videos und Live-Schulungen zum Thema wissenschaftliches Rechnen.

data archiving strategy

Eine tragfähige Archivierungsstrategie beruht auf fünf Entscheidungen, und sie in die richtige Reihenfolge zu bringen, erspart Jahre des Leidens.

1. Klassifizieren Sie nach Wert und Verpflichtung. Nicht alle Daten verdienen dieselbe Behandlung. Rohdaten aus Instrumenten, verarbeitete Zwischenergebnisse und finale veröffentlichte Datasets haben unterschiedliche Aufbewahrungsanforderungen. Ein Priorisierungssystem (zum Beispiel Rohdaten 10 Jahre aufbewahren, Zwischendaten 1 Jahr und veröffentlichte Ergebnisse unbegrenzt) vermeidet die Ausbreitung von Archiven.

2. Wählen Sie Medien und Anbieter. Die Optionen reichen von institutionellem Speicher (Tape-Silos von universitären HPC-Zentren, oft kostenlos oder günstig für affiliierte Forschende) über kommerzielle Cloud-Archivierungsklassen bis hin zu spezialisierten Long-Term-Archiving-Unternehmen. Jede hat eine andere Kostenkurve und ein anderes Lock-in-Profil.

Einen Blick wert: — Ein Abonnement für von der Universität unterstützte Python- und Data-Science-Zertifikate.

3. Legen Sie das Paketformat fest. Selbstbeschreibende Formate schlagen proprietäre Formate. HDF5, NetCDF4, Parquet und reiner Text mit Schema überleben besser als ein Binary Blob, dessen Reader zuletzt 2014 kompiliert wurde. Fügen Sie eine README-Datei, ein Prüfsummen-Manifest und eine Kopie der Analyse-Skripte bei.

4. Automatisieren Sie die Verifikation. Planen Sie regelmäßige Prüfsummen-Audits. Ein Dataset, das nie überprüft wurde, ist ein Dataset, von dem Sie nicht wissen, ob es noch existiert.

5. Dokumentieren Sie den Recovery-Pfad. Notieren Sie im Datenmanagementplan und im Archiv selbst genau, wie jemand im Jahr 2035 diese Daten abruft und öffnet. Geben Sie Tool-Versionen an.

what is archiving in data analysis

Archivierung in der Datenanalyse bedeutet, einen bestimmten analytischen Zustand einzufrieren, damit die Ergebnisse reproduziert werden können. Dazu gehören die Eingabedaten, der Code, der sie transformiert hat, die Umgebung (Container-Image, conda-Environment-Datei oder requirements.txt mit gepinnten Versionen) und die Ausgaben.

In der Praxis kommen hier Tools wie DVC, Git LFS und Snakemake/Nextflow-Provenance-Logs ins Spiel: Sie ermöglichen es, Input und Output einer Pipeline per Content-Hash statt per Dateiname zu archivieren, sodass ein Rerun die exakten Bytes reproduziert oder lautstark fehlschlägt. Für eine Bioinformatik-Variant-Calling-Pipeline könnte dies bedeuten, die Referenz-FASTA, BAM-Dateien, VCF, den Container-Digest und die Workflow-Definition gemeinsam in einem einzigen versionierten Paket zu archivieren.

data archiving best practices

Gute Praktiken für Long Term Data Archiving, die über alle Disziplinen hinweg Bestand haben:

  • Alles beim Schreiben mit Prüfsummen versehen und Manifeste neben den Daten speichern, nicht in einem separaten System, das auseinanderdriften kann.
  • Offene, selbstbeschreibende Formate mit integrierten Einheiten und Metadaten verwenden; Formate vermeiden, die an die Lizenz eines einzelnen Anbieters gebunden sind.
  • Die 3-2-1-1-0-Regel befolgen und mindestens eine Offline- oder Immutability-Kopie aufbewahren (Object Lock, WORM-Tape oder Air-Gapped Disk), um Ransomware zu überstehen.
  • Metadaten für einen Fremden schreiben. Gehen Sie davon aus, dass die Person, die sie liest, Sie nie getroffen hat und mit Ihren Namenskonventionen nicht vertraut ist.
  • Persistente Identifikatoren vergeben. Ein DOI über Zenodo, Dryad oder ein institutionelles Repository macht ein Dataset zitierfähig und gibt ihm eine stabile Landing Page.
  • Restores nach Zeitplan testen und Ergebnisse dokumentieren; ein ungetestetes Archiv ist eine Hypothese, keine Garantie.
  • Das Ende des Grants einplanen. Fördergeber zahlen irgendwann nicht mehr; entscheiden Sie jetzt, ob die Daten in institutionellen Speicher überführt oder gelöscht werden.

what data storage lasts the longest

Kein digitales Medium ist für immer, und die ehrliche Antwort ist, dass Langlebigkeit aus Migration kommt, nicht aus dem Medium selbst. Unter den üblicherweise verwendeten Medien hat Magnetband (LTO) eine oft zitierte Archivierungslebensdauer von 15 bis 30 Jahren unter geeigneter Temperatur- und Feuchtigkeitskontrolle, und es bleibt der Standard für nationale Archive und HPC-Zentren.

Optische Medien variieren stark: Gepresste Discs und archivtaugliche DVDs/Blu-rays im M-DISC-Stil werden mit jahrzehntelanger Lebensdauer beworben, während gewöhnliche gebrannte CDs und DVDs über die Jahre degradieren. Enterprise-Festplatten sind typischerweise für etwa fünf Jahre Dauerbetrieb ausgelegt, und SSDs haben Aufbewahrungsgrenzen, die schlechter werden, wenn sie nicht mit Strom versorgt werden: Ladung entweicht mit der Zeit aus den Zellen, sodass eine SSD, die jahrelang in einer Schublade liegt, ein schlechtes Archiv abgibt.

Cloud-Objektspeicher ist völlig medienagnostisch und setzt auf kontinuierliche Migration im Hintergrund. Deshalb können Anbieter extreme Haltbarkeit versprechen, ohne das Überleben einer bestimmten Festplatte zu versprechen.

Die praktische Erkenntnis: Wenn Sie Long Term Data Archiving Solutions bewerten oder Data Archiving Companies Reviews lesen, wählen Sie Medien mit einem dokumentierten Migrationspfad und einem Anbieter oder einer Institution, die sich zur Auffrischung verpflichtet haben, statt einem „permanenten“ Laufwerk nachzujagen.

what data storage

Abfragen zu „Which data storage“ bedeuten meist „Welchen Speicher sollte ich für X verwenden?“ Ein kurzer Entscheidungsleitfaden:

  • Aktive Analyse, wahlfreier Zugriff, hohe IOPS: paralleles Dateisystem oder NVMe-Scratch.
  • Gemeinsame Projektdaten, mäßiger Zugriff: vernetztes Dateisystem mit Snapshots (ZFS, Isilon oder ein Cloud-Dateidienst).
  • Cold Archives, selten gelesen, muss günstig sein: Tape (LTO) oder Cloud-Archive-Klassen. Wenn Sie professionelle Hilfe suchen, sehen Sie sich Data Archiving Company Services an.
  • Daten, die aus Compliance-Gründen unveränderlich sein müssen: Objektspeicher mit Object Locking/WORM. Dies ist ein häufiges Merkmal von Data Archiving Company Solutions.
  • Kleine Datasets, die mit einer Publikation verknüpft sind: ein Repository wie Zenodo oder Dryad, das DOI-Vergabe und langfristiges Hosting übernimmt.

Comparison: data archiving options for research groups

OptionTypical cost profileAccess latencyBest forMain caveat
Institutional HPC tapeLow/free for affiliatesMinutes to hoursLarge raw datasetsTied to institution; policy may change
Cloud archive class (e.g., S3 Glacier)Low storage, high egress/retrievalMinutes to hoursElastic, off-site copiesRetrieval fees and minimum durations
Cloud standard object storageModerateMillisecondsFrequently reused archivesCost grows with volume
Dedicated data archiving company servicesSubscription/contractVariesCompliance-heavy organizationsLock-in; less control over format
Local disk/NAS + off-site copyHardware costMillisecondsSmall labs, quick restoresYou own migration and verification
Public data repositoryFree to lowImmediate downloadPublished datasetsSize limits; not for private data

Bei der Bewertung von Long Term Data Archiving Solutions sollten Forschungsgruppen diese verschiedenen Data Archiving Company Solutions berücksichtigen. Während Data Archiving Companies Reviews Einblicke in bestimmte Anbieter liefern können, hängt die beste Wahl für Long Term Data Archiving von den spezifischen Bedürfnissen des Labors ab.

data archiving companies and services

Die Geschäftslandschaft für Dienstleistungen von Datenarchivierungsunternehmen lässt sich in drei Gruppen einteilen; zu wissen, welche Gruppe man benötigt, vermeidet unnötige Bewertungen.

Anbieter von Enterprise Information Archiving (EIA), darunter Proofpoint, Barracuda, Mimecast und Jatheon, konzentrieren sich auf E-Mail-, Messaging- und Kollaborationsdaten für Compliance- und rechtliche Offenlegungszwecke. Ihre Stärken liegen in Aufbewahrungsrichtlinien-Engines, Legal Hold und Audit Trails. Dies sind im Allgemeinen nicht die richtigen Lösungen für die langfristige Datenarchivierung wissenschaftlicher Datensätze.

Cloud-Infrastrukturanbieter – Amazon Web Services (S3 Glacier und Deep Archive), Microsoft Azure (Archive tier), Google Cloud (Archive und Coldline) – verkaufen Speicherprimitive statt schlüsselfertiger Archivierung. Sie bringen die Tools selbst mit: Lebenszyklusregeln, Prüfsummenüberprüfung und einen Katalog. Für Forschungssoftware-Ingenieure ist dies typischerweise der flexibelste und kostentransparenteste Weg zur langfristigen Datenarchivierung.

Repositories und Bewahrungsdienste für Forschungsdaten – Zenodo (betrieben vom CERN), Dryad, Figshare, das Internet Archive und institutionelle Repositorien – verwalten die DOI-Zuweisung, Metadatenstandards und die langfristige Bit-Preservation für Datensätze, die zur gemeinsamen Nutzung bestimmt sind. Sie sind nicht für private Archive von mehreren Petabyte ausgelegt.

Stellen Sie bei der Überprüfung von Datenarchivierungsunternehmen vier Fragen: Wie hoch sind die Abruflatenz und die Wiederherstellungskosten? Welche Formatgarantien bieten sie, und können Sie alles exportieren, wenn Sie den Anbieter wechseln?

Welche Integritätsprüfung wird durchgeführt und können Sie die Berichte einsehen? Und was passiert mit Ihren Daten, wenn das Unternehmen übernommen oder geschlossen wird? Ein Anbieter von Datenarchivierungslösungen, der die Ausstiegsfrage nicht beantworten kann, ist ein Risiko, keine Lösung.

Wichtige Erkenntnisse

  • Datenarchivierung unterscheidet sich vom Backup: Sie bewahrt bestimmte Datensätze langfristig, oft unveränderlich, auf, während ein Backup Systeme nach einem Ausfall wiederherstellt.
  • Langlebigkeit entsteht durch Migration und Verifizierung, nicht durch einen einzigen „permanenten“ Support; Tape- und Cloud-Objektspeicher dominieren die Cold Tiers.
  • Die 3-2-1-1-0-Regel und geplante Prüfsummen-Audits sind die beiden Praktiken, die Datenverluste am zuverlässigsten verhindern.
  • Selbstbeschreibende Formate (HDF5, NetCDF, Parquet) sowie eine README-Datei und eine fixierte Umgebung machen ein Archiv auch Jahre später reproduzierbar.
  • Kommerzielle Archivierung unterteilt sich in compliance-orientierte EIA-Anbieter, Cloud-Speicherprimitive und Forschungs-Repositories – die Auswahl erfolgt nach Anwendungsfall, nicht nach Marke.
  • Testen Sie immer eine Wiederherstellung, bevor Sie einem Archiv vertrauen.

Quellen und weiterführende Literatur

  • Research data archiving — Wikipedia: Research data archiving is the long-term storage of scholarly research data, including the natural sciences, social sciences, and life sciences. The various academic…

Häufig gestellte Fragen

Was ist Datenarchivierung?

Datenarchivierung ist die richtliniengesteuerte Verschiebung inaktiver Daten in einen Sekundärspeicher, der für die langfristige Aufbewahrung und nicht für den schnellen Zugriff konzipiert ist. Sie bewahrt einen definierten Datensatz – oft unveränderlich – für Compliance, Reproduzierbarkeit oder zukünftige Wiederverwendung auf und unterscheidet sich vom Backup, das dazu dient, Systeme nach einem Ausfall wiederherzustellen. Archive werden typischerweise mit Prüfsummen verifiziert und mit Metadaten katalogisiert, sodass sie auch ohne ihren ursprünglichen Ersteller interpretierbar bleiben.

Wie funktioniert die Datenspeicherung?

Der Speicher kodiert Bits als physikalischen Zustand (magnetische Domänen auf Festplatte oder Band, im Flash-Speicher eingeschlossene Ladung) und liest sie über einen Controller zurück, der eine Fehlerkorrektur anwendet. Auf der Hardware basierend ordnen Dateisysteme Dateien Blöcken zu, während Objektspeicher Schlüssel Byteströmen mit Metadaten zuordnen. Die Integrität hängt von Prüfsummen ab, die zum Zeitpunkt des Schreibens berechnet und später erneut überprüft werden, da „Silent Corruption“ die größte langfristige Bedrohung darstellt.

Was ist eine gute Datenarchivierungsstrategie?

Eine gute Strategie zur langfristigen Datenarchivierung klassifiziert Daten nach Wert und Verpflichtung, wählt ein Medium und einen Anbieter aus, definiert ein selbstbeschreibendes Paketformat, automatisiert die Prüfsummenüberprüfung und dokumentiert den Wiederherstellungspfad. Sie folgt außerdem der 3-2-1-1-0-Regel und plant voraus, was passiert, wenn die Fördermittel auslaufen. Das Schreiben von Wiederherstellungsanweisungen für einen zukünftigen Fremden ist der Schritt, den die meisten Teams überspringen und am meisten bereuen.

Was ist Archivierung in der Datenanalyse?

Archivierung in der Datenanalyse bedeutet das Einfrieren eines vollständigen analytischen Zustands (Eingabedaten, Code, fixierte Umgebung und Ausgaben), sodass die Ergebnisse Byte für Byte reproduziert werden können. Tools wie DVC, Git LFS und Workflow-Manager wie Snakemake und Nextflow archivieren durch das Hashen von Inhalten, wodurch die Reproduktion verifizierbar statt nur approximativ wird.

Welcher Datenspeicher hält am längsten?

Magnetbänder (LTO) gelten im Allgemeinen als die Medien mit der längsten Archivierungslebensdauer unter den gängigen Medien, oft mit 15 bis 30 Jahren unter kontrollierten Bedingungen angegeben, und bleiben das Rückgrat nationaler Archive. Archiv-Optikdatenträger sind seit Jahrzehnten auf dem Markt, aber ihre tatsächliche Haltbarkeit variiert stark, während HDDs und insbesondere stromlose SSDs schlechte Langzeitoptionen sind. In der Praxis hängt die Langlebigkeit mehr von einem konsequenten Migrationsplan ab als vom Medium selbst.

Welche Datenarchivierungsunternehmen sollte eine Forschungsgruppe in Betracht ziehen?

Bei der Betrachtung von Dienstleistungen von Datenarchivierungsunternehmen und langfristigen Datenarchivierungslösungen profitieren Forschungsgruppen in der Regel am meisten von institutioneller HPC-Bandspeicherung, Cloud-Archive-Tiers von AWS, Azure oder Google Cloud sowie öffentlichen Repositories wie Zenodo oder Dryad für veröffentlichte Datensätze. Enterprise-Datenarchivierungslösungen von Anbietern wie Proofpoint und Mimecast zielen auf E-Mails und Compliance-Aufzeichnungen ab, nicht auf wissenschaftliche Daten. Wenn Sie Bewertungen von Datenarchivierungsunternehmen lesen, bewerten Sie jeden Anbieter hinsichtlich Wiederherstellungskosten, Formatexport, Integritätsberichten und Ausstiegsbedingungen.

Für maßgebliche Informationen siehe die Wikipedia-Einträge zu data archiving, digital preservation und dem Bandstandard LTO Ultrium sowie das Handbuch der Digital Preservation Coalition für Anleitungen zur langfristigen Verwaltung.

Häufig gestellte Fragen

Was ist Datenarchivierung?

Bei der Datenarchivierung handelt es sich um die richtliniengesteuerte Verschiebung inaktiver Daten in einen Sekundärspeicher, der für die langfristige Aufbewahrung und nicht für den schnellen Zugriff konzipiert ist. Es bewahrt einen definierten Datensatz – oft unveränderlich – für Compliance, Reproduzierbarkeit oder zukünftige Wiederverwendung auf und unterscheidet sich vom Backup, das zur Wiederherstellung von Systemen nach einem Ausfall dient. Archive werden typischerweise mit Prüfsummen überprüft und mit Metadaten katalogisiert, sodass sie auch ohne ihren ursprünglichen Ersteller interpretierbar bleiben.

Wie funktioniert die Datenspeicherung?

Der Speicher kodiert Bits als physikalischen Zustand (magnetische Domänen auf Festplatte oder Band, im Flash-Speicher eingeschlossene Ladung) und liest sie über einen Controller zurück, der eine Fehlerkorrektur anwendet. Zusätzlich zur Hardware ordnen Dateisysteme Dateien Blöcken zu, während Objektspeicher Schlüssel Byteströmen mit Metadaten zuordnen. Die Integrität hängt von Prüfsummen ab, die zum Zeitpunkt des Schreibens berechnet und später erneut überprüft werden, da stille Korruption die größte langfristige Bedrohung darstellt.

Was ist eine gute Datenarchivierungsstrategie?

Eine gute Strategie zur langfristigen Datenarchivierung klassifiziert Daten nach Wert und Verpflichtung, wählt ein Medium und einen Anbieter aus, definiert ein selbstbeschreibendes Paketformat, automatisiert die Prüfsummenüberprüfung und dokumentiert den Wiederherstellungspfad. Es folgt außerdem der 3-2-1-1-0-Regel und sagt voraus, was passieren wird, wenn die Fördermittel auslaufen. Das Schreiben von Wiederherstellungsanweisungen für einen zukünftigen Fremden ist der Schritt, den die meisten Teams überspringen und am meisten bereuen.

Was ist Archivierung in der Datenanalyse?

Bei der Datenanalyse bedeutet Archivierung das Einfrieren eines vollständigen analytischen Zustands (Eingabedaten, Code, fixierte Umgebung und Ausgaben), sodass die Ergebnisse Byte für Byte reproduziert werden können. Tools wie DVC, Git LFS und Workflow-Manager wie Snakemake und Nextflow archivieren Inhalte, indem sie sie hashen, sodass die Reproduktion eher überprüfbar als ungefähr ist.

Welcher Datenspeicher hält am längsten?

Magnetbänder (LTO) gelten im Allgemeinen als die Medien mit der längsten Archivierungslebensdauer, die unter kontrollierten Bedingungen oft mit 15 bis 30 Jahren angegeben werden, und sie bleiben das Rückgrat nationaler Archive. Optische Datenträger für die Archivierung sind schon seit Jahrzehnten auf dem Markt, ihre tatsächliche Haltbarkeit schwankt jedoch stark, während Festplatten und insbesondere SSDs ohne eigene Stromversorgung auf lange Sicht keine gute Wahl sind. In der Praxis hängt die Langlebigkeit eher von einem festgelegten Migrationsplan als vom Medium ab.

Welche Datenarchivierungsunternehmen sollte eine Forschungsgruppe in Betracht ziehen?

Wenn es um Datenarchivierungsdienste für Unternehmen und langfristige Datenarchivierungslösungen geht, holen Forschungsgruppen in der Regel das Beste aus institutioneller HPC-Bandspeicherung, Cloud-Archivebenen von AWS, Azure oder Google Cloud und öffentlichen Repositories wie Zenodo oder Dryad für veröffentlichte Datensätze. Unternehmenslösungen zur Archivierung von Unternehmensdaten von Anbietern wie Proofpoint und Mimecast zielen eher auf E-Mail- und Compliance-Datensätze als auf wissenschaftliche Daten ab. Wenn Sie Bewertungen von Datenarchivierungsunternehmen lesen, bewerten Sie jeden Anbieter hinsichtlich Wiederherstellungskosten, Formatexport, Integritätsberichten und Ausstiegsbedingungen. Für maßgebliches i


Verdienen Sie Zertifikate von echten Universitäten

Ein Abonnement für von der Universität unterstützte Python- und Data-Science-Zertifikate