Zum Hauptinhalt springen
ActivePapers Speichern Sie Ihre Daten als recomputable documents – damit jedes veröffentlichte Ergebnis erneut ausgeführt, verifiziert und archiviert werden kann.

Einige Links auf dieser Website sind Affiliate-Links: Wenn Sie über diese kaufen, erhalten wir unter Umständen eine Provision, ohne dass für Sie zusätzliche Kosten entstehen. Dies beeinflusst niemals unsere Empfehlungen. Details finden Sie in unserer Affiliate-Offenlegung. Offenlegung der Affiliate-Partnerschaft.

Langzeit-Datenarchivierungslösungen im Vergleich

Bei Lösungen zur langfristigen Datenarchivierung handelt es sich um Systeme und Dienste, die Daten über Jahre oder sogar Jahrzehnte hinweg aufbewahren und sie gleichzeitig abrufbar, überprüfbar und erschwinglich halten. Sie decken mindestens vier verschiedene Schichten ab – Speichermedien, Übertragungs- und Integritätssoftware, Metadatenkataloge und Governance-Richtlinien – und Standards wie ISO 14721 (OAIS) und ISO 16363 definieren das Verhalten eines vertrauenswürdigen Archivs.

Lösungen zur langfristigen Datenarchivierung erklärt

Datenarchivierung ist die Praxis, Daten, die nicht mehr aktiv genutzt werden, vom Primärspeicher auf günstigere, langsamere oder Offline-Medien zu verschieben und sie gleichzeitig für zukünftige Referenzzwecke, Compliance oder Wiederverwendung abrufbar zu halten. Eine langfristige Datenarchivierungslösung bündelt diese Praxis in einem wiederholbaren System: Medien, Software, Metadaten und Richtlinien.

Der wichtigste Unterschied besteht zwischen Archivierung und Backup. Backups schützen vor Verlust und sind für die schnelle Wiederherstellung eines aktuellen Zustands konzipiert.

Archive schützen vor dem Vergessen und sind darauf ausgelegt, ein bestimmtes Objekt Jahre später langsam und selektiv abzurufen. Eine Backup-Rotation, bei der die Bänder alle 30 Tage überschrieben werden, ist kein Archiv. Ein Repository, das eine Molekulardynamik-Trajektorie aus dem Jahr 2019 mit seinen Eingabedateien, der Kraftfeldversion und der Prüfsumme enthält, hingegen schon.

Für Computerwissenschaftler liegt die Archivgrenze normalerweise dort, wo Daten nicht mehr wöchentlich gelesen werden. Die Rohdaten des Instruments, abgeschlossene Simulationstrajektorien und veröffentlichte Analyse-Notebooks gehören in ein Archiv. Scratch-Speicher, zwischenzeitliche Restart-Dateien und aktuelle Arbeitsdatensätze hingegen nicht.

Was sind langfristige Datenarchivierungslösungen?

Eine langfristige Datenarchivierungslösung ist jede Kombination aus Speicher, Software und Prozessen, die Daten über alle Hardwaregenerationen hinweg lesbar und überprüfbar hält. In jeder ernsthaften Implementierung tauchen vier Komponenten auf:

Verwandte: — Projektbasierte Data-Science-Pfade mit geführtem Terminal und realen Datensätzen.

  1. Speichermedien: Band (LTO-Generationen), Objektspeicher (S3-kompatibel, on-premises oder Cloud), optische Medien für Nischenfälle und replizierte Festplatten für Hot-Archive.
  2. Übertragungs- und Integritätstools – Prüfsummenbildung, Fixitätsüberprüfung und Fehlerkorrekturformate. Tools wie par2, BagIt und rsync-basierte Pipelines verarbeiten diese Ebene.
  3. Metadaten und Katalog – der Index, der ein Archiv durchsuchbar macht. Ohne ihn ist ein Archiv eine Mülldeponie. DataCite, Dublin Core und Domänenschemata (z. B. für Kristallographie oder Proteomik) stellen das Vokabular bereit.
  4. Governance – Aufbewahrungspläne, Zugriffskontrollen und Nachfolgeplanung für den Fall, dass die Person, die das Archiv erstellt hat, das Labor verlässt.

Die Archivierung von Unternehmensdaten fügt ein fünftes Anliegen hinzu: die Integration mit Identitätsanbietern, E-Discovery und Legal Hold. Forschungsarchive fügen in der Regel ein anderes fünftes Anliegen hinzu: die Reproduzierbarkeit, was bedeutet, dass das Archiv genügend Umgebungsdetails erfassen muss, um die Berechnung erneut ausführen zu können.

Bedeutung von Lösungen zur langfristigen Datenarchivierung

Der Begriff hat zwei Bedeutungen, die Käufer oft vermischen; ihre Trennung verhindert kostspielige Fehler.

Bedeutung eins: Aufbewahrungsinfrastruktur. Dies ist die speicherzentrierte Lesart, die von Anbietern von Datenarchivierungslösungen – wie Quantum, Cohesity, Archon und ähnlichen – verwendet wird, wobei Archivierung bedeutet, kalte Daten auf günstigere Medien auszulagern (Tiering) und Aufbewahrungsrichtlinien durchzusetzen. Das Wertversprechen sind die Kosten pro Terabyte und die Compliance. Diese werden oft als langfristige Datenspeicherlösungen bezeichnet.

Einen Blick wert: — Ein Abonnement für von der Universität unterstützte Python- und Data-Science-Zertifikate.

Bedeutung zwei: Konservierungsinfrastruktur. Dies ist die forschungsorientierte Lesart, bei der Archivierung bedeutet, sicherzustellen, dass ein Datensatz auch im Jahr 2040 noch interpretierbar ist. Das Wertversprechen ist die Reproduzierbarkeit und wissenschaftliche Integrität. Dies ist ein zentraler Aspekt langfristiger Datenarchivierungslösungen.

Ein Labor, das eine Aufbewahrungsinfrastruktur kauft und davon ausgeht, dass es damit eine Konservierungsinfrastruktur besitzt, wird die Lücke bemerken, wenn ein Student versucht, eine Analyse aus dem Jahr 2018 erneut durchzuführen und feststellt, dass die HDF5-Datei zwar intakt ist, der Code, die Umgebung und die Einheiten jedoch nicht dokumentiert wurden. Archivierungsdatenlösungen für Performance und Archivierungsdatenlösungen für Datensicherheit – einschließlich Datenbankarchivierungslösungen für Big Data und Archivierungsdatenlösungen für Big Data – lösen das erste Problem. Nur Metadatendisziplin löst das zweite.

Vorteile langfristiger Datenarchivierungslösungen

Kostenreduzierung ist der Vorteil, den Anbieter versprechen, und er ist real: Kalte Objektspeicherung und Band kosten nur einen Bruchteil der Kapazität einer primären SSD oder eines hochleistungsfähigen parallelen Dateisystems. Das Verschieben eines abgeschlossenen Projekts aus einem Scratch-Dateisystem macht zudem Kapazität für die nächste Simulation frei, was oft der dringendste Gewinn ist.

Compliance ist der zweite Vorteil. Regulierte Bereiche – klinische Genomik, pharmazeutische Forschung, Umweltüberwachung – unterliegen Aufbewahrungsanforderungen, die in Jahren gemessen werden, und ein Archiv mit einem Audit-Trail ist der Mechanismus, der diese erfüllt. Archivierungsdatenlösungen für Compliance sowie Archivierung und Enterprise-Governance verwenden in der Regel dieselben Tools.

Reproduzierbarkeit ist der dritte und für die Zielgruppe dieser Website relevanteste Vorteil. Die Reproduzierbarkeitskrise in der Computerwissenschaft ist teilweise ein Speicherproblem: Ergebnisse können nicht reproduziert werden, weil Eingaben, Code und Umgebung nie gemeinsam archiviert wurden. Ein gut gestaltetes Archiv ist eine Lösung für Reproduzierbarkeitskrisen und nicht nur eine Speicherebene.

Vor- und Nachteile langfristiger Datenarchivierungslösungen

Vorteile

Verwandte: — Eine umfassende technische Bibliothek mit Büchern, Videos und Live-Schulungen zum Thema wissenschaftliches Rechnen.

  • Deutlich niedrigere Kosten pro Terabyte als Primärspeicher.
  • Gibt Hochleistungsspeicher für aktive Arbeit frei.
  • Erfüllt Aufbewahrungs- und Audit-Pflichten mit einem belegbaren Nachweis.
  • Bewahrt Daten zur Wiederverwendung, Metaanalyse und Zitierung auf.

Nachteile

  • Abruflatenz: Band- und Deep-Cloud-Tiers können Stunden bis Tage dauern.
  • Format- und Softwareveralterung können dazu führen, dass intakte Bytes unlesbar werden.
  • Metadatenschulden sammeln sich stillschweigend an und sind teuer in der Rückzahlung.
  • Migrationsaufwand wiederholt sich bei jeder Mediengeneration, bei Bändern etwa alle 5–10 Jahre.
  • Zugriffskontrollen und Verschlüsselungsschlüssel müssen die Menschen überleben, die sie eingerichtet haben.

Lohnt sich eine langfristige Datenarchivierungslösung?

Kosteneffizienzberechnungen hängen von drei Variablen ab: den Kosten für den Verlust der Daten, den Kosten für deren Aufbewahrung und der Wahrscheinlichkeit, dass man sie benötigt. Veröffentlichte Datensätze, die Papieren zugrunde liegen, Daten, die gesetzlichen Aufbewahrungspflichten unterliegen, und unersetzliche Instrumentenausgaben rechtfertigen fast immer eine Archivierung. Zwischendateien, die aus den Eingaben an einem Nachmittag regeneriert werden können, normalerweise nicht.

Ein Praxistest: Wenn die Neugenerierung der Daten mehr kostet als die Speicherung für den Aufbewahrungszeitraum, archivieren Sie diese. Bei einem mehrwöchigen Molekulardynamiklauf sind die Regenerationskosten hoch und die Speicherkosten niedrig, sodass die Antwort klar ist. Für eine abgeleitete CSV-Datei, die ein Skript in wenigen Minuten rekonstruiert, ist die Antwort in die andere Richtung ebenso klar.

Wenn Sie einkaufen: — Interaktive Python- und Data-Science-Kurse, bei denen Sie direkt im Browser programmieren.

Probleme bei der langfristigen Datenarchivierung

Bit-Rot und stille Korruption. Medien degradieren. Eine Fixitätsprüfung nach Zeitplan – nicht nur einmal zum Zeitpunkt des Schreibens – ist die einzige zuverlässige Erkennungsmethode.

Formatveralterung. Ein proprietäres Binärformat eines eingestellten Anbieters stellt selbst auf perfekten Medien ein Erhaltungsrisiko dar. Offene Formate mit veröffentlichten Spezifikationen, wie HDF5, NetCDF und Klartext- oder Parquet-Tabellendaten, altern weitaus besser.

Metadatenverlust. Der häufigste Fehler ist nicht eine defekte Festplatte, sondern eine fehlende README-Datei. Archive ohne strukturierte Metadaten werden innerhalb weniger Jahre unsuchbar.

Verlust von Schlüsseln und Anmeldedaten. Verschlüsselte Archive, deren Schlüssel verloren gegangen sind, sind nicht von gelöschten Archiven zu unterscheiden. Die Schlüsselhinterlegung (Key Escrow) ist eine Governance-Anforderung und kein nachträglicher Einfall.

Kostenüberraschungen. Cloud-Egress-Gebühren und Abrufkosten können die Speichereinsparungen übersteigen, wenn ein Projekt häufiger als erwartet gelesen wird. Modellieren Sie Abrufmuster, bevor Sie sich festlegen.

Organisatorische Diskontinuität. Labore werden aufgelöst, Förderungen enden und institutionelle Repositories wechseln die Plattform. Die Nachfolgeplanung ist Teil des technischen Designs.

Vergleich: Anpassung der Lösung an die Arbeitslast

ArbeitslastTypische EignungAchtung bei
Fertige Simulationstrajektorien (TB-Skala)Band oder Cold-Object-Storage mit Katalog (Archivierungsdatenlösungen für Big Data)Abruflatenz; Einheiten und Kraftfeld dokumentieren
Veröffentlichte Analyse-NotebooksGit-Repository plus archivierte Environment-Lockfile und Daten-SnapshotNotebook-Ausgaben sind kein Ersatz für die Daten
Rohausgabe des Instruments mit AufbewahrungsregelnTiered Object Storage mit Lifecycle-Policy (langfristige Datenspeicherlösungen)Egress- und Abrufkosten
Regulierte klinische oder pharmazeutische DatenAnbieter-Archiv mit Audit-Trail und Legal Hold (Lösungen von Datenarchivierungsunternehmen)Vendor-Lock-in und Exportformat
Kleines Labor, begrenztes BudgetInstitutionelles Repository plus externe Festplatte mit Prüfsummen (langfristige Datenarchivierungslösungen)Risiko eines Einzelkopie-Verlusts; Offsite-Kopie verifizieren

Hinweis: Berücksichtigen Sie bei der Bewertung von Datenbankarchivierungslösungen für Big Data oder anderen Lösungen von Datenarchivierungsunternehmen die oben aufgeführten spezifischen Arbeitslastanforderungen.

So wählen Sie aus: eine Kriterienliste

  • Aufbewahrungshorizont. Fünf Jahre und fünfzig Jahre erfordern unterschiedliche Medien und eine unterschiedliche Governance für langfristige Datenarchivierungslösungen.
  • Wiederherstellungshäufigkeit und Latenztoleranz. Wöchentlicher Zugriff schließt Deep-Archive-Bänder aus, was ein wichtiger Gesichtspunkt für Lösungen von Datenarchivierungsunternehmen ist.
  • Offenheit der Formate. Bevorzugen Sie Formate, die dokumentiert und weit verbreitet sind, wenn Sie Lösungen von Datenarchivierungsunternehmen bewerten.
  • Metadatenschema. Wählen Sie eines vor der Ingestion, nicht danach, für langfristige Datenspeicherlösungen.
  • Integritätsprüfung. Geplante Fixitätsprüfungen mit aufgezeichneten Ergebnissen sind für Archivierungsdatenlösungen für Big Data unerlässlich.
  • Exit-Strategie. Stellen Sie sicher, dass Sie alles in einem offenen Format exportieren können, insbesondere bei Datenbankarchivierungslösungen für Big Data.
  • Gesamtkosten einschließlich Wiederherstellung und Migration. Der reine Speicherpreis ist irreführend.

Reproduzierbarkeit und Notebook-Archivierung

Langzeitspeicherlösungen für Jupyter-Notebooks verdienen eine gesonderte Behandlung, da Notebooks ein hybrides Artefakt sind: Code, Ausgabe und Erzählung in einer einzigen Datei. Die Notebook-Datei allein ist nicht ausreichend. Ein dauerhaftes Archiv eines Berechnungsergebnisses sollte das Notebook, die Umgebungsspezifikation (eine Lock-Datei oder ein Container-Image-Digest), die Eingabedaten oder eine Prüfsumme plus Speicherort und eine Klartextbeschreibung der Bedeutung des Ergebnisses enthalten.

Tools wie Binder, Zenodo und institutionelle Repositories decken Teile davon ab. Zenodo vergibt DOIs für hinterlegte Artefakte, was die Zitierung ermöglicht. Container erfassen Umgebungen, aber keine Daten. Die Kombination – DOI-identifizierte Hinterlegung, containerisierte Umgebung, prüfsummenbasierte Daten – ist das am nächsten an ein vollständiges Reproduzierbarkeitsarchiv heranreichende System, das derzeit existiert.

Wichtige Erkenntnisse

  • Langfristige Datenarchivierungslösungen kombinieren Medien, Integritätssoftware, Metadaten und Governance; das Fehlen einer einzigen Ebene zerstört das Archiv.
  • Archive und Backups lösen unterschiedliche Probleme – Aufbewahrung und selektiver Abruf gegenüber schneller Wiederherstellung des aktuellen Zustands.
  • Die Kosten pro Terabyte sprechen für Band und Cold-Object-Storage, aber Abruflatenz, Egress-Gebühren und Migrationsaufwand sind die eigentlichen Budgetposten.
  • Formatoffenheit und Metadatendisziplin entscheiden darüber, ob intakte Bytes in zwanzig Jahren noch nutzbar sind.
  • Für die Computerwissenschaft muss das Archiv Umgebung und Provenienz erfassen, nicht nur Daten, um als Reproduzierbarkeitslösung zu dienen.
  • Standards wie ISO 14721 (OAIS) und ISO 16363 bieten einen fundierten Rahmen für vertrauenswürdige digitale Repositorien.

Quellen & Weiterführende Literatur

  • Research data archiving — Wikipedia: Research data archiving is the long-term storage of scholarly research data, including the natural sciences, social sciences, and life sciences. The various academic…
  • Data storage — Wikipedia: Data storage is the recording (storing) of information (data) in a storage medium. Handwriting, phonographic recording, magnetic tape, and optical discs are all…
  • Big data — Wikipedia: Big data primarily refers to data sets that are too large or complex to be dealt with by traditional data-processing software. Data with many entries (rows) offers…
  • Data security — Wikipedia: Data security or data protection is the process of securing digital information to protect it from online threats. Data security or protection means protecting digital…

Häufig gestellte Fragen

Was sind langfristige Datenarchivierungslösungen?

Langfristige Datenarchivierungslösungen sind die Kombination aus Speichermedien, Software, Metadatensystemen und Richtlinien, die Daten über Jahre oder Jahrzehnte hinweg bewahren und sie gleichzeitig abrufbar und überprüfbar halten. Sie unterscheiden sich von Backup-Systemen dadurch, dass sie den selektiven Abruf über einen langen Horizont gegenüber der schnellen Wiederherstellung eines aktuellen Zustands priorisieren. Standards wie ISO 14721 (OAIS) beschreiben das Referenzmodell für diese Art von Repository.

Was deckt die Bedeutung von langfristigen Datenarchivierungslösungen in der Praxis ab?

In der Praxis umfasst der Begriff zwei sich überschneidende Dinge: Aufbewahrungsinfrastruktur, die kalte Daten auf günstigere Medien schichtet und Richtlinien durchsetzt, und Konservierungsinfrastruktur, die sicherstellt, dass Daten interpretierbar bleiben. Anbieter und Lösungsanbieter von Datenarchivierungsunternehmen meinen in der Regel das Erste; Forschungsgruppen benötigen normalerweise das Zweite. Das eine zu kaufen und davon auszugehen, dass man das andere besitzt, ist das häufigste und teuerste Missverständnis.

Was sind die Hauptvorteile von Lösungen zur langfristigen Datenarchivierung?

Die Hauptvorteile sind niedrigere Speicherkosten pro Terabyte, freigewordene Kapazitäten auf Primärsystemen, die Einhaltung von Aufbewahrungspflichten sowie die Bewahrung von Daten zur Wiederverwendung und Zitierung. Für Computerwissenschaftler gibt es einen vierten Vorteil: Ein ordnungsgemäß aufgebautes Archiv erfasst die Umgebung und Provenienz, die zur Reproduktion eines Ergebnisses erforderlich sind, was einen Kernpunkt der Reproduzierbarkeitskrise adressiert. Diese Vorteile machen langfristige Datenspeicherlösungen für groß angelegte Forschung unerlässlich.

Was sind die Vor- und Nachteile von Lösungen zur langfristigen Datenarchivierung?

Zu den Vorteilen zählen Kosteneffizienz, Compliance-Unterstützung und langfristige Datenwiederverwendung. Zu den Nachteilen gehören die in Stunden oder Tagen gemessene Abruflatenz für Band- und Deep-Cloud-Tiers, das Risiko der Formatveralterung, wiederkehrender Migrationsaufwand bei jeder Mediengeneration und der Governance-Aufwand bei der Verwaltung von Verschlüsselungsschlüsseln und Zugriffsrechten bei Personalwechsel. Bei der Bewertung von Lösungen von Datenarchivierungsunternehmen müssen diese Kompromisse abgewogen werden.

Lohnen sich langfristige Datenarchivierungslösungen?

Eine Archivierung lohnt sich, wenn die Kosten für die Neugenerierung oder den Verlust der Daten die Kosten für deren Speicherung über den Aufbewahrungszeitraum übersteigen. Unersetzbare Instrumentenausgaben, veröffentlichte Datensätze und regulierte Aufzeichnungen qualifizieren sich fast immer.

Abgeleitete Dateien, die durch Skripte schnell wiederhergestellt werden können, normalerweise nicht. Modellieren Sie die Abrufhäufigkeit und die Egress-Kosten, bevor Sie sich für einen Cloud-Tier entscheiden, insbesondere wenn Sie Datenarchivierungslösungen für Big Data in Betracht ziehen.

Auf welche Probleme stoßen langfristige Datenarchivierungslösungen?

Die wiederkehrenden Probleme sind Bit Rot und stille Korruption, Formatveralterung, Metadatenverlust, verlorene Verschlüsselungsschlüssel, unerwartete Abruf- und Egress-Kosten sowie organisatorische Diskontinuität, wenn Labore aufgelöst werden oder Fördermittel auslaufen. Geplante Fixitätsprüfungen, offene Formate, strukturierte Metadaten, Key Escrow und Nachfolgeplanung sind die Standardmaßnahmen für jedes dieser Probleme, auch bei der Implementierung von Datenbankarchivierungslösungen für Big Data.

Weiterführende Literatur

  • Konsultieren Sie das Referenzmodell des Open Archival Information System, ISO 14721, für das kanonische Vokabular der digitalen Langzeitarchivierung und langfristigen Datenarchivierungslösungen.
  • Die Research Data Alliance veröffentlicht praktische Leitlinien zur Datenzitierung und zu Metadaten für Forschungsarchive und Lösungen von Datenarchivierungsunternehmen.
  • Die Digital Preservation Coalition führt ein Handbuch mit Leitlinien zu Format- und Medienrisiken, einschließlich Lösungen von Datenarchivierungsunternehmen und Lösungen zur langfristigen Datenspeicherung.
  • Zu den Kriterien für die Repository-Zertifizierung siehe ISO 16363 zur Prüfung und Zertifizierung vertrauenswürdiger digitaler Repositories, die als Grundlage für Archivierungsdatenlösungen für Big Data und Datenbankarchivierungslösungen für Big Data dienen kann.

Häufig gestellte Fragen

Was sind langfristige Datenarchivierungslösungen?

Bei Lösungen zur langfristigen Datenarchivierung handelt es sich um kombinierte Speichermedien, Software, Metadatensysteme und Richtlinien, die Daten über Jahre oder Jahrzehnte hinweg aufbewahren und gleichzeitig abrufbar und überprüfbar halten. Sie unterscheiden sich von Backup-Systemen dadurch, dass sie dem selektiven Abruf über einen längeren Zeitraum Vorrang vor der schnellen Wiederherstellung des aktuellen Zustands einräumen. Standards wie ISO 14721 (OAIS) beschreiben das Referenzmodell für ein solches Repository.

Was decken langfristige Datenarchivierungslösungen in der Praxis ab?

In der Praxis umfasst der Begriff zwei sich überschneidende Dinge: Aufbewahrungsinfrastruktur, die kalte Daten auf günstigere Medien verteilt und Richtlinien durchsetzt, und Aufbewahrungsinfrastruktur, die sicherstellt, dass Daten interpretierbar bleiben. Anbieter und Anbieter von Lösungen für Datenarchivierungsunternehmen meinen in der Regel das Erste; Forschungsgruppen benötigen normalerweise die zweite. Das eine zu kaufen und davon auszugehen, dass man das andere hat, ist das häufigste und teuerste Missverständnis.

Was sind die Hauptvorteile langfristiger Datenarchivierungslösungen?

Die Hauptvorteile sind niedrigere Speicherkosten pro Terabyte, freigewordene Kapazität auf Primärsystemen, Einhaltung von Aufbewahrungspflichten und Aufbewahrung von Daten zur Wiederverwendung und Zitierung. Für Informatiker gibt es einen vierten Vorteil: Ein ordnungsgemäß aufgebautes Archiv erfasst die Umgebung und Herkunft, die zur Reproduktion eines Ergebnisses erforderlich sind, was einen Kernpunkt der Reproduzierbarkeitskrise angeht. Aufgrund dieser Vorteile sind langfristige Datenspeicherlösungen für groß angelegte Forschung unerlässlich.

Was sind die Vor- und Nachteile von Lösungen zur langfristigen Datenarchivierung?

Zu den Vorteilen zählen Kosteneffizienz, Compliance-Unterstützung und langfristige Datenwiederverwendung. Zu den Nachteilen gehören die in Stunden oder Tagen gemessene Abruflatenz für Band- und Deep-Cloud-Tiers, das Risiko der Formatveralterung, wiederkehrender Migrationsaufwand bei jeder Mediengeneration und der Governance-Aufwand durch die Verwaltung von Verschlüsselungsschlüsseln und Zugriffsrechten bei Personalwechsel. Bei der Bewertung der Lösungen von Datenarchivierungsunternehmen müssen diese Kompromisse abgewogen werden.

Lohnen sich langfristige Datenarchivierungslösungen?

Eine Archivierung lohnt sich, wenn die Kosten für die Neugenerierung oder den Verlust der Daten die Kosten für deren Speicherung für den Aufbewahrungszeitraum übersteigen. Unersetzbare Instrumentenausgaben, veröffentlichte Datensätze und regulierte Aufzeichnungen kommen fast immer in Frage. Abgeleitete Dateien, die von Skripten schnell wiederhergestellt werden können, tun dies normalerweise nicht. Modellieren Sie die Abrufhäufigkeit und die Kosten für ausgehenden Datenverkehr, bevor Sie sich auf eine Cloud-Ebene festlegen, insbesondere wenn Sie Datenarchivierungslösungen für Big Data in Betracht ziehen.

Auf welche Probleme stoßen langfristige Datenarchivierungslösungen?

Die wiederkehrenden Probleme sind Bitfäule und stille Korruption, Formatveralterung, Metadatenverlust, verlorene Verschlüsselungsschlüssel, unerwartete Abruf- und Ausgangskosten sowie organisatorische Diskontinuität, wenn Labore aufgelöst werden oder Fördermittel auslaufen. Geplante Fixitätsprüfungen, offene Formate, strukturierte Metadaten, Schlüsselhinterlegung und Nachfolgeplanung sind die Standardmaßnahmen für beides, auch bei der Implementierung von Datenbankarchivierungslösungen für Big Data. Weiterführende Literatur – Konsultieren Sie das Referenzmodell des Open Archival Information System, ISO 14721, für das kanonische Vokabular der digitalen Aufbewahrung und Langzeitdatenarchivierung


Lernen Sie Python, indem Sie in Ihrem Browser programmieren

Interaktive Python- und Data-Science-Kurse, bei denen Sie direkt im Browser programmieren