Archivierungsdatendienste: Ein praktischer Leitfaden
Archivierungsdatendienste verschieben Forschungsdaten vom aktiven Speicher in einen unabhängig verwalteten Langzeitspeicher mit Integritätsprüfungen, dauerhaften Identifikatoren und dokumentierten Aufbewahrungsrichtlinien und umfassen ungefähr vier Kategorien: institutionelle Repositories, domänenspezifische Archive, kommerzielle Cloud-Ebenen und selbst gehostete Systeme. Das OAIS-Referenzmodell (ISO 14721) definiert die funktionalen Rollen eines Archivs, und eine sorgfältige Auswahl ist wichtig, da eine molekulardynamische Trajektorie oder HDF5-Pipeline-Ausgabe, die in fünf Jahren nicht zurückgelesen werden kann, effektiv verloren geht.
- Datenarchivierung ist kein Backup: Backups stellen ein funktionsfähiges System wieder her, Archive bewahren ein festes, zitierfähiges Artefakt über Jahre oder Jahrzehnte hinweg.
- Die entscheidenden Kriterien für Datenarchivierungsdienste sind Aufbewahrungsgarantie, Fixitätsüberprüfung, persistente Identifikatoren, Metadatenstandards und Exit-Strategie – nicht der Rohpreis der Speicherung.
- Domain-Archive (PDB, GenBank, Zenodo, Dryad) bieten Ihnen kostenlose DOI-Erstellung und Community-Metadaten; Allzweck-Cloud-Cold-Stufen bieten Ihnen Skalierbarkeit, aber die Kuratierung bleibt Ihnen überlassen.
- Die FAIR-Prinzipien und das OAIS-Referenzmodell sind die beiden Rahmenwerke, auf die sich die meisten Geldgeber und Repositorien beziehen.
- Testen Sie die Wiederherstellung, bevor Sie sie festschreiben: Ein Archiv, aus dem Sie noch nie etwas zurückgelesen haben, ist eine Vermutung, keine Garantie.
Was ist Datenarchivierung und wie unterscheidet sie sich vom Backup?
Datenarchivierung bedeutet, dass eine endgültige, unveränderliche Kopie eines Datensatzes in einem verwalteten Speicher abgelegt wird, dessen Aufgabe eher die Aufbewahrung als die Verfügbarkeit ist. Es ist ein Backup vorhanden, damit Sie nach Löschung, Beschädigung oder Hardwarefehler eine Wiederherstellung durchführen können.
Es ist in der Regel versioniert, wird häufig überschrieben und befindet sich in der Nähe des Arbeitssystems. Ein Archiv existiert, damit eine bestimmte Version eines bestimmten Datensatzes lesbar und zitierfähig bleibt, nachdem das Projekt, der Student und möglicherweise das Labor weitergegangen sind.
Für Informatiker hat diese Unterscheidung Gewicht. Eine auf einem Labor-RAID-Array definierte GROMACS-Trajektorie mit 2 TB wird gesichert, wenn die Kopie nachts mit einem zweiten Server synchronisiert wird.
Es wird nur archiviert, wenn sich eine eingefrorene Kopie in einem System mit dokumentierter Aufbewahrung, Prüfsummen und einer dauerhaften Kennung wie einem DOI befindet. Der erste schützt Sie davor, dass Ihre Festplatte diese Woche ausfällt. Die zweite schützt einen Leser aus dem Jahr 2029, der Ihren Artikel aus dem Jahr 2024 reproduzieren möchte.
Die vier Kategorien von Datenarchivierungsdiensten
Archivierungsdatendienste lassen sich in vier praktische Gruppen einteilen, und die meisten Forschungsgruppen verwenden am Ende zwei oder drei für verschiedene Datenklassen.
Verwandte: — Interaktive Python- und Data-Science-Kurse, bei denen Sie direkt im Browser programmieren.
Institutionelle Repositories. Universitäten und nationale Labore unterhalten typischerweise Repositories, die auf DSpace, Dataverse oder Figshare basieren. Die Speicherung ist für angeschlossene Forscher im Allgemeinen kostenlos, Metadaten werden von Bibliothekaren verwaltet und DOIs werden erstellt. Die Dateigrößenbeschränkungen und das Gesamtkontingent variieren stark. Überprüfen Sie dies daher, bevor Sie eine Hinterlegung von mehreren Terabyte planen.
Domänenspezifische Archive. Disziplinen mit starken Datenkulturen unterhalten ihre eigenen Archive: die Protein Data Bank und GenBank in der Strukturbiologie und Genomik, das Materials Project und NOMAD in den Materialwissenschaften, Zenodo und Dryad als universelle domänenübergreifende Optionen und NASA/PDS- oder ESA-Archive für Planeten- und Erdbeobachtungsdaten. Diese bringen Community-Metadatenschemata, Validierung bei der Aufnahme und lange institutionelle Verpflichtungen mit sich.
Kommerzielle Cloud-Archivebenen. AWS S3 Glacier und Glacier Deep Archive, Azure Archive Storage und Google Cloud Archive Storage bieten sehr niedrige Speicherkosten pro Terabyte mit einer Abruflatenz von Minuten bis Stunden und Abrufgebühren, die die Rechnung dominieren können. Sie eignen sich hervorragend für große Rohdatensätze, die Sie selten berühren, und sind als Einzelarchiv schlecht geeignet, da sie keine Kuration, keinen DOI und keine Aufbewahrungsrichtlinie bieten.
Einen Blick wert: — Ein Abonnement für von der Universität unterstützte Python- und Data-Science-Zertifikate.
Selbst gehostete Datenarchivierungssysteme. Einige Gruppen führen ihre eigenen iRODS-, Archivematica- oder einfachen Objektspeicher-plus-Manifest-Setups aus. Dies gibt volle Kontrolle und kann die einzige Option für sensible oder exportkontrollierte Daten sein, aber es macht Ihr Team für die Medienmigration, Formatmigration und das institutionelle Kontinuitätsproblem verantwortlich – wer hält den Server nach Ablauf der Förderung am Laufen?
Kriterien für die Auswahl eines Datenarchivierungsdienstes
Der folgende Vergleich spiegelt die Fragen wider, die tatsächlich darüber entscheiden, ob Archivierungsdatendienste den Kontakt mit einem Geldgeber, einem Gutachter oder einem zukünftigen Leser überleben.
| Kriterium | Was Sie fragen sollten | Warum es wichtig ist |
|---|---|---|
| Aufbewahrungsgarantie | Gibt es eine veröffentlichte Aufbewahrungsrichtlinie und wer finanziert diese? | „Forever“-Versprechen ohne Stiftungskapital oder Mandat sind bloße Wunschdenken |
| Fixitätsprüfung | Werden Prüfsummen bei der Aufnahme und nach einem Zeitplan überprüft? | Silent Bit Rot ist der Fehlermodus, den Sie nicht sehen können |
| Persistente Bezeichner | Werden DOIs vergeben oder Äquivalente? | Zitierungen und die Compliance der Geldgeber hängen von stabilen Links ab |
| Metadatenstandard | Akzeptiert oder erfordert es Domänenschemata? | Auffindbarkeit und Maschinenlesbarkeit |
| Formatrichtlinie | Empfiehlt oder erfordert es offene Formate? | Proprietäre Binärformate altern stark |
| Zugangskontrolle | Können Sie ein Embargo verhängen, einschränken oder eine Lizenz festlegen? | Menschliche und geschützte Daten benötigen dies |
| Exit-Strategie | Können Sie den gesamten Datensatz mit Metadaten in großen Mengen exportieren? | Verhindert Vendor-Lock-in |
| Kostenmodell | Gebühren für Aufnahme, Speicherung, Abruf, Ausgang und Löschung | Abruf und Ausstieg stellen den Speicher oft in den Schatten |
Eine nützliche Disziplin besteht darin, die Kandidatenarchive anhand dieser Liste zu bewerten, bevor Sie etwas einreichen, und die Entscheidung in Ihrem Datenverwaltungsplan festzuhalten. Genau diese Begründung fordern Geldgeber zunehmend.
Datenspeicherung und -archivierung: Wo die Grenzen liegen
Datenspeicherung und Archivierung werden häufig miteinander verwechselt, da es sich bei beiden um Festplatten handelt. Die Betriebsgrenze ist jedoch der Punkt, an dem sich ein Datensatz nicht mehr ändert.
Aktiver Speicher speichert Daten, die Sie lesen und schreiben. Nearline-Speicher speichert Daten, auf die Sie gelegentlich zugreifen. Der Archivspeicher enthält Daten, die Sie behalten möchten, aber selten berühren. Ein dreistufiges Layout – schneller Scratch-Speicher, Projektspeicherung, Archiv – lässt sich genau darauf abstimmen und verhindert den häufigen Fehler, ein freigegebenes Netzlaufwerk als Archiv zu behandeln.
Die Wahl der Archivdatenspeicherung wirkt sich auch auf die Dateiformate aus. Komprimierte NumPy-Formate „.npz“, HDF5, NetCDF, Parquet und reine Textformate bleiben auf absehbare Zeit mit offenen Tools lesbar.
Checkpoint-Dateien aus einer bestimmten Simulationscodeversion, proprietäre Instrumentenformate und undokumentierte Binär-Dumps sind solche, die entweder eine Konvertierung oder einen eingebetteten Player erfordern. Als Faustregel gilt: Wenn Sie die Datei nicht mit einem vorhandenen Tool außerhalb Ihres Labors öffnen können, konvertieren Sie sie, bevor Sie sie archivieren.
So archivieren Sie einen Datensatz: Ein wiederholbarer Workflow
Ein Datenarchivierungs-Workflow, der einer Überprüfung standhält, besteht aus sechs Schritten.
- Den Datensatz einfrieren. Definieren Sie genau, aus welchen Dateien das archivierte Artefakt besteht, einschließlich Eingaben, Codeversion, Umgebungsspezifikation und Ausgaben. Speichern Sie ein Manifest mit Größen und Prüfsummen.
- Dokument. Schreiben Sie eine README-Datei mit Informationen zu Herkunft, Softwareversionen, Einheiten und bekannten Einschränkungen. Dies ist die Stunde mit dem höchsten Wert, die Sie verbringen werden.
- Wählen Sie das Archiv aus. Passen Sie die Datenklasse an die Archivierungsdatendienste an: Rohsequenzierungslesevorgänge in einem Sequenzarchiv, Strukturen in der PDB, alles andere in einem institutionellen oder allgemeinen Repository und Massenkaltkopien auf eine Cloud-Archivebene.
- Hinterlegen und Bestätigen. Laden Sie das Archiv hoch, lassen Sie es seine Prüfungen durchführen und bestätigen Sie, dass die Prüfsummen mit Ihrem Manifest übereinstimmen.
- Drucken und speichern Sie die ID. Tragen Sie den DOI in das Papier, das Labornotizbuch und Ihren Datenmanagementplan ein.
- Wiederherstellung testen. Laden Sie ein Beispiel herunter, überprüfen Sie die Prüfsummen und öffnen Sie die Dateien in einer sauberen Umgebung. Tun Sie es einmal, zum Zeitpunkt der Einreichung, nicht in fünf Jahren.
Die Schritte 1 und 6 werden am häufigsten ignoriert und helfen dabei, echte Probleme zu erkennen.
Best Practices und häufige Fehlermodi
Bei den Best Practices für die Datenarchivierung geht es weniger um Technologie als vielmehr um Gewohnheiten. Versionieren Sie Ihre Datensätze explizit, anstatt sie zu überschreiben, sodass ein DOI auf ein festes Artefakt verweist.
Halten Sie die Archivkopie schreibgeschützt. Speichern Sie das Manifest und die README-Datei mit den Daten, nicht in einem separaten Wiki. Bevorzugen Sie offene Formate und dokumentieren Sie diejenigen, die es nicht sind. Und trennen Sie die Frage „Wo sind die Daten?“ von „Wie bekomme ich es zurück?“ — Die zweite Frage ist die, die zählt.
Häufige Fehlerarten sind vorhersehbar. Die Behandlung eines synchronisierten Cloud-Ordners als Archiv schlägt fehl, da bei der Synchronisierung Löschvorgänge weitergegeben werden. Sich auf eine einzige kommerzielle Stufe zu verlassen, schlägt fehl, wenn die Abrufgebühren eine Wiederherstellung undurchführbar machen. Das Hinterlegen ohne Metadaten schlägt fehl, da die Daten nicht mehr auffindbar sind. Und angenommen, die institutionelle Kontinuität scheitert, wenn ein Labor geschlossen wird und niemand weiß, auf welchem Server sich die einzige Kopie befand. Jedes dieser Probleme lässt sich zum Zeitpunkt der Einzahlung kostengünstig verhindern und eine spätere Reparatur ist kostspielig. Berücksichtigen Sie bei der Auswahl von Archivierungsdatendiensten diese Risiken.
Wissenswerte Standards und Frameworks
In der Dokumentation von Geldgebern und Repositorien für die Archivierung von Datendiensten tauchen immer wieder zwei Frameworks auf. Das OAIS-Referenzmodell (ISO 14721) definiert die funktionalen Rollen eines Archivs – Aufnahme, Archivspeicherung, Datenverwaltung, Zugriff und Aufbewahrungsplanung – und ist das von den meisten Repository-Softwareprogrammen verwendete Vokabular. Die FAIR-Prinzipien (Findable, Accessible, Interoperable, Reusable) beschreiben, was ein gut archivierter Datensatz einem Leser bieten sollte und werden von vielen Geldgebern und Zeitschriften zitiert. Die Research Data Alliance und die Digital Preservation Coalition veröffentlichen praktische Leitlinien zur Aufbewahrung, Formatmigration und Zertifizierung; CoreTrustSeal ist eine Zertifizierung, die signalisiert, dass ein Repository die grundlegenden Aufbewahrungskriterien erfüllt. Die Überprüfung, ob ein Kandidatenarchiv über eine CoreTrustSeal-Zertifizierung oder eine gleichwertige Zertifizierung verfügt, ist eine schnelle Möglichkeit, Optionen zu filtern.
Quellen und weiterführende Literatur
- Archivierung von Forschungsdaten – Wikipedia: Bei der Archivierung von Forschungsdaten handelt es sich um die langfristige Speicherung wissenschaftlicher Forschungsdaten, einschließlich der Naturwissenschaften, Sozialwissenschaften und Lebenswissenschaften. Die verschiedenen akademischen…
Häufig gestellte Fragen
Was ist Datenarchivierung in einfachen Worten?
Bei der Datenarchivierung wird eine endgültige, unveränderliche Kopie eines Datensatzes in einem verwalteten Langzeitspeicher abgelegt, damit er über Jahre hinweg lesbar und zitierfähig bleibt. Es unterscheidet sich vom Backup, das dazu dient, ein funktionierendes System nach einem Ausfall wiederherzustellen. In einem Archiv geht es um Bewahrung und Herkunft; Bei einem Backup geht es um die Wiederherstellung.
Sind kostenlose Datenarchivierungsdienste gut genug für Forschungsdaten?
Kostenlose Archivierungsdatendienste wie Institutional Repositories, Zenodo und Domain Archives eignen sich häufig hervorragend für Forschungsdaten, da sie Kuration, DOIs und Community-Metadaten kostenlos hinzufügen. Ihre Grenzen liegen in der Regel eher in der Dateigröße, dem Gesamtkontingent und der Formatrichtlinie als in der Qualität. Für Multi-Terabyte-Rohdatensätze muss möglicherweise ein kostenloses Archiv mit einer kostenpflichtigen Cold-Storage-Stufe kombiniert werden.
Wie lange sollten Forschungsdaten archiviert werden?
Die Aufbewahrungsanforderungen variieren je nach Geldgeber, Zeitschrift und Institution und reichen in der Regel von einigen Jahren nach Projektende bis zu einem Jahrzehnt oder mehr für bestimmte Datentypen. Anstatt zu raten, prüfen Sie die Datenrichtlinie Ihres Geldgebers und den Aufbewahrungsplan Ihrer Institution und notieren Sie die erforderliche Aufbewahrungsfrist in Ihrem Datenverwaltungsplan.
Was ist der Unterschied zwischen Datenarchivierung und Datenspeicherung?
Unter Datenspeicherung versteht man die allgemeine Fähigkeit, Daten aufzubewahren, unabhängig davon, ob sie aktiv, Nearline oder archiviert sind. Datenarchivierung ist die spezifische Praxis der Aufbewahrung eines festen Datensatzes mit Integritätsprüfungen, Metadaten und einer Aufbewahrungsverpflichtung. Speicher ist eine Ressource; Die Archivierung ist ein Prozess mit Garantien.
Kann ich Daten in der Cloud archivieren?
Cloud-Archivebenen wie S3 Glacier, Azure Archive Storage und die Google Cloud Archive-Speicherklasse eignen sich für große Datensätze, auf die selten zugegriffen wird. Sie bieten Haltbarkeit und niedrige Speicherkosten, aber keine Kuratierung, keinen DOI und Abruf- oder Egress-Gebühren, die erheblich sein können. Die meisten Forschungsgruppen verwenden sie als Massenkopie neben einem kuratierten Repository, das den zitierfähigen Datensatz enthält.
Wie wähle ich ein Datenarchivierungsunternehmen oder einen Anbieter aus?
Beginnen Sie mit der Kriterientabelle oben: Aufbewahrungsrichtlinie, Fixitätsprüfung, persistente Identifikatoren, Metadatenunterstützung, Zugriffskontrolle, Exit-Strategie und das Vollkostenmodell einschließlich Abruf. Passen Sie dann den Anbieter an Ihre Datenklasse an – Domänenarchive für disziplinspezifische Daten, institutionelle Repositories für allgemeine Forschungsergebnisse und kommerzielle Ebenen für Massenkopien. Testen Sie den Abruf vor dem Festschreiben.
Häufig gestellte Fragen
Was ist Datenarchivierung in einfachen Worten?
Bei der Datenarchivierung wird eine endgültige, unveränderliche Kopie eines Datensatzes in einem verwalteten Langzeitspeicher abgelegt, damit er über Jahre hinweg lesbar und zitierfähig bleibt. Es unterscheidet sich vom Backup, das dazu dient, ein funktionierendes System nach einem Ausfall wiederherzustellen. In einem Archiv geht es um Bewahrung und Herkunft; Bei einem Backup geht es um die Wiederherstellung.
Sind kostenlose Datenarchivierungsdienste für Forschungsdaten gut genug?
Kostenlose Archivierungsdatendienste wie Institutional Repositories, Zenodo und Domain Archives eignen sich häufig hervorragend für Forschungsdaten, da sie Kuration, DOIs und Community-Metadaten kostenlos hinzufügen. Ihre Grenzen liegen in der Regel eher in der Dateigröße, dem Gesamtkontingent und der Formatrichtlinie als in der Qualität. Für Multi-Terabyte-Rohdatensätze muss möglicherweise ein kostenloses Archiv mit einer kostenpflichtigen Cold-Storage-Stufe kombiniert werden.
Wie lange sollten Forschungsdaten archiviert werden?
Die Aufbewahrungsanforderungen variieren je nach Geldgeber, Zeitschrift und Institution und reichen in der Regel von einigen Jahren nach Projektende bis zu einem Jahrzehnt oder mehr für bestimmte Datentypen. Anstatt zu raten, prüfen Sie die Datenrichtlinie Ihres Geldgebers und den Aufzeichnungsplan Ihrer Institution und notieren Sie die erforderliche Aufbewahrungsfrist in Ihrem Datenverwaltungsplan.
Was ist der Unterschied zwischen Datenarchivierung und Datenspeicherung?
Unter Datenspeicherung versteht man die allgemeine Fähigkeit, Daten aufzubewahren, unabhängig davon, ob sie aktiv, Nearline oder archiviert sind. Datenarchivierung ist die spezifische Praxis der Aufbewahrung eines festen Datensatzes mit Integritätsprüfungen, Metadaten und einer Aufbewahrungsverpflichtung. Speicher ist eine Ressource; Die Archivierung ist ein Prozess mit Garantien.
Kann ich Daten in der Cloud archivieren?
Cloud-Archivebenen wie S3 Glacier, Azure Archive Storage und die Google Cloud Archive-Speicherklasse eignen sich für große Datensätze, auf die selten zugegriffen wird. Sie bieten Haltbarkeit und niedrige Speicherkosten, aber keine Kuratierung, keinen DOI und Abruf- oder Ausgangsgebühren, die erheblich sein können. Die meisten Forschungsgruppen verwenden sie als Massenkopie neben einem kuratierten Repository, das den zitierfähigen Datensatz enthält.
Wie wähle ich ein Datenarchivierungsunternehmen oder einen Anbieter aus?
Beginnen Sie mit der Kriterientabelle oben: Aufbewahrungsrichtlinie, Fixitätsprüfung, persistente Identifikatoren, Metadatenunterstützung, Zugriffskontrolle, Exit-Strategie und das Vollkostenmodell einschließlich Abruf. Passen Sie dann den Anbieter an Ihre Datenklasse an – Domänenarchive für disziplinspezifische Daten, institutionelle Repositories für allgemeine Forschungsergebnisse und kommerzielle Ebenen für Massenkopien. Testen Sie den Abruf vor dem Festschreiben.
Erstellen Sie Projekt für Projekt ein Datenportfolio
Projektbasierte Data-Science-Pfade mit geführtem Terminal und realen Datensätzen