Zum Hauptinhalt springen
ActivePapers Speichern Sie Ihre Daten als recomputable documents – damit jedes veröffentlichte Ergebnis erneut ausgeführt, verifiziert und archiviert werden kann.

Einige Links auf dieser Website sind Affiliate-Links: Wenn Sie über diese kaufen, erhalten wir unter Umständen eine Provision, ohne dass für Sie zusätzliche Kosten entstehen. Dies beeinflusst niemals unsere Empfehlungen. Details finden Sie in unserer Affiliate-Offenlegung. Offenlegung der Affiliate-Partnerschaft.

Beste Datenarchivierungssoftware: Top-Picks im Vergleich

Datenarchivierungssoftware umfasst vier verschiedene Kategorien: Backup-Tools, hierarchisches Speichermanagement (HSM), Forschungsdaten-Repositories und Enterprise-Archivierungsplattformen, die jeweils ein anderes Problem lösen. Die richtige Wahl hängt davon ab, ob Sie eine Point-in-Time-Wiederherstellung, eine langfristige Bit-Level-Bewahrung oder eine regulatorische Aufbewahrung benötigen. Die entscheidenden Kriterien für Forschungsgruppen sind Formatoffenheit, Prüfsummenverifizierung, Metadatenerfassung und Kosten bei 10 TB+ – nicht Markenbekanntheit.

  • Archivierung und Backup lösen unterschiedliche Probleme: Backup stellt nach einem Fehler einen aktuellen Zustand wieder her; Archivierung bewahrt eine bestimmte, unveränderliche Version über Jahre oder Jahrzehnte hinweg.
  • Für Forschungsgruppen sind Formatoffenheit, Prüfsummenverifizierung, Metadatenerfassung und Kosten bei 10 TB+ die entscheidenden Kriterien – nicht Markenbekanntheit.
  • Open-Source-Softwaretools (BagIt, DVC, iRODS, Archivematica, restic, Borg) decken die meisten wissenschaftlichen Archivierungsbedürfnisse ohne Lizenzgebühren ab, erfordern jedoch betrieblichen Aufwand.
  • Unternehmensplattformen (IBM, Dell EMC, Veritas, Commvault) bieten Policy-Engines, Legal Hold und Compliance-Berichte, die Labore selten benötigen.
  • Das Archivierungsmodul von SAP (SAP ArchiveLink / Data Archiving, jetzt Teil von SAP Information Lifecycle Management) ist ein Datenbank-Offload-Mechanismus und kein Allzweck-Dateiarchiv.
  • Testen Sie die Wiederherstellung, bevor Sie einem Archiv vertrauen; ein nicht verifiziertes Archiv ist eine Hypothese, keine Garantie.

Was ist Datensicherungssoftware?

Datensicherungssoftware erstellt eine wiederherstellbare Kopie des aktuellen oder letzten Zustands eines Systems, sodass ein Fehler (Festplattenausfall, Ransomware, versehentliches Löschen) rückgängig gemacht werden kann. Backup-Tools optimieren die Wiederherstellungszeit und den Wiederherstellungspunkt: wie schnell Sie eine Wiederherstellung durchführen können und wie viele Daten Sie sich leisten können zu verlieren.

Produkte wie Veeam, Bacula, restic und BorgBackup passen in diese Definition. Backups erfolgen in der Regel zyklisch: Dieselben Daten werden wiederholt kopiert, wobei alte Kopien nach einem Aufbewahrungsplan ablaufen.

Die Unterscheidung ist wichtig, da Backup und Archivierung gegensätzliche wirtschaftliche Aspekte haben. Backup-Speicher ist pro Byte teuer, da er schnelle zufällige Lesevorgänge und häufige Neuschreibvorgänge unterstützen muss.

Archivspeicher ist pro Byte kostengünstig, da er einmal geschrieben und nur selten gelesen wird: Band, Objektspeicher mit Cold-Tiers oder optische Medien. Ein Backup, das zehn Jahre hält, ist kein Archiv; es ist ein Backup mit einem langen Aufbewahrungsfenster und wird jede vom Quellsystem angesammelte stille Beschädigung erben.

Für Computerwissenschaftler bedeutet dies in der Praxis, dass ein nächtlicher rsync auf ein Labor-NAS ein Backup und keine Archivierung darstellt. Wenn eine Simulationseingabedatei vor drei Jahren stillschweigend beschädigt wurde und jedes nachfolgende Backup die beschädigte Version kopiert hat, wird Sie keine Backup-Generation retten. Ein Archiv mit Prüfsummen pro Datei und Write-Once-Semantik hingegen schon.

Verwandte: — Projektbasierte Data-Science-Pfade mit geführtem Terminal und realen Datensätzen.

Was ist Archivieren von Daten?

Datenarchivierung bedeutet, Daten, die nicht mehr aktiv genutzt werden, in einen separaten Langzeitspeicher zu verschieben, wo sie intakt bleiben und später abgerufen werden können. Die bestimmenden Eigenschaften sind Unveränderlichkeit (das archivierte Objekt ändert sich nicht), Integritätsüberprüfung (Prüfsummen oder Fixity-Checks) und Aufbewahrungsrichtlinie (wie lange und was die Löschung auslöst). Archivierung ist eine Lebenszyklus-Entscheidung: Daten bewegen sich von Hot-Storage über Warm-Storage zu Cold-Storage und schließlich zur Entsorgung oder dauerhaften Bewahrung.

Standards und Konventionen verankern diese Arbeit. Das Referenzmodell des Open Archival Information System (OAIS), veröffentlicht als ISO 14721, definiert die funktionalen Einheiten (Ingest, Archivspeicherung, Datenverwaltung, Zugriff), die jedes seriöse Archiv implementiert.

Die BagIt-Spezifikation (RFC 8493) definiert eine einfache, selbstbeschreibende Verzeichnisstruktur zur Übertragung beliebiger Dateien mit Manifesten und Prüfsummen. Die FAIR-Prinzipien (Findable, Accessible, Interoperable, Reusable) regeln, wie Forschungsarchive Metadaten offenlegen sollten. Die Tools, die diese Standards implementieren, sind interoperabel; Tools, die ihr eigenes Containerformat erfinden, erzeugen einen Lock-in.

Einen Blick wert: — Ein Abonnement für von der Universität unterstützte Python- und Data-Science-Zertifikate.

Drei Archivierungsmodelle dominieren die wissenschaftliche Praxis:

  1. Archiv auf Dateiebene: Ein Verzeichnisbaum zusammen mit Manifesten und Prüfsummen, gespeichert auf Band oder Objektspeicher. BagIt und tar + sha256sum sind die Mindestversionen.
  2. Repository-Archiv – ein verwalteter Dienst (Zenodo, Dryad, institutionelle Repositories, Dataverse), der DOIs zuweist, Metadatenschemata erzwingt und die Langzeitbewahrung übernimmt.
  3. Anwendungsarchiv: Aus einem Live-System in schreibgeschützter Form exportierte Daten, z. B. die Datenarchivierung von SAP oder die Cold-Storage-Ebene einer Datenbank.

Jedes Modell hat einen anderen Fehlermodus. Archive auf Dateiebene scheitern aufgrund von Bit-Rot und Verlust der Dokumentation. Repository-Archive scheitern aufgrund von Richtlinienänderungen und Finanzierungsverlusten. Anwendungsarchive scheitern aufgrund von Formatänderungen des Anbieters.

Was ist Datenarchivierung in SAP?

Bei der Datenarchivierung in SAP werden abgeschlossene Geschäftsdokumente und Stammdaten aus der aktiven Datenbank in Archivdateien verschoben, während sie innerhalb von SAP-Transaktionen lesbar bleiben. Der Mechanismus wird durch SAP Data Archiving (Transaktion SARA und zugehörige Archivierungsobjekte) und SAP ArchiveLink bereitgestellt, das archivierte Dokumente mit den Anwendungen verknüpft, die sie anzeigen. In aktuellen SAP-Releases ist diese Funktionalität Teil von SAP Information Lifecycle Management (ILM), das Aufbewahrungsregeln, Legal Hold und Vernichtungsmanagement hinzufügt.

Die Motivation sind Leistung und Kosten. Eine SAP ERP- oder S/4HANA-Produktionsdatenbank, in der sich über Jahre Bestellungen, Materialdokumente und Änderungsprotokolle ansammeln, wächst, bis Abfragen und Backups langsamer werden.

Die Archivierung schreibt diese Datensätze in Archivdateien – historisch auf optischen Medien oder Bändern, heute oft in Content-Repositories oder Cloud-Objektspeichern – und löscht sie aus der Datenbank. Die Datensätze bleiben über dieselben Transaktionen zugänglich, sodass Benutzer keinen funktionalen Unterschied feststellen.

Die SAP-Archivierung ist daher ein spezialisiertes Archiv, das an eine Anwendung gekoppelt ist, und kein allgemeines Dateiarchiv. Dies ist auch außerhalb von SAP-Umgebungen wichtig zu verstehen, da es das allgemeine Muster illustriert: Archivierung durch Verschieben kalter Datensätze aus dem Transaktionsspeicher, Beibehalten eines Zeigers und Lesers sowie zentrale Durchsetzung der Aufbewahrung. Wenn Ihre Gruppe neben der Forschungsinformatik SAP für den Einkauf oder die Personalabteilung nutzt, sollten die beiden Archivierungsstrategien die Speicherrichtlinie, aber nicht die Tooling gemeinsam nutzen.

Verwandte: — Eine umfassende technische Bibliothek mit Büchern, Videos und Live-Schulungen zum Thema wissenschaftliches Rechnen.

Vergleichstabelle: Archivierungstools nach Anwendungsfall

ToolKategorieLizenzAm besten fürAchten Sie auf
BagIt (Library of Congress)Paketierung auf DateiebenePublic Domain / Open SourceVerpacken von Datensätzen für Depots oder BänderKeine integrierte Speicher- oder Abruf-UI
ArchivematicaDigitale BewahrungspipelineOpen Source (AGPL)Bibliotheken, Archive, langfristige OAIS-KonformitätSchwerer Stack (Docker, Elasticsearch); komplexes Setup
iRODSDatenraster / richtliniengesteuertes ArchivOpen Source (BSD)Multi-Site-Forschungsdaten mit MetadatenregelnErfordert Engagement der Systemadministration
DVCDatenversionskontrolleOpen Source (Apache 2.0)Versionierung von Datensätzen neben Git-CodeKein Bewahrungssystem; Remote-Speicher liegt in Ihrer Verantwortung
restic / BorgBackupBackup mit DedupOpen Source (BSD)Verschlüsselte, deduplizierte SnapshotsBackup-Semantik, kein Archiv in Aufbewahrungsqualität
Zenodo / Dryad / DataverseRepositoryGehosteter DienstZitierfähige, DOI-gestützte DatensatzveröffentlichungGrößenbeschränkungen; Einschränkungen des Metadatenschemas
IBM Storage Archive / ILMEnterprise-ArchivKommerziellRegulatorische Aufbewahrung, Legal Hold, TieringKosten und Komplexität für kleine Labore
Veritas Enterprise VaultEnterprise-ArchivKommerziellE-Mail- und Datei-Compliance-ArchivierungLizenzmodell; Migrationsreibung
CommvaultBackup- + ArchivplattformKommerziellEinheitliche Richtlinien über große InfrastrukturenOverkill unter ein paar hundert TB

Bei der Auswahl von Datenarchivierungssoftware entscheiden sich Anwender häufig zwischen kommerziellen Produkten und Open-Source-Software. Je nach Umgebung sucht man nach Open-Source-PC-Software oder spezifischer Software in Open-Source-Communities.

Während IBM Enterprise-Tools bereitstellt, trägt es auch zu IBM Open-Source-Software-Initiativen bei. Wer die Geschichte des Fachgebiets erkunden möchte, kann die ersten Open-Source-Softwarebeispiele betrachten, die den Weg für die heutigen Tools ebneten.

So wählen Sie aus: Kriterien, die wirklich wichtig sind

Offenheit des Formats. Ein Archiv, das Sie in zwanzig Jahren nicht mehr lesen können, ist ein Handicap. Bevorzugen Sie einfache Dateien, dokumentierte Schemata und Standardcontainer (BagIt, tar, Parquet, HDF5 mit veröffentlichten Spezifikationen) gegenüber proprietären Bundles. HDF5 und NetCDF sind selbstbeschreibend und weit verbreitet, weshalb sie bei Simulationsergebnissen dominieren.

Wenn Sie einkaufen: — Interaktive Python- und Data-Science-Kurse, bei denen Sie direkt im Browser programmieren.

Integritätsprüfung. Fordern Sie Prüfsummen zum Zeitpunkt des Schreibens und regelmäßige Fixity-Checks. sha256-Manifeste, BagIts manifest-sha256.txt und repository-seitige Fixity-Dienste sind geeignet. Ohne Verifizierung ist eine stille Beschädigung erst erkennbar, wenn man die Daten benötigt.

Metadatenerfassung. Ein Archiv ohne Provenienz ist ein Haufen Bytes. Erfassen Sie neben den Daten die Softwareversion, Eingabeparameter, Random Seeds und die Umgebung (Container-Image-Digest oder conda Lockfile). Hier unterscheiden sich Forschungsarchive von IT-Archiven.

Kosten bei Skalierung. Band bleibt das günstigste Medium pro Terabyte für kalte Daten; Cold-Tiers der Cloud (z. B. Archivklassen für Objektspeicher) tauschen höhere Kosten pro Byte gegen null betrieblichen Aufwand. Modellieren Sie Ihre Kosten bei 10 TB und 100 TB, nicht bei 1 TB.

Aufbewahrung und Löschung. Entscheiden Sie explizit, was wann gelöscht wird. Sowohl Löschungsanträge im Stil der DSGVO als auch Aufbewahrungsmandate von Geldgebern (oft 5–10 Jahre, manchmal länger) gelten für Forschungsdaten; eine Policy-Engine hilft dabei.

Test der Wiederherstellung. Planen Sie eine Wiederherstellungsübung ein. Die Wiederherstellung einer zufälligen Stichprobe von Dateien und die Verifizierung der Prüfsummen ist der einzige Beweis dafür, dass das Archiv funktioniert.

Open-Source-Optionen und ihr Platz

Open-Source-Software dominiert die wissenschaftliche Archivierung aus gutem Grund: Der Quellcode ist überprüfbar, die Formate sind dokumentiert und es gibt keine Kosten pro Arbeitsplatz. Das Open-Source-Modell selbst hat eine lange Geschichte – der Begriff wurde 1998 geprägt, und die Praxis des Teilens von Quellcode geht Jahrzehnte zurück, mit frühen Beispielen wie dem GNU-Projekt (1983) und davor dem akademischen Code-Sharing der ARPANET-Ära. Heute umfasst der übliche Open-Source-Software-Stack einer Forschungsgruppe typischerweise Linux, Python, Git und einen Paketmanager, auf dem Archivierungstools aufsetzen.

Für ein Labor könnte ein praktikables Open-Source-Archiv so aussehen: DVC oder Git LFS zur Versionierung aktiver Datensätze, BagIt zum Verpacken eingefrorener Datensätze, restic oder BorgBackup für verschlüsselte Off-site-Kopien und Zenodo für die DOI-gestützte Veröffentlichung des Teilsatzes, der zitierfähig sein muss. iRODS oder Archivematica kommen zum Einsatz, wenn richtliniengesteuertes Tiering oder formelle OAIS-Konformität über mehrere Standorte hinweg erforderlich sind. Beachten Sie, dass „Open-Source-PC-Software“ für die Archivierung spärlicher gesät ist als in anderen Kategorien: Die ausgereiftesten Archivierungstools sind serverseitig oder CLI-first, und Desktop-GUI-Optionen sind oft kommerzielle Schnittstellen für Open-Source-Engines.

Ein Vorbehalt muss klar benannt werden: Open Source verschiebt die Kosten von Lizenzen auf Arbeitskraft. Eine Gruppe ohne einen Research Software Engineer sollte gehosteten Repositories mehr Gewicht beimessen, da eine nicht gewartete iRODS-Instanz schlechter ist als ein kostenpflichtiger Dienst.

Quellen & Weiterführende Literatur

  • Research data archiving — Wikipedia: Research data archiving is the long-term storage of scholarly research data, including the natural sciences, social sciences, and life sciences. The various academic…
  • Open-source software — Wikipedia: Open-source software (OSS) is computer software whose source code is publicly available, allowing users to use, study, modify, and distribute it — in contrast with…
  • Open source — Wikipedia: Open source is the practice of publishing digital resources publicly alongside their source code or source files, enabling use, study, modification, and redistribution…
  • Study software — Wikipedia: Study software refers to computer programs designed to enhance the effectiveness of learning by improving the way students engage with, process, and retain information…

Häufig gestellte Fragen

Was ist Datensicherungssoftware?

Datensicherungssoftware kopiert den aktuellen Zustand eines Systems, sodass es nach einem Ausfall, einer Beschädigung oder einer Löschung wiederhergestellt werden kann. Sie ist auf schnelle Wiederherstellung und kurze Aufbewahrungsfenster optimiert und schreibt in der Regel dieselben Daten wiederholt neu. Beispiele sind Veeam, Bacula, restic und BorgBackup. Backup ist ein Wiederherstellungsmechanismus und kein Bewahrungsmechanismus.

Was ist Archivieren von Daten?

Datenarchivierung beinhaltet das Verschieben inaktiver Daten in einen separaten Langzeitspeicher, wo sie unveränderlich, integritätsgeprüft und gemäß einer Aufbewahrungsrichtlinie wiederherstellbar bleiben. Archive folgen Standards wie OAIS (ISO 14721) und BagIt (RFC 8493) und priorisieren die Haltbarkeit gegenüber der Zugriffsgeschwindigkeit. Das Ziel ist es, eine bestimmte Version zu bewahren und nicht den neuesten Zustand wiederherzustellen.

Was ist Datenarchivierung in SAP?

Durch die Datenarchivierung in SAP werden abgeschlossene Geschäftsdokumente aus der Live-Datenbank in Archivdateien verschoben und gleichzeitig dafür gesorgt, dass sie über SAP-Transaktionen lesbar bleiben. Die Umsetzung erfolgt über SAP Data Archiving (SARA-Transaktion), ArchiveLink und in aktuellen Versionen über SAP Information Lifecycle Management für Aufbewahrung und Legal Hold. Das Ziel ist die Datenbankleistung und Kostenkontrolle, nicht die allgemeine Dateierhaltung.

Ist Open-Source-Archivierungssoftware gut genug für Forschungsdaten?

Open-Source-Tools wie BagIt, Archivematica, iRODS, DVC, Restic und BorgBackup werden in der Produktion von Bibliotheken, Archiven und Rechenzentren für die Forschung verwendet. Sie erfüllen Langzeitarchivierungsstandards und vermeiden Lizenzkosten, erfordern jedoch betriebliches Fachwissen. Gruppen ohne dediziertes Systempersonal kombinieren häufig Open-Source-Paketierungstools mit einem gehosteten Repository zur endgültigen Hinterlegung.

Wie unterscheidet sich die Archivierung vom Backup?

Ein Backup stellt nach einem Ausfall einen aktuellen Zustand wieder her; Durch die Archivierung wird eine bestimmte Version über Jahre oder Jahrzehnte hinweg aufbewahrt. Der Backup-Speicher muss schnell sein und wird häufig neu geschrieben; Archivspeicher ist günstig, einmal beschreibbar und selten gelesen. Ein Backup mit langer Laufzeit ist kein Archiv, da es die stille Datenkorruption weiterleitet, anstatt eine verifizierte Kopie einzufrieren.

Wie oft sollte ich ein Archiv verifizieren?

Die Prüfhäufigkeit hängt vom Medium und der Risikotoleranz ab. Eine gängige Praxis besteht jedoch darin, Fixitätsprüfungen regelmäßig (vierteljährlich oder jährlich für Band- und Objektspeicher) und immer nach der Medienmigration durchzuführen. Bei jeder Prüfung sollten gespeicherte Prüfsummen mit neu berechneten Prüfsummen verglichen und Abweichungen zur Untersuchung aufgezeichnet werden. Wiederherstellungsübungen sollten die Überprüfung begleiten und nicht ersetzen.

Häufig gestellte Fragen

Was ist eine Datensicherungssoftware?

Datensicherungssoftware kopiert den aktuellen Zustand eines Systems, sodass es nach einem Ausfall, einer Beschädigung oder einer Löschung wiederhergestellt werden kann. Es ist für eine schnelle Wiederherstellung und kurze Aufbewahrungsfenster optimiert und schreibt in der Regel dieselben Daten wiederholt neu. Beispiele hierfür sind Veeam, Bacula, Restic und BorgBackup. Backup ist ein Wiederherstellungsmechanismus und kein Erhaltungsmechanismus.

Was sind Archivierungsdaten?

Bei der Datenarchivierung werden inaktive Daten in einen separaten Langzeitspeicher verschoben, wo sie unveränderlich, auf Integrität überprüft und im Rahmen einer Aufbewahrungsrichtlinie wiederherstellbar bleiben. Archive folgen Standards wie OAIS (ISO 14721) und BagIt (RFC 8493) und legen Wert auf Haltbarkeit gegenüber Zugriffsgeschwindigkeit. Das Ziel besteht darin, eine bestimmte Version zu bewahren und nicht den neuesten Stand wiederherzustellen.

Was ist Datenarchivierung in SAP?

Durch die Datenarchivierung in SAP werden abgeschlossene Geschäftsdokumente aus der Live-Datenbank in Archivdateien entfernt und gleichzeitig dafür gesorgt, dass sie über SAP-Transaktionen lesbar bleiben. Die Umsetzung erfolgt über SAP Data Archiving (SARA-Transaktion), ArchiveLink und in aktuellen Versionen über SAP Information Lifecycle Management für Aufbewahrung und Legal Hold. Das Ziel ist die Datenbankleistung und Kostenkontrolle, nicht die allgemeine Dateierhaltung.

Ist Open-Source-Archivierungssoftware gut genug für Forschungsdaten?

Open-Source-Tools wie BagIt, Archivematica, iRODS, DVC, Restic und BorgBackup werden in der Produktion von Bibliotheken, Archiven und Forschungscomputergruppen verwendet. Sie erfüllen Konservierungsstandards und vermeiden Lizenzkosten, erfordern jedoch betriebliches Fachwissen. Gruppen ohne dediziertes Systempersonal kombinieren häufig Open-Source-Paketierungstools mit einem gehosteten Repository zur endgültigen Hinterlegung.

Wie unterscheidet sich die Archivierung vom Backup?

Backup stellt nach einem Fehler den aktuellen Zustand wieder her; Durch die Archivierung wird eine bestimmte Version über Jahre oder Jahrzehnte hinweg aufbewahrt. Der Backup-Speicher muss schnell sein und wird häufig neu geschrieben; Archivspeicher ist günstig, einmal beschreibbar und selten lesbar. Ein Backup mit langer Laufzeit ist kein Archiv, da es die unbemerkte Beschädigung weiterleitet, anstatt eine verifizierte Kopie einzufrieren.

Wie oft sollte ich ein Archiv verifizieren?

Die Prüfhäufigkeit hängt vom Medium und der Risikotoleranz ab. Eine gängige Praxis besteht jedoch darin, Fixitätsprüfungen regelmäßig (vierteljährlich oder jährlich für Band- und Objektspeicher) und immer nach der Medienmigration durchzuführen. Bei jeder Prüfung sollten gespeicherte Prüfsummen mit neu berechneten Prüfsummen verglichen und Abweichungen zur Untersuchung aufgezeichnet werden. Wiederherstellungsübungen sollten die Überprüfung begleiten und nicht ersetzen.


Lernen Sie Python, indem Sie in Ihrem Browser programmieren

Interaktive Python- und Data-Science-Kurse, bei denen Sie direkt im Browser programmieren