データ サービスのアーカイブ: 実践ガイド
アーカイブ データ サービスは、研究データをアクティブ ストレージから、整合性チェック、永続的な識別子、文書化された保存ポリシーを備えた独立管理の長期ストレージに移動します。その範囲は機関リポジトリ、ドメイン固有のアーカイブ、商用クラウド層、セルフホスト システムのおよそ 4 つのカテゴリに及びます。 OAIS 参照モデル (ISO 14721) はアーカイブの機能的役割を定義します。分子動力学トラジェクトリーや HDF5 パイプライン出力は 5 年間読み戻せないと事実上失われるため、慎重に選択することが重要です。
- データ アーカイブ はバックアップではありません。バックアップは機能するシステムを復元し、アーカイブは固定された引用可能な成果物を何年も何十年も保存します。
- アーカイブ データ サービスの決定基準は、ストレージの実際の価格ではなく、保持保証、固定性検証、永続的な識別子、メタデータ標準、および出口戦略です。
- ドメイン アーカイブ (PDB、GenBank、Zenodo、Dryad) は、無料の DOI 作成とコミュニティ メタデータを提供します。汎用クラウドのコールド層はスケーラビリティを提供しますが、キュレーションはユーザーに任せます。
- FAIR 原則と OAIS 参照モデルは、ほとんどの資金提供者とリポジトリが参照する 2 つのフレームワークです。
- コミットする前に復元をテストします。一度も読み戻したことがないアーカイブは推測であり、保証ではありません。
データのアーカイブとは何ですか?またバックアップとの違いは何ですか?
データのアーカイブとは、データセットの完成した不変のコピーを管理されたストアに配置することを意味し、その役割は可用性ではなく保存です。バックアップが存在するため、削除、破損、またはハードウェア障害から回復できます。通常、バージョン管理され、頻繁に上書きされ、稼働中のシステムの近くに存在します。アーカイブは、プロジェクト、学生、場合によっては研究室が移行した後も、特定のデータセットの特定のバージョンを読み取り可能および引用可能に保つために存在します。
コンピューター科学者にとって、この違いは重要です。ラボ RAID アレイ上に定義された 2TB GROMACS トラジェクトリは、夜間にコピーを 2 番目のサーバーに rsync する場合にバックアップされます。文書化された保存、チェックサム、および DOI などの永続的な識別子を備えたシステム内に凍結コピーが存在する場合にのみアーカイブされます。 1 つ目は、今週ディスクが停止するのを防ぐものです。 2 つ目は、2024 年の記事を複製しようとする 2029 年の読者を保護します。
データ アーカイブ サービスの 4 つのカテゴリ
アーカイブ データ サービスは 4 つの便利なグループに分類され、ほとんどの研究グループは最終的に異なるクラスのデータに対して 2 つまたは 3 つを使用します。
機関リポジトリ。 大学や国立研究所は通常、DSpace、Dataverse、または Figshare に基づいてリポジトリを維持しています。ストレージは通常、提携研究者にとって無料であり、メタデータは図書館員によって維持され、DOI は作成されます。ファイル サイズの制限と合計クォータは大きく異なるため、数テラバイトのデポジットを計画する前に確認してください。
ドメイン固有のアーカイブ。 強力なデータ文化を持つ専門分野は、独自のアーカイブを維持しています。構造生物学とゲノミクスでは Protein Data Bank と GenBank、材料科学では Materials Project と NOMAD、汎用クロスドメイン オプションとして Zenodo と Dryad、惑星および地球の観測データについては NASA/PDS または ESA アーカイブです。これらにより、コミュニティのメタデータ スキーマ、取り込み時の検証、および組織的な長期コミットメントが得られます。
関連: — ガイド付きターミナルと実際のデータセットを使用したプロジェクトベースのデータ サイエンス パス.
商用クラウド アーカイブ層。 AWS S3 Glacier および Glacier Deep Archive、Azure Archive Storage、および Google Cloud Archive ストレージ クラスは、テラバイトあたりのストレージ コストが非常に低く、取得レイテンシは数分から数時間で測定され、取得料金が請求額の大部分を占める可能性があります。これらは、めったに触ることのない大規模な生データセットには優れていますが、キュレーション、DOI、保存ポリシーが提供されないため、単独のアーカイブとしては不十分です。
セルフホスト型データ アーカイブ システム。 一部のグループは、独自の iRODS、Archivematica、または単純なオブジェクト ストアとマニフェストのセットアップを実行しています。これにより完全な制御が可能になり、機密データや輸出規制データに対する唯一のオプションとなる可能性がありますが、チームはメディアの移行、フォーマットの移行、および組織の継続性の問題、つまり補助金終了後も誰がサーバーを稼働し続けるかという問題に責任を持つことになります。
データ アーカイブ サービスを選択する基準
以下の比較は、アーカイブ データ サービスが資金提供者、レビュー担当者、または将来の読者との実用的に耐えうるかどうかを実際に決定する質問を反映しています。
一見の価値があります: — 大学が支援する Python およびデータサイエンス証明書の 1 つのサブスクリプション.
| 基準 | 何を質問するか | なぜそれが重要なのか |
|---|---|---|
| 保持保証 | 公開された保存ポリシーはありますか? 誰がそれに資金を提供していますか? | 基金や義務付けのない「永遠」の主張は野心的なものである |
| 修正性チェック | チェックサムは取り込み時およびスケジュールに従って検証されますか? | サイレントビットロットは目に見えない故障モードです |
| 永続的な識別子 | DOI または同等のものを鋳造しますか? | 引用と資金提供者のコンプライアンスは安定したリンクに依存します。 |
| メタデータ標準 | ドメインスキーマを受け入れますか、それとも要求しますか? | 発見可能性と機械可読性 |
| フォーマットポリシー | オープンフォーマットを推奨または要求していますか? | 独自のバイナリ形式は非常に古くなります。 |
| アクセス制御 | ライセンスをエンバーゴ、制限、または設定できますか? | 人間を対象とした独自のデータにはこれが必要です |
| 出口戦略 | メタデータを含む完全なレコードを一括エクスポートできますか? | ロックインを防止 |
| コストモデル | 取り込み、保管、取得、出力、および削除の料金 | 取得と出力はストレージを大幅に上回ることがよくあります。 |
有用な規律は、何かを寄託する前にこのリストに照らして候補アーカイブを評価し、その決定をデータ管理計画に記録することです。資金提供者はまさにこの理由をますます要求しています。
データのストレージとアーカイブ: 境界線はどこにあるのか
データ ストレージとアーカイブはどちらもディスクを必要とするため、混同されることがよくありますが、運用境界とは、データセットの変更が停止する点です。アクティブ ストレージには、読み書きするデータが保持されます。ニアライン ストレージには、時々アクセスするデータが保存されます。アーカイブ ストレージには、保存しておきたいがめったに触らないデータが保存されます。 3 層レイアウト (高速スクラッチ、プロジェクト ストレージ、アーカイブ) がこれに明確にマッピングされ、共有ネットワーク ドライブをアーカイブとして扱うことによるよくある失敗を防ぎます。
アーカイブ データ ストレージの選択は、ファイル形式とも関係します。圧縮された NumPy .npz、HDF5、NetCDF、Parquet、およびプレーン テキスト形式は、当面はオープン ツールで読み取ることができます。特定のシミュレーション コード バージョンからのチェックポイント ファイル、独自の計測器フォーマット、文書化されていないバイナリ ダンプは、変換または埋め込みプレーヤーのいずれかを必要とします。経験則: 研究室外の既存のツールでファイルを開けない場合は、アーカイブする前にファイルを変換してください。
データセットをアーカイブする方法: 反復可能なワークフロー
検討中でも有効なデータ アーカイブ ワークフローには 6 つのステップがあります。
- データセットをフリーズします。 入力、コード バージョン、環境仕様、出力など、アーカイブされた成果物を構成するファイルを正確に定義します。サイズとチェックサムを含むマニフェストを保存します。
- ドキュメント 出所、ソフトウェアのバージョン、ユニット、既知の制限事項を網羅した README を作成します。これは、あなたが費やす単一の最も価値のある時間です。
- アーカイブを選択します。 データ クラスをアーカイブ データ サービスに一致させます。シーケンス アーカイブ内の生のシーケンス読み取り、PDB 内の構造、機関または一般リポジトリ内のその他すべて、およびクラウド アーカイブ層へのバルク コールド コピーです。
- 寄託と確定。 アップロードし、アーカイブにチェックを行わせ、チェックサムがマニフェストと一致することを確認します。
- ID を印刷して保存します。 DOI を紙、研究ノート、データ管理計画に記入します。
- テストリカバリ。 サンプルをダウンロードし、チェックサムを確認し、クリーンな環境でファイルを開きます。 5年後ではなく、登録時に一度だけ実行してください。
ステップ 1 と 6 は最も無視されることが多く、実際の問題の検出に役立ちます。
ベスト プラクティスと一般的な障害モード
データ アーカイブのベスト プラクティスは、テクノロジーではなく習慣に重点を置いています。データセットを上書きするのではなく、明示的にバージョン管理して、DOI が固定された成果物を指すようにします。アーカイブ コピーを読み取り専用にしておきます。マニフェストと README をデータとともに保存し、別の Wiki に保存しないでください。オープンな形式を好み、そうでない形式については文書化します。そして、「データはどこにあるのか?」という質問を分けてください。 「どうやって取り戻すの?」から— 2 番目の質問が重要です。
一般的な故障モードは予測可能です。同期によって削除が伝播されるため、同期されたクラウド フォルダーをアーカイブとして扱うと失敗します。単一の商用層に依存することは、取得料金によって回収が現実的でなくなると失敗します。メタデータなしでデポジットすると、データが検出できなくなるため失敗します。そして、研究室が閉鎖され、どのサーバーが唯一のコピーを保持していたのか誰も分からなくなると、組織の継続性が失われると仮定します。これらの問題はそれぞれ、寄託時に防ぐのは低コストですが、後で修復するにはコストがかかります。アーカイブ データ サービスを選択するときは、次のリスクを念頭に置いてください。
知っておく価値のある標準とフレームワーク
データ サービスのアーカイブに関する資金提供者とリポジトリのドキュメントには、2 つのフレームワークが繰り返し登場します。 OAIS 参照モデル (ISO 14721) は、アーカイブの機能的役割 (取り込み、アーカイブ ストレージ、データ管理、アクセス、保存計画) を定義しており、ほとんどのリポジトリ ソフトウェアで使用される語彙です。 FAIR (検索可能、アクセス可能、相互運用可能、再利用可能) 原則は、適切にアーカイブされたデータセットが読者に何を提供すべきかを説明しており、多くの資金提供者やジャーナルによって参照されています。 Research Data Alliance と Digital Preservation Coalition は、保存、フォーマットの移行、および認証に関する実践的なガイダンスを発行しています。 CoreTrustSeal は、リポジトリがベースラインの保存基準を満たしていることを示す証明書です。候補アーカイブに CoreTrustSeal 認定または同等の認定があるかどうかを確認することは、オプションをフィルタリングする簡単な方法です。
出典と詳細情報
- 研究データのアーカイブ — Wikipedia: 研究データのアーカイブとは、自然科学、社会科学、生命科学を含む学術研究データの長期保管です。さまざまな学術…
よくある質問
データのアーカイブとは簡単に言うと何ですか?
データのアーカイブとは、データセットの最終的な変更されていないコピーを管理された長期ストアに配置し、何年も読み取り可能で引用可能な状態を保つことです。これは、障害後に稼働中のシステムを復元するために存在するバックアップとは異なります。アーカイブとは保存と出所を意味します。バックアップとは復元のことです。
研究データには無料のデータ アーカイブ サービスで十分ですか?
Institutional Repositories、Zenodo、Domain Archives などの無料のアーカイブ データ サービスは、キュレーション、DOI、コミュニティ メタデータを無料で追加するため、多くの場合、研究データに最適です。通常、その制限は品質ではなく、ファイル サイズ、合計クォータ、およびフォーマット ポリシーです。マルチテラバイトの生データ セットの場合、無料のアーカイブと有料のコールド ストレージ層を組み合わせる必要がある場合があります。
研究データはどのくらいの期間アーカイブする必要がありますか?
保存要件は資金提供者、ジャーナル、機関によって異なり、通常、プロジェクト終了後数年から、特定のデータ タイプについては 10 年以上の範囲に及びます。推測するのではなく、資金提供者のデータ ポリシーと教育機関の記録スケジュールを確認し、必要な保存期間をデータ管理計画に記録してください。
データのアーカイブとデータ ストレージの違いは何ですか?
データ ストレージは、アクティブ、ニアライン、アーカイブのいずれであっても、データを保持する一般的な機能です。データのアーカイブは、整合性チェック、メタデータ、保持コミットメントを使用して、固定のデータ セットを保存する具体的な方法です。ストレージはリソースです。アーカイブは保証付きのプロセスです。
データをクラウドにアーカイブできますか?
S3 Glacier、Azure Archive Storage、Google Cloud Archive ストレージ クラスなどのクラウド アーカイブ層は、アクセスがほとんどない大規模なデータセットに適しています。これらは耐久性と低ストレージコストを提供しますが、キュレーションやDOIはなく、多額の可能性がある取得または送信料金が高額になる可能性があります。ほとんどの研究グループは、引用可能な記録を保持する厳選されたリポジトリと並行して、それらを一括コピーとして使用します。
データ アーカイブ会社またはプロバイダーはどのように選択すればよいですか?
上記の基準表から始めます: 保持ポリシー、修正性チェック、永続的な識別子、メタデータのサポート、アクセス制御、出口戦略、および取得を含むフルコストモデル。次に、プロバイダーをデータ クラス (分野固有のデータの場合はドメイン アーカイブ、一般的な研究成果の場合は機関リポジトリ、大量のコールド コピーの場合は商用層) に合わせます。コミットする前に取得をテストします。
よくある質問
データアーカイブとは簡単に言うと何ですか?
データのアーカイブとは、データセットの最終的な変更されていないコピーを管理された長期ストアに配置し、何年も読み取り可能で引用可能な状態を保つことです。これは、障害後に稼働中のシステムを復元するために存在するバックアップとは異なります。アーカイブとは保存と出所を意味します。バックアップとは復元のことです。
研究データには無料のデータ アーカイブ サービスで十分ですか?
Institutional Repositories、Zenodo、Domain Archives などの無料のアーカイブ データ サービスは、キュレーション、DOI、コミュニティ メタデータを無料で追加するため、多くの場合、研究データに最適です。通常、その制限は品質ではなく、ファイル サイズ、合計クォータ、およびフォーマット ポリシーです。マルチテラバイトの生データ セットの場合、無料のアーカイブと有料のコールド ストレージ層を組み合わせる必要がある場合があります。
研究データはどのくらいの期間アーカイブする必要がありますか?
保存要件は資金提供者、ジャーナル、機関によって異なり、通常、プロジェクト終了後数年から、特定のデータ タイプについては 10 年以上の範囲に及びます。推測するのではなく、資金提供者のデータ ポリシーと教育機関の記録スケジュールを確認し、必要な保存期間をデータ管理計画に記録してください。
データアーカイブとデータストレージの違いは何ですか?
データ ストレージは、アクティブ、ニアライン、アーカイブのいずれであっても、データを保持する一般的な機能です。データのアーカイブは、整合性チェック、メタデータ、保持コミットメントを使用して、固定のデータ セットを保存する具体的な方法です。ストレージはリソースです。アーカイブは保証付きのプロセスです。
データをクラウドにアーカイブできますか?
S3 Glacier、Azure Archive Storage、Google Cloud Archive ストレージ クラスなどのクラウド アーカイブ層は、アクセスがほとんどない大規模なデータセットに適しています。これらは耐久性と低ストレージコストを提供しますが、キュレーションやDOIはなく、多額の可能性がある取得または送信料金がかかりません。ほとんどの研究グループは、引用可能な記録を保持する厳選されたリポジトリと並行して、それらを一括コピーとして使用します。
データ アーカイブ会社またはプロバイダーはどのように選択すればよいですか?
上記の基準表から始めます: 保持ポリシー、修正性チェック、永続的な識別子、メタデータのサポート、アクセス制御、出口戦略、および取得を含むフルコストモデル。次に、プロバイダーをデータ クラス (分野固有のデータの場合はドメイン アーカイブ、一般的な研究成果の場合は機関リポジトリ、大量のコールド コピーの場合は商用層) に合わせます。コミットする前に取得をテストします。
ブラウザでコーディングして Python を学習する
ブラウザーで直接コーディングするインタラクティブな Python およびデータ サイエンス コース