归档数据服务:实用指南
归档数据服务将研究数据从主动存储转移到独立管理的长期存储,并具有完整性检查、持久标识符和记录的保留策略,大致涵盖四个类别:机构存储库、特定领域的档案、商业云层和自托管系统。 OAIS 参考模型 (ISO 14721) 定义了档案的功能角色,仔细选择很重要,因为五年内无法读取的分子动力学轨迹或 HDF5 管道输出实际上已经丢失。
- 数据归档 不是备份:备份恢复功能系统,归档将固定的、可引用的工件保存数年或数十年。
- 归档数据服务的决定标准是保留保证、固定性验证、持久标识符、元数据标准和退出策略,而不是存储的原始价格。
- 领域档案(PDB、GenBank、Zenodo、Dryad)为您提供免费的 DOI 创建和社区元数据;通用云冷层为您提供可扩展性,但由您自行管理。
- FAIR 原则和 OAIS 参考模型是大多数资助者和存储库参考的两个框架。
- 在提交之前测试恢复:您从未读回的存档只是猜测,而不是保证。
什么是数据归档,它与备份有何不同?
数据归档意味着将数据集的最终的、不可变的副本放入托管存储中,其任务是保存而不是可用性。存在备份,以便您可以从删除、损坏或硬件故障中恢复;它通常是版本化的,经常被覆盖,并且与工作系统紧密相连。存档的存在使得特定数据集的特定版本在项目、学生甚至实验室继续前进后仍然可读和可引用。
对于计算机科学家来说,这种区别很重要。如果在夜间将副本同步到第二台服务器,则会备份实验室 RAID 阵列上定义的 2TB GROMACS 轨迹。仅当冻结副本位于具有记录保留、校验和和持久标识符(例如 DOI)的系统中时,才会对其进行存档。第一个可以保护您免受本周磁盘损坏的影响;第二个是保护 2029 年希望从 2024 年起复制您的文章的读者。
数据归档服务的四类
归档数据服务分为四个方便的组,大多数研究小组最终使用两到三个不同类别的数据。
机构存储库。 大学和国家实验室通常维护基于 DSpace、Dataverse 或 Figshare 的存储库。附属研究人员的存储通常是免费的,元数据由图书馆员维护,DOI 是铸造的。文件大小限制和总配额差异很大,因此在计划多 TB 存款之前请先检查。
特定领域的档案。 具有强大数据文化的学科维护自己的档案:结构生物学和基因组学中的蛋白质数据库和 GenBank、材料科学中的材料项目和 NOMAD、作为通用跨域选项的 Zenodo 和 Dryad,以及用于行星和地球观测数据的 NASA/PDS 或 ESA 档案。这些带来了社区元数据模式、摄取验证以及长期的机构承诺。
Related: — Interactive Python and data-science courses you code directly in the browser.
商业云存档层。 AWS S3 Glacier 和 Glacier Deep Archive、Azure Archive Storage 和 Google Cloud Archive 存储类提供非常低的每 TB 存储成本,检索延迟以分钟到小时计算,检索费用可能在账单中占主导地位。它们非常适合您很少接触的大型原始数据集,但作为唯一的存档却很糟糕,因为它们不提供管理、不提供 DOI 且不提供保存政策。
自托管数据归档系统。 一些团体运行自己的 iRODS、Archivematica 或普通对象存储加清单设置。这提供了完全的控制权,并且可能是敏感或出口控制数据的唯一选择,但它使您的团队负责媒体迁移、格式迁移和机构连续性问题——在资助结束后谁让服务器保持运行?
选择数据归档服务的标准
下面的比较反映了实际决定归档数据服务是否能够在与资助者、审阅者或未来读者的接触中幸存下来的问题。
Reader favorite: — Project-based data-science paths with a guided terminal and real datasets.
| 标准 | 问什么 | 为什么这很重要 |
|---|---|---|
| 保留保证 | 是否有公布的保留政策?由谁资助? | 没有捐赠或授权的“永远”主张是仅是愿景 |
| 固定性检查 | 是否在摄取时并按计划验证校验和? | 静默位腐烂是你看不到的故障模式 |
| 持久标识符 | 它会铸造 DOI 或同等内容吗? | 引用和资助者合规性取决于稳定的链接 |
| 元数据标准 | 它接受或需要域模式吗? | 可发现性和机器可读性 |
| 格式政策 | 它是否推荐或要求开放格式? | 专有二进制格式严重老化 |
| 访问控制 | 您可以设置禁运期、限制或设置许可证吗? | 人类主体和专有数据需要这个 |
| 退出策略 | 您可以批量导出带有元数据的完整记录吗? | 防止锁定 |
| 成本模型 | 摄取、存储、检索、传出和删除费用 | 检索和导出常常使存储相形见绌。 |
一个有用的规则是在存放任何内容之前根据此列表评估候选档案,并将决定记录在您的数据管理计划中。资助者越来越要求这种推理。
数据存储和归档:边界所在
数据存储和归档经常被混为一谈,因为两者都涉及磁盘,但操作边界是数据集停止更改的点。主动存储保存您读取和写入的数据;近线存储保存您偶尔访问的数据;档案存储保存您打算保留但很少接触的数据。三层布局——快速暂存、项目存储、归档——清楚地映射到这一点,并防止将共享网络驱动器视为归档的常见故障。
档案数据存储选择也与文件格式相互作用。在可预见的未来,压缩的 NumPy .npz、HDF5、NetCDF、Parquet 和纯文本格式仍然可以通过开放工具读取。来自特定模拟代码版本、专有仪器格式和未记录的二进制转储的检查点文件需要转换或嵌入式播放器。经验法则:如果您无法使用实验室外的现有工具打开文件,请在存档之前对其进行转换。
如何归档数据集:可重复的工作流程
接受审查的数据归档工作流程有六个步骤。
- 冻结数据集。 准确定义构成存档工件的文件,包括输入、代码版本、环境规范和输出。保存包含大小和校验和的清单。
- 文档。 编写自述文件,涵盖出处、软件版本、单元和已知限制。这是您将花费的最高价值的一个小时。
- 选择存档。 将数据类与存档数据服务相匹配:序列存档中的原始测序读取、PDB 中的结构、机构或通用存储库中的其他所有内容以及到云存档层的批量冷副本。
- 存储并提交。 上传,让存档进行检查,并确认校验和与您的清单匹配。
- 打印并保存 ID。 将 DOI 写入论文、实验室笔记本和数据管理计划中。
- 测试恢复。 下载示例,验证校验和并在干净的环境中打开文件。在归档时就做一次,而不是从现在起五年后。
第 1 步和第 6 步是最常被忽视的步骤,但它们有助于发现真正的问题。
最佳实践和常见故障模式
数据归档最佳实践与技术无关,更多与习惯有关。明确对数据集进行版本控制而不是覆盖它们,以便 DOI 指向固定的工件。将存档副本保持为只读。将清单和自述文件与数据一起存储,而不是存储在单独的 wiki 中。优先选择开放格式并记录那些不开放的格式。并将“数据在哪里?”与“我如何取回它?”这两个问题分开 ——第二个问题才是最重要的。
常见的故障模式是可以预测的。将同步的云文件夹视为存档会失败,因为同步会传播删除。当检索费用导致恢复不切实际时,依赖单一商业层就会失败。没有元数据的存款会失败,因为数据变得不可发现。假设当实验室关闭并且没有人知道哪台服务器保存唯一副本时,机构连续性就会失败。在存款时预防这些问题的成本并不高,而以后修复的成本却很高。选择归档数据服务时,请牢记这些风险。
值得了解的标准和框架
用于归档数据服务的资助者和存储库文档中反复出现两个框架。 OAIS 参考模型 (ISO 14721) 定义了档案的功能角色——摄取、档案存储、数据管理、访问和保存规划——并且是大多数存储库软件使用的词汇。 FAIR(可查找、可访问、可互操作、可重用)原则描述了存档良好的数据集应为读者提供的内容,并被许多资助者和期刊引用。研究数据联盟和数字保存联盟发布了有关保留、格式迁移和认证的实用指南; CoreTrustSeal 是一项认证,表明存储库符合基线保存标准。检查候选档案是否具有 CoreTrustSeal 认证或同等认证是筛选选项的快速方法。
资料来源和进一步阅读
- 研究数据归档 — 维基百科:研究数据归档是学术研究数据的长期存储,包括自然科学、社会科学和生命科学。各种学术…
常见问题
简单来说什么是数据归档?
数据归档是将数据集的最终确定的、不变的副本放入托管的长期存储中的做法,以便其在数年内保持可读和可引用。它与备份不同,备份的目的是在发生故障后恢复工作系统。档案的意义在于保存和出处;备份是为了恢复。
免费数据归档服务对于研究数据来说足够好吗?
免费的归档数据服务(例如,Institutional Repositories、Zenodo 和 Domain Archives)通常非常适合研究数据,因为它们免费添加管理、DOI 和社区元数据。它们的限制通常是文件大小、总配额和格式策略,而不是质量。对于多 TB 的原始数据集,可能需要将免费存档与付费冷存储层相结合。
研究数据应存档多长时间?
保留要求因资助者、期刊和机构而异,通常范围从项目结束后几年到某些数据类型的十年或更长时间。不要猜测,而是检查资助者的数据政策和机构的记录时间表,并在数据管理计划中记录所需的保留期限。
数据归档和数据存储有什么区别?
数据存储是保留数据的一般能力,无论是活动的、近线的还是存档的。数据归档是通过完整性检查、元数据和保留承诺来保存一组固定数据的具体实践。存储是一种资源;归档是一个附带保证的过程。
我可以在云端存档数据吗?
S3 Glacier、Azure Archive Storage 和 Google Cloud Archive 存储类等云存档层适用于大型且很少访问的数据集。它们提供耐用性和较低的存储成本,但没有管理、没有 DOI,并且检索或出口费用可能很高。大多数研究小组将它们用作批量副本以及保存可引用记录的经过策划的存储库。
如何选择数据归档公司或提供商?
从上面的标准表开始:保留策略、固定性检查、持久标识符、元数据支持、访问控制、退出策略以及包括检索在内的完整成本模型。然后将提供商与您的数据类相匹配——特定学科数据的域档案、一般研究成果的机构存储库以及批量冷副本的商业层。在提交之前测试检索。
Frequently asked questions
简单来说什么是数据归档?
数据归档是将数据集的最终确定的、不变的副本放入托管的长期存储中的做法,以便其在数年内保持可读和可引用。它与备份不同,备份的目的是在发生故障后恢复工作系统。档案的意义在于保存和出处;备份是为了恢复。
免费的数据归档服务对于研究数据来说足够好吗?
免费的归档数据服务(例如,Institutional Repositories、Zenodo 和 Domain Archives)通常非常适合研究数据,因为它们免费添加管理、DOI 和社区元数据。它们的限制通常是文件大小、总配额和格式策略,而不是质量。对于多 TB 的原始数据集,可能需要将免费存档与付费冷存储层相结合。
研究数据应存档多长时间?
保留要求因资助者、期刊和机构而异,通常范围从项目结束后几年到某些数据类型的十年或更长时间。不要猜测,而是检查资助者的数据政策和机构的记录时间表,并在数据管理计划中记录所需的保留期限。
数据归档和数据存储有什么区别?
数据存储是保留数据的一般能力,无论是活动的、近线的还是存档的。数据归档是通过完整性检查、元数据和保留承诺来保存一组固定数据的具体实践。存储是一种资源;归档是一个附带保证的过程。
我可以在云端存档数据吗?
S3 Glacier、Azure Archive Storage 和 Google Cloud Archive 存储类等云存档层适用于大型且很少访问的数据集。它们提供耐用性和较低的存储成本,但没有管理、没有 DOI,并且检索或出口费用可能很高。大多数研究小组将它们用作批量副本以及保存可引用记录的精选存储库。
如何选择数据归档公司或提供商?
从上面的标准表开始:保留策略、固定性检查、持久标识符、元数据支持、访问控制、退出策略以及包括检索在内的完整成本模型。然后将提供商与您的数据类相匹配——特定学科数据的域档案、一般研究成果的机构存储库以及批量冷副本的商业层。在提交之前测试检索。
Own a course for life, not a subscription
Buy individual scientific-Python courses outright, frequently at deep discounts