Saltar al contenido principal
ActivePapers Almacena tus datos como documentos recomputables para que cualquier resultado publicado pueda ejecutarse de nuevo, verificarse y preservarse.

Algunos enlaces de este sitio son de afiliados: si compras a través de ellos, es posible que recibamos una comisión sin coste adicional para ti. Esto nunca afecta a nuestras recomendaciones. Consulta nuestra declaración de afiliados para más detalles. Divulgación de afiliados.

Las mejores herramientas de archivo de datos comparadas para la investigación (2026)

El archivado de datos es la reubicación impulsada por políticas de datos inactivos a un nivel de almacenamiento separado y menos costoso para su retención, cumplimiento o reutilización a largo plazo. Una configuración de archivado completa normalmente combina cuatro capas: un sistema de archivos o almacén de objetos, una herramienta de suma de comprobación/verificación, un catálogo de metadatos y una política de retención. Para los científicos computacionales, esto generalmente significa discos scratch en caliente por niveles, almacenamiento de proyectos en tibio y almacenamiento de objetos en frío como cintas o S3 Glacier.

El almacenamiento en la capa física funciona codificando bits como un estado medible (dominios magnéticos en un plato giratorio, carga atrapada en celdas flash NAND o geometría de fase/pit en medios ópticos) y luego leyendo ese estado a través de un controlador que maneja la corrección de errores. Una unidad de disco duro (HDD) escribe datos en pistas concéntricas en platos giratorios a través de un cabezal de lectura/escritura móvil; una unidad de estado sólido (SSD) almacena carga en transistores de puerta flotante sin partes móviles, razón por la cual las SSD tienen una latencia más baja pero una resistencia de escritura finita. Las unidades de cinta escriben pistas lineales en cinta magnética y siguen siendo el medio por terabyte más barato para datos fríos.

Por encima de la capa física está la capa lógica. Los sistemas de archivos como ext4, XFS, ZFS y Lustre asignan archivos a bloques y mantienen metadatos (inodos, directorios, permisos).

Los almacenes de objetos como Ceph RADOS, MinIO y Amazon S3 abandonan el árbol de directorios en favor de espacios de nombres planos donde cada objeto tiene una clave, un flujo de bytes y metadatos arbitrarios. Esta distinción es extremadamente importante para el archivado de datos: el almacenamiento de objetos escala a miles de millones de objetos y admite reglas de inmutabilidad y ciclo de vida de forma nativa, mientras que los sistemas de archivos POSIX son más fáciles de montar y programar mediante scripts, pero se degradan con un número de directorios muy grande.

Al evaluar soluciones de archivado de datos a largo plazo, estas diferencias estructurales son fundamentales.

La integridad de los datos es la tercera capa. La putrefacción silenciosa de bits (corrupción no detectada debido a la degradación de los medios, rayos cósmicos o errores de firmware) es el verdadero enemigo del archivero.

Relacionado: — Cursos interactivos de Python y ciencia de datos que codifica directamente en el navegador.

Las sumas de comprobación (MD5, SHA-256, BLAKE3) calculadas en el momento de la escritura y reverificadas durante la lectura o según una programación detectan esto. ZFS y Btrfs hacen esto automáticamente con sumas de verificación por bloque y autorreparación cuando existe redundancia; en ext4 simple, es necesario ejecutar su propio pase de verificación, por ejemplo con sha256sum -c contra un manifiesto, o usar una herramienta como par2 para generar bloques de recuperación. Los servicios profesionales de empresas de archivado de datos a menudo implementan estas comprobaciones para garantizar el archivado de datos a largo plazo.

Finalmente, la redundancia y la geografía determinan la durabilidad. RAID protege contra fallas de un solo disco, pero no contra fallas del controlador, incendios o ransomware.

La regla 3-2-1 (tres copias, dos medios diferentes, una externa) sigue siendo la base, y la variación 3-2-1-1-0 agrega una copia fuera de línea/inmutable y cero errores al verificar la restauración. Los almacenes de objetos en la nube anuncian cifras de durabilidad en el rango de “once nueves” (99,999999999%), pero este número describe la durabilidad de los objetos almacenados, no la disponibilidad del servicio o la seguridad contra el borrado accidental por parte de un usuario autorizado. Para aquellos que investigan reseñas de empresas de archivado de datos, es importante ver cómo las soluciones de las empresas de archivado de datos manejan estas compensaciones específicas de durabilidad y disponibilidad.

Vale la pena echarle un vistazo: — Una suscripción para certificados de ciencia de datos y Python respaldados por la universidad.

cómo almacenar datos

Las preguntas sobre “cómo almacenar datos” suelen resolverse en una decisión práctica: ¿dónde se encuentra un conjunto de datos determinado en cada etapa de su vida? Un modelo de trabajo para un grupo de simulación se ve así.

Las ejecuciones activas escriben en el NVMe scratch local del nodo. Las ejecuciones completadas se mueven a un sistema de archivos paralelo compartido (Lustre, GPFS o un montaje BeeGFS) para su análisis. Los conjuntos de datos publicados o reemplazados se empaquetan (a menudo en HDF5, NetCDF o un tar comprimido con un manifiesto de suma de comprobación) y se mueven a un nivel de archivo.

La mecánica de este empujón final es importante. Un paso típico de archivado de línea de comando para un conjunto de trayectorias de dinámica molecular podría ser:

tar --use-compress-program="zstd -T0 -19" -cf run42.tar.zst run42/
sha256sum run42.tar.zst > run42.tar.zst.sha256
rclone copy run42.tar.zst remote:archive/run42/ --checksum

El indicador --checksum en rclone fuerza una comparación de hash en lugar de depender del tamaño y el tiempo de modificación, lo cual es esencial cuando el destino es el almacenamiento de objetos. Para la salida HDF5, herramientas como h5repack con compresión gzip o SZIP pueden reducir significativamente los archivos sin cambiar la API utilizada por su código de análisis.

La recuperación es la parte que los equipos no planifican lo suficiente. Los niveles fríos tienen latencia: los archivos en cinta pueden tardar de minutos a horas en preparar un archivo, y las clases de archivo en la nube como S3 Glacier Flexible Retrieval o Deep Archive cobran por una recuperación acelerada e imponen duraciones mínimas de almacenamiento.

Un conjunto de datos que no puede recuperar dentro de su plazo se pierde efectivamente. Pruebe una restauración de una muestra aleatoria cada trimestre y registre cuánto tiempo tomó.

Relacionado: — Una amplia biblioteca técnica de libros, vídeos y formación en directo sobre informática científica..

qué es el archivado de datos

El archivado de datos es la reubicación deliberada y basada en políticas de datos inactivos desde sistemas primarios a almacenamiento secundario optimizado para costos y longevidad en lugar de velocidad. Su propósito difiere del de la copia de seguridad: la copia de seguridad existe para restaurar un sistema después de una falla o corrupción y generalmente tiene versiones y es a corto plazo, mientras que el archivado existe para preservar un conjunto específico de datos durante años o décadas y, a menudo, es inmutable. Esto también difiere de la eliminación: el archivado es una decisión de retención, no de eliminación, aunque una buena política define cuándo se destruyen finalmente los datos archivados.

Las definiciones empresariales de proveedores como Snowflake y Datacore enfatizan los factores de cumplimiento: regulaciones como HIPAA, GDPR, SEC Rule 17a-4 y 21 CFR Part 11 de la FDA requieren que ciertos registros se conserven, no se modifiquen y se puedan recuperar durante períodos de tiempo definidos. La investigación tiene sus propios impulsores.

Los financiadores, incluidos la NSF, los NIH y la Comisión Europea, exigen cada vez más planes de gestión de datos que especifiquen dónde se archivarán los datos y durante cuánto tiempo, y las revistas exigen que los datos subyacentes a una publicación estén disponibles. Para un laboratorio, la definición práctica de archivado es: el conjunto de datos se escribe una vez, se verifica, se cataloga con suficientes metadatos para que sean interpretables sin el autor original y se almacena en una ubicación que sobreviva a la graduación del estudiante de doctorado que lo creó.

Favorito del lector: — Rutas de ciencia de datos basadas en proyectos con una terminal guiada y conjuntos de datos reales.

estrategia de archivado de datos

Una estrategia de archivado viable se basa en cinco decisiones, y ponerlas en el orden correcto evita años de dolores de cabeza.

1. Clasificar por valor y obligación. No todos los datos merecen el mismo tratamiento. Los resultados brutos de los instrumentos, los intermedios procesados y los conjuntos de datos finales publicados tienen diferentes requisitos de retención. Un sistema de priorización (por ejemplo, conservar los datos brutos durante 10 años, los datos intermedios durante 1 año y los resultados publicados indefinidamente) evita la proliferación de archivos.

2. Elegir el medio y el proveedor. Las opciones van desde almacenamiento institucional (silos de cintas en centros universitarios de HPC, a menudo gratuitos o económicos para los investigadores afiliados) hasta clases comerciales de archivado en la nube y empresas de archivado dedicadas a largo plazo. Cada uno tiene una curva de costos y un perfil de bloqueo diferentes.

3. Establecer el formato del paquete. Los formatos autodescriptivos superan a los formatos propietarios. HDF5, NetCDF4, Parquet y el texto sin formato con esquema sobreviven mejor que un blob binario cuyo lector se compiló por última vez en 2014. Incluya un archivo README, un manifiesto de suma de comprobación y una copia de los scripts de análisis.

4. Automatizar la verificación. Programe auditorías periódicas de suma de verificación. Un conjunto de datos que nunca ha sido revisado es un conjunto de datos que no sabe si todavía existe.

5. Documentar la ruta de recuperación. Indique, en el plan de gestión de datos y en el archivo mismo, exactamente cómo alguien en 2035 recupera y abre estos datos. Incluya las versiones de las herramientas.

qué es el archivado en el análisis de datos

Archivar en el análisis de datos significa congelar un estado analítico específico para que los resultados puedan reproducirse. Esto incluye los datos de entrada, el código que los transformó, el entorno (imagen del contenedor, archivo de entorno conda o requirements.txt con versiones fijadas) y las salidas.

En la práctica, aquí es donde entran en juego herramientas como DVC, Git LFS y los registros de procedencia de Snakemake/Nextflow: le permiten archivar la entrada y salida de una canalización por hash de contenido en lugar de por nombre de archivo, de modo que una repetición reproduzca los bytes exactos o falle estrepitosamente. Para una canalización de llamadas de variantes bioinformáticas, esto podría significar archivar la referencia FASTA, los archivos BAM, el VCF, el resumen del contenedor y la definición del flujo de trabajo juntos en un único paquete versionado.

mejores prácticas de archivado de datos

Buenas prácticas para el archivado de datos a largo plazo que persisten en todas las disciplinas:

  • Calcule la suma de comprobación de todo en el momento de la escritura y almacene los manifiestos junto con los datos, no en un sistema separado que pueda desincronizarse.
  • Utilice formatos abiertos y autodescriptivos con unidades y metadatos integrados; evite formatos vinculados a la licencia de un único proveedor.
  • Siga la regla 3-2-1-1-0 y mantenga al menos una copia fuera de línea o inmutable (bloqueo de objeto, cinta WORM o disco air-gapped) para sobrevivir al ransomware.
  • Escriba metadatos para un extraño. Suponga que la persona que lo lee nunca lo ha conocido y no está familiarizada con sus convenciones de nomenclatura.
  • Asigne identificadores persistentes. Un DOI a través de Zenodo, Dryad o un repositorio institucional hace que un conjunto de datos sea citable y le proporciona una página de inicio estable.
  • Pruebe las restauraciones según un cronograma y registre los resultados; un archivo no probado es una hipótesis, no una garantía.
  • Planifique para el fin de la subvención. Los financiadores dejan de pagar; decida ahora si los datos se transfieren al almacenamiento institucional o se eliminan.

qué almacenamiento de datos dura más

Ningún medio digital es para siempre, y la respuesta honesta es que la longevidad proviene de la migración, no del medio en sí. Entre los medios de uso común, la cinta magnética (LTO) tiene una vida útil de archivo frecuentemente citada de entre 15 y 30 años bajo un control adecuado de temperatura y humedad, y sigue siendo el estándar para los archivos nacionales y los centros de HPC.

Los medios ópticos varían ampliamente: los discos prensados y los DVD/Blu-ray de estilo M-DISC se comercializan con décadas de vida útil, mientras que los CD y DVD grabados normales se degradan con el paso de los años. Los discos duros empresariales suelen estar clasificados para unos cinco años de servicio continuo, y los SSD tienen límites de retención que empeoran cuando no reciben alimentación: la carga se escapa de las celdas con el tiempo, por lo que un SSD que se deja en un cajón durante años es un mal archivo.

El almacenamiento de objetos en la nube es completamente independiente del medio y depende de una migración continua en segundo plano. Esta es la razón por la que los proveedores pueden prometer una durabilidad extrema sin prometer la supervivencia de una unidad específica.

La conclusión práctica: al evaluar soluciones de archivado de datos a largo plazo o leer reseñas de empresas de archivado de datos, elija medios con una ruta de migración documentada y un proveedor o institución comprometida a actualizarlos, en lugar de perseguir una unidad “permanente”.

qué almacenamiento de datos

Las consultas sobre “¿Qué almacenamiento de datos” generalmente significan “¿qué almacenamiento debo usar para X?”. Una breve guía de decisión:

  • Análisis activo, acceso aleatorio, IOPS alto: sistema de archivos paralelo o NVMe scratch.
  • Datos de proyecto compartidos, acceso moderado: sistema de archivos en red con instantáneas (ZFS, Isilon o un servicio de archivos en la nube).
  • Archivos fríos, rara vez leídos, deben ser baratos: cinta (LTO) o clases de archivo en la nube. Si busca ayuda profesional, consulte los servicios de una empresa de archivado de datos.
  • Datos que deben ser inmutables por motivos de cumplimiento: almacenamiento de objetos con bloqueo de objetos/WORM. Esta es una característica común de las soluciones de las empresas de archivado de datos.
  • Pequeños conjuntos de datos vinculados a una publicación: un repositorio como Zenodo o Dryad, que maneja la acuñación de DOI y el alojamiento a largo plazo.

Comparación: opciones de archivado de datos para grupos de investigación

OpciónPerfil de costos típicoLatencia de accesoLo mejor paraAdvertencia principal
Cinta HPC institucionalBajo/gratuito para afiliadosMinutos a horasGrandes conjuntos de datos brutosAtado a la institución; la política puede cambiar
Clase de archivo en la nube (p. ej., S3 Glacier)Bajo almacenamiento, alta salida/recuperaciónMinutos a horasCopias elásticas y externasTarifas de recuperación y duraciones mínimas
Almacenamiento de objetos estándar en la nubeModeradoMilisegundosArchivos reutilizados con frecuenciaEl costo crece con el volumen
Servicios dedicados de empresas de archivado de datosSuscripción/contratoVaríaOrganizaciones con mucho cumplimientoBloqueo; menos control sobre el formato
Disco local/NAS + copia externaCosto de hardwareMilisegundosPequeños laboratorios, restauraciones rápidasUsted es responsable de la migración y verificación
Repositorio público de datosGratis a bajoDescarga inmediataConjuntos de datos publicadosLímites de tamaño; no para datos privados

Al evaluar soluciones de archivado de datos a largo plazo, los grupos de investigación deben considerar estas diversas soluciones de empresas de archivado de datos. Si bien las reseñas de las empresas de archivado de datos pueden proporcionar información sobre proveedores específicos, la mejor opción para el archivado de datos a largo plazo depende de las necesidades específicas del laboratorio.

empresas y servicios de archivado de datos

El panorama empresarial de los servicios de archivado de datos se divide en tres grupos, y saber qué grupo necesita evita evaluaciones innecesarias.

Los proveedores de archivado de información empresarial (EIA), incluidos Proofpoint, Barracuda, Mimecast y Jatheon, se centran en el correo electrónico, la mensajería y los datos de colaboración con fines de cumplimiento y descubrimiento legal. Sus puntos fuertes residen en los motores de políticas de retención, la retención legal y los registros de auditoría. Por lo general, estas no son las soluciones de archivado de datos a largo plazo adecuadas para conjuntos de datos científicos.

Proveedores de infraestructura en la nube — Amazon Web Services (S3 Glacier y Deep Archive), Microsoft Azure (nivel Archive), Google Cloud (Archive y Coldline) — venden primitivos de almacenamiento en lugar de archivado llave en mano. Usted aporta las herramientas: reglas de ciclo de vida, verificación de sumas de comprobación (checksum) y un catálogo. Para los ingenieros de software de investigación, esta suele ser la ruta más flexible y transparente en cuanto a costos para el archivado de datos a largo plazo.

Repositorios de datos de investigación y servicios de preservación — Zenodo (operado por el CERN), Dryad, Figshare, Internet Archive y repositorios institucionales — gestionan la asignación de DOI, los estándares de metadatos y la preservación de bits a largo plazo para conjuntos de datos destinados a compartirse. No están diseñados para archivos privados de varios petabytes.

Al realizar revisiones de empresas de archivado de datos, formule cuatro preguntas: ¿Cuáles son la latencia de recuperación y el costo de la recuperación? ¿Qué garantías de formato ofrecen y puede exportarlo todo si se marcha? ¿Qué verificación de integridad realizan y puede ver los informes? ¿Y qué pasa con sus datos si la empresa es adquirida o cierra? Un proveedor de soluciones de archivado de datos que no pueda responder a la pregunta sobre la salida es un riesgo, no una solución.

Conclusiones clave

  • El archivado de datos es distinto de la copia de seguridad: preserva conjuntos de datos específicos a largo plazo, a menudo de forma inmutable, mientras que la copia de seguridad restaura los sistemas después de un fallo.
  • La longevidad proviene de la migración y la verificación, no de un único soporte “permanente”; la cinta y el almacenamiento de objetos en la nube dominan los niveles fríos (cold tiers).
  • La regla 3-2-1-1-0 y las auditorías programadas de sumas de comprobación son las dos prácticas que previenen de manera más confiable la pérdida de datos.
  • Los formatos autodescriptivos (HDF5, NetCDF, Parquet), así como un archivo README y un entorno anclado (pinned environment), hacen que un archivo sea reproducible años más tarde.
  • El archivado comercial se divide en proveedores de EIA centrados en el cumplimiento, primitivos de almacenamiento en la nube y repositorios de investigación; seleccionados por caso de uso, no por marca.
  • Pruebe siempre una restauración antes de confiar en un archivo.

Fuentes y lecturas adicionales

  • Research data archiving — Wikipedia: El archivado de datos de investigación es el almacenamiento a largo plazo de datos de investigaciones académicas, incluidas las ciencias naturales, las ciencias sociales y las ciencias de la vida. Los diversos académicos…

Preguntas frecuentes

¿Qué es el archivado de datos?

El archivado de datos es el movimiento impulsado por políticas de datos inactivos a un almacenamiento secundario diseñado para la retención a largo plazo en lugar de un acceso rápido. Preserva un conjunto definido de datos — a menudo de forma inmutable — para cumplimiento, reproducibilidad o reutilización futura, y es distinto de la copia de seguridad, que existe para restaurar sistemas después de un fallo. Los archivos generalmente se verifican con sumas de comprobación y se catalogan con metadatos para que sigan siendo interpretables sin su creador original.

¿Cómo funciona el almacenamiento de datos?

El almacenamiento codifica bits como un estado físico (dominios magnéticos en disco o cinta, carga atrapada en la memoria flash) y los lee a través de un controlador que aplica corrección de errores. Sobre el hardware, los sistemas de archivos asignan archivos a bloques, mientras que los almacenes de objetos asignan claves a flujos de bytes con metadatos. La integridad depende de sumas de comprobación calculadas en el momento de la escritura y revisadas más tarde, porque la corrupción silenciosa es la principal amenaza a largo plazo.

¿Cuál es una buena estrategia de archivado de datos?

Una buena estrategia para el archivado de datos a largo plazo clasifica los datos por valor y obligación, elige un medio y un proveedor, define un formato de paquete autodescriptivo, automatiza la verificación de sumas de comprobación y documenta la ruta de recuperación. También sigue la regla 3-2-1-1-0 y predice qué sucederá cuando finalice la financiación de la subvención. Escribir instrucciones de recuperación para un futuro extraño es el paso que la mayoría de los equipos omiten y del que más se arrepienten.

¿Qué es el archivado en el análisis de datos?

Archivar en el análisis de datos significa congelar un estado analítico completo (datos de entrada, código, entorno anclado y salidas) para que los resultados puedan reproducirse byte a byte. Herramientas como DVC, Git LFS y gestores de flujo de trabajo como Snakemake y Nextflow archivan mediante el hashing del contenido, haciendo que la reproducción sea verificable en lugar de aproximada.

¿Qué almacenamiento de datos dura más?

Generalmente se considera que la cinta magnética (LTO) tiene la vida útil de archivado más larga entre los medios comunes, a menudo citada entre 15 y 30 años en condiciones controladas, y sigue siendo la columna vertebral de los archivos nacionales. Los discos ópticos de archivo han estado en el mercado durante décadas, pero su durabilidad real varía ampliamente, mientras que los HDD y especialmente los SSD sin alimentación son malas opciones a largo plazo. En la práctica, la longevidad depende más de un calendario de migración comprometido que del medio.

¿Qué empresas de archivado de datos debería considerar un grupo de investigación?

Al analizar los servicios de empresas de archivado de datos y las soluciones de archivado a largo plazo, los grupos de investigación suelen aprovechar al máximo el almacenamiento en cinta HPC institucional, los niveles de archivo en la nube de AWS, Azure o Google Cloud, y los repositorios públicos como Zenodo o Dryad para conjuntos de datos publicados. Las soluciones empresariales de archivado de datos de proveedores como Proofpoint y Mimecast se dirigen a registros de correo electrónico y cumplimiento en lugar de datos científicos. Al leer reseñas de empresas de archivado de datos, evalúe a cualquier proveedor en cuanto a costo de recuperación, exportación de formato, informes de integridad y condiciones de salida.

Para obtener información autorizada, consulte las entradas de Wikipedia sobre archivado de datos, preservación digital y el estándar de cinta LTO Ultrium, así como el manual de la Digital Preservation Coalition para orientación sobre la gestión a largo plazo.

Preguntas frecuentes

¿Qué es el archivo de datos?

El archivado de datos es el movimiento impulsado por políticas de datos inactivos a un almacenamiento secundario diseñado para una retención a largo plazo en lugar de un acceso rápido. Preserva un conjunto definido de datos (a menudo de forma inmutable) para cumplimiento, reproducibilidad o reutilización futura, y es distinto de la copia de seguridad, que existe para restaurar sistemas después de una falla. Los archivos generalmente se verifican con sumas de verificación y se catalogan con metadatos para que sigan siendo interpretables sin su creador original.

¿Cómo funciona el almacenamiento de datos?

El almacenamiento codifica bits como un estado físico (dominios magnéticos en disco o cinta, carga atrapada en la memoria flash) y los lee a través de un controlador que aplica corrección de errores. Además del hardware, los sistemas de archivos asignan archivos a bloques, mientras que los almacenes de objetos asignan claves a flujos de bytes con metadatos. La integridad depende de sumas de verificación calculadas en el momento de la escritura y revisadas más tarde, porque la corrupción silenciosa es la principal amenaza a largo plazo.

¿Cuál es una buena estrategia de archivo de datos?

Una buena estrategia para el archivado de datos a largo plazo clasifica los datos por valor y obligación, elige un medio y un proveedor, define un formato de paquete autodescriptivo, automatiza la verificación de la suma de verificación y documenta la ruta de recuperación. También sigue la regla 3-2-1-1-0 y predice lo que sucederá cuando finalice la financiación de la subvención. Escribir instrucciones de recuperación para un futuro extraño es el paso que la mayoría de los equipos se saltan y del que más se arrepienten.

¿Qué es el archivo en el análisis de datos?

Archivar en el análisis de datos significa congelar un estado analítico completo (datos de entrada, código, entorno anclado y salidas) para que los resultados puedan reproducirse byte a byte. Herramientas como DVC, Git LFS y administradores de flujo de trabajo como Snakemake y Nextflow archivan el contenido mediante hash, lo que hace que la reproducción sea verificable en lugar de aproximada.

¿Qué almacenamiento de datos dura más?

Generalmente se considera que la cinta magnética (LTO) tiene la vida útil de archivo más larga entre los medios comunes, a menudo citada entre 15 y 30 años en condiciones controladas, y sigue siendo la columna vertebral de los archivos nacionales. Los discos ópticos de archivo han estado en el mercado durante décadas, pero su durabilidad real varía ampliamente, mientras que los HDD y especialmente los SSD sin alimentación son malas opciones a largo plazo. En la práctica, la longevidad depende más de un calendario migratorio comprometido que del medio.

¿Qué empresas de archivo de datos debería considerar un grupo de investigación?

Al analizar los servicios empresariales de archivado de datos y las soluciones de archivado de datos a largo plazo, los grupos de investigación suelen aprovechar al máximo el almacenamiento institucional en cinta HPC, los niveles de archivo en la nube de AWS, Azure o Google Cloud, y los repositorios públicos como Zenodo o Dryad para conjuntos de datos publicados. Las soluciones empresariales de archivado de datos de proveedores como Proofpoint y Mimecast apuntan a registros de cumplimiento y correo electrónico en lugar de datos científicos. Al leer reseñas de empresas de archivado de datos, evalúe a cualquier proveedor en cuanto a costos de recuperación, exportación de formato, informes de integridad y condiciones de salida. Para yo autoritario


Cree un portafolio de datos, proyecto por proyecto

Rutas de ciencia de datos basadas en proyectos con una terminal guiada y conjuntos de datos reales