Saltar al contenido principal
ActivePapers Almacena tus datos como documentos recomputables para que cualquier resultado publicado pueda ejecutarse de nuevo, verificarse y preservarse.

Algunos enlaces de este sitio son de afiliados: si compras a través de ellos, es posible que recibamos una comisión sin coste adicional para ti. Esto nunca afecta a nuestras recomendaciones. Consulta nuestra declaración de afiliados para más detalles. Divulgación de afiliados.

Los mejores artículos científicos de código abierto: mejores opciones

Los artículos científicos de código abierto son artículos de investigación revisados por pares publicados bajo licencias que permiten a cualquiera leerlos, reutilizarlos y redistribuirlos, y la lista práctica para encontrarlos abarca aproximadamente cinco plataformas distintas: DOAJ, ScienceOpen, arXiv, PubMed Central y repositorios institucionales. Solo el DOAJ indexa más de 20 000 revistas de acceso abierto a partir de 2025.

Conclusiones clave

  • Cinco tipos de plataformas cubren casi todos los casos de uso de artículos científicos de código abierto: megaíndices (DOAJ), capas de superposición y descubrimiento (ScienceOpen), servidores de preimpresiones (arXiv, bioRxiv), archivos obligatorios por financiadores (PubMed Central, Europe PMC) y repositorios institucionales (Zenodo, sistemas universitarios).
  • El criterio decisivo es la licencia, no la “lectura gratuita”. CC BY permite la reutilización comercial y la minería de textos; CC BY-NC y CC BY-ND bloquean una o ambas. Verifique el campo de licencia antes de construir un pipeline sobre un corpus.
  • Las preimpresiones no son revisadas por pares. arXiv y bioRxiv tienen un valor enorme para el trabajo computacional, pero cítelas como preimpresiones y rastree si existe una versión de registro (version of record).
  • Los metadatos legibles por máquina separan las plataformas utilizables de las inutilizables. OAI-PMH, API REST y JATS XML determinan si puede recolectar 50 000 artículos o hacer clic en ellos uno por uno.
  • Ningún índice está completo. La verificación cruzada de DOAJ con Europe PMC y un repositorio temático detecta las brechas de cobertura que afectan a las revisiones sistemáticas.

Qué significan realmente los “artículos científicos de código abierto”

Los artículos científicos de código abierto se encuentran en la intersección de dos ideas que suelen confundirse: el acceso abierto (el artículo es gratuito para leer) y la licencia abierta (el artículo es gratuito para reutilizar). Un artículo detrás del banner de “lectura gratuita” de una editorial es de acceso abierto en el sentido débil, pero aún puede prohibir la redistribución, la traducción o la minería de textos comercial. Un artículo bajo CC BY es abierto en el sentido fuerte: puede redistribuirlo, entrenar modelos con él y volver a publicar figuras con atribución.

Los científicos computacionales se interesan por el sentido fuerte. Al ensamblar un corpus para un modelo de lenguaje, extraer datos de reacción de tablas complementarias o crear un grafo de citas, el campo de la licencia es lo primero que debe analizar su pipeline. La Iniciativa de Acceso Abierto de Budapest y la posterior Declaración de Berlín establecieron el marco que la mayoría de los financiadores y repositorios consagran ahora en sus políticas.

Una segunda distinción es igualmente importante: el artículo frente al artefacto. En física computacional, química y bioinformática, el artículo suele ser el resultado menos reutilizable.

El código, los archivos de entrada (input decks), los archivos de trayectoria y los cuadernos de análisis son lo que otro laboratorio realmente necesita. Las plataformas que alojan artículos junto con código y datos —Zenodo, el modelo de superposición de ScienceOpen y los repositorios integrados en revistas— valen más para esta audiencia que los sitios de lectura pura.

La tabla de comparación

PlataformaTipo de contenidoTransparencia de licenciaAPI / acceso masivoIdeal para
DOAJRevistas OA revisadas por pares, metadatos a nivel de artículoCampo de licencia explícito por artículoSí: API pública, OAI-PMH, metadatos CC0Evaluar la legitimidad de una revista; crear listas blancas de revistas
ScienceOpenRevistas de superposición, revisión post-publicación, OA agregadoVaría según la colección de origenSí: API RESTDescubrimiento, revisión por pares abierta, colecciones
arXivPreimpresiones, física/matemáticas/CS/biología cuantitativaLicencia por artículo (a menudo la propia de arXiv)Sí: datos masivos, acceso S3Campos de avance rápido; resultados previos a la publicación
bioRxiv / medRxivPreimpresiones clínicas y de ciencias de la vidaPor artículo, frecuentemente CC BYSí: API y minería de texto completoBioinformática, genómica, artículos de métodos
PubMed Central / Europe PMCLiteratura biomédica financiadaMixto; subconjunto OA marcadoSí: API robustas, XML de texto completo para el subconjunto OATrabajo financiado por NIH/Wellcome; minería de textos
ZenodoArtículos, conjuntos de datos, software, todas las versionesSelección de licencia obligatoriaSí: API REST, DOI por versiónCódigo y datos citables junto a los artículos
Repositorios institucionalesProducción local, tesis, informesInconsistenteA veces: DSpace y EPrints exponen OAI-PMHLiteratura gris, tesis, informes técnicos de laboratorio

Esta tabla proporciona un resumen de las plataformas para acceder a artículos científicos de código abierto.

Relacionado: — Cursos interactivos de Python y ciencia de datos que codifica directamente en el navegador.

Notas plataforma por plataforma para el trabajo computacional

DOAJ: la capa de validación de revistas

DOAJ es un índice curado, no una editorial. Su valor para un grupo computacional es la función de lista blanca: aplica criterios documentados antes de listar una revista, lo que filtra los títulos depredadores que contaminan las búsquedas generales en la web.

Los metadatos se publican bajo CC0, por lo que puede ingerir toda la lista de revistas en sus propias herramientas sin fricciones de licencia. La limitación es que DOAJ indexa a nivel de revista y de metadatos de artículos; no es un corpus de texto completo y no aloja PDFs.

ScienceOpen: descubrimiento y revisión abierta por pares

ScienceOpen opera como una red de publicación de investigación que superpone el descubrimiento, la creación de colecciones y la revisión por pares posterior a la publicación sobre artículos científicos de código abierto y contenido agregado. Para un grupo de laboratorio, la característica útil es la capacidad de reunir una colección temática con un DOI y un editorial citable, lo que representa una ruta ligera para publicar una revisión o un estudio comparativo (benchmark survey) sin el envío tradicional a una revista. La transparencia de la revisión varía, por lo que trate el estado de la revisión como metadatos a verificar en lugar de como una garantía.

Favorito del lector: — Rutas de ciencia de datos basadas en proyectos con una terminal guiada y conjuntos de datos reales.

arXiv: el estándar para física y biología cuantitativa

arXiv es anterior al movimiento moderno de acceso abierto y sigue siendo el camino más rápido hacia los resultados en materia condensada, física de altas energías, métodos de química computacional y biología cuantitativa. El acceso masivo es muy conveniente: todo el corpus está disponible para su descarga, razón por la cual tantos modelos de lenguaje científicos se entrenan con él.

La limitación es el control de versiones: un artículo puede revisarse varias veces y la versión de registro puede residir en una revista. Especifique explícitamente el identificador de arXiv y el número de versión.

PubMed Central y Europe PMC: literatura obligatoria por financiadores

PubMed Central alberga el subconjunto abierto de literatura biomédica depositada bajo mandatos de financiadores, y Europe PMC lo refleja y amplía con puntos finales adicionales de minería de texto completo. La política de acceso público de los NIH y la política de acceso abierto del Wellcome Trust impulsan los depósitos aquí. Para los grupos de bioinformática, el XML de texto completo del subconjunto OA es el corpus estructurado más útil disponible, ya que incluye etiquetas de sección en lugar de un diseño de PDF bruto.

Zenodo: donde residen el código y los datos

Zenodo, operado por el CERN, asigna un DOI a cada carga y admite registros versionados, lo que resuelve el problema de “qué commit produjo esta figura”. Un artículo depositado como preimpresión más un registro de Zenodo para el código de análisis ofrece a los revisores y lectores una unidad reproducible. La contrapartida es que Zenodo no es revisado por pares ni indexado como una revista: es infraestructura, no un medio de publicación.

Repositorios institucionales y temáticos

Los repositorios universitarios, las instalaciones de DSpace y EPrints y los archivos temáticos específicos contienen tesis, informes técnicos y conjuntos de datos que nunca aparecen en una revista. La cobertura es desigual y la calidad de los metadatos varía ampliamente, pero para la literatura gris y los resultados negativos, a menudo son la única fuente. OAI-PMH es el protocolo de recolección estándar y la mayoría de estos sistemas lo exponen.

Cómo decidir: una lista de verificación de criterios

Siga estos pasos en orden, ya que los dos primeros eliminan la mayoría de las malas opciones para encontrar artículos científicos de código abierto:

Relacionado: — Una amplia biblioteca técnica de libros, vídeos y formación en directo sobre informática científica..

  1. Licencia. ¿La plataforma expone una licencia legible por máquina por artículo? CC BY es el estándar permisivo; CC BY-NC y CC BY-ND restringen el uso comercial o derivado.
  2. Estado de revisión por pares. ¿El elemento está revisado y ese estado es explícito en los metadatos? Las preimpresiones requieren un manejo diferente en una cita.
  3. Acceso masivo. ¿API, OAI-PMH o corpus descargable? Si necesita más de unos pocos cientos de artículos, esto es innegociable.
  4. Esquema de metadatos. ¿JATS XML, Dublin Core o propietario? JATS preserva la estructura de las secciones, lo cual es fundamental para la extracción.
  5. Control de versiones. ¿Puede fijar una versión específica y el registro enlaza a la versión de registro?
  6. Cobertura de su campo. Ningún índice está completo. Pruebe con diez artículos conocidos de su propia bibliografía y cuente los aciertos.
  7. Persistencia. ¿Existe un DOI y la institución anfitriona tiene respaldo institucional? Un DOI de un operador bien financiado es una apuesta a largo plazo más segura que un proyecto amateur.

Flujo de trabajo práctico para un grupo de laboratorio

Un pipeline de literatura reproducible para un grupo computacional que busca artículos científicos de código abierto normalmente se ejecuta en cuatro etapas. La etapa uno es el descubrimiento: consultar DOAJ para la legitimidad a nivel de revista, Europe PMC o arXiv para el contenido, y su repositorio institucional para la producción local.

La etapa dos es el filtrado de licencias: analizar el campo de la licencia y descartar cualquier cosa que bloquee la reutilización prevista antes de gastar recursos computacionales en ello. La etapa tres es la recolección: extraer el texto completo a través de la API de la plataforma cuando esté disponible, y almacenar el identificador de origen, la versión y la licencia junto con el texto. La etapa cuatro es la higiene de las citas: registrar la versión de registro, el identificador de la preimpresión y el DOI de Zenodo para cualquier código asociado, de modo que un lector pueda reconstruir exactamente lo que usted utilizó.

El modo de fallo que debe evitar es tratar el “acceso abierto” como un único valor booleano. Un corpus ensamblado sin metadatos de licencia y versión es un corpus que no puede redistribuir legalmente ni reproducir.

Nuestra elección: — Compre cursos individuales de Python científico directamente, frecuentemente con grandes descuentos.

Advertencias y trampas comunes

Las revistas depredadoras siguen siendo un peligro real, y el acceso abierto no es sinónimo de baja calidad; la correlación es inversa en la mayoría de los campos. Sci-Hub, que aparece en muchos resultados de búsqueda sobre este tema, distribuye artículos protegidos por derechos de autor sin permiso; no es una plataforma de código abierto para artículos científicos y su uso conlleva riesgos legales y éticos, particularmente para investigadores financiados cuyas instituciones tienen políticas al respecto.

Las páginas temáticas “abiertas” de las editoriales, como los listados de temas de acceso abierto de Springer, son útiles para navegar, pero son catálogos comerciales en lugar de índices independientes. Finalmente, los metadatos de las licencias a veces son incorrectos o faltan en la fuente; cuando una licencia es ambigua, contacte al autor de correspondencia en lugar de asumir el permiso.

Fuentes y lecturas adicionales

  • Open source — Wikipedia: Open source is the practice of publishing digital resources publicly alongside their source code or source files, enabling use, study, modification, and redistribution…
  • Scientific literature — Wikipedia: Scientific literature encompasses a vast body of academic papers that spans various disciplines within the natural and social sciences. It primarily consists of…

Preguntas frecuentes

¿Cuáles son las mejores plataformas de artículos científicos de código abierto?

DOAJ, ScienceOpen, arXiv, PubMed Central/Europe PMC y Zenodo cubren la gran mayoría de las necesidades, mientras que los repositorios institucionales llenan los vacíos de tesis y literatura gris. La elección correcta depende de su campo y de si necesita leer, minar o redistribuir. La mayoría de los grupos computacionales terminan usando dos o tres en combinación en lugar de uno solo.

¿Es el acceso abierto lo mismo que el código abierto?

No. El acceso abierto significa que el artículo se puede leer gratis; la licencia abierta significa que la reutilización es gratuita. Un artículo puede ser de acceso abierto pero tener una licencia sin derivados, lo que bloquea la minería de textos o la reutilización de figuras. Para trabajos computacionales, verifique la licencia Creative Commons específica, no el estado de acceso.

¿Puedo utilizar artículos científicos de código abierto para entrenar un modelo de aprendizaje automático?

Solo si la licencia lo permite. CC BY y CC0 permiten el uso comercial y derivado, incluido el entrenamiento, con atribución. CC BY-NC bloquea el entrenamiento comercial y CC BY-ND bloquea los derivados. Los términos de la editorial y las políticas de los financiadores pueden añadir condiciones adicionales, por lo que registre la licencia por documento en su corpus.

¿Son las preimpresiones de arXiv lo suficientemente confiables para ser citadas?

Las preimpresiones de arXiv son citables y se citan ampliamente en física y matemáticas, pero no son revisadas por pares. Cite el identificador y la versión de arXiv, y verifique si desde entonces ha aparecido una versión de registro en una revista. Para una revisión sistemática, la mayoría de los protocolos exigen distinguir las preimpresiones de los artículos revisados.

¿Cómo encuentro versiones de acceso abierto de artículos con muro de pago?

Consulte la ruta de acceso abierto de la propia editorial, luego Europe PMC o PubMed Central para trabajos biomédicos financiados, luego su repositorio institucional y, finalmente, un agregador como ScienceOpen o Unpaywall. Muchos financiadores obligan al depósito dentro de un periodo establecido, por lo que a menudo existe una copia de acceso abierto “verde” incluso cuando la versión de la revista es de pago.

¿Cuál es la diferencia entre el acceso abierto dorado, verde y diamante?

Gold Open Access publica el artículo final públicamente en la revista, a menudo con un cargo por procesamiento del artículo. Green Open Access deposita una versión en un repositorio, a veces después de un embargo. Diamond Open Access es como el Gold sin tarifas para autores o lectores, y DOAJ le permite filtrar por revistas de este tipo.

Preguntas frecuentes

¿Cuáles son las mejores plataformas de artículos científicos de código abierto?

DOAJ, ScienceOpen, arXiv, PubMed Central/Europe PMC y Zenodo cubren la gran mayoría de las necesidades, y los repositorios institucionales llenan los vacíos para tesis y literatura gris. La elección correcta depende de su campo y de si necesita leer, extraer o redistribuir. La mayoría de los grupos computacionales terminan usando dos o tres en combinación en lugar de uno.

¿Es el acceso abierto lo mismo que el código abierto?

No. El acceso abierto significa que el artículo se puede leer de forma gratuita; La licencia abierta significa que la reutilización es gratuita. Un artículo puede ser de acceso abierto pero tener una licencia sin derivados, lo que bloquea la extracción de texto o la reutilización de figuras. Para trabajos computacionales, verifique la licencia Creative Commons específica, no el estado de acceso.

¿Puedo utilizar artículos científicos de código abierto para entrenar un modelo de aprendizaje automático?

Sólo si la licencia lo permite. CC BY y CC0 permiten el uso comercial y derivado, incluida la formación, con atribución. CC BY-NC bloquea la formación comercial y CC BY-ND bloquea los derivados. Los términos del editor y las políticas de los financiadores pueden agregar condiciones adicionales, así que registre la licencia por documento en su corpus.

¿Son las preimpresiones de arXiv lo suficientemente confiables como para citarlas?

Las preimpresiones de arXiv se pueden citar y citar ampliamente en física y matemáticas, pero no están revisadas por pares. Cite el identificador y la versión de arXiv y verifique si desde entonces ha aparecido una versión del registro en una revista. Para una revisión sistemática, la mayoría de los protocolos requieren que se distingan los preprints de los artículos revisados.

¿Cómo encuentro versiones de acceso abierto de artículos de pago?

Consulte la ruta de acceso abierto del propio editor, luego Europe PMC o PubMed Central para trabajos biomédicos financiados, luego su repositorio institucional y luego un agregador como ScienceOpen o Unpaywall. Muchos financiadores exigen el depósito dentro de un período determinado, por lo que a menudo existe una copia verde de acceso abierto incluso cuando la versión de la revista es de pago.

¿Cuál es la diferencia entre el acceso abierto oro, verde y diamante?

Gold Open Access publica el artículo final públicamente en la revista, a menudo con un cargo por procesamiento del artículo. Green Open Access deposita una versión en un repositorio, a veces después de un embargo. Diamond Open Access es oro sin tarifas para autores o lectores, y DOAJ le permite filtrar por revistas de este tipo.


Sea propietario de un curso de por vida, no de una suscripción

Compre cursos individuales de Python científico directamente, frecuentemente con grandes descuentos