研究数据管理与存储:FAIR原则、国家数据中心与数据可用性声明

研究数据管理与存储:FAIR原则、国家数据中心与数据可用性声明撰写指南

文章要点:开放科学(open science)浪潮正在深刻改变学术数据管理的标准与期望。FAIR数据原则已被国际主流期刊和资助机构广泛采用,而中国本土的国家科学数据中心体系和国自然开放数据政策也要求研究者系统规划数据的长期管理与共享。本文系统讲解FAIR原则的实践含义、中国数据存储基础设施选择、NMPA电子记录合规要求及国际期刊数据可用性声明的撰写规范。

一、FAIR数据原则:内涵与实践

FAIR原则于2016年在《Scientific Data》发表的政策论文中正式提出,代表四个维度的数据质量要求:可发现性(Findable)、可访问性(Accessible)、互操作性(Interoperable)和可复用性(Reusable)。这一框架已成为国际科学数据管理的基础性共识,被欧盟”地平线2020″、美国NIH和中国自然科学基金委员会等主要科研资助机构广泛采纳。

可发现性(Findable):数据须有全球唯一且持久的标识符(如DOI),并具备足够的元数据描述,使其能够被搜索引擎和数据注册系统检索到。实践上,将数据存储在提供DOI服务的数据仓库(如国家科学数据中心、Zenodo、Figshare)中,并完整填写元数据字段,是实现可发现性的关键步骤。

可访问性(Accessible):数据(或至少是数据的元数据)应通过标准化的开放协议(如https)可被访问,且访问权限规则须清晰说明。即使数据因保密原因不能完全开放,其元数据也应持久可访问,使研究者知道数据的存在及申请访问的途径。

互操作性(Interoperable):数据应使用规范化的格式(如CSV、JSON-LD而非私有格式)和受控词汇(controlled vocabulary)或本体(ontology)进行描述,以便与其他数据集和计算工具整合分析。在临床研究中,使用标准的数据元素定义(如CDISC标准)有助于提高互操作性。

可复用性(Reusable):数据须有清晰的使用许可协议(如CC BY 4.0)、详细的来源信息和数据收集规范说明,使其他研究者能够在理解数据背景的前提下合理复用。在临床研究中,这意味着需要提供完整的数据字典(data dictionary)和处理流程说明。

二、中国国家科学数据中心体系

科技部和财政部自2019年起陆续认定了一批国家科学数据中心,作为中国科研数据长期存储和共享的官方基础设施。医学和生命科学领域的研究者可根据数据类型选择相应的国家级数据平台:

数据中心名称 主要数据类型 主管机构
国家人口健康科学数据中心 临床研究、流行病学、公共卫生数据 国家卫生健康委员会
国家基因组科学数据中心 基因组学、转录组学、蛋白质组学数据 科技部(挂靠北京基因组研究所)
国家微生物科学数据中心 微生物相关研究数据,含感染病研究 科技部(挂靠中国科学院微生物研究所)
国家综合地球观测数据共享平台 环境健康相关数据(非临床研究主要平台) 科技部

对于临床研究数据,国家人口健康科学数据中心(NHPDC)是首选的国家级存储平台,提供数据提交、元数据注册和受控访问管理服务。将数据存储于NHPDC并获得数据集DOI,可满足国内期刊和国自然结题报告对数据可用性的要求。

对于需要与国际研究社区共享的数据,常用的国际平台包括:Zenodo(CERN运营,免费,支持各类科研数据)、ClinicalTrials.gov结果数据库(美国NIH,临床试验结果专用)、NCBI的NCBI Gene Expression Omnibus(GEO,基因表达数据)等。需注意,将数据上传至这些国际平台可能涉及数据跨境传输的合规问题,须参照第三节所述框架评估合规性。

三、NMPA电子记录要求与合规实践

NMPA对药物临床试验电子记录的要求等同于美国FDA 21 CFR Part 11的核心精神,尽管中国并未直接引用这一编号,而是将相关要求融入GCP和相关技术指南中。核心合规要求包括:

系统验证(System Validation):用于产生、修改或存储临床试验数据的计算机系统须经过验证,证明其能够稳定、准确地执行预定功能。验证文件须包括用户需求规范(URS)、功能规范(FS)、验证方案(VP)和验证报告(VR)。NMPA检查时会索取EDC系统的验证摘要,商业EDC系统(如RAVE)通常提供标准验证包,研究者发起研究使用的自建系统须完成独立验证。

操作日志(Audit Trail):电子系统须自动记录对数据的每次修改,包括修改前后的值、修改时间和操作人身份,且日志须不可更改、不可删除。这是NMPA检查中最常核查的电子合规要点,任何数据修改必须有明确的原因记录(reason for change)。

访问控制与用户权限管理:用户须使用个人账号登录,不得共用账号。用户权限须按角色分配(如录入员可录入数据但不能批准,主任可批准但不能录入),且须有明确的用户权限审批记录。研究人员离职后须及时注销其账号,并记录注销时间。

电子签名:在GCP临床试验中,研究者对数据的电子批准须通过可追溯的电子签名完成,不可仅点击”确认”按钮而无身份验证机制。

简单来说:NMPA对电子记录的核心关切是”数据从产生到报告的完整可追溯性”。如果一份数据在某个节点被修改,检查员要能通过audit trail看到:谁改的、什么时候改的、把什么改成了什么、为什么改。这条”数字链条”一旦断裂,即使数据本身是真实的,也会被认定为合规失败。

四、临床试验数据的保存期限要求

数据保存期限是中国研究者在研究结束后容易忽视的合规问题,但未能满足保存要求可能导致NMPA检查问题,甚至影响后续申报项目的审评。

GCP对临床试验数据保存期限的规定:中国GCP要求,申办者(和研究机构)须保存临床试验相关记录至少至药品上市后5年;若药品未获批准,则至临床试验结束后至少5年。然而,对于研究者发起研究(IIT),通常参照国际惯例,主要数据(源文件、原始记录)须保存15年以上。各机构通常在机构科研管理规定中细化保存要求,研究启动时须确认本机构的具体政策。

不同类型数据的保存策略:

  • 源文件(medical records):原则上保存在医院原始系统中,无需研究团队另行转移,但须确保数据在保存期限内可访问。
  • EDC原始数据库:应导出为标准格式(如SAS数据集、CSV)备份存储,不能仅依赖商业EDC供应商的服务器,防止供应商更迭导致数据丢失。
  • 分析数据集和程序代码:统计分析所用的最终数据集和分析程序(如R/SAS代码)应与统计报告一同归档,使他人能够在未来重现分析结果。
  • 知情同意书:纸质知情同意书须留存原件,数字扫描件作为备份。保存期限通常与研究数据相同。

五、国自然开放数据要求与期刊数据可用性声明

国家自然科学基金的开放数据政策:国家自然科学基金委员会(NSFC)自2022年起加强了对科研数据管理的政策要求,在部分重点项目和重大项目中要求申请者提交数据管理计划(DMP)。国自然结题报告中须说明研究数据的存储和共享情况。研究者应将数据存储于国家认可的数据中心(如NHPDC),并在结题材料中提供数据集的访问链接或DOI编号。

期刊数据可用性声明(Data Availability Statement)的撰写:主流国际期刊均要求在论文中提供数据可用性声明,明确说明数据的可获取状态。以下是不同场景下的标准表述框架:

场景一:数据完全开放:
“本研究的数据集已上传至[数据库名称],访问地址为[URL],数据集识别号(DOI)为[DOI编号]。”

场景二:数据受限访问:
“本研究数据因包含受试者隐私信息,不能完全公开。去标识化后的汇总数据可通过向通讯作者合理申请获取。数据申请者须签署数据使用协议并说明研究目的,申请将在[X]个工作日内回复。”

场景三:数据存储于机构系统:
“本研究数据存储于[机构名称]临床研究数据库,遵守中国相关数据保护法规,数据在本机构保存至[年份]。如需访问,请联系通讯作者,访问将遵循机构伦理委员会批准的数据使用规程。”

需要注意的是,《Lancet》《NEJM》等期刊越来越倾向于要求独立统计验证,不接受”数据不可获得”作为唯一的可用性说明。若研究数据因保密原因无法开放,建议在声明中提供联系方式并明确数据申请程序,以增加稿件被接受的可能性。

简单来说:数据可用性声明不是一句”数据可应合理要求提供”的套话就能应付的。编辑和审稿人越来越关注声明的具体性:数据在哪里?如何申请?由谁批准?在规划数据存储时,提前考虑”如果有人申请我的数据,我能在合理时间内提供什么、以什么形式提供”,并据此撰写声明,才能经得住期刊编辑的追问。

与Editverse合作

Editverse为临床研究者提供数据可用性声明撰写、数据管理计划(DMP)起草以及数据章节的英文写作服务,帮助您的论文满足顶级期刊的开放科学要求。欢迎访问 Editverse论文写作服务页面

结论

研究数据管理已从研究结束后的”归档工作”转变为覆盖研究全生命周期的战略性活动。FAIR原则为数据共享提供了可操作的质量框架,国家科学数据中心体系为中国研究者提供了合规的存储基础设施,而NMPA电子记录要求和期刊数据可用性声明规范则分别从监管和发表两端对数据管理提出了明确期望。提前规划数据管理流程、在研究启动时制定详细的DMP,是在监管审查和学术发表两条赛道上同时获得竞争优势的有效策略。

参考文献

  1. Rehnert M, Takors R. FAIR research data management as community approach in bioengineering. Eng Life Sci. 2024;24(1):e202200005. PMID: 36619883
  2. Blumzon CFI, Panescu AT. Data Storage. Handb Exp Pharmacol. 2020;257:341-365. PMID: 31792682
  3. Arend D et al. The Plant Phenomics and Genomics Research Data Repository: An On-Premise Approach for FAIR-Compliant Data Acquisition. Methods Mol Biol. 2023;2668:1-22. PMID: 37646933
  4. Courtot M et al. BioSamples database: FAIRer samples metadata to accelerate research data management. Nucleic Acids Res. 2022;50(D1):D1500-D1507. PMID: 34747489
  5. Inau ET et al. Initiatives, Concepts, and Implementation Practices of the FAIR Data Principles in Health Data Stewardship: Scoping Review. J Med Internet Res. 2023;25:e45013. PMID: 37639292
  6. Fouad K et al. FAIR SCI Ahead: The Evolution of the Open Data Commons for Pre-Clinical Spinal Cord Injury Research. J Neurotrauma. 2021;38(2):169-191. PMID: 31608767
  7. Arend D et al. The on-premise data sharing infrastructure e!DAL: Foster FAIR data for faster data acquisition. Gigascience. 2021;10(2):giaa107. PMID: 33090199
  8. Gassman JJ et al. Data quality assurance, monitoring, and reporting. Control Clin Trials. 1995;16(2 Suppl):104S-136S. PMID: 7789140
  9. Gudi N et al. Regulatory Frameworks for Clinical Trial Data Sharing: Scoping Review. J Med Internet Res. 2022;24(5):e33591. PMID: 35507397
  10. Daher A et al. A code for clinical trials centralized monitoring, sharing open-science solutions to high-quality data. PLoS One. 2023;18(11):e0294412. PMID: 37992026
  11. Jacob D et al. An ecosystem for producing and sharing metadata within the web of FAIR Data. Gigascience. 2025;14:giae111. PMID: 39775840
  12. O’Leary NA et al. Exploring and retrieving sequence and metadata for species across the tree of life with NCBI Datasets. Sci Data. 2024;11(1):732. PMID: 38969627

类似文章

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注