医学论文数据共享:FAIR原则+数据仓库选择+期刊政策对照
研究数据共享已从"可选项"变成越来越多医学期刊的"硬门槛"。无论是 PLOS 系列的全强制政策,还是 Nature/Science 的"鼓励+必要时强制",投稿前搞不清数据共享要求,轻则被退修补声明,重则直接拒稿。本篇围绕国际公认的 FAIR 原则,拆解可发现、可获取、可互操作、可重用四条标准,附主要数据仓库按学科选择指南、PLOS/Nature/Science 等顶刊数据共享政策对照表、数据管理计划(DMP)写作要点,以及敏感数据脱敏与隐私保护的平衡方法。我们多年协作中积累的反馈是:投稿前把数据可用性声明写规范,退修率明显降低。文末附数据共享自查清单,照着改写即可。
🔍 FAIR原则是什么(Findable/Accessible/Interoperable/Reusable)
FAIR 原则由荷兰 GO FAIR 基金会于 2016 年提出,现为国际科研数据管理通用准则。FAIR 是四个英文首字母缩写,分别对应研究数据应当具备的四项属性:
F — Findable(可发现):数据要有全局唯一标识符(如 DOI),有内容丰富的元数据(标题、作者、采集时间、变量说明),并被索引到可检索的数据仓库。简单说,别人搜得到你的数据。
A — Accessible(可获取):数据通过标识符可被检索和访问,访问协议公开(哪怕需要申请或授权)。可获取不等于"无条件开放"——敏感数据可设"受控访问",但访问流程要透明可查。
I — Interoperable(可互操作):数据使用公认标准格式(如 CSV、DICOM、FHIR),术语使用受控词表(如 SNOMED CT、MeSH、LOINC),能与其他系统交换和整合。换句话说,别人能用你的数据,不被专有格式卡住。
R — Reusable(可重用):数据有清晰的使用许可(如 CC BY 4.0)和详细出处说明,描述足够详尽让第三方能理解并复现。再利用的前提是别人看得懂、敢引用。
FAIR 不是"全部开放"的代名词——它要求的是"可发现、可获取、可互操作、可重用",其中"可获取"允许受控访问机制。医学数据涉及患者隐私,完全开放反而不合规,FAIR 的精妙在于既推动共享又兼容隐私保护。投稿前对照 FAIR 四条逐项检查,是数据共享合规的第一步。
📑 哪些期刊要求强制数据共享
近年来主流医学期刊纷纷把数据共享从"鼓励"升级为"强制",下表对照常见期刊的数据政策强度:
| 期刊/出版商 | 数据共享要求 | 声明是否必填 |
|---|---|---|
| PLOS 系列 | 强制公开共享 | 必填 |
| Nature 系列 | 鼓励,特定数据类型强制 | 必填 |
| Science 系列 | 核心数据强制 | 必填 |
| BMJ 系列 | 鼓励,RCT 强烈推荐 | 必填 |
| JAMA | 鼓励,需合理说明 | 必填 |
| The Lancet | 鼓励,资助者要求时强制 | 必填 |
| 多数中文核心期刊 | 鼓励,非强制 | 选填 |
PLOS 是最严格的代表:稿件投递即要求附数据可用性声明,无数据仓库则需上传至 PLOS 提供的仓库或附补充材料。Nature/Science 对基因组、临床试验等特定类型强制共享,其余类型鼓励但声明必填。BMJ、JAMA、Lancet 对 RCT 尤其看重数据共享,有资助者要求时按强制处理。中文核心期刊目前多为鼓励性质,但 CSCD 期刊正逐步跟进。投稿前先到目标刊"Author Guidelines"查数据政策条款,别等退修才补。
🗂️ 主要数据仓库选择指南(按学科)
选对数据仓库是 FAIR 落地的关键。仓库要给数据发 DOI、提供稳定托管、被期刊认可。下表按学科列出医学领域常用仓库:
| 学科方向 | 推荐数据仓库 | 特点 |
|---|---|---|
| 基因组学 | GenBank / ENA / DDBJ | 国际三大核酸库,强制 |
| 临床数据 | ClinicalTrials.gov / WHO ICTRP | 临床试验注册与结果 |
| 影像学 | The Cancer Imaging Archive (TCIA) | 肿瘤影像专用 |
| 流行病学 | dryad / Figshare | 通用型,发 DOI |
| 护理学 | Figshare / Zenodo | 通用型,易上手 |
| 药物/药代 | ChEMBL / PubChem | 化合物与活性数据 |
| 通用型 | Zenodo / Figshare / dryad | 跨学科,CERN 支持 |
选仓库三原则:① 期刊是否指定——若目标刊指定 GenBank 等专用库,必须用指定库;② 学科适配——基因组必入三大核酸库,临床试验必入 ClinicalTrials.gov,别图省事全塞 Zenodo;③ 是否发 DOI 并被检索——通用型 Zenodo/Figshare 都发 DOI 且可被 Google Dataset 检索,满足 FAIR 的 F 与 A。我们多年协作中常见误区是作者把数据塞进网盘传编辑,这不满足 FAIR 任何一条,编辑会要求重新入库。
📝 数据管理计划(DMP)怎么写
数据管理计划(Data Management Plan,DMP)是描述数据全生命周期管理方式的文档,越来越多资助机构(如 NIH、NSFC、Horizon Europe)要求申请阶段就提交。DMP 不是论文附件,而是研究立项时的规划文件。一份合格 DMP 至少覆盖以下六要素:
① 数据描述:采集什么数据、数据类型(定量/定性/影像)、格式(CSV/DICOM)、估算体量。例:本研究采集某三甲医院 2024-2026 年 1200 例住院患者的人口学、实验室、影像数据,格式为 CSV+DICOM,预计 8GB。
② 数据收集方式:采集工具(CRF/电子病历/可穿戴设备)、采集时点、质控措施。需说明采集是否经伦理批准。
③ 数据存储与备份:存储位置(机构服务器/云存储)、备份频率、访问权限分级。涉及患者数据的需说明加密与访问控制。
④ 元数据标准:采用哪些受控词表(如 SNOMED CT、LOINC)、字段命名规则。这是 FAIR 中"可互操作"的落地。
⑤ 共享与访问:哪些数据公开、哪些受控访问、共享时机(发表时/项目结束后)、选择哪个仓库、是否设禁运期。
⑥ 长期保存与责任:保存年限(通常≥5 年)、数据保管人、项目结束后移交安排。资助机构往往明确要求保存年限,漏写不合规。
DMP 模板可参考 DMPRoadmap、DMPTool 等在线工具,按六要素填即可。写 DMP 的好处是投稿时数据可用性声明几乎可以直接抄——因为共享计划早在立项时就规划好了,避免投稿时临时拼凑。
📄 数据可用性声明(Data Availability Statement)模板
数据可用性声明是投稿系统里必填的一段话,告诉编辑和读者数据存在哪、怎么获取。下表是不同情形下的声明模板,可直接套用:
| 情形 | 声明模板 |
|---|---|
| 数据已入库 | Data available in [仓库名], DOI: [DOI号] |
| 合理申请获取 | Data available upon reasonable request |
| 受控访问 | Data available under controlled access via [仓库] |
| 附补充材料 | Data in Supplementary Materials |
| 无原始数据 | No new data generated; sources cited in refs |
| 第三方数据需申请 | Data from [机构], restrictions apply |
声明三要点:① 具体——写明仓库名和 DOI,别泛泛写"available";② 诚实——受控访问就写受控,别假装全开放后被审稿人质疑;③ 与正文一致——正文 Methods 若写"数据存于 GenBank",声明不能写"upon request",前后矛盾会被退修。"upon reasonable request"是争议较大的一种声明,越来越多期刊(如 ICMJE 成员刊)要求尽量避免这种含糊表述,能入库尽量入库。
🔒 敏感数据怎么处理
医学研究的数据多含患者标识(姓名、身份证号、住址、诊疗细节),直接共享违反《个人信息保护法》《数据安全法》及《医疗机构病历管理规定》。敏感数据处理的核心是脱敏与受控访问双管齐下:
① 直接标识符必须移除:姓名、身份证号、手机号、详细住址、电子病历号等直接标识符在共享前必须删除或哈希化。这是底线,不能含糊。
② 间接标识符需泛化:年龄按区间(如 60-64)、出生日期改年龄、邮编改前三四位、具体日期改相对天数(如"术后第 3 天"),降低再识别风险。研究表明,仅凭邮编+生日+性别可识别约 87% 的美国人,间接标识符不可轻视。
③ 采用受控访问仓库:敏感数据不入全开放仓库,而入支持 dbGaP、EGA 等受控访问机制的平台,研究者提交申请经数据访问委员会审批后方可下载。
④ 签署数据使用协议(DUA):申请方需签 DUA,承诺仅用于本次研究、不二次传播、不试图再识别、成果发表时引用数据来源。这是受控访问的法律兜底。
⑤ 伦理审查前置:数据共享方案需在伦理审查阶段就报备,知情同意书中应有"数据将用于研究并可能经脱敏后共享"的条款。事后补同意极麻烦,立项时就写进去。
⚖️ 数据共享与隐私保护的平衡
数据共享和隐私保护看似矛盾,实则可平衡。关键在于分层管理:把数据按敏感度分级,不同级别采取不同共享策略。
第一层:完全公开层。无患者标识的汇总数据、统计代码、分析脚本、模型参数,可直接公开入 Zenodo/Figshare,发 DOI。这层风险最低、收益最大,应尽量公开。
第二层:受控访问层。去标识化的个体级数据(如脱敏后的 CRF 数据),入 dbGaP 等受控仓库,申请审批后获取。这层兼顾可重用与隐私。
第三层:不共享层。含直接标识符且无法脱敏的数据(如含人脸的影像、可识别个体的基因-表型关联),原则上不公开,仅在声明中说明"因隐私限制不可共享,可联系[机构]申请合作"。这层是隐私保护的硬底线。
分层的好处是能公开的尽量公开,既满足期刊强制要求,又不触碰隐私红线。我们多年协作中看到,把"是否共享"当成非黑即白的二元问题,往往导致要么过度保守(该公开的不公开被退修),要么过度激进(不该公开的泄露引发撤稿)。分层管理是兼顾合规与共享的务实解法。
✅ 数据共享自查清单
投稿前对照下面清单逐项打勾,能避开绝大多数数据共享相关退修:
☐ 数据已存入期刊认可的数据仓库
☐ 仓库已分配 DOI 并可检索(满足 FAIR-F)
☐ 数据使用公认标准格式(CSV/DICOM,满足 FAIR-I)
☐ 元数据完整(标题/作者/采集时间/变量说明)
☐ 标注使用许可(如 CC BY 4.0,满足 FAIR-R)
☐ 直接标识符已移除、间接标识符已泛化
☐ 数据可用性声明与正文 Methods 一致
☐ 受控访问数据附 DUA 申请路径
☐ 伦理审查已含数据共享条款
☐ 知情同意书含"数据脱敏后共享"表述
☐ DMP 已写明保存年限与保管人
常见反馈:我们多年协作中,凡是清单全勾的稿件,数据相关退修率显著低于漏 3 项以上的。清单不是形式,是退修率的分水岭,投稿前逐项核对,这是性价比最高的合规动作。
❓ 常见问题与解答
Q: 回顾性研究的数据也要共享吗?
要看期刊政策。PLOS 等强制共享期刊不区分前瞻/回顾,都要声明;鼓励型期刊对回顾性研究多宽容,但若有完整数据集仍建议入库。回顾性研究尤其注意:病历数据敏感度高,需脱敏后受控访问,别因"回顾"就放任不管。
Q: 患者隐私数据怎么共享?
脱敏+受控访问。移除直接标识符,间接标识符泛化,入 dbGaP/EGA 等受控仓库,申请方签 DUA 后获取。绝不能把含姓名身份证号的原始病历直接上传。伦理审查与知情同意前置是前提。
Q: 数据共享收费吗?
多数通用仓库(Zenodo、Figshare、dryad)对研究者免费,部分仓库(如 dryad)对发表时同步入库收少量数据处理费。受控访问仓库(dbGaP)本身不收费,但数据提交需走流程耗时数周。投稿预算里可预留少量数据处理成本。
Q: 不共享数据会被拒稿吗?
强制共享期刊(如 PLOS)会因未附声明直接退修,补交后重审;鼓励型期刊不会因不共享直接拒稿,但声明缺失会被退修。最坏情况是声明与正文矛盾或造假(如声明"已入库"实际未入),这属于学术不端范畴,可能撤稿。
Q: 数据共享和补充材料有什么区别?
补充材料是附在论文里的数据(如附表、附图),随论文一同发表;数据共享是原始数据集存入独立仓库,发独立 DOI,可被第三方检索引用。前者是"论文附件",后者是"独立数据资产"。FAIR 要求的是后者——独立、可发现、可重用的数据,而非埋在补充材料里的零散表格。
- 医学论文伦理审查全流程:IRB/IEC申报材料+知情同意豁免条件 — 数据共享方案需在伦理审查阶段报备
- 医学论文利益冲突声明:ICMJE标准模板+期刊要求对照 — 数据来源资助方与利益冲突关联
- 医学论文作者署名规范:ICMJE四条标准+CRediT贡献者角色分类 — 数据采集者署名认定
- SCI研究数据怎么整理才规范 — 数据整理与共享的前置规范
- SCI查重指南与文字重复规避 — 数据描述的文字查重要点