SCI研究数据怎么管理:原始数据保存/共享要求/FAIR原则
数据管理不规范=投稿被质疑+发表后被查无法提供原始数据=撤稿。越来越多SCI刊要求"数据可用性声明"和原始数据共享。我们经手820+篇录用,15%因数据问题被要求补充。本文讲清保存期限、共享要求、FAIR原则、存储库选择和3个失败案例。
🧠 数据管理必要性
研究数据是论文的"证据链",管理不善后果严重:
• 投稿被质疑:审稿人质疑数据真实性,要求提供原始数据。无原始数据=拒稿。
• 发表后被查:发表后读者/编辑质疑,要求提供原始数据复现。无数据=撤稿+记学术不端。
• 期刊政策要求:PLOS/Elsevier/Springer等大出版社要求"数据可用性声明",部分强制共享。
• 基金审计:国自然/重点研发基金结题要求数据归档,无数据=结题困难。
📅 原始数据保存期限
原始数据(CRF表、电子数据库、影像、代码)保存期限:
| 研究类型 | 保存期限 | 依据 |
|---|---|---|
| 药物临床试验 | ≥5年(部分≥10年) | GCP规范 |
| 医疗器械试验 | ≥5年 | 器械GCP |
| 基金资助研究 | ≥5年(结题后) | 基金管理办法 |
| 一般临床研究 | ≥5年(建议10年) | 伦理规范 |
建议:统一保存≥10年,涵盖所有期刊和基金要求。保存内容包括原始记录、数据库、分析代码、图表源文件。
🔄 数据共享要求(出版社政策)
主流出版社数据政策:
| 出版社 | 政策 | 要求 |
|---|---|---|
| PLOS | 强制共享 | 所有数据公开存储库 |
| Elsevier | 鼓励+部分强制 | 数据可用性声明 |
| Springer Nature | 鼓励 | 数据可用性声明 |
| Wiley | 鼓励+部分强制 | 数据共享建议 |
数据可用性声明:投稿时必填,说明数据存储位置(存储库DOI/ Supplementary/ 限制获取理由)。"数据可应合理请求获取"已不被多数刊接受,需具体到存储库。
📋 FAIR原则
FAIR原则(Findable/Accessible/Interoperable/Reusable)是国际数据管理标准,2016年提出,要求研究数据:
【A-Accessible 可获取】 通过标准协议获取,明确访问条件或许可
【I-Interoperable 可互操作】 用通用格式(如CSV),术语用本体/词表
【R-Reusable 可重用】 清晰许可、详细文档、溯源信息完整
投SCI刊数据建议满足FAIR:上传存储库获DOI+元数据+通用格式+许可声明。FAIR不是强制,但满足的稿件审稿好感+1。
🗄️ 数据存储库选择
共享数据用通用存储库,获DOI可引用:
| 存储库 | 特点 | 适用 |
|---|---|---|
| Figshare | 通用,免费,DOI | 各类数据/文件 |
| Zenodo | CERN运营,免费,DOI | 数据+代码 |
| Dryad | 生物生态为主 | 生态学数据 |
| OSF | 开放科学框架 | 项目全流程 |
| GitHub | 代码为主,可获DOI | 分析代码 |
医学专用:clinicaltrials.gov(试验数据)、dbGaP(基因数据)、TCIA(影像数据)。选库原则:①期刊推荐优先;②通用数据用Figshare/Zenodo;③代码用GitHub+Zenodo存档。
💀 3个数据管理失败案例
① 原始数据丢失被撤稿:某团队发SCI后读者质疑统计,编辑要求提供原始数据。团队称"硬盘损坏数据丢失",无法复现。编辑撤稿+通报单位,记学术不端。教训:原始数据多重备份。
② 数据共享声明不当被拒:某投稿PLOS,数据可用性声明写"data available on request"。编辑拒:"不符合PLOS数据共享政策,需公开存储库。"改上传Zenodo获DOI后重投。教训:投稿前查刊数据政策。
③ 数据造假被查出:某论文图表被读者发现数据异常(图片拼接痕迹)。编辑要求提供原始影像,团队无法提供。调查确认造假,撤稿+记黑名单。教训:原始影像保存+不修图。
💡 数据管理最佳实践
① 数据管理计划(DMP):开题时写DMP,说明数据类型/格式/存储/共享/保存期。基金申请常要求DMP。
② 原始数据多重备份:本地硬盘+云盘+存储库三重备份,防丢失。
③ 电子数据库规范:用Excel/CSV/SPSS格式,字段清晰、单位统一、变量有标签。
④ 分析代码保存:R/Stata/SAS脚本保存,附README说明,可复现分析。
⑤ 图表源文件保存:保留生成图表的源数据和软件文件,便于修改和质疑时复现。
⑥ 存储库上传:投稿前上传Figshare/Zenodo获DOI,写进数据可用性声明。
⚠️ 提示:医学研究含患者隐私数据,共享前去标识化(脱敏),符合HIPAA/个人信息保护法。含可识别信息的数据不能公开共享,存限制获取库(如dbGaP controlled access)。
📝 DMP数据管理计划模板
DMP(Data Management Plan)是开题阶段就要写的数据管理规划,国自然/重点研发/欧盟地平线等基金均要求提交。我们协助撰写47份DMP,通过率100%。DMP必填要素:
| 要素 | 内容 | 常见问题 |
|---|---|---|
| 数据类型 | 原始/处理/分析/代码 | 描述过粗 |
| 格式标准 | CSV/SPSS/FASTA等 | 用私有格式 |
| 存储位置 | 本地/云/存储库 | 无具体库 |
| 访问权限 | 公开/限制/封闭 | 未说明条件 |
| 保存期限 | ≥5/10年 | 期限不达标 |
| 共享方式 | 存储库DOI | 写"应请求" |
DMP不是"写完即弃",应随研究进展动态更新,结题时附最终版。基金评审看DMP判断数据管理规范性,写不好影响立项。
🔒 医学数据去标识化方法
医学数据含患者隐私,共享前必须去标识化(脱敏),否则违反个人信息保护法/HIPAA。去标识化分两步:
【2.间接标识符处理】 以下字段需泛化或删除:
• 出生日期→年龄段(5岁一档)
• 就诊日期→相对时间(入组第N天)
• 邮编→前3位
• 罕见病诊断→保留(但结合其他字段可识别则删)
• 影像→去除DICOM头患者信息
【3.重新识别风险评估】 k-anonymity≥5,组合字段不唯一
注意:去标识化不等于匿名化。去标识化数据仍可能被重新识别(结合多源数据),共享时仍需签数据使用协议(DUA)。完全匿名化数据(无法还原个体)才可公开共享,但医学数据很难达到完全匿名。
📤 Zenodo存储库上传操作
Zenodo(CERN运营,免费,获DOI)上传操作流程:
【2.新建上传】 New upload→上传数据文件(≤50GB/文件)
【3.填元数据】 标题/作者/关键词/描述/资源类型
【4.选许可】 CC-BY(署名)/CC0(公有领域)/CC-BY-NC
【5.关联基金】 填Grant number(国自然等)
【6.发布】 Save→Publish→获DOI(如10.5281/zenodo.xxxxx)
【7.引用】 数据可用性声明写:Data available at Zenodo, DOI: 10.5281/zenodo.xxxxx
上传后DOI永久有效,不可删除(可发布新版本,旧版仍可访问)。建议上传"数据+README+代码"打包,方便他人复现。我们协助上传63个数据集到Zenodo/Figshare,全部获DOI。
📜 数据可用性声明模板
不同场景数据可用性声明模板(投稿时复制改写):
The datasets generated during the current study are available in the Zenodo repository, DOI: 10.5281/zenodo.xxxxx.
【场景2-数据在补充材料】
All data generated or analyzed during this study are included in this published article and its Supplementary Information files.
【场景3-数据受限制】
Due to privacy/ethical concerns, individual participant data cannot be publicly available. De-identified data are available from the corresponding author upon reasonable request and approval by the ethics committee.
【场景4-代码已开源】
The analysis code is available at GitHub (https://github.com/xxx/xxx) and archived at Zenodo, DOI: 10.5281/zenodo.xxxxx.
避坑:场景3的"应合理请求获取"已不被PLOS/部分Elsevier刊接受,需说明获取条件(伦理审批/DUA/审批流程)。无数据共享声明=格式审查退回。
🔄 数据版本控制与变更追踪
研究数据会反复修改,版本控制防混乱。我们处理的返修案例中23%涉及数据修改,无版本记录=无法证明数据未被篡改。版本控制要点:
① 命名规范:文件名含日期+版本号,如 data_v1_20250301.csv、data_v2_20250415.csv,禁用"final""最终""最新"等模糊命名。
② 修改留痕:每次修改记录改动内容、原因、操作人、时间。用Excel可在单独sheet记修改日志,或用Git管理代码/CSV。
③ 锁定基准版:投稿时锁定一版数据作为"投稿基准版",返修修改另存新版,保留旧版可追溯。
④ 代码版本:分析代码用Git管理,每次提交附说明。论文录用后给代码打标签(tag)对应发表版本。
日期 | 操作人 | 修改字段 | 修改前→修改后 | 原因
2025-04-15 | 张某 | age | 文本→数值 | 统一格式
2025-04-20 | 李某 | 删3条重复记录 | n=210→n=207 | 去重
2025-05-10 | 王某 | 新增group字段 | -→A/B/C | 分组分析
版本混乱的代价:某团队返修时改了数据,但忘了改对应图表,审稿人发现数据与图表不符拒稿。版本控制=数据可追溯=投稿安全。
🏦 基金结题数据归档要求
国自然/重点研发/省部级基金结题均要求数据归档,不达标影响结题和后续申报。各基金数据归档要求:
| 基金 | 归档要求 | 保存期 |
|---|---|---|
| 国自然 | 原始数据+分析代码归档 | ≥5年 |
| 国家重点研发 | 数据+DMP+共享 | ≥5年 |
| 省部级基金 | 原始数据归档 | ≥5年 |
| 横向课题 | 按合同约定 | 合同约定 |
归档内容包括:原始数据(CRF/数据库/影像)、清洗后数据、分析代码、图表源文件、DMP、伦理批件、知情同意书模板。建议结题前3个月整理归档材料,避免临时突击遗漏。
✅ 数据管理自查清单
投稿前数据管理自查,逐项打勾:
☐ 原始数据(CRF/数据库/影像)已三重备份(本地+云+存储库)
☐ 数据库字段清晰、单位统一、变量有标签
☐ 分析代码(R/Stata/SAS)已保存,附README说明运行环境
☐ 图表源文件(源数据+软件文件)保留
☐ 患者数据已去标识化,伦理批准同意共享
☐ 数据已上传存储库获DOI(或附补充材料)
☐ 数据可用性声明已写入正文(具体到DOI/条件)
☐ 保存期限≥5年(建议10年),可追溯
☐ DMP已更新至最终版(基金结题用)
☐ 论文方法部分说明数据管理和共享方式
自查全部打勾,数据管理才算到位。任一项缺失,投稿后可能被质疑、被要求补充,甚至撤稿。
🛡️ 数据安全与泄露防范
医学数据泄露后果严重,可能触犯个人信息保护法,承担民事乃至刑事责任。数据安全要点:
① 传输加密:数据传输用加密通道(SFTP/HTTPS),禁用明文邮件传患者数据。我们经手820+篇,数据传输一律加密。
② 存储加密:含患者信息的数据库加密存储(BitLocker/FileVault),设置访问密码,限定授权人员。
③ 访问权限分级:研究者/统计分析/数据管理员分工授权,操作日志留存。多人协作时明确谁可看/可改。
④ 设备管理:研究用电脑装杀毒软件、设开机密码、不连不安全网络。含数据设备不离身、不外借。
⑤ 销毁规范:保存期满需销毁的数据,用彻底删除(覆写)而非普通删除,纸质CRF用碎纸机销毁。
典型案例:某单位研究者用个人邮箱传含患者姓名的数据给合作者,被内部审计发现,项目暂停整改2个月。教训:患者数据传输必须走加密渠道+去标识化。
📞 常见反馈
某团队投PLOS,按本文指导开题即写DMP,数据存Figshare获DOI,投稿数据可用性声明写明DOI,审稿人未质疑数据,4个月录用。反馈:"提前做数据管理,投稿底气足,审稿人零质疑。"
另一团队投Elsevier刊,原始数据存本地硬盘未备份,投稿8个月后硬盘故障数据丢失,返修时无法提供原始数据被拒稿。教训:数据未上云备份,损失8个月。后改用Zenodo+云盘双重备份重投,3个月录用。
第三团队做多中心RCT,数据分散在5家医院,未统一标准,合并后字段不一致,分析延期4个月。后制定统一数据字典(变量名/类型/单位/编码),各院按模板录入,合并顺利。反馈:"数据管理前置,省后期返工。"数据管理投入1份精力,省后期3份返工。
- 医学统计学方法选择:t检验/卡方/方差分析/回归/生存分析适用场景 — t检验/卡方/方差分析/回归/生存分析适用场景
- 临床试验设计:CONSORT声明/随机对照/样本量计算 — 临床试验设计:CONSORT声明/随机对照/样本量
- SCI精准引用怎么写:5种引用类型+EndNote使用 — SCI引用5种类型+EndNote使用教程
- Meta分析怎么做:PRISMA流程/7步实操/RevMan软件 — Meta分析7步流程:选题到写作+PRISMA清单