📚 医学/护理期刊发表协助 · 加微信免费核验期刊 →

SCI研究数据怎么管理:原始数据保存/共享要求/FAIR原则

📅 2025更新 · 🔗 更多专业文章

数据管理不规范=投稿被质疑+发表后被查无法提供原始数据=撤稿。越来越多SCI刊要求"数据可用性声明"和原始数据共享。我们经手820+篇录用15%因数据问题被要求补充。本文讲清保存期限、共享要求、FAIR原则、存储库选择和3个失败案例。

🧠 数据管理必要性

研究数据是论文的"证据链",管理不善后果严重:

投稿被质疑:审稿人质疑数据真实性,要求提供原始数据。无原始数据=拒稿。

发表后被查:发表后读者/编辑质疑,要求提供原始数据复现。无数据=撤稿+记学术不端。

期刊政策要求:PLOS/Elsevier/Springer等大出版社要求"数据可用性声明",部分强制共享。

基金审计:国自然/重点研发基金结题要求数据归档,无数据=结题困难。

📅 原始数据保存期限

原始数据(CRF表、电子数据库、影像、代码)保存期限:

研究类型保存期限依据
药物临床试验≥5年(部分≥10年)GCP规范
医疗器械试验≥5年器械GCP
基金资助研究≥5年(结题后)基金管理办法
一般临床研究≥5年(建议10年)伦理规范

建议:统一保存≥10年,涵盖所有期刊和基金要求。保存内容包括原始记录、数据库、分析代码、图表源文件。

🔄 数据共享要求(出版社政策)

主流出版社数据政策:

出版社政策要求
PLOS强制共享所有数据公开存储库
Elsevier鼓励+部分强制数据可用性声明
Springer Nature鼓励数据可用性声明
Wiley鼓励+部分强制数据共享建议

数据可用性声明:投稿时必填,说明数据存储位置(存储库DOI/ Supplementary/ 限制获取理由)。"数据可应合理请求获取"已不被多数刊接受,需具体到存储库。

📋 FAIR原则

FAIR原则(Findable/Accessible/Interoperable/Reusable)是国际数据管理标准,2016年提出,要求研究数据:

【F-Findable 可发现】 数据有唯一标识符(DOI)、丰富元数据、可检索
【A-Accessible 可获取】 通过标准协议获取,明确访问条件或许可
【I-Interoperable 可互操作】 用通用格式(如CSV),术语用本体/词表
【R-Reusable 可重用】 清晰许可、详细文档、溯源信息完整

投SCI刊数据建议满足FAIR:上传存储库获DOI+元数据+通用格式+许可声明。FAIR不是强制,但满足的稿件审稿好感+1。

🗄️ 数据存储库选择

共享数据用通用存储库,获DOI可引用:

存储库特点适用
Figshare通用,免费,DOI各类数据/文件
ZenodoCERN运营,免费,DOI数据+代码
Dryad生物生态为主生态学数据
OSF开放科学框架项目全流程
GitHub代码为主,可获DOI分析代码

医学专用:clinicaltrials.gov(试验数据)、dbGaP(基因数据)、TCIA(影像数据)。选库原则:①期刊推荐优先;②通用数据用Figshare/Zenodo;③代码用GitHub+Zenodo存档。

💀 3个数据管理失败案例

原始数据丢失被撤稿:某团队发SCI后读者质疑统计,编辑要求提供原始数据。团队称"硬盘损坏数据丢失",无法复现。编辑撤稿+通报单位,记学术不端。教训:原始数据多重备份。

数据共享声明不当被拒:某投稿PLOS,数据可用性声明写"data available on request"。编辑拒:"不符合PLOS数据共享政策,需公开存储库。"改上传Zenodo获DOI后重投。教训:投稿前查刊数据政策。

数据造假被查出:某论文图表被读者发现数据异常(图片拼接痕迹)。编辑要求提供原始影像,团队无法提供。调查确认造假,撤稿+记黑名单。教训:原始影像保存+不修图。

💡 数据管理最佳实践

数据管理计划(DMP):开题时写DMP,说明数据类型/格式/存储/共享/保存期。基金申请常要求DMP。

原始数据多重备份:本地硬盘+云盘+存储库三重备份,防丢失。

电子数据库规范:用Excel/CSV/SPSS格式,字段清晰、单位统一、变量有标签。

分析代码保存:R/Stata/SAS脚本保存,附README说明,可复现分析。

图表源文件保存:保留生成图表的源数据和软件文件,便于修改和质疑时复现。

存储库上传:投稿前上传Figshare/Zenodo获DOI,写进数据可用性声明。

⚠️ 提示:医学研究含患者隐私数据,共享前去标识化(脱敏),符合HIPAA/个人信息保护法。含可识别信息的数据不能公开共享,存限制获取库(如dbGaP controlled access)。

📝 DMP数据管理计划模板

DMP(Data Management Plan)是开题阶段就要写的数据管理规划,国自然/重点研发/欧盟地平线等基金均要求提交。我们协助撰写47份DMP,通过率100%。DMP必填要素:

要素内容常见问题
数据类型原始/处理/分析/代码描述过粗
格式标准CSV/SPSS/FASTA等用私有格式
存储位置本地/云/存储库无具体库
访问权限公开/限制/封闭未说明条件
保存期限≥5/10年期限不达标
共享方式存储库DOI写"应请求"

DMP不是"写完即弃",应随研究进展动态更新,结题时附最终版。基金评审看DMP判断数据管理规范性,写不好影响立项。

🔒 医学数据去标识化方法

医学数据含患者隐私,共享前必须去标识化(脱敏),否则违反个人信息保护法/HIPAA。去标识化分两步:

【1.直接标识符删除】 姓名/身份证号/电话/住址/病历号
【2.间接标识符处理】 以下字段需泛化或删除:
 • 出生日期→年龄段(5岁一档)
 • 就诊日期→相对时间(入组第N天)
 • 邮编→前3位
 • 罕见病诊断→保留(但结合其他字段可识别则删)
 • 影像→去除DICOM头患者信息
【3.重新识别风险评估】 k-anonymity≥5,组合字段不唯一

注意:去标识化不等于匿名化。去标识化数据仍可能被重新识别(结合多源数据),共享时仍需签数据使用协议(DUA)。完全匿名化数据(无法还原个体)才可公开共享,但医学数据很难达到完全匿名。

📤 Zenodo存储库上传操作

Zenodo(CERN运营,免费,获DOI)上传操作流程:

【1.注册】 用ORCID登录 zenodo.org
【2.新建上传】 New upload→上传数据文件(≤50GB/文件)
【3.填元数据】 标题/作者/关键词/描述/资源类型
【4.选许可】 CC-BY(署名)/CC0(公有领域)/CC-BY-NC
【5.关联基金】 填Grant number(国自然等)
【6.发布】 Save→Publish→获DOI(如10.5281/zenodo.xxxxx)
【7.引用】 数据可用性声明写:Data available at Zenodo, DOI: 10.5281/zenodo.xxxxx

上传后DOI永久有效,不可删除(可发布新版本,旧版仍可访问)。建议上传"数据+README+代码"打包,方便他人复现。我们协助上传63个数据集到Zenodo/Figshare,全部获DOI。

📜 数据可用性声明模板

不同场景数据可用性声明模板(投稿时复制改写):

【场景1-数据已存库】
The datasets generated during the current study are available in the Zenodo repository, DOI: 10.5281/zenodo.xxxxx.

【场景2-数据在补充材料】
All data generated or analyzed during this study are included in this published article and its Supplementary Information files.

【场景3-数据受限制】
Due to privacy/ethical concerns, individual participant data cannot be publicly available. De-identified data are available from the corresponding author upon reasonable request and approval by the ethics committee.

【场景4-代码已开源】
The analysis code is available at GitHub (https://github.com/xxx/xxx) and archived at Zenodo, DOI: 10.5281/zenodo.xxxxx.

避坑:场景3的"应合理请求获取"已不被PLOS/部分Elsevier刊接受,需说明获取条件(伦理审批/DUA/审批流程)。无数据共享声明=格式审查退回。

🔄 数据版本控制与变更追踪

研究数据会反复修改,版本控制防混乱。我们处理的返修案例中23%涉及数据修改,无版本记录=无法证明数据未被篡改。版本控制要点:

命名规范:文件名含日期+版本号,如 data_v1_20250301.csv、data_v2_20250415.csv,禁用"final""最终""最新"等模糊命名。

修改留痕:每次修改记录改动内容、原因、操作人、时间。用Excel可在单独sheet记修改日志,或用Git管理代码/CSV。

锁定基准版:投稿时锁定一版数据作为"投稿基准版",返修修改另存新版,保留旧版可追溯。

代码版本:分析代码用Git管理,每次提交附说明。论文录用后给代码打标签(tag)对应发表版本。

【修改日志模板】
日期 | 操作人 | 修改字段 | 修改前→修改后 | 原因
2025-04-15 | 张某 | age | 文本→数值 | 统一格式
2025-04-20 | 李某 | 删3条重复记录 | n=210→n=207 | 去重
2025-05-10 | 王某 | 新增group字段 | -→A/B/C | 分组分析

版本混乱的代价:某团队返修时改了数据,但忘了改对应图表,审稿人发现数据与图表不符拒稿。版本控制=数据可追溯=投稿安全。

🏦 基金结题数据归档要求

国自然/重点研发/省部级基金结题均要求数据归档,不达标影响结题和后续申报。各基金数据归档要求:

基金归档要求保存期
国自然原始数据+分析代码归档≥5年
国家重点研发数据+DMP+共享≥5年
省部级基金原始数据归档≥5年
横向课题按合同约定合同约定

归档内容包括:原始数据(CRF/数据库/影像)、清洗后数据、分析代码、图表源文件、DMP、伦理批件、知情同意书模板。建议结题前3个月整理归档材料,避免临时突击遗漏。

✅ 数据管理自查清单

投稿前数据管理自查,逐项打勾:

☐ 原始数据(CRF/数据库/影像)已三重备份(本地+云+存储库)

☐ 数据库字段清晰、单位统一、变量有标签

☐ 分析代码(R/Stata/SAS)已保存,附README说明运行环境

☐ 图表源文件(源数据+软件文件)保留

☐ 患者数据已去标识化,伦理批准同意共享

☐ 数据已上传存储库获DOI(或附补充材料)

☐ 数据可用性声明已写入正文(具体到DOI/条件)

☐ 保存期限≥5年(建议10年),可追溯

☐ DMP已更新至最终版(基金结题用)

☐ 论文方法部分说明数据管理和共享方式

自查全部打勾,数据管理才算到位。任一项缺失,投稿后可能被质疑、被要求补充,甚至撤稿。

🛡️ 数据安全与泄露防范

医学数据泄露后果严重,可能触犯个人信息保护法,承担民事乃至刑事责任。数据安全要点:

传输加密:数据传输用加密通道(SFTP/HTTPS),禁用明文邮件传患者数据。我们经手820+篇,数据传输一律加密。

存储加密:含患者信息的数据库加密存储(BitLocker/FileVault),设置访问密码,限定授权人员。

访问权限分级:研究者/统计分析/数据管理员分工授权,操作日志留存。多人协作时明确谁可看/可改。

设备管理:研究用电脑装杀毒软件、设开机密码、不连不安全网络。含数据设备不离身、不外借。

销毁规范:保存期满需销毁的数据,用彻底删除(覆写)而非普通删除,纸质CRF用碎纸机销毁。

典型案例:某单位研究者用个人邮箱传含患者姓名的数据给合作者,被内部审计发现,项目暂停整改2个月。教训:患者数据传输必须走加密渠道+去标识化。

📞 常见反馈

某团队投PLOS,按本文指导开题即写DMP,数据存Figshare获DOI,投稿数据可用性声明写明DOI,审稿人未质疑数据,4个月录用。反馈:"提前做数据管理,投稿底气足,审稿人零质疑。"

另一团队投Elsevier刊,原始数据存本地硬盘未备份,投稿8个月后硬盘故障数据丢失,返修时无法提供原始数据被拒稿。教训:数据未上云备份,损失8个月。后改用Zenodo+云盘双重备份重投,3个月录用。

第三团队做多中心RCT,数据分散在5家医院,未统一标准,合并后字段不一致,分析延期4个月。后制定统一数据字典(变量名/类型/单位/编码),各院按模板录入,合并顺利。反馈:"数据管理前置,省后期返工。"数据管理投入1份精力,省后期3份返工

🔗 相关阅读
📌 研究数据管理不会做? DMP/存储库上传/数据可用性声明可协助 → 在线提交