
1. 2025年最让我印象深刻的一件事上海会场里的“自下而上”今年RDA相关的各类会议、线上讨论和组会我参加了不下二十场但真正让我觉得“这一年没白过”的是年初在上海参加的那场围绕数据管理方案的小型研讨会。当时会场里坐的人很杂有做生命科学数据库的工程师有高校图书馆负责数据服务的馆员有来自跨国药企的数据合规经理还有几个和我一样常年泡在RDA各种工作组里的“老油条”。大家讨论的焦点很简单一套在上海本地多个科研机构试运行的数据管理指南能不能被RDA社区采纳作为一套可供跨国团队参考的共同推荐。说实话最开始我并没有抱太高期待。RDA这类国际社区里从来不缺来自各个国家和地区的“本地方案”大多数提案的命运是进入工作组邮件列表之后被讨论三个月然后渐渐沉底。但“上海方案”走了一条不一样的路。它没有一开始就抛出一套大而全的框架而是先聚焦在一个非常具体的痛点上跨国多中心研究项目中数据协作往往卡在最基础的一步——各方连“数据长什么样”“谁能动哪些数据”“数据归谁管”都说不清楚。方案用了一整套带实例的模板把这些问题拆成可勾选、可填写的操作单据再配上最小的元数据要求。整套东西下来不到40页但每一步都能直接拿去用。我在现场看到的一个细节特别有意思方案讨论环节一位来自欧洲的同行本来准备了一堆技术层面的质疑但翻完里面的“数据出境协作检查表”后他问的第一个问题变成了“这套表能不能翻译成英文先让我们项目组试跑两个月”。这就是“自下而上”的力量——它不是在讲理念而是在提供一个可以直接塞进项目日程表里的东西。1.1 为什么“上海方案”能在这一年破圈复盘下来一套地方性方案能在RDA社区里走出“从上海到全球”的曲线背后有几个关键因素。第一是它踩准了2025年RDA社区的主流议题变化。前几年各工作组讨论最多的是元数据标准、持久标识符、数据仓库互操作这些偏“硬技术”的话题。但今年越来越多讨论转向了治理机制和协作流程数据共享的共识边界在哪里、不同国家的合规要求如何在实际项目中对齐、机构层面的角色和问责机制怎么设计。恰好“上海方案”的核心并不在技术标准层面而在协作流程的规范层面——它回答了跨境项目中“谁在什么时候对什么数据做什么决定”这一系列问题这正好是社区当时最缺的东西。第二是它有真实的实践体量支撑。方案里引用的不是三五个课题组的试点而是覆盖了上海地区多家三甲医院、高校和科研院所在内的真实数据协作案例。这些案例覆盖了罕见病队列研究、中药标准化、新发传染病监测等多个领域每个案例都附了实际填好的模板样例当然做了严格的脱敏处理。这种来自真实项目的颗粒度是任何纯粹由工作组“头脑风暴”写出来的推荐文件都模仿不来的。第三是它做了一件很多人忽略的事把“共识”拆成了“共识的最小单元”。方案里大量使用了“默认推荐例外声明”的句式结构——例如默认推荐使用某类数据分级方式但允许参与方在明确声明理由和替代方案的前提下做例外处理。这种“先框定最大公约数再留出合规弹性”的写法让持有不同立场的机构都能先坐下来签个字而不是在第一步就卡死在细节分歧上。1.2 从一页提案到全球文件共识是怎么攒出来的从上海会场的“试跑”开始到被RDA社区正式列为推荐参考这个过程我全程看在眼里也参与了部分评审工作里面有不少教科书上不会写的门道。草案被提交到RDA社区后经历了整整两轮公开评议。第一轮收到的反对意见几乎都集中在同一个区域方案里对“数据主权”的处理方式不同文化背景的评审人理解完全不一样。有人觉得方案里对数据出境场景的约束写得太实会增加不必要的行政负担也有人觉得写得还不够严对弱势参与方的保护不足。这里我学到的关键经验是在国际社区里推进任何跨文化标准最忌讳的是用“我们本地已经跑通了”来回应当前争议。正确做法是快速把海外评审人的不同意查看更多分门别类、给每一个都找到对应的“真实场景”来回应。当时上海团队做了一个很聪明的动作——他们从已有的实践里挑出三个“争议对应案例”每个案例都展示了一个妥协点是怎么在真实项目中平衡的。这三块拼图一补预期中的最大争论点就被化解掉了大半。到第二轮评议结束时方案已经不只是“上海方案”了。欧洲几个大学联盟主动提出要把他们内部的临床数据协作指引往方案框架上靠大洋洲有一家国家级的农业研究机构也在邮件里表示要按这个模板改版他们内部的数据管理计划。2025年RDA社区年会期间这套方案被正式纳入年度推荐文件清单。“从上海到全球”这个表述就是在那时候开始被频繁提起的。2. 五大工作组里真正落地的是哪几个年终复盘不能只看“上海方案”这一件事。2025年RDA框架下各个方向都有进展但作为一线从业者我得实话实说工作组的数量和组织规模并不能代表真实影响力。真正对一线科研数据管理产生实质性影响的我认为是以下几个方向。2.1 数据互操作框架解决“鸡同鸭讲”的老大难互操作问题在RDA社区谈了快十年今年的最大变化是终于从“务虚”转向了“务实”。我所在的一个跨国合作项目就在今年年初正式接入了RDA互操作框架里推荐的D-Core元数据模型替代了我们此前自己拍脑袋设计的一套半吊子元数据规范。D-Core的理念用大白话讲就是所有数据集都只需要保证一张“最小公约数”元数据表核心标识符、粒度、数据格式、版本记录、访问权限。这五个字段对齐后至少能让不同系统之间先“说上话”。相比起追求面面俱到的FRBR式复杂模型D-Core砍掉了大量“听起来有用但实际没人填”的字段。落地过程中最让我意外的发现是最难的不是技术对接而是让团队成员接受“最小化”的理念。数据管理员的天然职业习惯是“多留一些信息总没错”但字段越多意味着维护成本越高、出错概率越大而且越容易造成“标签污染”。我们花了两周做培训核心就讲两件事为什么这五个字段是底线超出底线的字段在什么情况下可以自行扩展。培训和约定到位后对接效率确实提升了一整个量级。2.2 长期保存与可持续资金比技术更难的是“养”今年社区里关于长期保存的讨论氛围有些焦虑。不少资深数据基础设施无论是大学数据中心还是国家级别的大型存储设施都开始发出同一个信号按目前的预算情况我们养不起“永远保存一切”了。这是一道残酷但真实的算术题一套包含冷存储、热数据区和计算层的数据保存系统继续往上堆容量的边际成本虽然不高但要保证未来二十年随时能把这些数据调出来、解析出来、并且保证颗粒度不变这个长期维护成本高得惊人。RDA做了很多测算——为什么很多研究所的数据保存系统运行五年后就会终被废弃答案是保存本身不贵但“让数据在二十年后依然可读、可用、可信”的后台团队开支没有任何项目能长期兜底。2025年讨论出的一个比较有共识的应对思路是分级承诺不同价值的数据库采取完全不同的保存策略。头部门槛定制包含高价值研究数据的核心仓储采用严格的全量保存中段数据则走“机会主义保存”模式利用云服务的低频存储低成本处理低价值数据和中间产物明确约定保质期到期自动降级或删除。这套策略的难点在于“让数据所有者接受自己的数据可能进不了核心保存库”这个事实但讨论总比回避强。2.3 信任与合规认证框架的实用化之路数据仓储的信任认证Trustworthy Data RepositoryTDR这个词在圈子里提了很多年但此前对一线机构来说完全做一次认证的时间和经费投入是极其吓人的。2025年的一个重要变化是RDA社区联合相关机构发布了精简版自评工具把原本上百项指标的认证框架压缩成了35项核心指标附加项的组合。我做过的实际对比测试显示完整版认证流程从头到尾做一遍至少需要投入两位全职人员干六到九个月精简版自评工具则可以把工作量压到两到三周得到的结论虽然不是正式的“认证通过”但足以让机构管理层对现有数据管理能级形成一个比较客观的认知同时也为后续正式认证打好了基础。这套工具的真实价值在于它逼着机构把平时“默认没问题”的事情一项一项书面回答一遍。很多机构做完整套自评后发现自己连最基本的数据备份恢复演练记录都不完整或者是元数据方案里压根没有明确负责人和审查周期。这些问题在单点上看都是小事但叠在一起就是数据信任危机的地基松动。2026年我预测越来越多基金会和期刊可能会把“通过TDR自评”作为数据管理计划的一项软性加分项这个趋势值得关注。3. 2025年实际踩过的坑与修正复盘不能只说光鲜的成果这一年我也踩了不少坑有些坑还是我自己带队踩进去、又爬出来的。写成文字就当给同行们做个反面教材。3.1 语义映射的“过度设计”教训今年年初我们团队接手了一个跨三个国家的生物医学数据集整合项目。第一步就遇到了典型问题三套来源数据的元数据字段语义定义各不相同。当时团队里年轻的同事颇有干劲建议直接建立一套全字段的一对一映射体系把每一对字段的语义差异都写成精确映射规则再引入自动化工具跑批处理。听起来很完美对吧我们按这个思路做了两个月成果是一张超过两百条规则的映射表。投入产出比极低因为每增加一个新的数据源这套映射表就要做一轮大改规则之间的冲突也开始出现。踩过坑之后我才下决心做减法把映射目标从“全字段精确映射”降级为“核心字段最小映射”一套语义模糊但对齐成本极低的映射就能解决问题。我们实际上抛弃的规则占了整个映射表的80%但剩下的20%解决了日常协作里95%的用法。教训总结语义映射这件事向来是80/20法则的极端表现场合。过度设计会带来巨大的维护成本并成为整个数据流水线里最脆弱的环节。宁可初期效率低一些、多留手工会话作为兜底也不要一上来就赌自动化全量映射。3.2 工具普及不等于用户采纳今年我们机构里做了一件“面子工程”式的事花大力气引入了一套开源机构知识库系统功能覆盖数据集注册、版本管理、引用生成、接口输出一应俱全技术团队只花了两周就部署上线。我当时觉得这套系统好用得不得了肯定能带动研究人员的数据共享热情。结果呢三个月后系统里注册的数据集一共只有个位数。问题很明显系统对于我们这类“后台系统管理员”很好用但对于注册和描述数据集的科研人员来说操作路径太长、字段说明太学术化、每一步都在消耗他们的耐心。本质上我犯了一个经典错误把工具普及等同于用户采纳。后来解决办法很朴素把“手工录入数据”改成“科研人员只负责填一张Excel表发给数据管理员由数据管理员在后台代为录入”。虽然这个工作流一听就很“不自动化”但它居然真的运转起来了录入量在两个月内增长了十几倍。这背后是一个非常反直觉的道理再先进的工具如果让关键用户群体觉得“麻烦”就远不如一个“好用但不先进”的替代流程有效。3.3 “全球共识”落地时别忘了区域差异“上海方案”确实成了全球推荐参考但在应用层面我对它的预期没有之前那么乐观。一个显而易见的现实差距是不同国家、不同区域在制度环境、技术基础设施、人力资源储备这三方面差距比会议共识和推荐文档里体现出来的大得多。比如方案里默认每个参与方机构都有至少一名专职数据管理员。这个假设在北欧、北美和国内头部机构是成立的但在某些科研基础薄弱的地区很多项目团队连数据库设计和基本的数据字典规范都没落实。再比如方案推荐的异步多方评审流程需要参与者负担较多的协作文档负担这在带宽和时区都不占优势的团队里会很难执行。2025年下半年我在做推广培训的时候开始有意识地调整表述在讲方案时不再完全按原文档讲而是增加一个“区域落地适配层”的概念——让使用者根据自己团队的技术成熟度和人力储备选出两三条最适合自己当前阶段的做法先跑起来剩下的等环境成熟后逐步补齐。这个改动虽然是我个人基于培训反馈做的但效果明显比“全有或全无”式的方案搬运好得多。4. 2026年三大战役每一场都不好打年终盘点自然要看向未来。RDA乃至整个科研数据治理领域2026年的待办事项显然堆成了山。但真正称得上“决定下一阶段格局”的战役我认为只有三场。4.1 第一场共识文件终结“最后一公里”如果说2025年的突破是把“上海方案”推成全球共识那2026年的硬仗就是把各类共识文件真正推进到各国、各机构的日常制度里。现在很多机构的情况是RDA的推荐参考文档链接被放进了政策附录里但在具体的项目管理流程中很少有人真的会去打开那份文档更别说按文档调整工作方式了。共识文件与日常工作流中间存在一个巨大的“最后一公里”空档。我在和很多同行交流后基本形成一个判断这个空档不能靠再版超长文档来填只能靠“嵌入式工具”来填。也就是说共识的载体从一套PDF文档变成一套可以直接插进项目管理软件、电子实验记录本或机构知识库里的插件、模板、SDK和自动检查脚本。比如项目立项时自动弹出“数据管理计划简易模板”填写框数据交付时自动跑一遍合规自检清单全程不需要用户去阅读任何推荐文档。2026年我们这边的工作计划里已经把“把上海方案的实操模板改造成一套轻量级Web表单和API接口”列入了Q1优先级。这件事单靠一家机构肯定做不大但至少可以在几个合作的跨国项目里把闭环跑通做出“嵌入式共识”的标杆案例。4.2 第二场数据基础设施从“能连”走向“智能”过去五年大家做数据互操作拼到最后拼的是“接口数量”你有多少个OpenAIRE接口接了几个国家的数据仓储2025年这个风向已经开始变了——越来越多讨论转向了智能层能不能让数据基础设施不仅“传得通”还能“看得懂”这里的核心变化来自于数据语义的进一步结构化。现在大家的工作流里有一大部分时间是花在“找数据”和“判断这个数据能不能用”上每一个判断都得分项排查这个数据集的时间粒度合不合适、字段口径是否匹配、质量记录是否完整。2026年这一仗打得好不好取决于能不能把这类数据集的“可判断性”前置化处理。我的判断是2026年是AI-ready数据集从概念走向落地的关键一年。多个大型科研数据联盟已经实质性地开始推动AI-ready数据发布规范要求数据集不仅有人类可读的元数据还要附带一组机器可读的结构化元数据直接服务模型训练和自动评估。这件事的技术难度不算高真正的门槛在于转变工作习惯——现在80%的数据集管理者还停留在“数据发布文件上传描述文本”的思维模式里。让这部分人转变为“数据发布结构化描述机器可读接口质量证明”的思维模式这才是2026年真正要打的硬仗。4.3 第三场评估体系的重构直接决定未来五年的科研资源流向现在无论国内还是国外科研评价体系的核心指标依然高度偏向论文产出。尽管“数据共享”“数据管理计划”已被很多基金组织列入申请要求但真正决定项目是否获批、职称能否晋升的评价体系里数据工作的话语权仍然非常有限。这场战役的本质是把“数据工作本身的价值”显性化。具体到可操作的层面有三个方向是我在2026年特别关注的第一数据引用量的规范化。越来越多的期刊和数据库开始要求论文在参考文献部分规范引用底层数据集但目前的引用格式极不统一。如果2026年RDA社区能联手主要出版商推出一个“数据引用最小格式集”让数据引用纳入引文索引体系那对数据生产者来说就是最直接的激励。第二数据管理计划DMP执行度的评估。目前基金结题时各方对数据管理计划执行情况普遍默认为“写没写”而不是“做没做”。如果能形成一套简便的、自动化的DMP执行度检查工具基金机构在结题时就能低成本地核验“计划里承诺公开的数据集是否真的公开了”这会对整个科研数据生态的诚实度产生质变。第三数据管理专业角色的职业化认证。这个方向看似小众但我在多个职业社区都观察到了强烈的需求信号。现在大量机构里负责数据管理工作的同事职业身份很难确证认定有的是馆员、有的是技术人员、有的是兼职研究生2026年若能在RDA框架下推出一个真正的数据管理师能力框架和职业认证体系对稳定一线队伍、吸引新人入行都会有很大的帮助。5. 最后分享两点比技术更重要的体会这一年下来技术层面的方法和工具可以写很多但真正让我睡不着觉的反而是一些“非技术”层面的感受。第一点是关于共识的本质。我在参与RDA活动的这几年里越来越清楚地认识到任何能够被广泛采纳的标准从来不是“讨论出来的”而是在一次次真实项目协作中“磨出来的”。那些在推荐文件里看起来简洁清爽的条款背后几乎都是无数失败对接、无效会议和深夜邮件攒出来的妥协结果。所以如果你也正在推动某个数据标准在自己机构里落地别指望一次完美设计能一步到位做好长期“磨”的心理建设可能是最重要的准备。第二点是我在年底一个内部复盘会上说过的话做科研数据管理需要的是技术能力但更需要的是“翻译能力”——把数据管理的要求翻译成不同利益相关方听得懂、愿意执行的行动方案的能力。研究者关心的是“这样填表会不会耽误我出结果”管理层关心的是“投入这么多人力做数据管理能从哪些方面体现价值”IT团队关心的是“新标准对我们的系统改造量有多大”。能把同一套方案翻译成这三种完全不同的语言并且让三方都觉得合理这才是数据管理这个行当真正的核心竞争力。2026年的三大战役每一场都不好打而且大概率无法在一年内全部打完。但方向已经足够清晰了让共识真正变成基础设施让基础设施真正变成智能协作的底座让管理和评价体系真正认可数据工作者的贡献。这条路很长但每一步都有迹可循。希望明年这个时候回头复盘我们能看到的不是又多了几份文档而是更多真实落地的项目和更多因为规范的数据管理而真正受益的科研成果。