在人类探索未知、拓展认知的漫长过程中,科学成果的呈现与交流方式一直在不断演进。从最初的口耳相传,到手写抄录,再到学术期刊的兴起,直至如今的数字化即时传播,每一次媒介的革新都深刻地改变了科学发现的轨迹与合作模式。
近期,中国推出了首本英文数据期刊《数据快报(英文)》,标志着在科技期刊领域迈出了新步伐。该期刊被定位为顶级的综合性数据出版平台,由中国科学院计算机网络信息中心主办,生态领域战略科学家、中国科学院院士于贵瑞担任主编。此外,中国科学院计划于2026年创办一系列涵盖不同学科领域的数据期刊,与《数据快报(英文)》共同构建数据期刊集群,为科研人员提供一个快速分享数据成果的平台,并搭建起连接国内外科学数据交流与传播的桥梁。
《数据快报(英文)》的问世,并不仅仅是期刊数量的简单增加。它触及了一个更根本的时代性议题:当科学数据从科研过程中的“副产品”上升为与学术论文同等重要的战略性成果时,现有的学术表达体系应如何随之调整?围绕这一核心问题,记者采访了于贵瑞院士,请他深入解读“论文/论著”与“数据论文/产品”并行发展所展现出的时代必然性。于贵瑞院士指出:“如果说过去一个世纪,论文是记录人类科学发现的主要载体,那么在未来的一个世纪,人类必将借助数据与论文共同谱写科学史的新篇章。”
科学成果的呈现方式不再局限于论文,需要多维度发展
在数百年来的学术体系中,科学家们普遍追求发表论文,而学术声誉、职位晋升及学科评估也往往以此为核心。然而,当科学数据被赋予“成果”的地位,能够像论文一样进行发布、共享和引用时,一个根本性的问题随之而来:我们是否正处于对科学成果定义进行重新界定的时代?从“唯论文论”转向“数据并重”,这究竟是现有边界的拓展,还是内在核心的重塑?
记者:您提出科研成果正从“以论文为唯一载体”迈向“论文与数据并行的时代”。对于科研人员而言,一个直接的担忧是:如果数据也能独立发布并被视为成果,这是否会削弱传统论文的地位?这两种成果之间究竟是什么样的关系?
于贵瑞:这并非地位的稀释,而是内涵的扩展。论文主要传播的是“发现了什么”以及“我们对世界的认知和解释”,它承载着人类的理解和理论构建。而数据论文或数据产品,则精确地呈现科学观测的具体结果、可供进一步挖掘的新知识的“原始素材”,以及经过系统整理的科技信息。两者承担着不同的使命:论文提供的是认知结论,数据则提供可重复验证的证据链。两者并行发展,意味着科学成果的发布从“结论”延伸至“证据”,使得整个知识生产链条都能够被清晰地展现、严格地检验、并被广泛地复用。这并非是此消彼长的关系,而是如同硬币的两面,终于同时获得了学术上的认可。
记者:现代科学历经数百年,已形成一套高度制度化的研究模式——“提出问题—实验观测—分析论证—发表论文或专著”。在这个过程中,数据长期处于“幕后”角色。现在要把数据从幕后推向台前,最大的观念阻碍是什么?
于贵瑞:最大的观念阻碍恰恰在于这个经典模式的巨大成功。数百年间,无数科学家的思想结晶通过论文体系汇聚,照亮了人类认识世界的道路,这使得人们不自觉地将“成果”等同于“论文”。然而,进入21世纪以来,这一景象正在发生深刻变化:科学数据与科学论文都呈现爆炸式增长,还原论、整体论、系统论、实践论等多元科学思维正在深度融合。自然科学已从“象牙塔”走向服务人类社会可持续发展的“伟大实践”前沿。在这种变革背景下,继续将数据视为论文的附属品,无异于试图用旧地图去寻找新大陆。
记者:“数据论文”这一概念,让许多一线科研人员感到既兴奋又困惑。大家普遍关心的是:发表数据论文能否获得与传统论文同等的学术认可?在职称评审、项目申请中,它能否成为“硬通货”?
于贵瑞:这正是我们致力于推动新型数据出版生态系统的核心关注点之一。科学数据长期以来被视为“初级产品”或“副产品”,主要原因在于它缺乏独立的成果身份和规范的引用评价体系。Data Express期刊集群的创建,目标之一就是让数据成果能够像重磅学术论文一样,通过国家级平台获得应有的学术可见度和国际传播力。一旦数据论文拥有了规范的标识注册、标准的引用方式以及影响力评估体系,其在学术评价中的“硬通货”属性自然会逐步建立起来。这并非某个机构一纸公文就能解决的问题,而是一个需要基础设施、评价标准和学术共同体共识协同推进的系统性工程。我们正在努力铺设的就是这条道路。
数据若无法有效利用,再多的投入也是沉没成本
任何一次深刻的学术变革,都不是凭空发生的。从国家战略资源在全球范围内的竞争,到人工智能对“计算原料”的巨大需求,再到开放科学对“可复现性”的严格要求,这三股力量正从不同层面挤压着传统的成果表达体系。关键在于:这些驱动力是仅仅停留在口号层面,还是已经给科研人员带来了切肤之痛的现实压力?
记者:您提到了国家层面需要高水平的数据成果发布平台。现实情况是,我国大科学装置、野外台站网络产生的大量数据,大部分仍面临“存得下来,但发不出去;发得出去,但影响力不够”的困境。这个困境的症结究竟在哪里?
于贵瑞:以上提到的几种情况都存在,但核心问题在于缺乏一套完整、与国际接轨的数据出版与传播基础设施。缺乏平台,意味着高质量数据没有与之价值相匹配的展示窗口;缺乏标准,意味着数据成果的规范描述、质量控制和同行评议尚未形成公认的范式;缺乏意愿则是前两者的必然结果——当科学家的数据贡献无法被有效记录、引用和回报时,其共享的动力自然会减弱。这正是我们启动Data Express的关键动因:为国家级战略数据资源提供与之匹配的出版渠道,让数据贡献者获得应有的学术回报,从而形成“生产—出版—复用—再创造”的良性循环。
记者:您刚才提到了一个更深层次的概念——我们不仅需要数据出版平台,更需要对“数据”本身进行正本清源。在推进这项工作时,重新厘清“数据是什么”为何如此重要?
于贵瑞:因为如果不厘清这一点,讨论很容易滑向“数据就是计算机里的0和1”这种技术化、狭窄化的理解。在更广阔的科学语境中,“Data”一词源自拉丁语“datum”,意为“被给予的事物”。其核心含义是“为参考、分析或决策而收集起来的事实、信息或统计资料”。它可以表现为数字、文字、度量值、观测结果,甚至是事物描述——简而言之,数据是我们用于分析研究、从中获取新认知的原始材料。当这些经过科学设计、严谨采集与系统整理的“原始材料”本身被赋予成果地位,能够像论文一样被发布、共享、引用和评价时,我们讨论的就不是一个简单的技术升级问题,而是一个全新的学术交流时代的到来。正本清源,是为了让学界认识到:数据出版并非“多了一种出版物”,而是科学成果内涵与外延的一次重新定义。
记者:“AI-Ready数据”是当前的热门词汇,但一线科研人员更关心的是一个实际问题:如果我的数据没有被处理成“可机读”的形式,会在多大程度上失去价值?这种压力是真实的,还是被夸大了?
于贵瑞:这是真实且正在加速的压力。未来人工智能领域的国际竞争,本质上也是高质量数据资源的竞争。再先进的大模型,如果没有大规模、高标准、可计算的数据作为“燃料”,也无法产生可靠的科学发现。“AI for Science”的核心路径是“高维数据+物理模型+神经网络”的深度融合,实现从传统模拟预测到智能生成创造的飞跃。传统论文中的数据描述,机器难以直接读取和计算,如同让一个高速引擎去烧未经提炼的原矿。数据论文的使命,恰恰是将科学数据高效转化为可计算、可复用、可机器理解与训练的“AI-Ready”资源,使其成为“机器可读的科学知识载体”。如果你的数据无法被机器高效获取和理解,在AI驱动的科学发现流程中,它很可能会被绕过、被忽略。这不是未来的威胁,这是当下正在发生的筛选机制。
建设平台易,构建生态难,关键在于让数据“活”起来
建立一个数据出版平台相对容易,但要构建一个能够让数据真正流动、复用、增值的全球知识生态,则是一个截然不同的挑战。Data Express提出了三个核心定位和“四个一体化”的蓝图,涵盖了从刊群矩阵到技术平台,再到专家网络和学术共同体。但理想的愿景能否落地?科研人员更关心的是:这个生态系统最终能为我的研究带来哪些实际的便利和回报?
记者:Data Express的愿景包含三个核心定位:国家重大数据成果的首发平台、驱动开放科学运转的关键枢纽、国际学术交流与数据外交的重要窗口。这三个定位之间是什么关系?
于贵瑞:这三个定位是层层递进且相互补充的。首发与汇聚平台解决了“数据有处可发”的问题,这是基础;驱动开放科学运转解决了“数据发布后能否被利用”的问题,这是核心——我们致力于推动科学数据从“保存”走向“共享”,再从“共享”迈向“复用”,促成“数据生产者—数据出版者—数据使用者”三方协同共赢的良性循环;国际交流窗口则解决了“数据能否获得全球影响力”的问题,这是目标——我们坚持国内与国际稿源并重,让世界看到中国不仅是科学数据资源大国,更将坚定不移地迈向科学数据出版强国。三者缺一不可。如果仅仅是首发而不激活复用,就如同一个静态仓库;如果只谈共享而缺乏国际话语权,就难以吸引全球优质稿源和合作。这是一个系统性的工程。
记者:过去,论文发表后,数据不可得、代码不可见、模型不可验证,这在很大程度上导致了“可复现性危机”。Data Express明确提出要构建“数据—软件—模型—论文一体化”的新型立体化传播体系,那么,如何从制度设计上确保这种一体化不是“拼盘式”的简单捆绑?
于贵瑞:关键在于平台一体化的技术贯通。我们依托数字出版引擎、科学数据银行、国家科技资源标识等基础设施,将数据存储、标识注册、开放出版、国际传播与学术评价的技术全流程打通。这意味着,一篇数据论文的发表,并非仅仅是孤立地上传一个文件,而是连同其背后的数据产品、分析软件标识、算法模型链接,共同构成一个可追溯、可验证的完整支撑链条。这不是事后拼凑,而是从提交流程的一开始就被作为整体单元来处理和评审。评审者可以同步审视数据质量、方法逻辑和结论之间的自洽性,这在制度层面就为“可复现性”提供了保障。这是确保科学严谨性、缩短创新周期的关键制度设计。
记者:当前,许多科学家对数据共享仍心存顾虑——担心被抢发、被滥用、或者自己的心血付之东流被“搭便车”。Data Express在保护数据生产者利益和激励开放共享之间,将如何找到平衡点?
于贵瑞:这种顾虑非常真实。我们的设计逻辑是“以确权促共享”。首先,数据论文的发表本身就确立了学术优先权——你的数据集经过同行评议正式出版,带有时间戳和数字对象标识符,这就是你作为数据创造者的学术身份证。其次,我们致力于促成“数据生产者—数据出版者—数据使用者”三方协同共赢的良性循环:使用者必须规范引用,引用将被追踪记录,记录将转化为可量化的学术影响力。当数据贡献能够被看见、被计量、被回报时,共享就不再是单向的付出,而是一种能够带来持续学术回报的战略性行为。
我们期待实现的愿景是:让每一份凝聚着智慧与心血的高价值科学数据,都能被发现、被共享、被引用、被传承,让数据论文与产品成为连接科学家、连接学科、连接世界的新语言和新纽带。这既是应对范式变革的必然选择,也是为开放科学与人工智能赋能的科学发现、技术发明与工程创新,贡献中国力量、中国产品与中国智慧的必由之路。
| 主队 | 比分 | 客队 | 联赛 | 时间(北京) |
|---|---|---|---|---|
| 近期暂无比赛,请稍后再来查看。 | ||||