GA黄金甲

突破“数据孤岛”,推动组学资源治理自立自强——走进国度基因组科学数据中心

  今年1月,依附GA黄金甲(国度生物信息中心)(以下简称基因组所)的国度基因组科学数据中心(NGDC)有10篇论文集中亮相国际生物数据库期刊《核酸钻延追。对于这样一本顶级期刊来说,这种情况并不多见。

  一个刚6岁的数据中心何以获得这样的成就?近日,《中国科学报》走进基因组所相识NGDC成长背后的奥秘。

  面向国度必要,追赶国际措施

  NGDC可追忆至2016年2月基因组所成立的性命与健全大数据中心。它的成立既是对接国度需要,也是钻研所自身发展的必要。

  持久以来,全世界科学家产生的组学数据都要提交给三大数据库——美国国立生物技术信息中心(NCBI)、欧洲生物信息学钻研所(EBI)、日本核酸数据库(DDBJ)。这三家于上世纪八九十年代成立的机构在2005年成立了国际核酸序列共享同盟(INSDC),形成领域内数据存储和共享使用的尺度。

  这使得我国科学家颁发论文时必要通过互联网将数据提交到这些数据库,而做科研时必要使用的数据又要从这些数据库下载,科研效能时时遭逢国际带宽瓶颈的约束。同时,我国科学基金项目和沉点研发打算产生的大量基因组科学数据,分散在分歧钻研单元和尝试室,形成了无法共享和进一步挖掘利用的“数据孤岛”。

  “对标国际三大数据库,建成一个永续性的生物信息存储机构,曾是我们几代性命科学钻研者三十年的企盼。”在1月中旬于基因组所进行的NGDC年会上,中科院院士陈润生说。

  解决这些问题既是我国几代性命科学家的呼叫,也是年轻的基因组所的内涵发展需要。

  “人类基因组打算之后,钻研所作为战术科技力量,若何进一步担任国度使命,必要转型发展。”基因组所所长薛勇彪向《中国科学报》暗示,其时的挑战是“没人没钱缺机造”,但优势是“船幼好调头”。

  为调整航向,基因组所进行了一系列学科布局与运行机造优化调整。

  例如,在学科发展上,该所将表观基因组和生物信息钻延装干湿结合”,进一步布局了大数据中心;运行机造上,突破传统PI模式,将分属科研和工程系列的三个团队整合到一个大数据中心,实现从“单兵作战”到“集团军作战”的转变;资源配置以工作导向为主,钻研所“自带干粮”投入经费支持;考评机造方面,对数据中心的工作人员突破“唯论文”考评,让更多人看到职业发展的但愿。

  在此基础上,2016年2月,该所性命与健全大数据中心应运而生,并构建了组学原始数据存储归档系统(GSA)。其指标是:安身中国,服务全球。

  “数据中心从一路头就对标INSDC,并约请该同盟的专家担任国际照拂,以增长他们对数据中心的相识和支持。”NGDC副主任、基因组所钻研怨芈张说,在同年10月召开的全国生物信息学与系统生物学大会上,由该数据中心提议的中国基因组学数据共享同盟得到了国内与会科学家的一致支持。

  2017年,鲍一明钻研员的参与让大数据中心团队增添了学术带头人。

  “一幼我单枪匹马的致力起不到多大作用,团队极度沉要。”NGDC主任、基因组所钻研员鲍一明对《中国科学报》说。他曾在NCBI工作16年,其间屡次援手垂危递交论文的中国科学家解决递交数据时的技术问题,选择回国是但愿阐扬更大的作用。

  “这支团队年轻、有活力,踏踏实实做事件,并且极度联结。”他说,最关键的是,各人有着共同的指标:实现中国生物信息数据存管用的自立自强。

  萦绕共同的愿景,他们凝心聚力,“撸起袖子加油干”。

  在团队成员的致力下,组学原始数据存储归档系统(GSA)先后被爱思唯尔、威利、细胞、施普林格·天然等全球重要出版集团认可。2017年起,他们还受到INSDC约请,作为该同盟之表的唯逐一家机构参与INSDC年会并在会上作汇报。

  2019年6月,我国生物学家们终于迎来了企盼已久的时刻:NGDC作为首批20个国度科学数据中心之一获批成立。该中心由基因组所作为依附单元,结合中科院生物物理所和上海营养与健全所共同建设,旨在建设支持我国性命科学发展、国际驰名的基因组科学数据中心。

  同年11月,中央编办批复中科院北京基因组钻研所加挂“国度生物信息中心”牌子,承担国度生物信息大数据统一汇交、集中存储、安全治理与盛开共享以及前沿交叉钻研和转化利用等工作。

  “这是一件极度值得庆祝的事件,可能为创新驱动和国度战术发展服务。”NGDC照拂、北京大学教授罗静初说。但他同时暗示,“这并不是‘肥肉’,而是‘苦差事’。”

  自动攻关,获国内表认可

  “打着两块‘国字头’的牌号,肯定要做出一点事!”鲍一明等人内心憋着一股劲儿,跃跃欲试筹备开发和启动多个前沿数据库。

  但新冠疫情突发而至。该团队在钻研所的部署下垂危开发新冠病毒信息库。2020年1月22日,距离春节前三天,2019新冠病毒信息库正式颁布。

  该信息库整合了全球有关机构和数据库公开颁布的冠状病毒基因组序列数据、元信息、学术文件等,并对分歧冠状病毒株的基因组序列做了变异分析与展示。这为尔后发展病毒分子溯源、追踪病毒株变异蹊径、造订疫情防控战术等提供了数据基础与决策支持。

  例如2020年1月,初次收录颁布由中国医学科学院病原生物学钻研所提交的国内5条新冠病毒基因组序列,并与NCBI实现数据同步共享;6月,北京新发地疫情,通过基因组比对分析确定问题呈此刻冷链三文鱼,初次发现冷链货物传染可能是造成部门疫情暴发的病毒源头,为优化疫情常态化防控战术,实杏装人物并沉”的新型防控措施提供了科学凭据;7月和次年1月,该中心专家全程参加WHO来华发展新冠病毒溯源结合钻研,提供了有力的数据支持,受到国内表专家组成员的好评……

  “那段功夫的确比力劳累,时时连夜加班分析数据、整顿资料、撰写汇报。但作为‘国度队’一员,我们有责任和使命出一份力。”NGDC副主任、基因组所正高级工程师赵文化说。

  据介绍,该信息库被多家国际机构推荐使用,收到了来自国内多个机构以及美国、英国、意大利等10余个国度的钻研者的积极反馈。他们来信感激:“NGDC在极短的功夫内成立了一个极度优良、给人深刻印象的信息库”“愿意与NGDC共享数据分析了局”。

  据介绍,目前新冠病毒信息库仍在维持全球最新、最齐全的有关基因组数据动态更新,为国内表科学钻研和合作提供有力支持。

  汗水浇灌出荣誉。去年,钻研团队的成就入选国度“十三五”科技创新成就展,并被科技部授予“全国科技系统抗击新冠肺炎疫情先进集体”称号。

  不只是在新冠病毒信息库建设方面,该中心的科学家们还“双线出战”,不休提升数据中心在国际上的可见度。

  “作为数据产出和使用大国,我国生物信息数量和用户占INSDC有关比沉的20%左右,是占比最多的国度之一。这意味着中国有能力成为该同盟的一员。”鲍一明说。

  但作为一个后来者,想要参与INSDC并不容易。在鲍一明和同事的致力下,目前新冠数据资源方面,双方已在标注NGDC编号的前提下实现共享。去年,INSDC自动提出若是成为合作同伴,但愿中国科学家在数据共享和存储方面做出贡献。

  该中心还在“一带一路”国际科学组织同盟(ANSO)的支持下,成立了以我国为主的国际生物多样性和健全大数据共享同盟(BHBD),当前已与12个国度的28个机组成立了数据共享和科研合作关系。

  求实发展,把好数据质量关

  六年来,NGDC不休夯实自身的建设。据介绍,该中心已经成立了蕴含9大数据类型的63个数据库,形成涵盖“数据-信息-知识”一体化数据资源系统。

  鲍一明介绍,该资源系统可实现我国生物数据的安全汇交治理,同时开发了由数据可视化、序列比对、基因表白、表观遗传、基因组组成和新冠序列分析六个专题组成的生物信息在线分析平台(BIT),为我国生物数据的挖掘利用提供了沉要支持。

  例如,组学原始数据存储归档系统(GSA)已汇交科技项目4700个,来自近500家单元2300个用户递交的数据量超12PB,有关数据支持了290种国内表期刊的940篇文章;新冠病毒信息库目前已收录新冠病毒序列900万余条,为全球179个国度和地域150多万名访客提供数据服务,累计数据下载超26亿条。

  在回首成就的时辰,鲍一明和同事们也复苏地意识到,当前NGDC尚处于初期阶段,综合能力与国际一流机构仍有比力显著的差距。

  “好比数据整合和拥有国际影响力的特色数据库资源有待进一步发展,大数据挖掘分析技术和能力也待加强。”鲍一明说,科技部、财政部已经给NGDC相当大力度的赞助,但与国际同类机构相比,NGDC还面对存储推算设施、人才行列以及经费支持等方面的问题。

  只管还存在很多限杜纂挑战,作为一名“后起之秀”,NGDC已陆续5年被《核酸钻延追评价为与NCBI、EBI并列的全球重要生物数据中心。

  “下一步,我们要对峙求实发展,在确保数据安全的前提下,添补中心在数据处置、存储和检索等主题技术方面的短板,研发成立生物信息大数据关键主题算法和软件,加强中心的服务能力和国际影响力。”鲍一明说。

(原载于《中国科学报》2022 年3月17日 头版

附件下载:
【网站地图】