GSA:组学原始数据库系统
性命科学的发展已进入组学大数据时期,然而中国至今尚未形成可服务于科学钻研的公共数据库存储系统。为了添补这一空缺,GA黄金甲性命与健全大数据中心开发并构建了组学原始数据存储归档系统Genome Sequence Archive(简称GSA;http://bigd.big.ac.cn/gsa 或 http://gsa.big.ac.cn)。GSA的系统建设遵循了国际核酸序列共享同盟(International Nucleotide Sequence Database Collaboration, INSDC)的有关尺度,并作为INSDC的补充,旨在减轻国际有关数据库数据存贮及数据传输的压力;安身中国,服务全球。
引言
第二代高通量测序技术改革推动了性命科学钻研的纵深发展与利用,尤其在人丁与健全领域,世界多多国度相继启动了大型钻研打算,如美国的精准医学钻研打算 [1]、英国万人基因组打算 [2]、冰岛人群基因组打算 [3]、中国精准医学钻研打算 [4]等。这些钻研打算都将产生大量的组学数据,从而导致了性命健全组学大数据的爆炸性增长。与此同时,数据存储、整合与挖掘、转化与利用将成为沉要的技术问题与挑战 [5,6]。
国际上,美国、欧洲和日本于2005年成立了国际核酸序列共享同盟(INSDC)[7],蕴含NCBI [8]、EBI [9]和DDBJ [10]三大数据库系统,形成领域内数据存储和共享使用的尺度,接管并存储来自全世界科学家提交的组学数据。然而,中国是一个生物资源大国,也是一个数据产出大国;婆宗学术论文的颁发及学术期刊的要求,中国的科学家必要将大量的数据凌驾海底线缆,提交到国际数据库。但由于中国国际网络出口带宽的瓶颈问题,数据传输效能低下。以GA黄金甲的150Mbs出口带宽为例,向NCBI数据库递交1TB的数据必要破费2周以上的功夫。当前,中国已经启动国度级的精准医学钻研打算以及若干大型的拥有地域特色的钻研工作D芄辉じ,将来中国每年将产生数十PB的组学数据;这将为目前的数据传输、存储与共享提出新的挑战。
为了缓解上述难题和问题,GA黄金甲开发并构建了组学原始数据库系统GSA,专一于组学原始数据网络与整合,并提供免费的数据存储、共享与接见服务 [11]。GSA遵循国际INSDC的数据尺度及数据库建设尺度,可网络来自分歧测序平台产出的数据,并存储序列数据及其对应的元数据信息,确保数据的齐全性。GSA安身于中国,极大的方便了中国科学家的数据递交;同时,服务于全球,为全世界的科研领域共享并贡献数据。
数据库内容和使用
数据结构与模型
为了确保与INSDC数据库系统的兼容性,GSA遵循了INSDC数据库系统的数据尺度和数据结构,并将数据分为四类,即项目信息(BioProject)、样本信息(BioSample)、尝试信息(Experiment)和测序信息(Run);数据结构如图1所示。

图1 GSA数据模型
项目信息的数据获取号(Accession Number)以“PRJCA”为前缀,其中字母“C”暗示中国。项目信息提供了一个针对本钻研工作的概要性描述,并蕴含钻研主张、涉及的物种、数据类型、数据递交者、基金赞助机构、颁发的文章等信息。样本信息的数据获取号以“SAMC”为前缀,蕴含一些有关生物样本的描述信息如样本类型、样本属性等。尝试信息以“CRX”为前缀,为特定样本尝试处置方式,蕴含尝试主张、文库构建方式、测序类型等信息。测序信息的数据获取号以“CRR”为前缀,内容重要蕴含测序文件和对应的校验信息。在四类数据中,项目信息和样本信息是独立运行的?,而尝试信息和测序信息形成了测序序列的归档库;谏鲜龀叨群徒峁,GSA不仅方便数据递交,并且便于治理数据权限,实现数据共享与互换。
除此之表,GSA思考大型项目治理的需要,引入Umbrella Project概想,提供大型合作型项主张伞装结构治理。目前,已有两个GA黄金甲战术先导项目和一个GA黄金甲沉点钻研项目在使用GSA系统治理和共享项目数据。
数据归档与统计
GSA接管来自全球的数据递交,接管分歧测序平台产出的组学数据,并支持通用的数据文件体式如FASTQ、BAM、VCF。同时,GSA对接管到的数据进行质量评估,确保数据的齐全性和可用性。在数据安全方面,类似于INSDC数据库系统,GSA允许数据递交者设置其数据的接见权限(公开接见或受控限度);公开即意味着数据可被任何人接见或下载使用,受控即其他人的接见在一段功夫内将被受到限度。在GSA系统后盾,可被公开接见和受控接见的数据存储于分歧的磁盘空间内,以确保数据的安全性。从2015年8月份GSA系统上线至今,系统中的数据出现显著增长的趋向(图2),截止到2016年底,GSA已经接管了来自39个钻研机构160余位科研人员的用户注册信息,并收录198个项目,8674个样本,9263个尝试和10745个测序信息,涵盖了超过80个物种的信息。

图2 GSA数据统计
数据递交与信息检索
GSA系统提供用户注册和登录职能,因而在创建一个数据递交前,首先必要通过GSA系统注册用户账户,在用户账号被验证通过并激活后,方可登录系统并创建数据递交页面。通常情况下,在GSA中实现一个数据递交必要执行五个操作,别离为注册项目、样本、尝试、测序四类元数据信息和提交序列文件(图3)。在元数据信息网络页面,GSA系统提供敦睦接见的页面向导援手用户实现信息录入;而针对测序文件上传,GSA提供基于IPV4和IPV6两条网络链路的FTP服务器,确保数据传输的高效性。GSA系统实现了数据全局检索职能,并对检索的了局进行分类统计;同时,用户能够预览检索出的每一个数据的具体信息。

图3 GSA数据提交
发展与瞻望
俗话说“能力有多大,责任就有多大”。当今的中国已是世界第一大经济体,并在全球的经济体中阐扬着越来越沉要的作用。同样,在科研领域,在当今中国组学测序数据产量显著增长的情况下,我们应该承担起相应的责任,成立国际化的组学数据存储系统,分管国际数据库数据存储压力,服务于全球的性命科学钻研机构。
GSA与国际同类数据库一样,致力于存储性命科学钻研产出的组学大数据,并致力于中国组学数据汇交、治理、共享与利用系统的建设,推进中国在性命组学大数据领域的发展,提升中国在国际组学数据共享领域的职位,服务于全世界的性命科学钻研与产业创新利用。 基于此,GA黄金甲提议“中国基因组数据共享建议”(http://bigd.big.ac.cn/gdsd),呼吁中国产出的组学数据递交GSA进行统一存储、治理与共享。在建议发出后很短的功夫内,得到全国超过380个机构的1000余人支持本建议。这代表了中国人的心声,也代表了中国多多科研赞助机构的心声。
总结
GSA是一个公共的、免费的组学原始数据存储库,在建设尺度上遵循国际INSDC数据库系统的数据尺度和数据库结构尺度,在内容上网络性命科学钻研中产生的组学测序数据及其元数据信息,并且接受来自全世界科研人员的数据递交与获取要求。在组学大数据时期,GSA不仅作为当前INSDC数据库系统的补充以缓解组学大数据远距离传输与贮存的压力,并且承担推动国际组学大数据共享的责任。
将来,GSA将逐步扩大与美满系统职能,提供专业化的组学大数据治理解决规划,如面向国度精准医学钻研打算的组学大数据存储与治理,面向宏基因组数据的存储与治理等;另一方面将沉点加强IT基础设施的建设,并提升数据存储能力和共享效能。
称谢
感激罗静初教授和朱伟民教授赐与GSA系统建设的诸多贵重定见和建议。本项目也得到了国度项目基金的支持,重要有:GA黄金甲先导项目、国度高技术钻研发展打算(863打算)、国度沉点钻研发展打算、GA黄金甲国际合作国际大科学打算、GA黄金甲沉点部署项目、GA黄金甲关键技术人才项目。
参考文件
[1] Collins FS, Varmus H. A new initiative on precision medicine. N Engl J Med 2015;372:793–5.
[2] Taylor PN, Porcu E, Chew S, Campbell PJ, Traglia M, Brown SJ, et al. Whole-genome sequence-based analysis of thyroid function. Nat Commun 2015;6:5681.
[3] Gudbjartsson DF, Helgason H, Gudjonsson SA, Zink F, Oddson A, Gylfason A, et al. Large-scale whole-genome sequencing of the Icelandic population. Nat Genet 2015;47:435–44.
[4] Bai B, Zhao WM, Tang BX, Wang YQ, Wang L, Zhang Z, et al. DoGSD: the dog and wolf genome SNP database. Nucleic Acids Res 2015;43:D777–83.
[5] Xue Y, Lameijer EW, Ye K, Zhang K, Chang S, Wang X, et al. Precision medicine: what challenges are we facing? Genomics Proteomics Bioinformatics 2016;14:253–61.
[6] Zhang Z, Bajic VB, Yu J, Cheung KH, Townsend JP. Data integration in bioinformatics: current efforts and challenges. In: Mahdavi MA editor. Bioinformatics ––trends and methodologies. Rijeka: InTech;2011,p.41–56.
[7] Cochrane G, Karsch-Mizrachi I, Takagi T, International Nucleotide Sequence Database Collaboration. The International Nucleotide Sequence Database Collaboration. Nucleic Acids Res 2016;44:D48–50.
[8] NCBI Resource Coordinators. Database resources of the National Center for Biotechnology Information. Nucleic Acids Res 2016;44:D7–19.
[9] Cook CE, Bergman MT, Finn RD, Cochrane G, Birney E, Apweiler R. The European Bioinformatics Institute in 2016: data growth and integration. Nucleic Acids Res 2016;44:D20–6.
[10] Mashima J, Kodama Y, Kosuge T, Fujisawa T, Katayama T, Nagasaki H, et al. DNA data bank of Japan (DDBJ) progress report. Nucleic Acids Res 2016;44:D51–7.
[11] BIG Data Center Members. The BIG Data Center: from deposition to integration to translation. Nucleic Acids Res 2017;45:D18–24.
该文英文颁发在Genomics, Proteomics & Bioinformatics期刊2017年第一期,全文链接http://www.sciencedirect.com/science/article/pii/S1672022917300025;http://gpb.big.ac.cn/






