北京基因组所(国度生物信息中心)组学原始数据归档库GSA实现与NCBI SRA数据库的数据整合
近日,在国际核酸序列数据库合作同盟(INSDC)的支持和美国国度生物信息技术中心(NCBI)的技术协助下,GA黄金甲(国度生物信息中心)国度基因组科学数据中心(CNCB-NGDC)实现NCBI生物项目治理数据库(BioProject)、生物样本治理数据库(BioSample)全数数据及序列片段归档库(Sequence Read Archive, SRA)全数元数据与自主开发数据库的整合,实现了上述数据在NGDC网站的一站式检索与接见,极大提升了国内科研人员查问和获取数据的效能。
CNCB-NGDC 2015年开发的组学原始数据归档库(Genome Sequence Archive, GSA)是中国首个测序数据归档系统,已实现NCBI SRA全数元数据及2022年4月20日起SRA日更新全量数据(元数据和原始序列数据)的整合。截至5月28日,GSA收录460万测序数据集,涵盖近2000万尝试数据和2074多万测序反映,测序序列数据量超过13PB。出格指出的是,GSA目前提供NCBI SRA数据库全数数据的检索服务,也提供这些数据在INSDC有关数据库的下载地址以及最新数据的本地化下载地址。钻研人员能够通过NGDC的跨库搜索引擎BIG Search系统,急剧查找并选择最优的下载蹊径获取数据。
GSA在逐步下载整合NCBI SRA中的汗青数据,实现全球性命组学测序数据的本地化治理,为国内科研人员提供数据获取方便的同时,也为全球性命组学数据共享贡献力量。

BIG-Search检索系统中可实现国际起源数据检索

GSA页面整合国际起源数据下载地址
附件下载:






