生物信息生物信息学与算法转录组

转录组入门(4):了解参考基因组及基因注释

2017-07-24  本文已影响746人  lxmic

作业要求

在UCSC下载hg19参考基因组,群主博客有详细说明,从gencode数据库下载基因注释文件,并且用IGV去查看你感兴趣的基因的结构,例如TP53,EGFR等等。
截图几个基因的IGV可视化结构!还可以下载ENSEMBL,NCBI的GTF,也导入IGV看看,截图基因结构。了解IGV常识。
来源于生信技能树:http://www.biotrainee.com/forum.php?mod=viewthread&tid=1750#lastpost

实验过程

1.参考基因组hg19下载

Jimmy大神的博客:生信菜鸟团,详细介绍了各种基因组版本的对应关系以及下载方法。

# 下载USCS版本的hg19
$ mkdir -p ~/disk2/data/reference/genome
$ cd ~/disk2/data/reference/genome
$ nohup wget http://hgdownload.soe.ucsc.edu/goldenPath/hg19/bigZips/chromFa.tar.gz &
# 解压,得到所有染色体的信息
$ tar -zxvf chromFa.tar.gz
# 将所有的染色体信息整合在一起,重定向写入hg19.fa文件,得到参考基因组
$ cat *.fa > hg19.fa
# 将多余的染色体信息文件删除,节省空间
$ rm -rf chr*

2.参考基因组注释下载

进入人和小鼠基因组注释信息官网GENCODE,选择data->human->GRCh37-mapped Releases,下载最新第26版本的hg19人类基因组注释信息。点击进入下载页面,将GTF和GFF3全部下载,解压。

图6 hg19版本基因组注释信息
图7 基因组注释信息版本GFF和GTF

GTF和GFF之间的区别:

数据结构:都是由9列构成,分别是reference sequence name; annotation source; feature type; start coordinate; end coordinate; score; strand; frame; attributes.前8列都是相同的,第9列不同。
GFF第9列:都是以键值对的形式,键值之间用“=”连接,不同属性之间用“;”分隔,都是以ID这个属性开始。下图中有两个ID,说明是不同的序列。

图8 gff第9列格式
GTF第9列:同样以键值对的形式,键值之间是以空格区分,值用双引号括起来;不同属性之间用“;”分隔;开头必须是gene_id, transcipt_id两个属性。 图9 gtf第9列格式
参考资料:http://www.jianshu.com/p/48b5a0972301
http://www.gencodegenes.org/faq.html
# gtf及gff3下载代码
$ mkdir -p ~/disk/data/reference/genome/hg19
$ cd ~/disk2/data/reference/genome/hg19
$ wget ftp://ftp.sanger.ac.uk/pub/gencode/Gencode_human/release_26/GRCh37_mapping/gencode.v26lift37.annotation.gtf.gz
$ wget ftp://ftp.sanger.ac.uk/pub/gencode/Gencode_human/release_26/GRCh37_mapping/gencode.v26lift37.annotation.gff3.gz
$ gunzip *.gz && rm -rf *.gz

3.IGV下载及使用

Integrative Genomics Viewer(IGV)是一种探索大型综合基因组数据的高性能交互式可视化工具。它支持各种各样的数据类型,包括基于芯片测序、二代测序数据和基因组注释数据等。

# 进入IGV官网,并下载相应的软件包,有Windows,Mac,和LINUX,这里我下载Linux二进制包
$ cd ~/src
$ wget http://data.broadinstitute.org/igv/projects/downloads/IGV_2.3.97.zip
$ unzip IGV_2.3.97.zip && mv IGV_2.3.97 ~/biosoft
# 添加环境变量
$ vim ~/.bashrc
PATH=$PATH:~/biosoft/IGV_2.3.97
$ source ~/.bashrc
# 运行IGV,Linux直接运行igv.sh可以开启IGV窗口,但是会比较慢,要耐心等待。
$ igv.sh

参考资料:
http://blog.sina.com.cn/s/blog_165caa4fd0102wh0n.html
http://www.cnblogs.com/leezx/p/5603481.html

上一篇下一篇

猜你喜欢

热点阅读