生信分析服务器怎么用(生信基因功能分析工具:Orthofinder使用教程)

本文目录
- 生信基因功能分析工具:Orthofinder使用教程
- 生信数据分析新手常见问题
- 在超算做生信分析
- 生信分析基本流程
- 用于生物信息分析该如何安装ubuntu系统
- 【工具】Galaxy(training)生信平台资源
- 生物信息流程搭建方法
生信基因功能分析工具:Orthofinder使用教程
最近Orthofinder2开始陆续更新,文章已经投发到biorkix上,在网上搜了一圈,关于Orthofinder的使用的中文教程几乎是空白的,这周就借此机会和大家一起来学习一下这款软件。
OrthoFinder是比较基因组学中的实用的,运行快速,准确的全面的工具。它的主要功能是,找到了正交群和直系同源物,推断出所有正交群的根基因树,并识别那些基因树中的所有基因重复事件。它还为所分析的物种推断出有根的物种树,并将基因重复事件从基因树比对到物种树的分支中。
另外,OrthoFinder还为比较基因组分析提供全面的统计数据。相比OrthoMCL, OrthoFinder使用简单安装都很简单,安装只需要用过conda就行,运行只需一组FASTA格式的蛋白质序列文件(每个物种一个)。
为了让大家更好的理解使用Orthofinder,在正式介绍其使用的流程前,先来回顾一下与之相关的生物学知识。
直系同源物和旁系同源物
Orthologs(直系同源物)是在两个物种的最后共同祖先(LCA)中来自单个基因的一对基因。直系同源物是同源性基因,是物种形成事件的结果。Paralogs(旁系同源物)是同源基因,是重复事件的结果。下图就可以看到,不同物种间的alpha-chain gene互为Orthologs(直系同源物)。这时候可以引用一个新名词orthogroup (正交群)就用来形容自一组物种的LCA中的单个基因的基因组(在图中就是alpha chain gene)。然后同一物种间alpha 和beta chain gene互为Paralogs(旁系同源物)。最后所有这些关系都可以由OrthoFinder来识别。
为什么要研究正交群?
废话说了一大篇,是时候开始安装软件了。在这里推荐大家使用conda来安装,简单明了,不用担心其他Dependencies的安装
接着准备好测试数据,为了展示的方便,我将原始测试数据重新命名:
正式运行Orthofinder,相当简单的操作, -f 输入目录,里面包含你需要运行的蛋白质fasta文件, -t 所用到的CPU数目。基本的用法就如下,更多的可以去manual中查看。
生成的结果会存储于Results_XXX文件中,现在简单看看里面有啥。
正交群以两种不同的格式返回,一种是制表符分隔的表格格式(* .csv),另一种格式与orthoMCL(* .txt)的输出格式相同。还应该有一个名为WorkingDirectory的目录,其中包含运算过程的中间文件,例如blast结果。
安装加载以下R包
读取Orthofinder中正交群的文件。结果文件将正交群存储为制表符分隔表,其中每一行是正交群,其名为OG,后跟7位数字(例如OG0000123)。表中的每列对应一个物种,并且与fasta文件具有相同的名称。表中的单元格包含序列ID。由于正交组可以包含来自单个物种的几个基因(即,旁系同源物),因此表中的单个cell可以包含由逗号分隔的几个序列ID。下面是读取结果文件的例子:
获取特定正交群的信息:
可以清晰的看到,在对应的fa文件中,在该特定的正交群OG000018下所包含的fasta序列,其结果如下:
接着让我们来看开正交群的数目,为了获得特定正交群的序列,需要在每个正交群中构建每个物种的基因数量的矩阵:
我们可以在正交群OG0000018中检查每个物种中的旁系同源物的数量:
我们还可以绘制每个正交群中存在的基因数量:
另外一写有趣的事我们可以查看,每个物种中只有一个直系同源的正交群(1:1:1:1正交群):
正好只存在于两个物种(1:1:0:0正交群)的正交群:
让我们找出这个数字背后所对应的物种:
基本的用法和分析就讲解到这里,当然这只是最基本的东西。其结果涉及到的下游分析还有很多很多,例如构建直系同源基因树等等的知识,大家可以自行进行探讨。
生信数据分析新手常见问题
写一个帖子,慢慢收录一些看起来似乎很简单,确实比较常见的 数据分析新手 的问题。
双端测序(PE)本身就是对一个片段的两个方向分别测一次。所有一个样品会对应两个文件,其中一个是所谓的 正向 (事实是,测的第一链条,即Forward),常见文件命名会带有 _1 或者 .1 ;另外一个,是所谓的 反向 (事实是,测的第二链,即Reverse Complement),常见文件命名会带有 _2 或者 .2 。
如下,其中a图会引物会引导测序,125个bp,并产生正向测序读段文件;c图中引物会引导测序,125bp,并产生反向测序读段文件
正反向都是测同样长度的读段,比如125bp,从字符数目来计算,文件似乎应该是一样大。 为什么文件大小为什么会不同?比如一个是2.0G,另一个2.2G 。造成这么大差别,主要原因是看到的都是.gz压缩文件,压缩的算法有很多,基本上没有一个算法是不受文本复杂度限制的。正反向记录的碱基必然是不同的,至少顺序必然是不同的,所以压缩的效果会有差异,最后文件大小会有差异。
你需要了解一下screen或者tmux这类程序
建议tmux
在超算做生信分析
如此众多软件,可以通过Module的功能将这些工具的环境加载到自己账户下,进行提交计算。我们以一款商用NGS组装和比对工具Sentieon来演示整个过程:
1、拿到超算发的VPN账户,使用Hillstone VPN工具进行登录:
也可根据实际计算需要编写执行脚本,然后使用 yhbatch 的方式提交到计算节 点上运行,yhbatch 的作业提交步骤可参考:
Sentieon软件特点
--该软件能替换常规的分析工具(GATK4/GATK 3.7/Picard 2.9.0/BWA 0.7.15-r1140), 结 果匹配的同时,还具有如下突出的特点:
--并行计算实现 10 – 50 倍的加速,天河二号上单节点测试,分析外显子组只需半小 时, 30X 全基因组 8 小时。
--在高深度测序区域没有 down-sampling(GATK 对深度大于 500 的区域会做 downsampling),这对于高深度测序尤其是低 allele frequency 的变异的重要性尤其突 出,一个典型的应用是 ctDNA 测序结果分析。
--没有 run-to-run difference:严谨的软件和算法工程实现,去除了原来 GATK 软件中 因为例如 thread-dependency,随机取样等原因导致的结果不可重复的问题 。
--大量 WGS 的 joint-calling:软件能实现大到 10 万个 WGS 数据的一次性 jointcalling, 无需中间步骤,此功能已被软件客户广泛使用。
--TNscope 获得 DREAM challenge 榜首的,自主设计的算法产品,除了能 call 结构变 异之外,对于 snv 和 indel,也给出了更高的准确度。
更多介绍及详情可参考 Sentieon中文网站
生信分析基本流程
生信分析的基本流程包括以下步骤:
数据获取:从实验室得到原始数据,可以是基因序列数据、转录组数据、蛋白质组数据等。
数据预处理:对原始数据进行质控、去除低质量数据、去除污染物等预处理步骤,确保数据的质量。
数据比对:将原始数据与已知的基因组或转录组等进行比对,找到序列中的基因、转录本、变异等信息。
功能注释:对比对结果进行注释,确定基因的功能、调控元件等。
差异分析:对不同样本之间的基因表达差异进行统计分析,找到与疾病、表型等相关的基因。
生物信息学分析:利用各种生物信息学工具和数据库,进行进一步的分析和挖掘。
结果展示:将分析结果进行可视化展示,包括绘制热图、散点图、柱状图等,便于分析者进行结果解读。
结果验证:通过实验验证分析结果的准确性和可靠性。
生信分析的流程可以根据具体的分析目的和数据类型进行适当的调整和优化。
用于生物信息分析该如何安装ubuntu系统
1. 生信软件系统的选择——Linux(ubuntu)
对于生信分析人员来说,日常工作,软件运行,跑流程,均在linux下操作。当然,也有基于云端的生信分析平台,如免费的Galaxy,或者某些 公司的一站式云平台。
比较初学者学生物信息还是使用开源软件、学原理、一步一步运行才有意思。这路子,一定要适应Linux的命令行界面。
选择windows还是linux? 一定是linux,windows太多的生物软件不兼容了。
选择linux的哪个版本?推荐桌面版的Ubuntu——稳定,美观,适合初学者之称;次之,Centos——免费、稳定的服务器linux版本之称。
用那种方式安装linux好?推荐虚拟机安装。不太建议双系统,云端这种。因为,对于初学者在系统中,需要反复折腾,测试,搞垮系统是常事。
选择开源的VMbox还是商业版VMware?两者都可以,但各有缺点。VMbox更新比较快,经常更新后,可能会出现报错,系统无法打开的现象,较低版本的反而比较稳定,如果用好了,不建议经常更新。还有一点是,VMbox在鼠标控制上,没有VMware流畅。VMware十分稳定,流程好用。最新版一般要收费。可以选择比最新版版本稍低的,上网搜注册码,免费使用。还是那样,用好了,不要经常更新。某些生信软件会提供VMbox的镜像,如qiime。
VMbox的镜像能不能转到VMware上使用?,答案是可以的,使用VMbox的镜像导出功能,然后使用VMware进行导入,保持两者格式相同。
【工具】Galaxy(training)生信平台资源
***隐藏网址***
生信平台化是以后的一大趋势,目前国内外多个公司都建立了自己的生信分析平台,有全免费的也有部分免费的。目前开放的比较有名的有:Galaxy,GenePattern,GenomeQuest,UCSC,DNAnexus等。
Galaxy大部分是免费的,官网的原话:
首页对各类服务器进行了分类:
比如,这里找了个 Metabolomics workflow :
***隐藏网址***
***隐藏网址***
没用过,现在也不知道怎么用,尤其是部署自己的服务器,对Galaxy平台进行本地化搭建,貌似有些麻烦,后续有机会摸索。
***隐藏网址***
***隐藏网址***
生物信息流程搭建方法
先来看一则招聘信息:
关于生物信息流程,不同的分类标准可能得到不一样的分类结果,比如:
A review of bioinformatic pipeline frameworks 这篇综述中,按照隐式公约框架、明确框架、配置框架和基于类的框架等对现代的生物信息流程框架进行分类。
生信分析流程构建的几大流派 按照脚本语言流、Common Workflow language 语言流、Makefile流、配置文件流、Jupyter notebook和R markdown流等分为不同流派。
依我看,生物信息流程无非分为旧方法和新方法两类(废话~~~),分别了解一下。
传统的方法,也是目前最常用的流程搭建方法,尤其是在工业界。
缺点:
最新流行的流程工具,但实际上在工业界并没有普及。
CWL(Common Workflow Language)普通工作流语言和WDL(Workflow Description Language)工作流描述语言。定义每一个计算过程(脚本)的输入和输出,然后通过连接这些输入和输出,构成数据分析流程。
可以在多个平台执行,比如本地服务器、SGE 集群,云计算平台等,可以做到一次编写多处执行。Linux版本最有名的如snakemake, nextflow,bpipe等。图形界面版的如Galaxy,一些商业公司的云平台(拖拉图标即可)。
Cromwell 是 Broad Institute 开发的工作流管理引擎,支持 WDL 和 CWL 两种工作流描述语言。
CWL中snakemake的一个示例语法:
可参考博文:
***隐藏网址***
WDL语法结构:
示例:
***隐藏网址***
docker不是一个流程方法,只是个封装的容器工具而已,所以这个分类比较牵强,只是上面两种的延伸。我们把自己开发的流程做成Docker镜像,以便使用和分享。
以ChIP-seq等分析时常用的peak calling工具MACS2为例。
具体可参考博文:
***隐藏网址***

更多文章:
server2008官网下载(sql server 2008 r2 express 官方)
2026年9月7日 13:00
域名邮箱域名续费(企业邮箱提示域名已过期,域名不在我这,怎么续费)
2026年9月7日 11:00
菜鸡免费版安卓破解下载(菜鸡云游戏最新版破解版永久免费无限时间下载地址)
2026年9月7日 02:10







