GEO数据处理清洗教程汇总,代做各领域生信分析和辅导
邢博士解答世间万物
2024年12月31日 23:49

GEO数据处理清洗教程汇总

GEO数据处理清洗教程

基因ID转换方法汇总

GEO的表达矩阵的探针ID转换成基因名称教程 (提取的表达矩阵里只有基因探针ID,没有正式的基因名称时运行这一步)

GEO上基因探针注释平台GPL背景知识介绍

在基因表达数据分析中,了解特定的基因探针平台(GPL)的注释信息是非常重要的。`GEO`,或者称为`Gene Expression Omnibus`,是一个存储高通量基因表达数据(如微阵列和次世代测序数据)的公共数据库,由美国国立生物技术信息中心(NCBI)管理。每个数据集通常与一个或多个探针平台相关联,这些平台在GEO中被指定为GPL(Gene Expression Omnibus Platform)。

GEO的GPL(Gene Expression Omnibus Platform)

在GEO中,每个基因探针平台被赋予一个唯一的GPL编号。GPL描述了用于测量基因表达的技术和方法,包括探针的设计、制造信息以及探针与基因(或转录本)之间的对应关系。这些信息对于正确解释基因表达数据至关重要。

主要内容包括:

1. 平台描述

  • 制造商:如Affymetrix, Illumina, Agilent等。

  • 技术类型:如微阵列芯片、次世代测序。

  • 探针特征:探针数量、探针覆盖的生物体(如人类、小鼠等)。

2. 探针注释

  • 探针ID:每个探针在平台上的唯一标识。

  • 探针位置信息:探针在基因组或转录组上的具体位置。

  • 靶标基因:每个探针旨在检测的基因或转录本。

  • 相关序列:探针的核苷酸序列。

3. 访问和使用

  • GPL访问编号:如GPL570。

  • 数据集示例:与该平台相关的GEO数据集编号(如GSE号)。

  • 下载和查询:用户可以通过NCBI的GEO查询界面查询特定平台的注释数据。

为什么探针注释重要?

  • 精确的生物学解释:正确的探针到基因的映射确保了实验结果的生物学解释的准确性。

  • 数据比较:统一的探针注释允许不同实验数据间的有效比较。

  • 研究复现:详细的平台注释信息帮助其他研究者复现和验证实验结果。

从GEO中下载基因的GPL探针注释文件

a.下载GSE75436_family.soft.gz文件

该注释文件中可能有基因名称的注释信息

b. 进入该GSE数据集对应的GPL570网页中尝试下载探针对应的基因名称注释信息

进入到GPL平台页面后,下拉到页面末尾,如果有Download full table ,就把这个注释table下载一下

如果没有Download full table,就下载GPL的family.soft.gz压缩包文件

这从GSE网页或GPL网页这两个地方一般都能下载到soft文件压缩包,但是有的GPL开头的soft文件压缩包会很大,几百兆甚至几个GB大小,一般正常的soft文件压缩包只有几十兆大小,如果你用的几百兆大小的soft文件去提取,那个文件肯定不是要用的那个soft文件。

1.1.2 从下载的基因注释文件中提取出基因探针对应基因名称两列注释信息

1.1.2.1使用下载的GSEXXX_family.soft.gz 或GPLXXX_family.soft.gz注释文件中提取出基因探针对应的基因名称

提取的基因注释信息文件

这从GSE网页或GPL网页两个地方一般都能下载到soft文件压缩包,但是有的GPL开头的soft文件压缩包会很大,几百兆甚至几个GB大小,一般正常的soft文件压缩包只有几十兆大小,如果你用的几百兆大小的soft文件去提取,那个文件肯定不是要用的那个soft文件。

1.1.2.2可以尝试使用从GPL网页下载的txt文件中提取出基因的注释信息

从该数据集的GPL平台网页中下载基因注释的表格文件

软件界面和参数

运行的结果

1.2 对GPLsoft文件中没有基因名称的探针获取基因注释(第二种基因探针注释方法)

该方法对于一些非编码RNA的GSE数据集的注释可能会非常有用

分析模块的位置和界面

运行完成的结果

运行状态显示信息

执行已完成,运行结果保存的目录位置为: D:/data/GEO/GSE84839; 分析结果日志保存的路径为: D:/data/GEO/GSE84839/GSE84839_last_final_run_res_log.csv

运行完成的结果

运行这个模块来从部分GPL编号来获取基因探针跟基因注释的结果是最后的选择,一般不推荐直接运行这个模块,更推荐直接从下载的GPL或GSE family.soft.gz文件中提取出基因探针跟基因对应的注释信息,因为这个模块收录的GPL注释信息的平台很少,只有部分非编码RNA难注释的GPL编号可以用这个模块来做,很多GPL编号是不适合用这个模块取做的。

1.3 同一物种不同类型基因id转换

该模块对于基因名称SYMBOL跟ENTREZID,ENSEMBL(为ENSG等开头基因ID),REFSEQ(为NM开头:mRNA,NP开头:蛋白,NR开头:非编码RNA),UNIPROT,UCSCKG(为ENST转录本)这六种类型中的一中或多种类型的基因ID或名称间的互相转换是非常有用的。

软件界面

运行结果

1.4 不同物种间同源基因转换

该节教程:网页链接​

该方法对于小鼠和人之间的基因名称相互转换或者其它物种的基因名称转成人或小鼠的基因名称从而方法进行某些只能用人或小鼠模式生物才能做的生信分析是非常有用的。

能进行同源基因转换的物种清单

软件界面

运行结果

1.5从染色体的位置信息中注释出基因的名称和TSS位置信息

功能介绍

一般GEO中的一些甲基化数据可能没有基因名称,只有在染色体上的染色体编号,起始位置,终止位置这样的位置信息,需要注释出基因名称。我下面的分流流程实现了三个功能:

  1. 对数据进行整理清洗

  2. 从染色体位置信息中注释出基因名称

  3. 注释出相对TSS转录起始位点的上游和下游位置信息

具体的分析流程,以GSE134052这个甲基化数据集为例

数据集下载

下载结果

这个数据集没有下载到表达矩阵。但是下载到了样本的分组信息文件。

主要原因是GEO中的这个series_matrix文件只有5kb,文件太小,是个无效文件,无法提取出表达矩阵

对该文件进行手动下载和解压。

对下载到的甲基化数据的大文件进行查看

查看该大文件中的内容

该甲基化数据文件虽然是txt文件,但是文件大小有612M,使用excel或记事本都不容易打开。

使用该查看大文件的工具来查看大文件中的内容,会从大文件中提取开头和结尾前50行生成一个小文件方便用excel查看

该分析模块的名称step_module_name是view_large_file,即用的是这个总的参数文件的完整的文件:D:/omics_tools/demo_data/total_analysis_params_demo.xlsx 里面的该名称的step_moudule_name对应的里面的参数值。

修改参数值的时候,只用改这个模块的参数值中我标红的那几个参数值,包括大家电脑中要分析的数据的文件路径和一些要调整和特别指定的重要参数值,没有标红的参数值,大家一律用默认的,不用修改。

可以看到这个甲基化文件没有基因名称,只有染色体位置信息编号,我们后面需要从染色体位置信息中注释出基因的名称。

把染色体位置信息列拆分成chr,start,end类似bed文件格式的这样三列信息整合在原来的甲基化数据中。

我们在对染色体位置信息进行注释基因名称前,需要把染色体位置信息列拆分成chr,start,end类似bed文件格式的这样三列信息整合在原来的甲基化数据中,这样会方法后续的基因注释。

因为数据清洗的工具模块很多,该模块在最下面,要一直下拉到最下方

该分析模块的名称step_module_name是data_split_column,即用的是这个总的参数文件的完整的文件:D:/omics_tools/demo_data/total_analysis_params_demo.xlsx 里面的该名称的step_moudule_name对应的里面的参数值。

修改参数值的时候,只用改这个模块的参数值中我标红的那几个参数值,包括大家电脑中要分析的数据的文件路径和一些要调整和特别指定的重要参数值,没有标红的参数值,大家一律用默认的,不用修改。

运行结果

生成了一个678M的甲基化数据大文件

再查看下该大文件中的内容

现在已经被拆分出chr,start,end这三列了。

跟染色体位置信息注释出基因名称和基因的TSS位置信息

视频教程:

从NCBI服务器上下载研究物种的基因组注释信息教程

网页链接​

下载到的文件

将该文件解压后并查看文件内容

这个基因组注释文件有40多万行,只有6万多行是基因名称行,所以要把基因名称行提取出来

第一列# featue列下面的行为gene的时候所在的行都是基因名称行。

注意在使用该模块的时候,func_filter_rows_pattern要用到的列名不能有空格等特殊符号,所以这里要把基因组注释文件的第一列的列名由’# feature'修改成'feature'这个名字,保存文件后,再进行分析

根据染色体位置信息注释出基因名称和TSS位置信息

该模块在数据清洗的栏目下拉到最下方就可以发现该模块。

该分析模块的名称step_module_name是annotate_bed_with_gene_tss,即用的是这个总的参数文件的完整的文件:D:/omics_tools/demo_data/total_analysis_params_demo.xlsx 里面的该名称的step_moudule_name对应的里面的参数值。

修改参数值的时候,只用改这个模块的参数值中我标红的那几个参数值,包括大家电脑中要分析的数据的文件路径和一些要调整和特别指定的重要参数值,没有标红的参数值,大家一律用默认的,不用修改。

生成了一个600多M的带基因名称的甲基化矩阵和一个800多M更详细注释信息的甲基化数据大文件

再查看下该大文件中的内容

总的注释后的甲基化数据

甲基化表达矩阵,第一列有基因名称

将提取的基因注释信息跟表达矩阵合并

软件界面

运行结果

结果文件

文件中的内容

3 GEO的样本分组信息提取和处理教程

3.1 从样本注释文件中提取出分组数据 (优先选择使用这种方法)

该节教程: 网页链接​

软件界面

运行结果

3.2 从表达矩阵中提取出分组信息 (第2种分组信息提取方法)

该节教程:网页链接​

软件分析界面

运行结果

3.3 自己构建分组信息文件

当然如果少数GSE数据集遇到没有提取出GSEXXX_sample_info.csv的情况,也可以看看我b站的教学视频,根据GEO网页中的样本编号的分组情况,自建一个这样的分组文件,分组文件一般是长这个样子的,有两列,一列列名叫sample.id,是GSM编号信息,另一列是group.level,存放的是分组信息,当然sample.id这一列的样本名还是要以表达矩阵的样本名为准,这样才能让表达矩阵后面跟样本分组信息按照相同的列名整合在一起:

OmicsTools软件和分析教程介绍

前言和简介

OmicsTools全能医学生物生信分析电脑软件简介

我开发了一款本地电脑无限使用的零代码生信数据分析作图神器一站式全流程电脑软件OmicsTools,旨在成为可以做各种医学生物生信领域科研数据分析作图的的全能科研软件,欢迎大家使用OmicsTools进行生物医学科研数据分析和作图,该软件件能让大家在不需要任何编程和代码编写的基础上,分析次数没有限制,可以无限使用,让您在自己电脑上快速进行大量的生信分析和加速大家的科研。

OmicsTools生信分析电脑软件可以做医学生物生信各个领域的科研数据分析和作图,并致力于成为医学生物生信领域的综合全能分析软件,一个软件帮助大家做医学生物生信领域的各种研究,快速出成果。

软件下载获取

我开发的本地电脑无限使用无限分析作图的生信零代码一键分析电脑软件神器OmicsTools 软件在github上的zihaoxingstudy1/OmicsTools(https://github.com/zihaoxingstudy1/OmicsTools)仓库中,也可以到我的生信交流q群群文件中下载,q群中的软件版本会更新一些,大家可以下载安装OmicsTools进行各种生信分析和可视化作图。

现在1群满员,会提示加2群,2群也可以下载到软件。

持续整理的各领域生信分析文档和答疑文档

所有人可编辑提问我对各种问题跟答疑答疑的腾讯文档

【腾讯文档】各领域生信分析全流程教程和答疑指导汇总版

https://docs.qq.com/doc/DWWtrd0Z2T1JHWVNa

所有大家遇到的各种生信分析问题都在我的这篇腾讯文档对应的答疑文档中进行,腾讯文档的答疑文档支持所有人编辑和提问。

这篇总的腾讯文档是各领域生信分析答疑指导汇总文档的入口,以后所有的生信分析教程资料都在这个在线word文档中就能检索到,答疑汇总也能在这个word文档中检索到,都在这个在线word文档对应的提问答疑文档文件中提问,提问的问题在文档中用红色字体显示,我答疑在文档中用黑色字体显示,提问答个疑的文档和教程的文档所有人都可编辑。大家在腾讯文档里提问好了之后,现在答疑文档也是比较多的,发个截图和答疑文档的链接网址给我看看,这样我能快速定位到你提问的是哪个问题。

可以提供的科研分析作图服务和标书基金课题写作辅导清单