整理自生信技能树小洁老师授课内容

图表介绍

热图

  1. 输入数据输入数据是**数值型矩阵/数据框**
  2. 颜色的变化表示数值的大小
热图类别
  1. 相关性热图
  2. 差异基因热图

1. 散点图

2. 箱线图

  1. 输入数据是一个连续型向量和一个有重复值的离散型向量分类变量
  2. 图解:包括 min max median 25% 75% 离群点
  3. 单个基因在两组之间的表达量差异

3. 火山图

  1. 横坐标:logFC,纵坐标:-log10(P.value)

     FoldChange (FC):处理组平均值 对照组平均值
     logFC:Foldchange 取 log2
    
  2. 理解 logFC,一定是**处理组-对照组**

  3. logFC 一般 <20 才正常

在这里插入图片描述
1)logFC>0,treat>control ,基因表达量上升

在这里插入图片描述
2)logFC<0,treat<control ,基因表达量下降
在这里插入图片描述
3)通常所说的上调、下调基因是指表达量显著 上升/下降的基因 (结合P值
在这里插入图片描述

4)logFC的常见阈值,没有标准答案

	1、2、1.2、1.5、2.2、0.585(=log2(1.5))
  1. 差异分析结果 limma

     P值越小,越有信心认为差异显著,-log10( P-value)越大
    

在这里插入图片描述

以上图片来自生信技能树小洁老师

4. 主成分分析(PCA)

  1. 主成分分析,旨在利用降维的思想,把多指标转化为少数几个综合指标(即主成分)
  2. 根据这些主成分对样本进行聚类,代表样本的点在坐标轴上距离越远,说明样本差异越大。
  3. PCA样本聚类图
    1)图上的点代表样本(中心点除外)
    2)点与点之间的距离代表样本与样本之间的差异
  4. 用于“预实验”,简单查看组间是否有差别
    1)同一分组是否聚成一簇(组内重复好)
    2)中心点之间是否有距离(组间差别大)

2. GEO背景介绍及分析思路

1. 表达数据实验设计

  1. 实验目的:实验目的:通过基因表达量数据的差异分析富集分析来解释生物学现象
  2. 组别设计
  3. 流程:不同处理 – 差异基因 – 找功能、找关联、找机制、同一通路有多个基因表达变化 – 解释差异,缩小基因范围

2. 数据库介绍

  1. NCBI:Gene Expression Omnibus – Browse Content

  2. 流程:在这里插入图片描述

  3. 基因表达芯片的原理

     探针的表达量代表基因的表达量
    
  4. 分析思路

在这里插入图片描述

3. 表达矩阵

GSM,样本编号
需要分组信息
需要转换为 gene symbol

4. 富集分析

代码分析流程

复杂数据分析

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐