REPRODUCIBLE BIOINFORMATICS

让 RNA-seq
从数据,到答案。

一套清晰、可追溯的转录组分析路径:质量控制、比对、定量与差异表达。每一步,都可以被复现。

04
核心阶段
03
工具语言
100%
可复现
transcript_015′ → 3′
GENE EXPRESSION12,483features

THE PIPELINE

四步完成标准分析

从 FASTQ 到生物学解释,每个阶段都有明确的输入、输出与质量指标。

01
QC

质量控制

FastQC 检查碱基质量、接头污染与序列重复度。

*.fastq.gz → html
02

序列比对

STAR 将高质量 reads 快速比对至参考基因组。

FASTQ → sorted BAM
03
Σ

表达定量

featureCounts 按注释文件生成基因表达矩阵。

BAM + GTF → counts
04
Δ

差异分析

DESeq2 建模、校正并筛选差异表达基因。

counts → DEG table

READY TO RUN

把方法写进代码

根据样本信息调整路径与分组,即可将下面的骨架用于常规双端测序数据。

# 1. QC and adapter trimming
fastqc raw/*.fastq.gz -o results/fastqc -t 8
fastp -i raw/sample_R1.fastq.gz -I raw/sample_R2.fastq.gz \
  -o clean/sample_R1.fq.gz -O clean/sample_R2.fq.gz \
  --html results/fastp/sample.html --thread 8

# 2. Alignment with STAR
STAR --runThreadN 16 --genomeDir reference/star_index \
  --readFilesIn clean/sample_R1.fq.gz clean/sample_R2.fq.gz \
  --readFilesCommand zcat --outSAMtype BAM SortedByCoordinate \
  --outFileNamePrefix results/star/sample.

# 3. Gene-level quantification
featureCounts -T 8 -p -a reference/genes.gtf \
  -o results/counts.txt results/star/*.bam

BEFORE YOU RUN

结果可信,始于设计。

01

生物学重复

每组建议至少 3 个独立生物学重复;技术重复不能替代生物学重复。

02

记录批次因素

将批次、性别或组织来源写入 metadata,并在设计公式中控制混杂。

03

先看整体分布

在解释单个基因前,先检查 PCA、样本相关性和测序深度是否合理。