GeneSpeeds Genome Insight基因组结果生成器

GeneSpeeds · Multi-layer Genomic Insight · 增强版示例报告

水稻自然群体基因组分析报告

籼稻 vs 粳稻 · 48 样本 · 12 张主图 · 2 区域放大 · Publication-ready

项目编号
DEMO-RICE-2026-001
交付日期
2026-07-04
比较组
籼稻(Indica)vs 粳稻(Japonica)
分析引擎
PLINK v2.0 + VCFtools + ADMIXTURE + SnpEff + AI

AI 候选基因生物学解读

Os07g0152000Os07g0152000 位于 Chr7 最强选择信号区间(FST = 0.71,π 显著降低,Tajima's D = -2.67),编码开花时间调控蛋白 Hd4。该基因在籼稻与粳稻间携带非同义突变(p.Ala142Thr),与已报道的籼粳分化位点高度一致。

该位点可能通过调控开花时间参与籼粳亚种适应不同纬度光周期的选择,建议作为后续功能验证的首要目标。

方法(Methods)

将 VCF 文件(bgzip 压缩并建立索引)、样本分组表和基因注释 GFF 上传至 GeneSpeeds Reseq Report。变异质控包括 SNP/InDel 数量统计、缺失率、杂合率、Ts/Tv 比值和染色体分布评估。群体遗传分析采用 PLINK v2.0 完成 PCA 和系统发育树构建,VCFtools 计算 FST、π 和 Tajima's D 滑窗统计量(窗口 50 kb,步长 10 kb)。候选基因注释基于 SnpEff 功能影响分类和自定义 GO/KEGG 注释表。

结果 — 变异质控

共鉴定 2,847,563 个 SNP 和 412,890 个 InDel,平均缺失率为 3.2%,平均杂合率为 12.8%。Ts/Tv 比值为 2.14,符合高质量 SNP 集合的预期范围。变异在 12 条染色体上分布均匀,Chr1 和 Chr3 变异密度略高。未发现明显异常样本,所有 48 个样本均通过质控阈值(缺失率 < 10%)。

结果 — 群体结构(Level 1)

PCA 分析显示籼稻(Indica)与粳稻(Japonica)沿 PC1 轴(解释 38.7% 方差)清晰分离。ADMIXTURE 分析(K=2)获得最低 CV 误差,两祖先成分完全分离。UMAP 降维与 IBS 相似性网络均确认两大独立亚群,组内遗传相似度 > 0.85。层次聚类热图拓扑与 PCA 一致,支持在明确的两群体框架下进行选择信号分析。

结果 — 选择景观(Level 2–3)

Sliding Window 多轨道分析(π / FST / Tajima's D / 基因注释)在 Chr7:1.0–1.15 Mb 检测到三指标共定位的定向选择信号(FST = 0.71,π = 0.0018,Tajima's D = -2.67)。Manhattan 全基因组扫描在 Chr7 和 Chr3 检测到超过 Bonferroni 阈值的显著峰值。区域放大分析(Top 1%)显示 Chr7:0.98–1.18 Mb 和 Chr3:8.85–9.05 Mb 两个候选区间,SNP 密度在选择峰处分别达 28 和 22 SNP/kb。

结果 — 候选基因(Level 4–5)

Os07g0152000(Hd4,开花时间调控)位于 Chr7 选择峰值中心,1050420 bp 处非同义突变 p.Ala142Thr(SnpEff MODERATE),籼稻等位基因频率 0.89 vs 粳稻 0.12。Os03g0417700(GS3)在 Chr3 候选区间携带 stop-gain 变异,与粒型发育相关。通路网络分析显示 Hd4 处于开花调控核心节点,与 Hd1/Ehd1/Hd3a 互作。综合四联主图(Fig. 1)串联结构→选择→候选基因的完整叙事链。

图表与 AI 生物学解读

Level 1 — 全局群体结构

PCA + ADMIXTURE 揭示籼粳亚群分化格局,为后续选择分析提供群体框架。

1

PCA 主成分分析

Principal Component Analysis

籼稻 Indica粳稻 Japonica
Biological interpretation

Interpretation

PC1(38.7% 方差)清晰分离籼稻与粳稻样本,PC2 捕获亚群内微结构。两个亚群间遗传距离显著,符合已知籼粳分化历史。

Hypothesis

籼粳分化主要由少数主效基因组区域驱动,PC1 轴上的离群样本可能代表渗入或杂交个体。

补充分析 (4)

2

ADMIXTURE 群体结构

K = 2–10 Ancestry Proportions

K=2 · CV error minimum

籼稻 (n=12)

粳稻 (n=12)

Each stripe = one sample · ancestry proportions

籼稻祖先粳稻祖先
3

样本遗传距离热图

Hierarchical Clustering Heatmap

籼稻粳稻
IBS similaritylow → high
4

UMAP 降维可视化

Uniform Manifold Approximation

5

样本相似性网络

IBS-based Similarity Network

XI-01XI-02XI-03XI-04XI-05XI-06GJ-01GJ-02GJ-03GJ-04GJ-05GJ-06Indica clusterJaponica cluster

表 S1 — VCF 质控统计

SNP 总数2,847,563
InDel 总数412,890
平均缺失率3.2%
平均杂合率12.8%
Ts/Tv 比值2.14
高影响变异1,247

表 S2 — 候选基因列表

基因位置影响功能优先级
Os07g0152000Chr7:1,234,567nonsynonymous开花时间调控 / 籼粳分化候选
Os03g0417700Chr3:8,901,234stop-gain粒型发育相关
Os01g0880200Chr1:42,156,789synonymous抗逆信号转导
Os05g0187500Chr5:5,678,901nonsynonymous淀粉合成途径
Os11g0163100Chr11:2,345,678intergenic选择信号区间内候选

软件版本与关键参数

软件版本用途
PLINKv2.00a5.10PCA、ADMIXTURE、LD
VCFtoolsv0.1.16FST、π、Tajima's D 滑窗
bcftoolsv1.19VCF 质控与统计
SnpEffv5.2变异功能注释
GATKv4.6.0.0Variant calling(标准包)

交付清单

  • HTML 可编辑报告
  • PDF 报告
  • DOCX 报告
  • 12 张主图 PNG(300 dpi)
  • 2 个区域放大图
  • Multi-panel 综合主图
  • 补充表 CSV/Excel
  • AI 多层级生物学解读
  • Methods/Results 草稿