Skip to content

反向 MR:疾病 → 蛋白

正向是 cis-pQTL(蛋白)→ 疾病;本分析把方向调过来,检验是否存在反向因果。

为什么现在才做R/12_bidirectional.R 只被单对流水线 run_all.R 调用, 而本课题走批量筛查 analysis/01_screen.R,且 config.yamlbidirectional.enabled = false——2026-07-31 核查时才发现这个缺口。 新脚本 analysis/35_reverse_mr.R 为批量筛查补上这一步。

一、方法

设定
反向暴露疾病(R9_dm 的 7 个结局)
反向工具疾病 GWAS 全基因组显著位点 p<5e-8,不设 cis 窗
LD clumpingplink1.9 + 1000G EUR,r²<0.001,10 Mb
反向结局蛋白水平(UKB-PPP 全基因组 sumstats)
估计方法IVW(固定效应);单工具时退化为 Wald ratio
多重校正全部 142 对一起做 BH-FDR

坐标系铁律

LD 面板(1000G EUR)是 hg19,本课题数据是 hg38

  • clumping 只能按 rsID(r² 是单倍型属性,与坐标系无关)
  • 取蛋白数据只能按 hg38 的 chr:pos(UKB-PPP tar 无 rsid 列)

实测确认 FinnGen R9 与 UKB-PPP 同为 hg38(rs7903146 两侧都是 chr10:112,998,590)。

★★ 必须剔除落在蛋白自身 cis 区的反向工具

不做这一步,整个分析都是假的

试跑时 AGER × 糖网反向 p = 3.18e-26,看着像铁证。查下去发现反向工具 rs915894 距 AGER 的 cis 锚点只有 35 kb,它对 AGER 的效应 z = −17.3—— 那是 cis-pQTL 效应本身,与"疾病导致蛋白变化"毫无关系。

处理方式剩余工具数p
不剔除任何 cis 工具263.18e-26(假阳性)
只剔 ±1 Mb(早期诊断用,非最终实现)230.0715
最终规则:±1 Mb + 整个 MHC(AGER 位于 MHC)190.0325

不修的话,每一个 cis 区恰好落在疾病位点上的蛋白都会假装"反向因果", 而这恰恰是我们最关心的那批蛋白。

三个数字别混用

0.0715 只属于中间诊断步骤(当时尚未加入 MHC 整体排除)。 最终实现的操作值是 0.0325,脚本内置的回归断言校验的也是它。

:::

排除规则:cis 锚点 ±1 Mb;蛋白 cis 位于 MHC(chr6:25–34 Mb)时额外排除整个 MHC(长程 LD)。

实际剔除 379 个工具,其中 340 个来自 MHC 蛋白(涉及 49 对)。

脚本内置回归断言钉住这个病例:AGER × Retinopathy 剔除后 p 若不 >1e-3 即报错拒绝输出。 当前通过(剔 7 个工具,剩 19 个,p = 0.0325)。

二、反向工具储量

结局p<5e-8 位点去模糊回文在 LD 面板clump 后工具数
T2D_mahajan6,598−1,0145,58498
T1D_gcst44,613−6,59833,57794
Retinopathy20,655−2,88815,09127
Maculopathy16,864−2,37512,32411
Nephropathy12,320−1,7229,03810
Neuropathy9,464−1,3376,9757
NeovascGlaucoma577−993773

三、★ 最重要的一条:反向显著率主要由检验功效决定

142 对全部可算,47 对反向 FDR<0.05(33.1%)。但按结局拆开看:

结局工具数中位对数反向显著率中位 se
Neuropathy2520%0.0337
Nephropathy5911%0.0210
Maculopathy10190%0.0075
Retinopathy262425%0.0099
T1D_gcst915749%0.0038
T2D_mahajan972839%0.0106

工具数与反向显著率的 Spearman 相关 = 0.71。

阴性结果的正确读法

基础病有 90+ 个工具,能测出 |beta|≈0.008 的效应;并发症只有 2–27 个,测不出。

所以**"某并发症上反向不显著"不等于方向已确立**,同时也可能只是功效不足。 这两种解释无法用现有数据区分,必须标注为「未发现反向证据」而非「已排除反向因果」

四、A 级三个候选:方向未被推翻,但只能说"未见反向证据"

蛋白结局工具beta_revsep
IFNAR1Maculopathy11−0.00570.00700.42
APOL1Maculopathy110.00350.00670.60
ERMAPMaculopathy110.00140.00680.83

三个都不显著,正向方向没有被推翻。但按 se≈0.0068 计,这 11 个工具在 80% 把握下 只能测出 |beta| > 0.019 的反向效应——比这更小的真实反向效应测不出来。

诚实表述:未发现反向因果的证据。不能写成已排除反向因果。

五、31 个靶点蛋白里,8 对在并发症方向反向显著

蛋白分层结局工具beta_revFDR
BTN3A2C-MHC 区Retinopathy190.07749.2e-06
ITGB7D-仅 MRRetinopathy260.04191.2e-04
TIGITD-仅 MRRetinopathy260.03286.9e-03
APOEB-共定位支持但需注意Retinopathy25−0.02628.1e-03
SIGLEC5D-仅 MRRetinopathy260.01884.7e-02
BCL2L15D-仅 MRRetinopathy250.02534.0e-02
HCG22C-MHC 区Nephropathy5−0.05723.6e-02
HCG22C-MHC 区Neuropathy2−0.08844.2e-02

要点:

  • A 级三个候选不在其中,眼科主结论不受影响
  • APOE 需重点披露:它在 Retinopathy T2D 两个方向都反向显著,方向存疑
  • HCG22 那两条基于 2 个和 5 个工具,本身极不可靠,应标为证据不足而非阳性
  • BTN3A2 属 C 级 MHC,本来就带 LD 混杂标注

另有 11 对在基础病方向反向显著(APOE、NOTCH2、AGER、AIF1、LTB、MICB_MICA、 TRIM40、BCL2L15、ITGB7、PAM、SIGLEC5)。

六、正面结果:两种方法独立指向同一批蛋白

T2D 用的是 Mahajan noUKBB 版本,与暴露 UKB-PPP 无样本重叠,不受重叠偏倚影响。 该支查出 11 个反向显著蛋白,其中 APOE、NOTCH2、PAM 正是糖尿病对照分析 独立标为「糖尿病驱动」的那批。

两种方法、两条完全不同的推理路径,指向同一批蛋白——可作为正文的交叉验证。

另外 8 个反向显著蛋白:查清后不动摇任何结论

SHBG、AMY2B、TYRO3、NCAN、NCR3LG1、MDGA1、MANSC4、ROBO2

核查项结果
正向显著记录9 条,全部是 T1D/T2D 基础病,并发症 0 条
进入靶点决策表0 个
共定位支持0 个(3 个"证据不足",5 个"不支持")
出现在糖尿病对照表0 个(该表只比较并发症与糖尿病端)

它们是与糖尿病本身纠缠的蛋白,从未进入眼科候选清单,结论无需改动

顺带得到一个阳性对照

SHBG 反向最强(FDR = 2.5e-12)。性激素结合球蛋白与 2 型糖尿病的双向关系 在文献中有充分记载——方法能把它检出来,说明流水线是灵敏的。

七、必须披露的限制

一、T1D 那一支有样本重叠。 GCST90824163 含 UK Biobank(约 44.5% 样本), 而暴露 UKB-PPP 就是 UKB。反向方向上的重叠会让结果偏向观察性关联。 无法定量拆开其贡献;但 T2D 无重叠也有 39% 显著率,说明功效才是主因,重叠不是唯一原因

二、并发症的反向工具里混着糖尿病位点。 这是 R9 采用一般人群对照的必然结果。 所以"糖网 → 蛋白"严格讲是"糖尿病 + 糖网易感性 → 蛋白"。 参见 R9 对照定义的取舍

三、NeovascGlaucoma 只有 3 个工具,该支的任何结论都属证据不足。

八、产物

results/reverse_mr/
├── reverse_instruments.csv    250 条工具记录,237 个唯一位点
├── reverse_mr_results.csv     142 对的完整结果
├── _iv/<疾病>.csv             各疾病的 clump 后工具(带指纹缓存)
└── _prot/<蛋白>.csv           95 个蛋白在工具位点上的效应(带指纹缓存)

运行:Rscript analysis/35_reverse_mr.R(可断点续跑;nprot=N 试跑,force 重算)。 全量约 33 分钟,瓶颈在从 D 盘的 tar 流式提取。

个人科研与运维文档 · 内容持续修订