主题
反向 MR:疾病 → 蛋白
正向是 cis-pQTL(蛋白)→ 疾病;本分析把方向调过来,检验是否存在反向因果。
为什么现在才做:
R/12_bidirectional.R只被单对流水线run_all.R调用, 而本课题走批量筛查analysis/01_screen.R,且config.yaml里bidirectional.enabled = false——2026-07-31 核查时才发现这个缺口。 新脚本analysis/35_reverse_mr.R为批量筛查补上这一步。
一、方法
| 项 | 设定 |
|---|---|
| 反向暴露 | 疾病(R9_dm 的 7 个结局) |
| 反向工具 | 疾病 GWAS 全基因组显著位点 p<5e-8,不设 cis 窗 |
| LD clumping | plink1.9 + 1000G EUR,r²<0.001,10 Mb |
| 反向结局 | 蛋白水平(UKB-PPP 全基因组 sumstats) |
| 估计方法 | IVW(固定效应);单工具时退化为 Wald ratio |
| 多重校正 | 全部 142 对一起做 BH-FDR |
坐标系铁律
LD 面板(1000G EUR)是 hg19,本课题数据是 hg38:
- clumping 只能按 rsID(r² 是单倍型属性,与坐标系无关)
- 取蛋白数据只能按 hg38 的 chr:pos(UKB-PPP tar 无 rsid 列)
实测确认 FinnGen R9 与 UKB-PPP 同为 hg38(rs7903146 两侧都是 chr10:112,998,590)。
★★ 必须剔除落在蛋白自身 cis 区的反向工具
不做这一步,整个分析都是假的
试跑时 AGER × 糖网反向 p = 3.18e-26,看着像铁证。查下去发现反向工具 rs915894 距 AGER 的 cis 锚点只有 35 kb,它对 AGER 的效应 z = −17.3—— 那是 cis-pQTL 效应本身,与"疾病导致蛋白变化"毫无关系。
| 处理方式 | 剩余工具数 | p |
|---|---|---|
| 不剔除任何 cis 工具 | 26 | 3.18e-26(假阳性) |
| 只剔 ±1 Mb(早期诊断用,非最终实现) | 23 | 0.0715 |
| 最终规则:±1 Mb + 整个 MHC(AGER 位于 MHC) | 19 | 0.0325 |
不修的话,每一个 cis 区恰好落在疾病位点上的蛋白都会假装"反向因果", 而这恰恰是我们最关心的那批蛋白。
三个数字别混用
0.0715 只属于中间诊断步骤(当时尚未加入 MHC 整体排除)。 最终实现的操作值是 0.0325,脚本内置的回归断言校验的也是它。
:::
排除规则:cis 锚点 ±1 Mb;蛋白 cis 位于 MHC(chr6:25–34 Mb)时额外排除整个 MHC(长程 LD)。
实际剔除 379 个工具,其中 340 个来自 MHC 蛋白(涉及 49 对)。
脚本内置回归断言钉住这个病例:AGER × Retinopathy 剔除后 p 若不 >1e-3 即报错拒绝输出。 当前通过(剔 7 个工具,剩 19 个,p = 0.0325)。
二、反向工具储量
| 结局 | p<5e-8 位点 | 去模糊回文 | 在 LD 面板 | clump 后工具数 |
|---|---|---|---|---|
| T2D_mahajan | 6,598 | −1,014 | 5,584 | 98 |
| T1D_gcst | 44,613 | −6,598 | 33,577 | 94 |
| Retinopathy | 20,655 | −2,888 | 15,091 | 27 |
| Maculopathy | 16,864 | −2,375 | 12,324 | 11 |
| Nephropathy | 12,320 | −1,722 | 9,038 | 10 |
| Neuropathy | 9,464 | −1,337 | 6,975 | 7 |
| NeovascGlaucoma | 577 | −99 | 377 | 3 |
三、★ 最重要的一条:反向显著率主要由检验功效决定
142 对全部可算,47 对反向 FDR<0.05(33.1%)。但按结局拆开看:
| 结局 | 工具数中位 | 对数 | 反向显著率 | 中位 se |
|---|---|---|---|---|
| Neuropathy | 2 | 5 | 20% | 0.0337 |
| Nephropathy | 5 | 9 | 11% | 0.0210 |
| Maculopathy | 10 | 19 | 0% | 0.0075 |
| Retinopathy | 26 | 24 | 25% | 0.0099 |
| T1D_gcst | 91 | 57 | 49% | 0.0038 |
| T2D_mahajan | 97 | 28 | 39% | 0.0106 |
工具数与反向显著率的 Spearman 相关 = 0.71。
阴性结果的正确读法
基础病有 90+ 个工具,能测出 |beta|≈0.008 的效应;并发症只有 2–27 个,测不出。
所以**"某并发症上反向不显著"不等于方向已确立**,同时也可能只是功效不足。 这两种解释无法用现有数据区分,必须标注为「未发现反向证据」而非「已排除反向因果」。
四、A 级三个候选:方向未被推翻,但只能说"未见反向证据"
| 蛋白 | 结局 | 工具 | beta_rev | se | p |
|---|---|---|---|---|---|
| IFNAR1 | Maculopathy | 11 | −0.0057 | 0.0070 | 0.42 |
| APOL1 | Maculopathy | 11 | 0.0035 | 0.0067 | 0.60 |
| ERMAP | Maculopathy | 11 | 0.0014 | 0.0068 | 0.83 |
三个都不显著,正向方向没有被推翻。但按 se≈0.0068 计,这 11 个工具在 80% 把握下 只能测出 |beta| > 0.019 的反向效应——比这更小的真实反向效应测不出来。
诚实表述:未发现反向因果的证据。不能写成已排除反向因果。
五、31 个靶点蛋白里,8 对在并发症方向反向显著
| 蛋白 | 分层 | 结局 | 工具 | beta_rev | FDR |
|---|---|---|---|---|---|
| BTN3A2 | C-MHC 区 | Retinopathy | 19 | 0.0774 | 9.2e-06 |
| ITGB7 | D-仅 MR | Retinopathy | 26 | 0.0419 | 1.2e-04 |
| TIGIT | D-仅 MR | Retinopathy | 26 | 0.0328 | 6.9e-03 |
| APOE | B-共定位支持但需注意 | Retinopathy | 25 | −0.0262 | 8.1e-03 |
| SIGLEC5 | D-仅 MR | Retinopathy | 26 | 0.0188 | 4.7e-02 |
| BCL2L15 | D-仅 MR | Retinopathy | 25 | 0.0253 | 4.0e-02 |
| HCG22 | C-MHC 区 | Nephropathy | 5 | −0.0572 | 3.6e-02 |
| HCG22 | C-MHC 区 | Neuropathy | 2 | −0.0884 | 4.2e-02 |
要点:
- A 级三个候选不在其中,眼科主结论不受影响
- APOE 需重点披露:它在 Retinopathy 和 T2D 两个方向都反向显著,方向存疑
- HCG22 那两条基于 2 个和 5 个工具,本身极不可靠,应标为证据不足而非阳性
- BTN3A2 属 C 级 MHC,本来就带 LD 混杂标注
另有 11 对在基础病方向反向显著(APOE、NOTCH2、AGER、AIF1、LTB、MICB_MICA、 TRIM40、BCL2L15、ITGB7、PAM、SIGLEC5)。
六、正面结果:两种方法独立指向同一批蛋白
T2D 用的是 Mahajan noUKBB 版本,与暴露 UKB-PPP 无样本重叠,不受重叠偏倚影响。 该支查出 11 个反向显著蛋白,其中 APOE、NOTCH2、PAM 正是糖尿病对照分析 独立标为「糖尿病驱动」的那批。
两种方法、两条完全不同的推理路径,指向同一批蛋白——可作为正文的交叉验证。
另外 8 个反向显著蛋白:查清后不动摇任何结论
SHBG、AMY2B、TYRO3、NCAN、NCR3LG1、MDGA1、MANSC4、ROBO2
| 核查项 | 结果 |
|---|---|
| 正向显著记录 | 9 条,全部是 T1D/T2D 基础病,并发症 0 条 |
| 进入靶点决策表 | 0 个 |
| 共定位支持 | 0 个(3 个"证据不足",5 个"不支持") |
| 出现在糖尿病对照表 | 0 个(该表只比较并发症与糖尿病端) |
它们是与糖尿病本身纠缠的蛋白,从未进入眼科候选清单,结论无需改动。
顺带得到一个阳性对照
SHBG 反向最强(FDR = 2.5e-12)。性激素结合球蛋白与 2 型糖尿病的双向关系 在文献中有充分记载——方法能把它检出来,说明流水线是灵敏的。
七、必须披露的限制
一、T1D 那一支有样本重叠。 GCST90824163 含 UK Biobank(约 44.5% 样本), 而暴露 UKB-PPP 就是 UKB。反向方向上的重叠会让结果偏向观察性关联。 无法定量拆开其贡献;但 T2D 无重叠也有 39% 显著率,说明功效才是主因,重叠不是唯一原因。
二、并发症的反向工具里混着糖尿病位点。 这是 R9 采用一般人群对照的必然结果。 所以"糖网 → 蛋白"严格讲是"糖尿病 + 糖网易感性 → 蛋白"。 参见 R9 对照定义的取舍。
三、NeovascGlaucoma 只有 3 个工具,该支的任何结论都属证据不足。
八、产物
results/reverse_mr/
├── reverse_instruments.csv 250 条工具记录,237 个唯一位点
├── reverse_mr_results.csv 142 对的完整结果
├── _iv/<疾病>.csv 各疾病的 clump 后工具(带指纹缓存)
└── _prot/<蛋白>.csv 95 个蛋白在工具位点上的效应(带指纹缓存)运行:Rscript analysis/35_reverse_mr.R(可断点续跑;nprot=N 试跑,force 重算)。 全量约 33 分钟,瓶颈在从 D 盘的 tar 流式提取。