Skip to content

MHC 区为什么是假阳性雷区

本课题的结果里 MHC 出现频率极高——"MR 前五全是 chr6 MHC 区 LD 假象被判否"、 "AGER 在 MHC 区多效性极强"、"通过 HEIDI 的 AGER 与 TNXB 均落在 MHC"。 这一页解释 MHC 是什么、为什么它专门制造假阳性,以及本课题哪些靶点落在里面。

★ 2026-08-06 口径变更:本页第 4 节「我们的处理方式」已作废

本页第 4 节写的是**"不预先剔除 + 披露 + 让共定位裁决"**。该做法已于 2026-08-06 更改为 在工具选择阶段排除 chr6:26–34Mb,依据是 proteome-wide MR 奠基作 Zheng et al. Nat Genet 2020;52:1122 的方法原文:

"we removed SNPs and proteins coded for by genes within the MHC region (chr6: from 26Mb to 34Mb)" —— Methods, Instrument Selection

同时 Krishna et al. Nat Commun 2024;15:6469 指出标准 fine-mapping 与共定位方法 在 MHC 区本身就不适用,即"让共定位裁决"这条路在该区域不成立。

本页第 1–3、5 节(机制解释与实测数据)仍然有效, 处理方式请以 → 分析流程与文献依据(2026-08-06 定稿) 为准。


1. MHC 是什么

MHC = Major Histocompatibility Complex,主要组织相容性复合体,在人类又叫 HLA 区 (Human Leukocyte Antigen,人白细胞抗原)。它是人 6 号染色体短臂上一段约 4 Mb 的连续区域chr6:28.5–33.4 Mb,GRCh37),编码免疫系统识别"自己 vs 非己"的核心分子。

经典 MHC扩展 MHC(xMHC)
坐标(GRCh37)chr6:28,477,797–33,448,354chr6:25,726,063–33,400,644
长度≈ 5.0 Mb≈ 7.7 Mb
内容HLA-A/B/C(I 类)、HLA-DR/DQ/DP(II 类)、补体 C4/CFB/C2(III 类)等再向外扩,含组蛋白簇、BTN 基因家族等

它是全基因组关联信号最密集的区域:自身免疫病(1 型糖尿病、类风湿、乳糜泻)、 感染易感性、多种癌症的最强信号几乎都在这里。


2. 为什么它专门制造假阳性

三个性质叠加,恰好把 MR / 共定位的前提全部打破:

① 超长连锁不平衡(LD)块 —— 这是最要命的

一般基因组区域的 LD 块是几十 kb,MHC 里可以长达数 Mb:整段区域以"祖先单倍型" (ancestral haplotype,如 8.1AH)的形式整体遗传,几百个基因锁在一起共同传递。

后果:同一个 LD 块里的两个信号,"看起来共定位"是常态,而不是证据。 共定位(coloc / HyPrColoc)的核心假设是"如果两个性状共享同一个因果变异, 它们的关联信号形状应该重合"。但在 MHC 里,几百个不同的因果变异会因为共处一个 长单倍型而信号形状天然重合——这正是 coloc 分不出 H4(共享因果变异)与 H3(各有因果变异、只是 LD 相连)的场景。

这就是我们的结果里「MR 最强的前五名蛋白,共定位一个都没通过」的原因—— 不是共定位算错了,是共定位在正确地拒绝 LD 假象。

② 极端多态性

HLA 基因是人类基因组中变异最多的基因,HLA-B 一个基因就有数千种等位型。 参考面板(如 1000 Genomes EUR)对这种多态性的覆盖天然不足, LD 估计、等位基因对齐、imputation 质量在这一区都比别处差。

③ 极端多效性(pleiotropy)

一个 MHC 变异同时关联几十上百种性状是常态。这直接违反 MR 的第三条核心假设 (排他性限制:工具只能通过暴露影响结局,不能有别的通路)。

本课题实测(PheWAS,OpenGWAS 50,164 个数据集,Bonferroni 阈值 8.52×10⁻⁹):

蛋白位置通过 Bonferroni 的关联数 / 性状数
AGERchr6:32,155,581(MHC 经典)427 / 321
HLA-DRAMHC 经典330 / 260
BTN2A1chr6:26,498,758(扩展 MHC)308 / 240
对照:TNFRSF10Achr8(非 MHC)7 / 6
对照:SPRY2chr13(非 MHC)0 / 0

差了两个数量级。这不是"AGER 比较重要",而是"AGER 的工具 SNP 标记的是一整段 免疫单倍型,它跟什么都相关"。


3. 本课题哪些靶点落在 MHC

用本地 LD 面板 EUR.bim(GRCh37)对 117 个工具 SNP 逐个查坐标,实测结果:

全部 119 个显著蛋白中,18 个落在 MHC / 扩展 MHC: AGER、AIF1、ATP6V1G2、BTN1A1、BTN2A1、CDSN、CFB、DDR1、DXO、HCG22、 HLA-DRA、HLA-E、LTA、LTB、MICB_MICA、MOG、TNXB、TRIM40。

★ 关键发现:跨并发症"共享蛋白"几乎全是 MHC

在 ≥3 个糖尿病并发症中同时显著的 5 个蛋白,全部在 MHC 区内

蛋白工具 SNP位置(GRCh37)区域命中并发症数
AGERrs204993chr6:32,155,581MHC 经典4
HCG22rs2905757chr6:31,022,828MHC 经典4
BTN2A1rs72843784chr6:26,498,758扩展 MHC4
CFBrs641153chr6:31,914,180MHC 经典3
LTBrs2395470chr6:31,235,261MHC 经典3

命中 2 个并发症的 7 个蛋白里,也有 6 个在 MHC(唯一例外是 SIGLEC5,chr19)。

解读铁律:这个"共享"不能读成"5 个蛋白同时驱动多种糖尿病并发症"。 更可能的解释是——同一段 MHC 单倍型同时与多个并发症相关, 而这 5 个蛋白只是碰巧其 cis 区落在这段单倍型上的"路标"。 真正的因果分子可能是这一区里的任何一个(甚至是 HLA 本身)。


4. 我们的处理方式

环节做法
不预先剔除MHC 蛋白照常进筛查,结果如实呈现——直接删会构成选择性报告
靠共定位裁决让 coloc / HyPrColoc 去判 —— 本课题 MR 前五全部被判为 LD 假象(coloc_support=False),这恰恰是流程有效的证明
靠 SMR-HEIDI 交叉验证HEIDI 检验专门用于区分"共享因果变异"与"LD 连锁";但通过 HEIDI 也不等于洗白——AGER 与 TNXB 通过了 HEIDI,仍因位于 MHC 而被我们降级
靠 PheWAS 量化多效性脱靶关联数直接暴露多效性强度(AGER 427 vs TNFRSF10A 7)
写作时必须披露凡涉及 MHC 靶点的结论,一律标注"位于 MHC 区,LD 与多效性混杂不可排除"

⚠️ 一个常见误区:有些流水线选择直接把 chr6:25–34 Mb 整段剔除。 这在方法学上可接受(很多自身免疫 MR 论文这么做),但要在方法学里明写。 本课题选择保留 + 披露 + 让共定位裁决,理由是 AGER-RAGE 通路本身就是 糖尿病微血管损伤的经典机制,直接删掉会丢失一条有生物学先验的线索。


5. 一句话总结

MHC 是一段 6 号染色体上约 4 Mb 的免疫基因密集区。它的 LD 块超长、多态性极端、 多效性极强——这三条恰好把 MR 的"无混杂"和共定位的"信号形状可区分"两个前提同时打破。 所以 MHC 里出现强关联是常态,而强关联在这里几乎不构成因果证据。

在本课题里,这句话的具体含义是:AGER 是 DR 侧 MR 信号最强的蛋白(p=5.6×10⁻⁶¹), 但它同时是脱靶最严重(427 个关联)、共定位被判否的蛋白。 它可以作为"通路层面的线索"来讲(AGE-RAGE 是糖尿病微血管损伤的教科书机制), 但不能作为"经过遗传学验证的因果药靶"来讲。


相关

个人科研与运维文档 · 内容持续修订