主题
分析流程定稿 v2 · MHC 留而标注
这一页是当前唯一有效的流程定稿。 做任何靶点 MR 分析之前先读这一页。
与旧页的关系:分析流程与文献依据(2026-08-06 初版)保留不动,作为历史记录,不再更新。两页冲突时以本页为准。
⚠️ 最大变更:初版在第 1 相设了「④ 排除 MHC chr6:26–34Mb」。 本版取消该步骤——MHC 区蛋白照常进入分析,但在共定位之后单列为不可解释层, 不进入靶点提名。理由见 §2。
本版相对初版的其他修订:① 新增第 0 相(性状层 QC)② 通路富集画成第 2 相旁路 ③ 4-1 / 4-2 对调 ④ 只标注项独立成第 5 相并重排
每一步的查证过程、我判错并被纠正的地方 → 流程答疑
一、流程图
二、MHC:为什么不在工具选择阶段删,改为留而标注
这是本课题争议最久的一处。结论:不设排除步骤,改为在共定位之后单列。
2.1 "剔除 MHC"不是规范条目,只是高频惯例
几乎所有 pQTL-MR 论文的"排除 MHC"都可回溯到同一处——Zheng et al. Nat Genet 2020 工具选择节(已逐字核对):
"Due to the complex LD structure of SNPs within the human Major Histocompatibility Complex (MHC) region, we removed SNPs and proteins coded for by genes within the MHC region (chr6: from 26Mb to 34Mb)."
⚠️ 但这是一项研究的操作决定,不是方法学论证。Zheng 等人从未做过"删 vs 不删"的对比来证明必须删。
决定性旁证:2026 年 Int J Epidemiol 更新版系统综述识别出 29 个 MR 质量/偏倚评估工具, 覆盖 IV1/IV2/IV3 三大假设、工具选择、人群分层、敏感性分析、样本重叠等, MHC 处理不在任何一个工具的条目里(Yu J, et al. 2026, PMID 41999635)。
→ 既然不是规范要求,删或不删都需要自己给理由。我们选择不删,并给出机制。
2.2 删掉会付出的具体代价
| 会被删掉的 | 为什么是代价 |
|---|---|
| AGER(RAGE) chr6:32.18 Mb | AGE–RAGE 轴是糖尿病并发症最教科书级的分子通路;且它在本课题按 z 检验是头号命中 |
| CFB / C2 / C4A / C4B MHC III 区 | 补体是 AMD 最确证的因果通路,pegcetacoplan、avacincaptad pegol 正是已上市的补体靶向药 |
| 另 20 余个 MHC 编码蛋白 | 本课题工具池内共 26 个蛋白落在 26–34 Mb |
机械删除会招致"你把该病最确证的通路删了"这一实质性质疑,而这在眼科/内分泌方向的审稿人眼里是缺陷,不是保守。
2.3 但也不能沉默地留着——必须配机制
文献里有意识保留 MHC 的论文都配了额外机制,这才是可辩护的"不删":
- SSNS 蛋白组 MR(medRxiv 2025):核心发现 TNXB 就在 MHC 内,用 HLA 等位基因做共定位
- DMARD → AD 靶点 MR:靶点含 TNF(MHC III 区),若剔除则英夫利昔/依那西普整条线索消失
本课题的机制是"共定位不可解释 → 单列成节 → 不进靶点提名",理由来自我们自己的数据:
| 本课题实测 | 结果 |
|---|---|
| 共定位「无法判定」最宽档 36 对 | 100% 是 MHC |
| SuSiE 版共定位 | 因 LD 面板失配整体降级(s 中位 0.827) |
| MHC 蛋白平均横跨的并发症数 | 2.7 个 |
| 非 MHC 蛋白平均横跨的并发症数 | 1.35 个 |
| 31 个显著蛋白一起跑富集 | 头号 immune response p = 7.2e-07 |
| 只留 20 个非 MHC 蛋白 | 免疫信号完全消失(最好 p = 0.047),变成脂蛋白颗粒 |
"横跨多个并发症"正是长程 LD 假象的签名;而共定位在该区域给不出可解释的后验概率, 是因为 coloc.abf 的单因果变异假设在 MHC 几乎必然被违反 (Krishna 2024 Nat Commun 15:6469 亦记录标准 fine-mapping 与共定位在该区不适用)。
这个设计比"删掉"提供的信息更多
删掉 → 我们看不到 MHC 结果,只能声称它不可靠。 留而标注 → 我们展示 MHC 结果,并用数据证明它不可解释。
Methods 可以这样写:
鉴于"剔除 MHC 区"虽为高频惯例但未见于任何一个 MR 质量评估工具,且其必要性此前未经正式检验 (Zheng 2020 未做删/不删对比),我们保留 MHC 区蛋白全程参与分析,并在共定位后将其单列为 一个预先声明的不可解释层:该层不参与靶点提名,但全部结果予以报告。 支持该处理的本数据集证据为:共定位无法判定的关联 100% 来自该区域; MHC 蛋白平均横跨 2.7 个并发症而非 MHC 为 1.35 个;全组免疫通路富集完全由该层承载 (剔除后 p 由 7.2e-07 退至 0.047)。
2.4 坐标:必须写明区间 + build
文献里至少四套坐标在流通(26–34 Mb / 28.48–33.45 Mb / 29–33 Mb / 25–34 Mb 扩展 MHC), 同一句"排除 MHC 区"在不同论文里涉及的基因数差别很大。方法学必须写明区间与 build。
本课题实测(Ensembl REST;UKB-PPP 哨兵表同时带 hg19 与 hg38 坐标):
cis 工具行 1955 / 蛋白 1954
按 chr6:26–34Mb 筛,hg19 命中 26 个蛋白
按 chr6:26–34Mb 筛,hg38 命中 26 个蛋白
两者差集 = 空→ 两个 build 得到同一批 26 个蛋白,本课题无需 liftover。 这一条要写进 Methods。
⚠️ 注意坐标选择的实际后果:BTN3A2(26.37 Mb)与 BTN2A1(26.46 Mb)在 26–34 与 25–35 区间内, 但不在 29–33 区间内。用哪套坐标,MHC 层的成员就不同。本课题采用 26–34 Mb(GRCh38)。
2.5 与最像的一篇同类研究的关系
本课题的方法学切入点
Yuan S, et al. Cell Rep Med 2023(PMID 37652020) 与本课题设计几乎一比一 (UKB-PPP 54,306 + deCODE 35,559、1,886 蛋白、cis only、FinnGen 10 个糖尿病并发症、 MR + 共定位 + 反向 MR + 复制)。
其头号并发症结论是:"HLA-DRA, AGER, HSPA1A, and HSPA1B are associated with most microvascular complications."
Ensembl REST 实测(GRCh38):HLA-DRA 32.44 Mb · AGER 32.18 Mb · HSPA1A 31.82 Mb · HSPA1B 31.83 Mb —— 四个全部落在 26–34 Mb 内;其反向 MR 结果中的 MICB(31.49 Mb)亦然。
而该文全文检索 "MHC"、"chromosome 6"、"long-range LD"、"extended LD" 零命中, 局限性 6 条中无一条涉及 MHC/LD 结构;并发症端共定位支持薄弱被归因于 "possibly due to limited statistical power",而非 LD。
⚠️ 上述否定性判断经两次不同问法的检索一致,但尚未逐字通读原文,写入正文前必须自读确认。
★ 同一批作者(Yuan / Larsson / Li)在 2024 年乳糜泻表型组 MR(EBioMedicine, PMID 38382313)中 做了剔除 MHC 的敏感性分析,据此判定 1 型糖尿病与非霍奇金淋巴瘤的关联 "attenuated when excluding SNPs in the MHC region"、属共享遗传结构而非因果。 同一团队在免疫病里做了、在糖尿病并发症里没做——这个对比可直接写进讨论。
我们保留 MHC 的设计恰好让这个论证更直接:MHC 蛋白就在我们的结果表里, 我们可以并排展示"我们复现了他们的 AGER 等信号"与"这些信号不可用标准共定位解释", 而不必从被删掉的数据里回溯。
三、每步依据与强度
本表相对初版下调了两处过度评级
初版把「排除 MHC」标为强、把「富集位置」标为强·三篇一致。 经 2026-08-06 复查:前者只是惯例(非规范条目,见 §2.1),后者文献实际分两派(见下)。已改。
| 步骤 | 依据 | 强度 |
|---|---|---|
| 0 位置:LDSC 放 MR 之前的性状层 | 两篇实际排法:Results 首节 post-GWAS 分析(BCC scTWAS);遗传相关排第 1、MR 排第 4(乳腺癌×精神);MRC IEU 词典亦述 LDSC 可识别值得 MR 跟进的关系 | 中 · 惯例一致 |
| 0 用法:rg 用作数据源身份核验、不合格则退役数据源 | 定向检索未找到先例。本课题实例:换 T1D 源后 rg(T1D,T2D) 由 0.886 → 0.087 | 弱 · 自行声明 |
| 1① 统一坐标 build 必须最先 | Zheng 2020 原文:"We first mapped SNPs to genome build GRCh37.p13 coordinates and then used the following criteria…" | 强 |
| 1②③ cis 窗口 · F≥10 · clumping · Steiger filtering | 多篇一致(Schmidt 2020 的 cis 框架;GBMI 工具层含 Steiger filtering) | 强 |
| 1 不设 MHC 排除 | 该惯例非规范条目(29 个 MR 质量评估工具均无此条)且未经删/不删对比检验;有意识保留者须配机制(SSNS 用 HLA 等位基因共定位)——本课题配"共定位不可解释层" | 惯例存在分歧 · 自行声明并配机制 |
| 2 MR + 多重检验校正 | 全部文献一致 | 强 |
| 3 共定位 | Zheng 2020:413 个 MR 关联中 130 个(31.5%)在此被否;MR+coloc 双支持的靶点-适应症对更可能获批 | 最强 |
| 3 后 MHC 分层 | 依据为本数据集实测(无法判定 100% 来自 MHC、SuSiE 因 LD 失配降级、横跨 2.7 vs 1.35)+ Krishna 2024 记录标准共定位在 MHC 不适用 | 中 · 本课题实测 + 一篇机制文献 |
| 4-1 Steiger 方向性 / 反向 MR | 绝对位置文献不统一,但"先于复制"有出处:Zheng 2020 次序为反向因果 → 跨研究复制;GBMI 更把 Steiger 提到工具层 | 中 · 相对次序有据 |
| 4-2 外部复制 | 位置不统一(共定位前/后都有) | 弱 · 自行声明 |
| 5-1 / 5-2 / 5-4 pheWAS / 成药性 / 表达 | 一致:均在收窄后、只对个位数候选做。Zheng 2020 的成药性注释套在"MR+共定位双支持"结果上;GBMI 把药物库/试验/伪影标记列为最后一步 annotation only | 强 |
| 5-3 跨组学「只能加分不能扣分」 | 文献几乎不讨论跨组学能否否决。本课题实测:跨层顶信号常非同一变异(r² 仅 0.095 / 0.031);IFNAR1 视网膜层完全阴性而其为证据最硬候选 | 弱 · 自行声明(规则由本课题实测确立) |
| 5-3 → 5-4 次序 | 无文献可依;按"谁先出结果、谁用来解释"自定 | 弱 · 自行声明 |
| 通路富集跑 MR 显著集、不参与筛选 | ⚠️ 文献分两派:A 派跑全部显著集、位置在 MR 后(Yuan 2023 用 GeneMANIA 跑 47 个显著蛋白,位置在反向 MR 之前;PLOS Genetics COVID 跑全部显著蛋白、写在 Discussion);B 派跑筛完的优先集、位置在方向性之后(CHD/MI 跑 13+7 个,排 Results 第 7 节)。本课题选 A 派:存活者仅个位数(3 个基因无法做通路富集),且富集在本课题承担 MHC 诊断功能 | 中 · 分两派,本课题理由充分 |
| 通路富集按 MHC 分组跑 | 定向检索未找到先例。是支撑 §2.3 的核心证据,属主结果而非附属 | 弱 · 自行声明 |
四、报告方式
正文写漏斗(每步剩多少 + 重点讨论存活者),完整结果表进补充材料且不贴 A/B/C/D 标签。
MHC 层单独成节,与主漏斗并列呈现——这是"留而标注"能成立的前提: 不报告 ≠ 不分析,分析过程中一条记录都不能删。
| 过了哪些 | 只能说 | 不能说 |
|---|---|---|
| 只过 MR | "存在关联"、"一个候选" | 任何"因果"字眼 |
| + 共定位 | "与共享同一因果变异一致" | "因果"、"靶点" |
| + 跨平台方向一致 | "在不同检测技术间一致" | "已复制"、"已验证" |
| + 全部关卡 | "我们提名 X 为候选药物靶点" | "我们确认 X 是因果的" |
| MHC 层 | "在标准共定位框架下不可解释" | 任何提名或因果表述 |
五、开跑前自检
- 这一步有没有否决权? 有 → 必须进漏斗计数;没有 → 只标注,不许拿它剔候选
- 顺序对不对? 第 1 相①最先;4-1 在 4-2 前;第 5 相在第 4 相后
- 缓存指纹涵盖这次改的参数了吗? 换口径不改指纹 = 静默复用旧产物(已踩过两次)
- MHC 标记算对了吗? 按坐标算、不用蛋白名硬编码;26 个应全部命中,逐个断言
- MHC 层是否被误当成筛选? 它退出提名,但必须出现在结果里
- 我要写的这句话,证据层级够到哪一档?
六、参考文献(全部经 PubMed 核对,附 PMID)
方法学来源
- Zheng J, Haberland V, Baird D, et al. Phenome-wide Mendelian randomization mapping the influence of the plasma proteome on complex diseases. Nat Genet. 2020;52(10):1122–1131. PMID 32895551 · PMC7610464 · doi:10.1038/s41588-020-0682-6
- Zhao H, Rasheed H, Nøst TH, et al. Proteome-wide Mendelian randomization in global biobank meta-analysis reveals multi-ancestry drug targets for common diseases. Cell Genomics. 2022;2. PMID 36388766 · PMC9646482
- Schmidt AF, Finan C, Gordillo-Marañón M, et al. Genetic drug target validation using Mendelian randomisation. Nat Commun. 2020;11:3255. PMID 32591531
- Zuber V, Grinberg NF, Gill D, et al. Combining evidence from Mendelian randomization and colocalization: review and comparison of approaches. Am J Hum Genet. 2022;109(5):767–782. PMID 35452592
- Lin Z, Xue H, Pan W. A robust cis-Mendelian randomization method with application to drug target discovery (cisMR-cML). Nat Commun. 2024;15:6072. PMID 39025905 · doi:10.1038/s41467-024-50385-y
⚠️ 此文常被误引为「Chen X 等」,第一作者实为 Lin Z,卷页 15:6072。
- Hukerikar N, Hingorani AD, Finan C, Schmidt AF. Prioritising genetic findings for drug target identification and validation. Atherosclerosis. 2024;390:117462. PMID 38325120
- Common pitfalls in drug target Mendelian randomization and how to avoid them. BMC Medicine. 2024. PMC11481744
质量评估与报告规范
- Yu J, et al. Structured tools for assessing quality and risk of bias in Mendelian randomization studies: an updated systematic review. Int J Epidemiol. 2026;55. PMID 41999635
识别出 29 个结构化评估工具,MHC 处理不在任何一个的条目里——本页 §2.1 的核心依据。
- Guidelines for Mendelian randomisation studies — Diabetologia. 期刊公开指南页(社论正文付费墙:doi:10.1007/s00125-025-06484-6)
要求 STROBE-MR 清单 + 三角验证框架,并指出共定位、反向 MR、功能富集"一般不算独立方法"。
MHC 相关
- Krishna C, et al. The influence of HLA genetic variation on plasma protein expression. Nat Commun. 2024;15:6469. PMID 39085222
504 个蛋白受 HLA 变异影响、94.8% 为 trans、机制为抗原呈递;标准 fine-mapping 与共定位在该区不适用——本页 §2.3 的机制依据。
- Fernando MM, Stevens CR, Walsh EC, De Jager PL, Goyette P, Plenge RM, Vyse TJ, Rioux JD. Defining the role of the MHC in autoimmunity: a review and pooled analysis. PLoS Genet. 2008;4(4):e1000024. PMID 18437207 · PMC2291482
MHC 约 250 个基因、30 年研究汇总(MS/T1D/SLE/UC/CD/RA)。⚠️ 该文与 MR、因果推断、工具变量选择无关,不可用于论证 MR 中 MHC 的处理方式。
同类研究(对照)
- Yuan S, Xu F, Li X, Chen J, Zheng J, Mantzoros CS, Larsson SC. Plasma proteins and onset of type 2 diabetes and diabetic complications: proteome-wide Mendelian randomization and colocalization analyses. Cell Rep Med. 2023;4(9):101174. PMID 37652020 · PMC10518626
- Yuan S, Jiang F, Chen J, Lebwohl B, Green PHR, Leffler D, Larsson SC, Li X, Ludvigsson JF. Phenome-wide Mendelian randomization analysis reveals multiple health comorbidities of coeliac disease. EBioMedicine. 2024;101:105033. PMID 38382313
⚠️ 此文常被误引为「Elvers 等人关于克罗恩病的研究」——作者列表无 Elvers,病种为乳糜泻。
- Proteome-wide MR identifies causal links between blood proteins and severe COVID-19. PLOS Genetics. doi:10.1371/journal.pgen.1010042(富集跑全部显著蛋白、写在 Discussion)
- Comprehensive Mendelian randomization analysis of plasma proteomics for coronary heart disease and myocardial infarction. J Transl Med. 2024. PMID 38689297 · PMC11061979(富集跑 13+7 个优先蛋白、排 Results 第 7 节)
七、未决事项
- [ ] 逐字通读 Yuan 2023(PMC10518626)STAR Methods 与补充表 S9:确认 MHC 确无处理、抠出 17 个并发症蛋白完整名单逐个对照、核 HSPA1A/1B 在其富集结论中的权重
- [ ] 核实 GBMI 是否真的"保留全部工具变量并以分层标注 MHC"(此说法未能在其方法节证实;tier 1/2/3 系 Zheng 2020 的工具特异性分层,非按 MHC 分)
- [ ] 核实 Diabetologia 指南中「避免按 F 统计量排除工具」一条(若属实,与本页第 1 相③冲突)
- [ ] MVMR / 两步中介:正式分解"糖尿病驱动 vs 并发症特异"(当前只有并排对比)
- [ ] 阳性对照:确认流水线能在糖网端 recover 已知为真的信号
- [ ] LDSC 截距估计样本重叠(MRlap),处理 T1D 源含 UKB 5–6% 重叠
- [ ] 代码侧:
32_targets_table.R的in_MHC由蛋白名硬编码改为按坐标计算;29_enrichment.R的分组同理