Skip to content

分析流程定稿 v2 · MHC 留而标注

这一页是当前唯一有效的流程定稿。 做任何靶点 MR 分析之前先读这一页。

与旧页的关系分析流程与文献依据(2026-08-06 初版)保留不动,作为历史记录,不再更新。两页冲突时以本页为准。

⚠️ 最大变更:初版在第 1 相设了「④ 排除 MHC chr6:26–34Mb」。 本版取消该步骤——MHC 区蛋白照常进入分析,但在共定位之后单列为不可解释层, 不进入靶点提名。理由见 §2。

本版相对初版的其他修订:① 新增第 0 相(性状层 QC)② 通路富集画成第 2 相旁路 ③ 4-1 / 4-2 对调 ④ 只标注项独立成第 5 相并重排

每一步的查证过程、我判错并被纠正的地方 → 流程答疑


一、流程图

0性状层 QC / 数据验收LDSC 遗传相关 rg · 输入断言(频率方向 · 样本量 · build)★ 否决的是数据源1工具选择单位是「变异」,全部发生在 MR 之前① 统一坐标 build(必须最先:②③ 都按坐标划范围)② cis 窗口 ±500kb③ F ≥ 10 · clumping · Steiger filtering★ 本版不设 MHC 排除步骤MHC 蛋白照常进入分析,在第 3 相之后单列2MR + 多重检验校正检验数 = 本结局实际报告的蛋白数(MHC 蛋白计入分母)通路富集★ 按 MHC 分组跑只描述 · 不筛选3共定位Zheng 2020 实测:31.5% 的 MR 关联在此被判为假输出按 MHC 归属分流 →MHC 层 26–34Mb共定位不可解释单列成节 · 不提名全部记录保留↓ 只喂给定稿非 MHC 蛋白继续4否决性检验会改变候选名单 —— 漏斗计数到此为止4-1方向性 / 反向 MR是蛋白导致病,还是病导致蛋白?★ 否决权 · 计入漏斗4-2外部复制不一致先查 PAV / 表位伪影,再判否决★ 否决权 · 计入漏斗5描述性注释只对第 4 相存活者做 —— 不剔除任何候选,正文只报存活者5-1 on-target pheWAS只标注5-2 成药性只标注5-3 跨组学定向验证只标注 · 只能加分5-4 组织 / 单细胞表达只标注 · 查表6定稿正文写漏斗 + 重点讨论存活者;MHC 层与富集单列成节,不贴 A/B/C/D虚线 = 不进靶点漏斗。第 0 相 LDSC 否决的是「数据源」;富集什么都不否决;MHC 层退出提名但全部记录保留并单独报告。

二、MHC:为什么不在工具选择阶段删,改为留而标注

这是本课题争议最久的一处。结论:不设排除步骤,改为在共定位之后单列。

2.1 "剔除 MHC"不是规范条目,只是高频惯例

几乎所有 pQTL-MR 论文的"排除 MHC"都可回溯到同一处——Zheng et al. Nat Genet 2020 工具选择节(已逐字核对):

"Due to the complex LD structure of SNPs within the human Major Histocompatibility Complex (MHC) region, we removed SNPs and proteins coded for by genes within the MHC region (chr6: from 26Mb to 34Mb)."

⚠️ 但这是一项研究的操作决定,不是方法学论证。Zheng 等人从未做过"删 vs 不删"的对比来证明必须删。

决定性旁证:2026 年 Int J Epidemiol 更新版系统综述识别出 29 个 MR 质量/偏倚评估工具, 覆盖 IV1/IV2/IV3 三大假设、工具选择、人群分层、敏感性分析、样本重叠等, MHC 处理不在任何一个工具的条目里(Yu J, et al. 2026, PMID 41999635)。

既然不是规范要求,删或不删都需要自己给理由。我们选择不删,并给出机制。

2.2 删掉会付出的具体代价

会被删掉的为什么是代价
AGER(RAGE) chr6:32.18 MbAGE–RAGE 轴是糖尿病并发症最教科书级的分子通路;且它在本课题按 z 检验是头号命中
CFB / C2 / C4A / C4B MHC III 区补体是 AMD 最确证的因果通路,pegcetacoplan、avacincaptad pegol 正是已上市的补体靶向药
另 20 余个 MHC 编码蛋白本课题工具池内共 26 个蛋白落在 26–34 Mb

机械删除会招致"你把该病最确证的通路删了"这一实质性质疑,而这在眼科/内分泌方向的审稿人眼里是缺陷,不是保守。

2.3 但也不能沉默地留着——必须配机制

文献里有意识保留 MHC 的论文都配了额外机制,这才是可辩护的"不删":

  • SSNS 蛋白组 MR(medRxiv 2025):核心发现 TNXB 就在 MHC 内,用 HLA 等位基因做共定位
  • DMARD → AD 靶点 MR:靶点含 TNF(MHC III 区),若剔除则英夫利昔/依那西普整条线索消失

本课题的机制是"共定位不可解释 → 单列成节 → 不进靶点提名",理由来自我们自己的数据:

本课题实测结果
共定位「无法判定」最宽档 36 对100% 是 MHC
SuSiE 版共定位因 LD 面板失配整体降级(s 中位 0.827
MHC 蛋白平均横跨的并发症数2.7 个
非 MHC 蛋白平均横跨的并发症数1.35 个
31 个显著蛋白一起跑富集头号 immune response p = 7.2e-07
只留 20 个非 MHC 蛋白免疫信号完全消失(最好 p = 0.047),变成脂蛋白颗粒

"横跨多个并发症"正是长程 LD 假象的签名;而共定位在该区域给不出可解释的后验概率, 是因为 coloc.abf 的单因果变异假设在 MHC 几乎必然被违反 (Krishna 2024 Nat Commun 15:6469 亦记录标准 fine-mapping 与共定位在该区不适用)。

这个设计比"删掉"提供的信息更多

删掉 → 我们看不到 MHC 结果,只能声称它不可靠。 留而标注 → 我们展示 MHC 结果,并用数据证明它不可解释。

Methods 可以这样写:

鉴于"剔除 MHC 区"虽为高频惯例但未见于任何一个 MR 质量评估工具,且其必要性此前未经正式检验 (Zheng 2020 未做删/不删对比),我们保留 MHC 区蛋白全程参与分析,并在共定位后将其单列为 一个预先声明的不可解释层:该层不参与靶点提名,但全部结果予以报告。 支持该处理的本数据集证据为:共定位无法判定的关联 100% 来自该区域; MHC 蛋白平均横跨 2.7 个并发症而非 MHC 为 1.35 个;全组免疫通路富集完全由该层承载 (剔除后 p 由 7.2e-07 退至 0.047)。

2.4 坐标:必须写明区间 + build

文献里至少四套坐标在流通(26–34 Mb / 28.48–33.45 Mb / 29–33 Mb / 25–34 Mb 扩展 MHC), 同一句"排除 MHC 区"在不同论文里涉及的基因数差别很大。方法学必须写明区间与 build。

本课题实测(Ensembl REST;UKB-PPP 哨兵表同时带 hg19 与 hg38 坐标):

cis 工具行 1955 / 蛋白 1954
按 chr6:26–34Mb 筛,hg19 命中 26 个蛋白
按 chr6:26–34Mb 筛,hg38 命中 26 个蛋白
两者差集 = 空

两个 build 得到同一批 26 个蛋白,本课题无需 liftover。 这一条要写进 Methods。

⚠️ 注意坐标选择的实际后果:BTN3A2(26.37 Mb)与 BTN2A1(26.46 Mb)在 26–3425–35 区间内, 但不在 29–33 区间内。用哪套坐标,MHC 层的成员就不同。本课题采用 26–34 Mb(GRCh38)。

2.5 与最像的一篇同类研究的关系

本课题的方法学切入点

Yuan S, et al. Cell Rep Med 2023(PMID 37652020) 与本课题设计几乎一比一 (UKB-PPP 54,306 + deCODE 35,559、1,886 蛋白、cis only、FinnGen 10 个糖尿病并发症、 MR + 共定位 + 反向 MR + 复制)。

其头号并发症结论是:"HLA-DRA, AGER, HSPA1A, and HSPA1B are associated with most microvascular complications."

Ensembl REST 实测(GRCh38):HLA-DRA 32.44 Mb · AGER 32.18 Mb · HSPA1A 31.82 Mb · HSPA1B 31.83 Mb —— 四个全部落在 26–34 Mb 内;其反向 MR 结果中的 MICB(31.49 Mb)亦然。

而该文全文检索 "MHC"、"chromosome 6"、"long-range LD"、"extended LD" 零命中, 局限性 6 条中无一条涉及 MHC/LD 结构;并发症端共定位支持薄弱被归因于 "possibly due to limited statistical power",而非 LD。

⚠️ 上述否定性判断经两次不同问法的检索一致,但尚未逐字通读原文,写入正文前必须自读确认

同一批作者(Yuan / Larsson / Li)在 2024 年乳糜泻表型组 MR(EBioMedicine, PMID 38382313)中 做了剔除 MHC 的敏感性分析,据此判定 1 型糖尿病与非霍奇金淋巴瘤的关联 "attenuated when excluding SNPs in the MHC region"、属共享遗传结构而非因果。 同一团队在免疫病里做了、在糖尿病并发症里没做——这个对比可直接写进讨论。

我们保留 MHC 的设计恰好让这个论证更直接:MHC 蛋白就在我们的结果表里, 我们可以并排展示"我们复现了他们的 AGER 等信号"与"这些信号不可用标准共定位解释", 而不必从被删掉的数据里回溯。


三、每步依据与强度

本表相对初版下调了两处过度评级

初版把「排除 MHC」标为、把「富集位置」标为强·三篇一致。 经 2026-08-06 复查:前者只是惯例(非规范条目,见 §2.1),后者文献实际分两派(见下)。已改。

步骤依据强度
0 位置:LDSC 放 MR 之前的性状层两篇实际排法:Results 首节 post-GWAS 分析(BCC scTWAS);遗传相关排第 1、MR 排第 4(乳腺癌×精神);MRC IEU 词典亦述 LDSC 可识别值得 MR 跟进的关系中 · 惯例一致
0 用法:rg 用作数据源身份核验、不合格则退役数据源定向检索未找到先例。本课题实例:换 T1D 源后 rg(T1D,T2D) 由 0.886 → 0.087弱 · 自行声明
1① 统一坐标 build 必须最先Zheng 2020 原文:"We first mapped SNPs to genome build GRCh37.p13 coordinates and then used the following criteria…"
1②③ cis 窗口 · F≥10 · clumping · Steiger filtering多篇一致(Schmidt 2020 的 cis 框架;GBMI 工具层含 Steiger filtering)
1 不设 MHC 排除该惯例非规范条目(29 个 MR 质量评估工具均无此条)且未经删/不删对比检验;有意识保留者须配机制(SSNS 用 HLA 等位基因共定位)——本课题配"共定位不可解释层"惯例存在分歧 · 自行声明并配机制
2 MR + 多重检验校正全部文献一致
3 共定位Zheng 2020:413 个 MR 关联中 130 个(31.5%)在此被否;MR+coloc 双支持的靶点-适应症对更可能获批最强
3 后 MHC 分层依据为本数据集实测(无法判定 100% 来自 MHC、SuSiE 因 LD 失配降级、横跨 2.7 vs 1.35)+ Krishna 2024 记录标准共定位在 MHC 不适用中 · 本课题实测 + 一篇机制文献
4-1 Steiger 方向性 / 反向 MR绝对位置文献不统一,但"先于复制"有出处:Zheng 2020 次序为反向因果 → 跨研究复制;GBMI 更把 Steiger 提到工具层中 · 相对次序有据
4-2 外部复制位置不统一(共定位前/后都有)弱 · 自行声明
5-1 / 5-2 / 5-4 pheWAS / 成药性 / 表达一致:均在收窄后、只对个位数候选做。Zheng 2020 的成药性注释套在"MR+共定位双支持"结果上;GBMI 把药物库/试验/伪影标记列为最后一步 annotation only
5-3 跨组学「只能加分不能扣分」文献几乎不讨论跨组学能否否决。本课题实测:跨层顶信号常非同一变异(r² 仅 0.095 / 0.031);IFNAR1 视网膜层完全阴性而其为证据最硬候选弱 · 自行声明(规则由本课题实测确立)
5-3 → 5-4 次序无文献可依;按"谁先出结果、谁用来解释"自定弱 · 自行声明
通路富集MR 显著集、不参与筛选⚠️ 文献分两派:A 派跑全部显著集、位置在 MR 后(Yuan 2023 用 GeneMANIA 跑 47 个显著蛋白,位置在反向 MR 之前;PLOS Genetics COVID 跑全部显著蛋白、写在 Discussion);B 派跑筛完的优先集、位置在方向性之后(CHD/MI 跑 13+7 个,排 Results 第 7 节)。本课题选 A 派:存活者仅个位数(3 个基因无法做通路富集),且富集在本课题承担 MHC 诊断功能中 · 分两派,本课题理由充分
通路富集按 MHC 分组跑定向检索未找到先例。是支撑 §2.3 的核心证据,属主结果而非附属弱 · 自行声明

四、报告方式

正文写漏斗(每步剩多少 + 重点讨论存活者),完整结果表进补充材料且不贴 A/B/C/D 标签

MHC 层单独成节,与主漏斗并列呈现——这是"留而标注"能成立的前提: 不报告 ≠ 不分析,分析过程中一条记录都不能删。

过了哪些只能说不能说
只过 MR"存在关联"、"一个候选"任何"因果"字眼
+ 共定位"与共享同一因果变异一致""因果"、"靶点"
+ 跨平台方向一致"在不同检测技术间一致""已复制"、"已验证"
+ 全部关卡"我们提名 X 为候选药物靶点""我们确认 X 是因果的"
MHC 层"在标准共定位框架下不可解释"任何提名或因果表述

五、开跑前自检

  1. 这一步有没有否决权? 有 → 必须进漏斗计数;没有 → 只标注,不许拿它剔候选
  2. 顺序对不对? 第 1 相①最先;4-1 在 4-2 前;第 5 相在第 4 相后
  3. 缓存指纹涵盖这次改的参数了吗? 换口径不改指纹 = 静默复用旧产物(已踩过两次)
  4. MHC 标记算对了吗? 按坐标算、不用蛋白名硬编码;26 个应全部命中,逐个断言
  5. MHC 层是否被误当成筛选? 它退出提名,但必须出现在结果里
  6. 我要写的这句话,证据层级够到哪一档?

六、参考文献(全部经 PubMed 核对,附 PMID)

方法学来源

  1. Zheng J, Haberland V, Baird D, et al. Phenome-wide Mendelian randomization mapping the influence of the plasma proteome on complex diseases. Nat Genet. 2020;52(10):1122–1131. PMID 32895551 · PMC7610464 · doi:10.1038/s41588-020-0682-6
  2. Zhao H, Rasheed H, Nøst TH, et al. Proteome-wide Mendelian randomization in global biobank meta-analysis reveals multi-ancestry drug targets for common diseases. Cell Genomics. 2022;2. PMID 36388766 · PMC9646482
  3. Schmidt AF, Finan C, Gordillo-Marañón M, et al. Genetic drug target validation using Mendelian randomisation. Nat Commun. 2020;11:3255. PMID 32591531
  4. Zuber V, Grinberg NF, Gill D, et al. Combining evidence from Mendelian randomization and colocalization: review and comparison of approaches. Am J Hum Genet. 2022;109(5):767–782. PMID 35452592
  5. Lin Z, Xue H, Pan W. A robust cis-Mendelian randomization method with application to drug target discovery (cisMR-cML). Nat Commun. 2024;15:6072. PMID 39025905 · doi:10.1038/s41467-024-50385-y

    ⚠️ 此文常被误引为「Chen X 等」,第一作者实为 Lin Z,卷页 15:6072

  6. Hukerikar N, Hingorani AD, Finan C, Schmidt AF. Prioritising genetic findings for drug target identification and validation. Atherosclerosis. 2024;390:117462. PMID 38325120
  7. Common pitfalls in drug target Mendelian randomization and how to avoid them. BMC Medicine. 2024. PMC11481744

质量评估与报告规范

  1. Yu J, et al. Structured tools for assessing quality and risk of bias in Mendelian randomization studies: an updated systematic review. Int J Epidemiol. 2026;55. PMID 41999635

    识别出 29 个结构化评估工具,MHC 处理不在任何一个的条目里——本页 §2.1 的核心依据。

  2. Guidelines for Mendelian randomisation studies — Diabetologia. 期刊公开指南页(社论正文付费墙:doi:10.1007/s00125-025-06484-6)

    要求 STROBE-MR 清单 + 三角验证框架,并指出共定位、反向 MR、功能富集"一般不算独立方法"

MHC 相关

  1. Krishna C, et al. The influence of HLA genetic variation on plasma protein expression. Nat Commun. 2024;15:6469. PMID 39085222

    504 个蛋白受 HLA 变异影响、94.8% 为 trans、机制为抗原呈递;标准 fine-mapping 与共定位在该区不适用——本页 §2.3 的机制依据。

  2. Fernando MM, Stevens CR, Walsh EC, De Jager PL, Goyette P, Plenge RM, Vyse TJ, Rioux JD. Defining the role of the MHC in autoimmunity: a review and pooled analysis. PLoS Genet. 2008;4(4):e1000024. PMID 18437207 · PMC2291482

    MHC 约 250 个基因、30 年研究汇总(MS/T1D/SLE/UC/CD/RA)。⚠️ 该文与 MR、因果推断、工具变量选择无关,不可用于论证 MR 中 MHC 的处理方式。

同类研究(对照)

  1. Yuan S, Xu F, Li X, Chen J, Zheng J, Mantzoros CS, Larsson SC. Plasma proteins and onset of type 2 diabetes and diabetic complications: proteome-wide Mendelian randomization and colocalization analyses. Cell Rep Med. 2023;4(9):101174. PMID 37652020 · PMC10518626
  2. Yuan S, Jiang F, Chen J, Lebwohl B, Green PHR, Leffler D, Larsson SC, Li X, Ludvigsson JF. Phenome-wide Mendelian randomization analysis reveals multiple health comorbidities of coeliac disease. EBioMedicine. 2024;101:105033. PMID 38382313

    ⚠️ 此文常被误引为「Elvers 等人关于克罗恩病的研究」——作者列表无 Elvers,病种为乳糜泻

  3. Proteome-wide MR identifies causal links between blood proteins and severe COVID-19. PLOS Genetics. doi:10.1371/journal.pgen.1010042(富集跑全部显著蛋白、写在 Discussion)
  4. Comprehensive Mendelian randomization analysis of plasma proteomics for coronary heart disease and myocardial infarction. J Transl Med. 2024. PMID 38689297 · PMC11061979(富集跑 13+7 个优先蛋白、排 Results 第 7 节)

七、未决事项

  • [ ] 逐字通读 Yuan 2023(PMC10518626)STAR Methods 与补充表 S9:确认 MHC 确无处理、抠出 17 个并发症蛋白完整名单逐个对照、核 HSPA1A/1B 在其富集结论中的权重
  • [ ] 核实 GBMI 是否真的"保留全部工具变量并以分层标注 MHC"(此说法未能在其方法节证实;tier 1/2/3 系 Zheng 2020 的工具特异性分层,非按 MHC 分)
  • [ ] 核实 Diabetologia 指南中「避免按 F 统计量排除工具」一条(若属实,与本页第 1 相③冲突)
  • [ ] MVMR / 两步中介:正式分解"糖尿病驱动 vs 并发症特异"(当前只有并排对比)
  • [ ] 阳性对照:确认流水线能在糖网端 recover 已知为真的信号
  • [ ] LDSC 截距估计样本重叠(MRlap),处理 T1D 源含 UKB 5–6% 重叠
  • [ ] 代码侧:32_targets_table.Rin_MHC蛋白名硬编码改为按坐标计算29_enrichment.R 的分组同理

个人科研与运维文档 · 内容持续修订