Skip to content

分析流程与文献依据

这一页解决的问题:以前"先做什么后做什么"靠临场判断,讨论时反复摇摆。 本页把 cis-pQTL 药靶 MR 的流程定死,每一步都标出文献依据和依据强度, 并记录几个关键争议的查证过程,避免重复争论。

👉 每一步「为什么放在那里」的查证过程、我判错并被纠正的地方、 以及与本课题最像的那篇已发表论文(Cell Rep Med 2023)的对照 —— 见 流程答疑 · 每一步为什么放在那里

⚠️ 本页含一处口径变更:MHC 区改为在工具选择阶段排除, 与旧页 MHC 区为什么是假阳性雷区 第 4 节的"不预先剔除"相反, 以本页为准,理由见第三节。


一、最终流程

0性状层 QC / 数据验收LDSC 遗传相关 rg · 输入断言(频率方向 · 样本量 · build)★ 否决的是数据源1工具选择单位是「变异」,全部发生在 MR 之前① 统一坐标 build② cis 窗口 ±500kb③ F ≥ 10 · clumping④ 排除 MHC 26–34Mb(连蛋白一起移除)← 必须最先做:②③④ 都是按坐标划范围2MR + 多重检验校正一次测两千个蛋白,靠运气也会蒙对,所以要提高及格线通路富集跑显著蛋白集只描述 · 不筛选↓ 只喂给定稿3共定位最关键:31.5% 的 MR 关联在这一步被判为假查影响蛋白和影响疾病的是不是同一个变异4否决性检验会改变候选名单 —— 漏斗计数到此为止4-1方向性 / 反向 MR是蛋白导致病,还是病导致蛋白?★ 否决权 · 剔除者计入漏斗4-2外部复制换一批人、换一台机器再看一遍★ 否决权 · 剔除者计入漏斗5描述性注释只对上面两道的存活者做 —— 不剔除任何候选,正文只报存活者5-1 on-target pheWAS只标注5-2 成药性只标注5-3 跨组学定向验证只标注 · 只能加分5-4 组织 / 单细胞表达只标注 · 查表6定稿按算出来的证据层级写,不是按想要的层级写两者都不决定候选去留,但不是一回事:LDSC 否决的是「数据源」,不合格则不许开跑;通路富集什么都不否决,只描述这批蛋白整体偏向哪类通路。

第 1 步的四个子项有先后:① 必须在 ②③④ 之前

cis 窗口、MHC 排除都是按坐标划范围的操作——坐标系没统一,范围就划错。 Zheng 2020 的工具选择第一句正是这个: "We first mapped SNPs to genome build GRCh37.p13 coordinates and then used the following criteria…"

第 4 相与第 5 相是两类东西,所以给了两个相号(2026-08-06 二次调整)

早先它们共用一个「4」(4-1~4-5)。但有否决权和没否决权是根本区别, 共用相号等于在说它们是同一类操作——虚线框只是视觉暗示,相号才是结构声明。现在分开:

  • 第 4 相 否决性检验:4-1 方向性/反向 MR → 4-2 外部复制。 它们确实会剔除候选,所以必须进漏斗计数漏斗到第 4 相结束为止
  • 第 5 相 描述性注释:5-1~5-4 一个候选都不会剔除。 PheWAS 命中是已知责任,不是取消资格。

第 5 相的口径是"广算,窄报":计算上对 MR+共定位的全部存活者做都行(成本一样,还能出补充表), 但正文只报第 4 相存活者的注释结果,否则读者会以为注释也参与了筛选。

为什么方向性排在外部复制前面(2026-08-06 调整)

早先的版本把外部复制放在 4-1。改过来的理由有三条,第三条最实际:

  1. 文献顺序如此。Zheng 2020 Nat Genet 在 MR 之后的次序是 共定位 → PWCoCo → 异质性 → 反向因果(双向 MR + Steiger)跨 pQTL 研究复制; GBMI(Cell Genomics)更把 Steiger 提到工具筛选层,比复制早得多。
  2. 性质不同:方向搞反了是效力问题(这个估计根本不是我们以为的因果量), 复制不上是稳健性问题。效力应当先于稳健性——一个方向反了的估计,讨论它稳不稳没有意义。
  3. 反向因果的信号会复制。若某关联其实是"疾病 → 蛋白",它在 deCODE、在 ARIC 照样出现, 因为它是真实存在的关联,只是方向反了。复制放前面, 等于先给一个反向因果的伪信号发一张"通过外部复制"的通行证, 在漏斗图上构成误导性的证据累积顺序。反过来则无任何信息损失。

注意:两道都是纯否决,交集可交换 —— 换顺序不改变最终存活集合。 变的只是漏斗每一格的数字、计算成本,以及叙事的诚实度。第三样才是理由。

4-2 不是无脑否决:复制失败要先分岔

跨平台不一致未必说明信号是假的,也可能是测定伪影。 本课题实例:APOL1 在 Olink 与两个 SomaScan 上方向相反,判定为表位伪影, 据此排除的是"血浆水平致病"这一机制,而不是简单记一个"复制失败"。

所以 4-2 的正确写法是:不一致 → 先查 PAV / 表位与适配体结合伪影 → 再判是否否决

★ 5-3 跨组学只能加分,不能扣分 —— 依据是我们自己的实测

把 eQTL / sQTL / 疾病组织 eQTL 放进流程,最容易犯的错是拿阴性当反对证据。 本课题有三条实测结果说明为什么不行:

实测说明什么
跨层信号往往不是同一个变异:血浆 pQTL 与 eQTL 顶变异 r² 仅 0.095 / 0.031"方向相反"不构成反对——比较的根本不是同一个信号
IFNAR1 视网膜 eQTL 层完全阴性而 IFNAR1 是本课题证据最硬的候选(Ifnar1−/− 激光 CNV 病灶更大 P=0.028、IFN-β 治疗改善 P=0.0038、小胶质特异敲除可复现 P=0.0007)
ERMAP 视网膜 PP.H4 = 0.949 但方向与血浆相反早先"强共定位支持"的说法已撤回

第二行是决定性的:若 5-3 有否决权,我们会用一个无法支持阴性推断的层,杀掉最好的候选。

规则:5-3 阳性可写作"机制上一致",5-3 阴性只能写"该层未提供支持", 不得写成"该层不支持因果关系"。

⚠️ 另有一个已知实现坑:06_sqtl_smr 层曾把 HEIDI = NA 当作通过(已修)。 且该层目前只覆盖 6 条染色体、走的是 R13 线、不含视网膜——属孤儿层,未接入本流程。 若要正式纳入 5-3,必须先补齐或明确声明其覆盖范围。

★ 5-3 与 5-4 必须成对读:先跨组学出结果,再用表达去解释它(2026-08-06 二次调整)

早先这两项是反过来排的(表达在前、跨组学在后),理由是"跨组学的阴性必须参照表达才能解读"。 那句话本身没错,但由它推出"表达必须排在前面"是不成立的—— 它证明的是两者必须一起读,不是谁必须先跑:解读上的耦合 ≠ 执行上的先后。

按 5-3 的结果分两种情况,表达都是在看到跨组学结果之后才去查的,只是扮演的角色不同:

5-3 跨组学的结果5-4 表达扮演什么角色
阳性(疾病组织 eQTL 与 GWAS 共定位、方向一致)细化——是哪一类细胞扛着这个信号
阴性诊断——该组织根本不表达(这层压根没机会检出,零信息),还是表达了但没检出 eQTL(检出力问题)

本课题的 IFNAR1 属阴性里的第二种:小鼠那边做的是小胶质特异敲除并复现了表型, 说明视网膜小胶质确实表达它 —— 所以那个阴性是检出问题,不是"这个组织没有这个蛋白"。

另一条理由:5-3 是这两项里唯一可能改变我们措辞的(阳性了可以写"机制上一致"); 5-4 单独存在时永远改变不了任何结论,只能修饰别的结论。能动的放前面,只能修饰的跟在后面。

一般而论还有个反方理由——"表达决定了跨组学该去哪个组织跑"。 但本课题不适用:视网膜是按"疾病组织"选的,在跑之前就由课题定死了,表达图谱没有参与这个决策。

注意这与第 4 相的排序逻辑不同:有否决权的关卡按"效力先于稳健性"排(故 4-1 在 4-2 前); 纯注释块没有东西被筛掉,排序跟的是"谁先出结果、谁用来解释"这个朴素逻辑, 谈不上什么优雅的梯度。

5-3 买到的是机制可信度,不是期刊分数

Diabetologia 2025 的投稿指南,共定位、反向 MR、功能富集"一般不算独立方法"—— 跨组学同理:它与主分析共享同一套遗传工具逻辑与 LD 混杂偏倚来源。 真正算"三角验证"的是 RCT、队列研究、湿实验、阴性对照、跨情境比较。 所以 5-3 该做,但别指望它替代独立证据


一之二、每一步在干什么(大白话版)

先看整件事在问什么

"如果用药把某个蛋白降下来,病会不会少发生?"

真去给人吃药做试验,又贵又慢还有风险。但有个现成的"天然实验": 每个人出生时,基因就已经把他这辈子的蛋白水平定得偏高或偏低了,而这是随机分配的—— 爹妈给你哪一半基因,跟你后来的生活习惯、收入、性格都无关。

所以我们可以找出"天生这个蛋白就偏低的人",看他们是不是得病更少。 这就等于老天爷替我们做了一场随机对照试验。这套方法叫孟德尔随机化(MR)。

1 工具选择——找出"天生蛋白偏低的人"

要找基因里那些"能决定这个蛋白高低"的位点,当作我们的"天然药物"。四件事,第一件必须先做

① 先对齐"坐标系"(基因组版本)

人类基因组参考序列有好几个版本(常见的是 GRCh37GRCh38)。 同一个基因在两个版本里的坐标不一样,在 6 号染色体这一带差了几十 kb。

而下面的"cis 窗口 ±500kb"和"排除 chr6:26–34Mb"都是按坐标划范围的—— 坐标系不统一,范围就会划错。

打个比方:老版和新版两张地图,同一栋楼的门牌号差了几十号。 你拿老地图的门牌号去新地图上圈范围,圈出来的就是另一片地方。

这里有个我们必须注意的坑

Zheng 2020 用的是 GRCh37,它给的 MHC 坐标 26–34Mb 也是 GRCh37 的。 而我们的数据(UKB-PPP、FinnGen R9)是 GRCh38——照抄坐标之前要先换算

另外:如果全程用 rsID 来匹配变异,版本不一致不会出错(rsID 与版本无关); 但只要用到坐标(划 cis 窗口、圈 MHC 区),版本就必须对上。

② cis 窗口 ±500kb

只认这个蛋白自家门口的变异。离得远的变异多半要绕好几道弯才影响到它, 路上会捎带影响别的东西——那就不是干净的工具了。

③ F ≥ 10 · clumping

  • F ≥ 10:这个变异对蛋白的影响要够强。太弱的当工具,算出来的因果效应会被噪音带偏。
  • clumping:几个变异如果互相高度相关(连坐遗传),只留一个。 否则同一份信息被数了好几遍,等于虚报了证据量。

④ 排除 MHC 区——避开基因组里最挤的那条街

6 号染色体上有一段(chr6:26–34Mb)叫 MHC,是免疫系统的核心区。它有两个麻烦:

  1. 那一整段是"捆绑遗传"的——几百个基因像一串粽子绑在一起往下传, 你看到某个变异跟疾病有关,根本分不清是这串里哪个基因干的
  2. 那里的变异跟几百种病都有关系——你以为工具只通过目标蛋白起作用, 实际上它还从十几条别的路影响疾病,这就违反了 MR 最核心的前提

所以国际做法是:这段区域里的变异一律不用

★ 它和 ②③ 有一个实质差别:F≥10 和 clumping 只是筛掉某些变异(蛋白还在, 只要还有别的合格变异);而 MHC 排除是连蛋白一起移除—— 这段区域里编码的蛋白整个退出分析。Zheng 2020 原文是 "we removed SNPs and proteins coded for by genes within the MHC region"。 我们那 11 个蛋白就是这样直接消失的,分母从 31 变成 20。

2 MR + 多重检验校正——算出因果效应

用上面选好的工具,算"蛋白每升高一个单位,得病风险变化多少"。

为什么要"多重检验校正":我们一次测两千多个蛋白。就算这些蛋白其实全都没用, 纯靠运气也会有一百个看起来"显著"。

打个比方:抛硬币连中 10 次很惊人;但让一万个人一起抛,总会有人连中 10 次,那就不惊人了。 校正就是把及格线提高,让"碰巧蒙对"的过不了。

3 共定位——查是不是"隔壁老王"干的 ★最关键

MR 说"这个蛋白跟病有关",但还有一种可能:真正起作用的是旁边的基因,你的蛋白只是碰巧挨着它、跟着一起变。

共定位就是查:影响蛋白的那个变异,和影响疾病的那个变异,到底是不是同一个?

  • 是同一个 → 关系可能是真的
  • 不是同一个,只是挨得近 → 假的,是"连坐"造成的错觉

Zheng 2020 实测:413 个 MR 说有关系的,130 个(31.5%)在这一步被判为假的。 这就是为什么共定位不能省,也不能放到后面——三分之一是假的, 不先筛掉就往下做,等于花大钱去研究一堆假线索。

到这一步,候选就从几千个收窄到个位数了。 后面几步都只对这几个做。

4-1 方向性 / 反向 MR——是蛋白导致病,还是病导致蛋白?★这道在前

这是很容易搞反的一件事。病人身上某个炎症蛋白高,很可能是生病之后才高的, 而不是这个蛋白导致了病。这一步就是把因果方向确认清楚。

为什么排在外部复制前面:因为方向反了的关联照样会在别的平台复制—— 它是真实存在的关联,只是箭头反了。先复制后查方向, 等于先给伪信号盖一个"已通过外部复制"的章。理由详见上面第一节的红框。

4-2 外部复制——换一批人、换一台机器再看一遍

用另一个国家的队列(比如冰岛的 deCODE)、另一种测蛋白的技术(SomaScan 对 Olink), 看结果还在不在。一个只在一批人身上成立的发现,多半靠不住。

⚠️ 但不一致不等于假:也可能是抗体/适配体结合到了被变异改掉的那一小段, 测到的是"结合力"而不是"蛋白量"。所以不一致时先查 PAV / 表位伪影,再判否决


到这里两道关卡走完,候选名单就定了 —— 漏斗计数到此为止。下面第 5 相的四项只对存活者做,一个都不会再被刷掉。

5-1 pheWAS 安全性——这个药会不会有副作用

同一个蛋白往往在全身好几个地方都有用。药物把它压下去, 治病的地方压下去了,别的地方也一起被压了——那就是副作用。

pheWAS 就是拿同一个工具去扫几千种其他疾病,看会不会顺带招来别的毛病。

⚠️ 注意:扫出问题不等于这个靶点不能要,而是"我们已经知道它有这个风险"。 真实的药也都有副作用。

5-2 成药性——现实中有没有可能做成药

有些蛋白结构上根本没法被药物结合;有些则已经有现成的药了(那就可以考虑老药新用)。

5-3 跨组学定向验证——换一个分子层再看一遍

前面几步问的都是"血浆里这个蛋白多少"。5-3 换一层问: 编码它的基因,转录本多不多?剪接方式变没变?在真正得病的组织(比如视网膜)里呢?

做法是在另一层上重跑因果分析:eQTL / sQTL 的 SMR-HEIDI、疾病组织 eQTL 与 GWAS 的共定位。

★ 但它只能加分,不能扣分——理由见上面第一节的红框(跨层根本不是同一个变异,阴性无法解释)。

5-4 组织 / 单细胞表达——用它来解释 5-3(查表)

看这个蛋白主要在哪种细胞里表达。如果它在跟这个病相关的细胞里高表达,故事就更完整。

和 5-3 的区别:5-3 是真跑分析,5-4 是查表。 分开列是为了不让 5-4 显得比实际更有力。

这一步的主要用途是解释上一步:5-3 阳性时,它告诉你是哪类细胞扛着信号; 5-3 阴性时,它告诉你这个阴性是"根本不表达"还是"表达了但没检出"。

但要注意:"在这种细胞里表达高"不是因果证据,它只是让机制说得通, 不能拿来提升结论的强度。这一步不做因果推断

6 定稿——按算出来的强度写,不是按想要的写

前面每一步都是一道关。过了几道,就只能说到什么份上:

过了哪些只能说不能说
只过 MR"存在关联"、"一个候选"任何"因果"字眼
+ 共定位"与共享同一因果变异一致""因果"、"靶点"
+ 跨平台方向一致"在不同检测技术间一致""已复制"、"已验证"
+ 全部关卡"我们提名 X 为候选药物靶点""我们确认 X 是因果的"

这个层级是算出来的,不是选出来的。 算出来是哪一档,就写哪一档。

★ 那 LDSC、通路富集在哪一步?——有位置,只是不在候选链上

2026-08-06 补:旧版只写了"不在链上",没写"在哪里"

这等于把"不决定候选去留"误传成"没有位置"。两者都有明确位置,且都查了文献:

位置输入是什么否决什么文献依据
LDSC第 0 相,第 1 相之前两个性状的全基因组汇总统计数据源中·两篇实际排法一致
通路富集第 2 相输出引出的旁路,直通第 6 相MR 显著蛋白集(不是最后剩的几个候选)什么都不否决强·三篇一致

这是个很容易摆错位置的东西。

LDSC 算的是"性状 × 性状"的遗传相关——比如"1 型糖尿病和 2 型糖尿病共享多少遗传结构"。 它的作用单位根本不是"蛋白 × 疾病",所以它永远回答不了"哪个蛋白该留下"

它真正的位置是 第 0 相:第 1 相之前的性状层 QC / 数据验收

本课题实例:我们换了 T1D 的数据源之后,用 LDSC 算 rg(T1D, T2D), 结果从 0.886 降到 0.087——这证明新数据测的确实是 1 型糖尿病,而不是混进了 2 型。 如果这个数没降下来,说明数据源有问题,后面六个相全部白做。

文献支持的是位置,不是我们的措辞(2026-08-06 查证):

  • 位置有据:基底细胞癌那篇把 LDSC 放在 Results 第一节的 post-GWAS 分析 ("At the trait level, we first applied LD Score Regression … to estimate SNP-based heritability and assess potential confounding factors");乳腺癌×精神疾病那篇把 全基因组遗传相关排第 1、因果分析(MR)排第 4;MRC IEU 的 MR 词典也写明 LDSC 可用来识别值得用 MR 跟进的关系。
  • ⚠️ 但"拿 rg 与近缘性状比对来核验数据源身份、并据此退役整个数据源"这个用法, 定向检索未找到先例——它是本课题自定的,写 Methods 时必须声明,不能挂别人的引文。
  • 顺带查到一个我们还没用的 LDSC 用法:用截距估计样本重叠并校正 MR 估计(MRlap)。 这正好能处理我们"T1D 源含 UKB 5–6% 重叠"那个待办。

通路富集:它作用于"一组蛋白",是结果的背景描述("这批蛋白整体上偏向哪类通路"), 不改变任何单个候选的去留。它的输入是"MR 显著蛋白集",不是最后剩下的那几个候选。

三篇实际排法一致(2026-08-06 查证):

论文工具输入集位置
Yuan 2023 Cell Rep Med(与本课题最像的一篇)GeneMANIA47 个 MR 显著蛋白T2D 结果之后、反向 MR 之前
蛋白组 MR × 重症 COVID,PLOS GeneticsKEGG全部 MR 显著蛋白Discussion,敏感性分析之后
乳腺癌 × 精神疾病MAGMA 系列多效基因集Results 第 8 节(共 9 节)

★ 我们"按 MHC 分组跑富集"这一招,没找到先例——而它可能是本文最有力的一击

本课题实测:31 个显著蛋白一起跑 → 头号 immune response p=7.2e-07; 剔掉 MHC 只留 20 个 → 免疫信号完全消失(最好 p=0.047),变成脂蛋白颗粒。

同一批数据,分组方式一变,"机制结论"就翻了。这正说明富集只能当背景,不能当证据。

但它还有第二个用途:它是一个诊断工具,可以用来检验别人的富集结论是不是 MHC 驱动的。 与本课题最像的 Yuan 2023 的富集结论是"protein-folding / response to heat / oxidative stress", 而 HSPA1A(chr6:31.82Mb)与 HSPA1B(chr6:31.83Mb)两个热休克蛋白正在 MHC 区内—— ⚠️ 这是待验证的假设,需要读其补充表确认这两个在富集里的权重,不能当结论写。

把这类分析放进候选筛选链是范畴错误

不是"严不严格"的选择问题,而是工具和对象根本不匹配—— 拿量体温的工具去称体重,再认真也称不出来。

分析作用单位能决定候选去留吗
MR / 共定位 / 方向性 / 复制(第 1–4 相)蛋白 × 疾病✅ 能
pheWAS / 成药性 / 组织表达 / 跨组学(第 5 相)单个候选只描述(跨组学只能加分
LDSC(第 0 相)性状 × 性状❌ 不能决定候选——但能否决整个数据源
通路富集(第 2 相旁路)一组蛋白什么都不否决

★ 注意最后两行不是同一回事:LDSC 有否决权,只是它否决的对象是数据源; 通路富集则完全没有否决权。旧版把两者笼统写成"不在链上",掩盖了这个区别。


二、每步的依据与强度

步骤依据强度
0 位置:LDSC 放 MR 之前的性状层基底细胞癌那篇:"At the trait level, we first applied LD Score Regression…";乳腺癌×精神疾病:遗传相关排第 1、MR 排第 4;MRC IEU 词典:LDSC 可识别值得用 MR 跟进的关系中 · 两篇实际排法
0 用法:rg 用作数据源身份核验、不合格则退役数据源定向检索未找到先例(搜到的都是错分校正方法)。本课题自定,须在 Methods 声明弱 · 自行声明
1① 统一坐标 buildZheng 2020 原文"We first mapped SNPs to genome build GRCh37.p13 coordinates and then used the following criteria…"
1②③ cis 窗口 · F≥10 · clumping多篇一致;Schmidt 2020 Nat Commun 的 cis 框架 ⚠️未读原文
1④ 排除 MHC chr6:26–34MbZheng 2020 Nat Genet(本领域奠基作)原文;Ren 2023 J Transl Med 坐标完全一致
2 MR + 多重检验校正全部文献
3 共定位Zheng 2020:31.5% 的 MR 关联在此被否;且 MR+coloc 双支持的靶点更可能获批最强
4-1 Steiger 方向性 / 反向 MRZheng 2020 把反向因果放在跨研究复制之前;GBMI 更提前到工具层。绝对位置文献不统一,但"先于复制"有出处中 · 相对次序有据
4-2 外部复制位置不统一(共定位前/后都有)弱 · 需自行声明
5-1 / 5-2 / 5-4 PheWAS / 成药性 / 组织表达五篇一致:都在收窄后、只对个位数候选做;Zheng 2020 的成药性注释即套在"MR+共定位双支持"的结果上,GBMI 把药物数据库/临床试验/伪影标记列为最后一步的 annotation only
5-3 跨组学定向验证多组学 MR / SMR-HEIDI 是成熟做法;但**"能否用作否决"文献几乎不讨论**,本课题按自己的实测定为只能加分(跨层非同一变异,r² 0.095/0.031)弱 · 自行声明(规则由本课题实测确立
5-3 → 5-4 的次序无文献可依。本课题按"谁先出结果、谁用来解释"定:跨组学出结果,表达用来细化(阳性)或诊断(阴性)弱 · 自行声明
通路富集:跑在 MR 显著蛋白集上、位置在 MR 结果之后、不参与筛选三篇一致:Yuan 2023 Cell Rep Med 用 GeneMANIA 跑 47 个 MR 显著蛋白,位置在反向 MR 之前;PLOS Genetics COVID 跑全部显著蛋白、写在 Discussion;乳腺癌×精神疾病排 Results 第 8 节
通路富集按 MHC 分组跑(本课题做法)定向检索未找到先例。本课题实测:31 个一起跑 immune p=7.2e-07 → 非 MHC 的 20 个免疫信号消失(最好 p=0.047)弱 · 自行声明(但属主结果,非附属)

4-1 / 4-2 的绝对位置是文献本身不统一的地方,我们自己定并在 Methods 声明即可——这正是 STROBE-MR 的要求。两者的相对次序不是随便定的:Zheng 2020 的反向因果在跨研究复制之前,我们与之一致。

本课题的选择:Steiger filtering(剔工具)放第 1 相工具层;Steiger 方向性检验与反向 MR 放 4-1; 外部复制放 4-2,即共定位之后、安全性扫描之前; 第 5 相(5-1~5-4)串在第 4 相之后,只对存活者报告,且 5-3 跨组学只能加分不能扣分坐标 build 统一到 GRCh38(我们的数据源版本), 引用 Zheng 2020 的 MHC 区间时按 GRCh38 换算,不直接照抄其 GRCh37 数值。


三、三个关键判断的查证过程

3.1 MHC:在工具选择阶段排除 ★ 口径变更

决定性原文——Zheng et al. Nat Genet 2020,Methods → Instrument Selection:

"Due to the complex LD structure of SNPs within the human Major Histocompatibility Complex (MHC) region, we removed SNPs and proteins coded for by genes within the MHC region (chr6: from 26Mb to 34Mb)."

三个要点:

  1. 位置:工具选择阶段,早于验证与 MR
  2. 范围cis 和 trans 都适用,而且是"SNPs and proteins"——连蛋白一起移除,MHC 区编码的蛋白根本不进入分析
  3. 坐标chr6:26–34 Mb,与 Ren 2023 J Transl Med 完全一致。 ★ 但要注意 Zheng 2020 用的是 GRCh37.p13(原文明写"We first mapped SNPs to genome build GRCh37.p13 coordinates"),这个区间是 GRCh37 坐标;我们的数据是 GRCh38,需换算后再用

查证过程中我犯过三次错,记下来避免重犯

错误性质
"tier 1" "tier 2" 搜索来证明"分级普遍"循环论证——搜索词预设了结论
接受搜索摘要"MHC 排除是标准 cis 选择标准"摘要抹平了 cis/trans 的区分
由一篇 QC 条款推出"MHC 排除只对 trans"样本为一——方法节描述的是那一篇做了什么,不是领域惯例

最后一次是靠实际读到 Zheng 2020 原文才纠正的。此前我明确标注过"只读到摘要、全文未进", 却仍基于不完整信息给了低强度评级——缺证据时该去拿证据,不是给个评级了事

为什么有些论文不排除? 6 篇实读样本里 3 篇根本不提,Cell Genomics 2022 列了完整工具标准却不含 MHC。 更合理的解释是报告不全——这正对应领域现状的那句原文: "there is little consistency in analytical strategy and reporting approach"。

为什么坐标很关键:MHC 分经典段与扩展段,坐标选择直接决定谁被排除。 本课题 11 个 MHC 蛋白的 GRCh38 坐标(Ensembl REST 实测):

位置蛋白
经典 MHC(28–34 Mb)TRIM40 30.14 · HCG22 31.05 · MICB 31.49 · ATP6V1G2 31.54 · LTB 31.58 · AIF1 31.62 · CFB 31.95 · TNXB 32.04 · AGER 32.18
扩展 MHC(25–28 Mb)BTN3A2 26.37 · BTN2A1 26.46

按 Zheng 2020 的 26–34 Mb,11 个全部落入,全部排除

机制依据(为什么不能靠共定位在 MHC 区裁决)——Krishna et al. Nat Commun 2024:

"standard fine-mapping and colocalization methods optimized for bi-allelic SNPs … are not suitable for analysis in the MHC region"

该文同时给出量化:504 个蛋白受 HLA 变异影响,478/504(94.8%)是 trans

80% 的 HLA-pQTL 落在肽结合槽——HLA 通过抗原呈递广泛影响血浆蛋白组。

3.2 报告方式:漏斗,不贴分级标签

主流是漏斗(报每步剩多少 + 重点讨论存活者),分级标签是少数派:

研究漏斗
同济 C1R(同 UKB-PPP 54,2191,954 → 224 → 40 → 5;全文 tier 零命中
Zhou 2025 皮肤黑色素瘤2,940 → 1,927 → MR 128 → 显著 2 → coloc 2 → PheWAS 2
NAFLD1,834 cis-pQTL → 4 过 FDR → 2 共定位支持
腹主动脉瘤34 个关联 → 共定位突出 2 个

用分级的那几篇,每篇定义都不同、且都明说是作者自定义、不引用既有标准

所以:正文写漏斗,完整结果表进补充材料且不贴 A/B/C/D 标签。 分析过程中一条都不能删——那与正文怎么写是两回事。

3.3 表征在共定位之后

五篇一致,最直白的是 Zhou 2025:共定位只对 MR 显著的 2 个做,然后

"To explore potential roles of DPEP1 and TYRP1 in other phenotypes, we conducted PheWAS"

Zou 2024 骨关节炎明写共定位 "not used to exclude candidates", PheWAS 只对 3 个核心靶点做、目的是 "to investigate whether side effects existed"

硬理由:Zheng 2020 实测 413 个 MR 关联中 130 个(31.5%)不被共定位支持。 若在共定位之前就做表征,等于对三分之一的假阳性支付 PheWAS、单细胞、成药性的成本。

3.4 同构研究怎么处理 MHC 蛋白(实测)

同济 C1R 那篇候选里有 BTN3A2BTN2A1(都在扩展 MHC),处理方式:

"Reverse MR and MR-Steiger analyses supported the directionality of 88 of the 89 associations, leading to the exclusion of BTN3A2"

"Two additional proteins (BTN2A1 and FGF5) colocalized but exhibited opposite directional effects across diseases, suggesting potential adverse effects if targeted"

★ 两点值得注意:① 它没用区域规则,而是靠反向 MR / 方向一致性处理; ② BTN2A1 通过了共定位——说明实操中 MHC 区的共定位可以给出高 PP.H4, 这正是 Krishna 2024 警告"方法不适用"的现实映照。

★ 但它撞上的只有扩展段的两个,候选里没有一个经典 MHC 蛋白; 我们有 9 个经典 MHC 蛋白(结局是糖尿病并发症 + FinnGen,免疫信号强得多)。


四、对本课题的影响

按 Zheng 2020 排除 MHC 后:

现在排除后
蛋白3120
蛋白–疾病对5727
三个重点候选ERMAP / IFNAR1 / APOL1不变(都非 MHC)

那 11 个 MHC 蛋白独占 30 / 57 对,超过一半;MHC 蛋白平均横跨 2.7 个并发症、 非 MHC 平均 1.35 个——"一个蛋白横跨多种并发症"主要是超长连锁块造出来的

保留 MHC 所得到的发现不丢,改写成敏感性分析

  • 31 个一起跑富集 → 头号结果 immune response p=7.2e-07
  • 只跑非 MHC 的 20 个 → 免疫信号完全消失(最好 p=0.047),变成脂蛋白颗粒

这不是损失,而是用我们自己的数据印证了 Zheng 2020 排除 MHC 的必要性—— 比单纯照做更有说服力。写法:主分析按排除口径,敏感性分析报"若不排除会得到什么"。

代价:所有比例性数字(61%、37% 等)分母改变,需重算;核心结论与三候选不受影响。


五、参考文献

以下题录经 NCBI E-utilities 核对;标注了我读到的程度。

#文献读到程度提供什么
1Zheng J, et al. Phenome-wide Mendelian randomization mapping the influence of the plasma proteome on complex diseases. Nat Genet 2020;52:1122–1131. PMC7610464 · doi:10.1038/s41588-020-0682-6全文(PMC)MHC 排除原文;31.5% 被共定位否掉;MR+coloc 预测药物获批
2Krishna C, et al. The influence of HLA genetic variation on plasma protein expression. Nat Commun 2024;15:6469. PMC11291675 · doi:10.1038/s41467-024-50583-8全文504 蛋白 / 94.8% trans / 抗原呈递;标准 fine-mapping 与共定位在 MHC 区不适用
3Zhao H, et al. Proteome-wide Mendelian randomization in global biobank meta-analysis reveals multi-ancestry drug targets for common diseases. Cell Genomics 2022;2:100195. PMC9646482全文工具标准(cis ±500kb、r²<0.6、F>10、Steiger);不含 MHC 条款
4Ren F, et al. Proteome-wide Mendelian randomization study implicates therapeutic targets in common cancers. J Transl Med 2023;21:646. PMC10512580全文明确排除 chr6:26–34Mb,位于工具选择标准,cis+trans 通用
5Ni F, et al. Proteome-wide Mendelian randomization and functional studies uncover therapeutic targets for polycystic ovarian syndrome. Am J Hum Genet 2024;111:2799–2813. PMC11639085全文65 个候选全部保留分层、无一删除;tier 为作者自定义
6Zou M, et al. Proteome-Wide Mendelian Randomization and Colocalization Analysis Identify Therapeutic Targets for Knee and Hip Osteoarthritis. Biomolecules 2024;14:355. PMC10967895全文完整流程顺序;共定位「not used to exclude candidates」;PheWAS 只对 3 个核心靶点
7Zhou D, et al. Proteome-wide Mendelian randomization and colocalization analysis identify therapeutic targets for cutaneous melanoma. Medicine 2025;104:e44678. PMC12459469全文最简洁的漏斗;PheWAS 明写在共定位之后
8Yang C, et al. Mendelian randomization and genetic colocalization infer the effects of the multi-tissue proteome on 211 complex disease-related phenotypes. Genome Med 2022;14:140. PMC9746220全文MR 与共定位并行的变体写法
9Gill D, et al. Common pitfalls in drug target Mendelian randomization and how to avoid them. BMC Med 2024;22:473. PMC11481744全文30 条陷阱:发生 vs 进展、生存偏倚、on-target 效应
10Lin Z, et al. A robust cis-Mendelian randomization method with application to drug target discovery. Nat Commun 2024;15:6072. PMC11258283全文条件效应 vs 边际效应;只用暴露相关 SNP 会使工具失效
11Lutz SM, et al. Caution against examining the role of reverse causality in Mendelian Randomization. Genet Epidemiol 2021;45:445–454. PMC8222166全文MR-Steiger 在多效性下会给出错误方向
12Bhattacharyya U, et al. Large-Scale Mendelian Randomization Study … Psychopathology and Cognitive Task Performance. medRxiv 2024. doi:10.1101/2024.01.18.24301455全文⚠️未发表预印本;其 QC 只对 trans-pQTL 排 MHC(少数做法)
13同济 C1R 共病研究,medRxiv 2026.07.14.26358022本地 PDF 全文同 UKB-PPP 54,219;漏斗式报告;MHC 蛋白用反向 MR / 方向一致性处理
14Schmidt AF, et al. Nat Commun 2020;11:3255⚠️未读原文cis-MR 药靶框架、±500 kb 窗(引自已装 skill)
15Skrivankova VW, et al. JAMA 2021;326:1614⚠️未读原文STROBE-MR 报告规范
16Burgess S, et al. Wellcome Open Res 2019;4:186 v3部分(§4 谐化节)MR 通用指南;等位对齐与频率交叉核对

工具文档TwoSampleMR 官方文档(首页、Exposure data vignette、extract_instruments() 参考页) 全部零提及 MHC / HLA / chr6,无区域排除参数——工具选择仅涉及 p 值阈值与 LD clumping。 这说明区域过滤属于 pQTL 研究的特定问题,不是通用 MR 包的功能。


相关

个人科研与运维文档 · 内容持续修订