主题
本页已于 2026-08-07 被 v4 取代,保留仅作历史记录,不再更新
现行定稿是 分析流程定稿 v4。
v4 改了两处: ① 第 4 步外部复制拆成 4a / 4b / 4c 三个子项(换暴露平台 / 换结局队列 / 两侧都换), 它们测的不是同一件事,盲区互补; ② 第 4 步不再有否决权,只分流;v3 写在第 4 步括号里的「先查 PAV / 表位伪影 → 再判否决」 被提出来成为独立的 4X 表位 / PAV 调查,那才是全流程唯一可能否决的地方。
另外 v4 把 MHC 判定由「自己按 chr6:26–34 Mb 划坐标(26 个蛋白)」 改为直接采用 UKB-PPP 工具表自带的 MHC 列(= Sun 2023 原文 25.5–34.0 Mb,27 个蛋白)。
本页以下内容中,§1 流程图、§4 措辞阶梯、§6 依据表、§7 自检均已过时; §2(C1R 依据)、§3(LDSC / MHC 的"是否必要")、§5(表征次序) 仍然有效,v4 直接沿用。
分析流程定稿 v3 · 共定位后置
⚠️ 历史版本。 现行定稿见 v4。
三个版本的关系(前两版保留不动,仅作历史记录,不再更新):
版本 MHC 共定位位置 LDSC 状态 初版 工具选择阶段排除 第 3 相(硬否决) 第 0 相 已弃用 v2 留而标注,共定位后单列 第 3 相(硬否决) 第 0 相 已弃用 v3(本页) 不设步骤,在共定位处标注 第 5 步(措辞升级关卡) 降为可选 ✅ 现行 v3 的三处变更全部有实证依据,见 §2、§3。 查证过程与我判错被纠正的记录 → 流程答疑
一、流程图
二、v3 的三处变更,逐条给依据
变更的直接触发是 C1R 预印本(Li L, Tang Z, …, Liu J. Proteogenomic mapping of multimorbidity identifies C1R linking coronary artery disease and dementia. medRxiv 2026.07.14.26358022)—— 它与本课题最像:同一张 UKB-PPP 哨兵表、同 1,954 个蛋白、同样用 deCODE 做外部复制。 以下引文来自本地 PDF 全文抽取,非二手转述。
2.1 共定位移到外部复制之后,且改为「措辞升级关卡」
C1R 的小节标题与首句:
"Genetic colocalization prioritizes four shared signals""To assess whether the identified protein–disease pairs share genetic determinants, we performed colocalization analysis. Of the … proteins, nine showed strong evidence of colocalization (PPH4 > 0.8). Among these, four had MR effect directions consistent across their associated diseases—C1R …"
摘要里的措辞是 "… of which four were further supported by colocalization"。
两个要点:
- 位置:共定位在冰岛队列外部复制之后(其 Methods/Results 次序为 MR → 多病共享筛选 → 反向 MR/Steiger → 冰岛队列复制 → 共定位)。
- 性质:既不是纯否决,也不是纯排序。 精确说法是「措辞升级关卡」:
「否决 vs 排序」的准确表述(2026-08-06 订正)
本页初稿写成「优先级排序,不是否决」,那是被小节标题的 prioritizes 带偏了。 看实际数字链 40 → 9(PP.H4>0.8)→ 4(再加跨病符号一致),这确实在收窄, 而且下游深挖(PheWAS、功能验证)只对那 4 个做——没过共定位的进不了主结论。
但它也不是删除:40 个全部保留并报告,摘要主数字就是 "40 circulating proteins with cross-disease relevance"。
→ 准确的定性是:它收窄的是「能说什么」,不是「结果集」。
| 处理 | |
|---|---|
| 结果集 | 40 个全部保留、全部报告 |
| 措辞 | 只有 9 / 4 个拿到 "further supported by colocalization"、"prioritized candidates" |
| 下游投入 | 只给那 4 个(乃至只给 C1R 一个) |
这个区别决定漏斗图怎么画:当作否决就画成 40→4、31 个消失; 按实际应画成「40 个全部报告,其中 4 个升级为优先候选」。C1R 画的是后者。
★ 第 3 步与第 5 步的「方向」不是一回事
图上看不出来,但这是两个正交的检验:
| 第 3 步 反向 MR / MR-Steiger | 第 5 步 "consistent across their associated diseases" | |
|---|---|---|
| 中文 | 因果方向 | 跨病效应符号一致性 |
| 问什么 | 是蛋白→疾病,还是疾病→蛋白? | 蛋白升高时,它关联的几个病是不是同向变化? |
| 作用单位 | 一个「蛋白–疾病」对 | 一个蛋白 × 它关联的多个病 |
| C1R 结果 | BTN3A2 因果方向不成立 → 剔除 | BTN2A1、FGF5 跨病符号相反 → 标注 |
一个蛋白可以因果方向完全正确(两个病里都是蛋白→疾病),但符号相反—— 升高会升 CAD 风险、降 T2D 风险。第 3 步一路通过,第 5 步才发现。 C1R 对这种情况的判语是 "suggesting potential adverse effects if targeted"—— 这是成药可行性判断,不是因果有效性判断。
⚠️ 搬到本课题有个陷阱:这个检验只在「一个蛋白命中 ≥2 个并发症」时才定义得出来。 C1R 先筛了「≥2 个病的蛋白」,人人都有这个属性;我们没有做这个前置筛选。 而本课题实测 MHC 蛋白平均横跨 2.7 个并发症、非 MHC 仅 1.35 个—— 也就是说能被这条标准考核的,不成比例地是 MHC 蛋白。
→ 正确用法:命中 ≥2 个并发症者报告符号一致性,不一致者标注「若靶向可能存在权衡」; 命中 1 个者标注「不适用」,不是「未通过」(与第 4 步三分法同一原则:无法评估 ≠ 阴性)。
采纳这个顺序,措辞阶梯必须跟着改
共定位若不再是否决,第 4 步之后那一批就没有过 LD 检验。 Zheng 2020 实测 413 个 MR 关联中 130 个(31.5%)不被共定位支持—— 也就是说这一批里可能有约三分之一是 LD 假象。
C1R 自己很小心:它管那一批叫 "cross-disease relevance",不叫 causal。 我们必须照做:第 4 步后只能写「关联 / 候选」,只有共定位支持的子集才能升级措辞。见 §4。
2.2 外部复制改为三分法:不可评估 ≠ 阴性
C1R 原文:
"Reverse MR and MR-Steiger analyses supported the directionality of … associations, leading to the exclusion of BTN3A2. The remaining proteins were subsequently evaluated in an independent Icelandic cohort (N=35,559, SomaLogic platform). Of these, … proteins were available for validation. Among them, ITIH3, MST1, and SF3B4 showed likely false-positive …"
只剔除方向相反 / 假阳性的那 3 个;在冰岛队列里根本没有数据的那些,一个都没删。
★ 这一点我们代码里其实早就写着,只是流程图一直没对齐: tools/decode_platform_check_r9dm.R:71 的原话是 「SomaScan 数据未下载 …… 跨平台复制属未做,不是阴性」; 同文件 32 行给 ERMAP 标了 「★未下载,非确认无适配体」。
三类判定必须写死在 Methods 里,不能事后分类:
| 类别 | 有没有信息 | 处理 |
|---|---|---|
| 方向相反 | 有,且矛盾 | 先查 PAV / 表位与适配体结合伪影 → 再判是否否决(本课题 APOL1 即走此路,判为表位伪影) |
| 方向一致 | 有,且支持 | 通过;显著与否只作证据强度标注,不作通过与否 |
| 不可评估 | 无 | 保留在内,标注「该平台无此蛋白 / 无适配体 / SNP 缺失」,不否决 |
2.3 通路富集改用第 4 步存活集
C1R 原文:
"… the network of the validated proteins and their associated diseases … Pathway enrichment analysis of these CAD-connected proteins implicated the complement and coagulation cascades …"
其富集小节排在共定位小节之前,输入是复制验证之后的蛋白集。
这也解决了 v2 遗留的一个矛盾:v2 里富集挂在第 2 相(因为第 4 相只剩个位数、跑不动富集)。 改用三分法之后存活集变大,富集可以名正言顺地放在第 4 步之后。
⚠️ 但必须仍按 MHC 分组跑——因为「31 个一起跑免疫 p=7.2e-07 → 非 MHC 的 20 个信号消失(p=0.047)」 这个对比是我们判定 MHC 层的核心证据,需要 MHC 蛋白在场。v3 里 MHC 蛋白不被排除, 一路走到第 5 步才被标注,所以第 4 步存活集天然含 MHC,这个对比做得成。
三、两个"是否必要",用实证回答
3.1 LDSC:药靶 MR 不必要
| 论文 | LDSC / genetic correlation / heritability |
|---|---|
| Yuan S 2023 Cell Rep Med(与本课题设计几乎一比一) | ❌ 全文检索零命中(本轮验证) |
| C1R 2026 medRxiv(同哨兵表、同 1,954 蛋白) | ❌ 全文 78,305 字符,ldsc / ld score / genetic correlation / heritability 全部 0 次(本轮验证) |
两篇最像的都没做。 原因也说得通:LDSC 的作用单位是"性状 × 性状",需要两个性状的全基因组汇总统计; 而 cis-pQTL 药靶 MR 的暴露是单个 cis 工具,根本不在它的作用单位上。
→ 结论:LDSC 不是药靶 MR 的组成部分,降为可选的数据验收。
但本课题保留它,有两个具体理由(都不是"流程要求"):
- 结局数据源身份核验:换 T1D 源后
rg(T1D,T2D)由 0.886 → 0.087,据此退役了整个旧数据源 (GCST90475661 实为 T2D 主导)。这一次是决定性的。 - LDSC 截距估计样本重叠(MRlap):本课题 T1D 源含 UKB 重叠 5–6%,这条待办正好用它。
触发条件写进流程图:① 换了结局数据源 ② 需要估计样本重叠。不满足就不必做。
3.2 MHC:不必要排除,但必须处理
不必要排除——三条
- 不是规范条目:2026 年 Int J Epidemiol 更新版系统综述识别出 29 个 MR 质量/偏倚评估工具, 覆盖 IV1/IV2/IV3、工具选择、人群分层、敏感性分析、样本重叠等,MHC 处理不在任何一个的条目里 (Yu J, et al. PMID 41999635)。
- 奠基作没验证过:Zheng 2020 的工具选择节确有明确操作 ("we removed SNPs and proteins coded for by genes within the MHC region (chr6: 26–34Mb)"), 但从未做过删 vs 不删的对比来证明必须删。
- 两篇最像的都不排:Yuan 2023 全文无 MHC 条款; C1R 全文
mhc/major histocompatibility/hla/chromosome 6/long-range全部 0 次(本轮验证)。
但必须处理——两条
① C1R 自己提供了最好的反面实例。 它候选里有两个扩展 MHC 蛋白,处理方式是普通关卡:
"Reverse MR and MR-Steiger analyses supported the directionality … leading to the exclusion of BTN3A2"
"Two additional proteins (BTN2A1 and FGF5) colocalized but exhibited opposite directional effects across diseases, suggesting potential adverse effects if targeted"
★ BTN2A1 通过了共定位。 这正说明 MHC 区照样能给出高 PP.H4,所以高 PP.H4 在这个区域不能当证据—— 与 Krishna 2024 Nat Commun 15:6469 记录的「标准 fine-mapping 与共定位在该区不适用」互为印证。
② 我们的暴露程度比 C1R 严重得多。
| C1R | 本课题 | |
|---|---|---|
| 候选中的 MHC 蛋白 | 2 个,均在扩展段(BTN3A2、BTN2A1) | 9 个经典段 + 2 个扩展段 = 11 个 |
| 结局 | 10 个年龄相关病 | 糖尿病并发症 + FinnGen,免疫信号强得多 |
C1R 靠方向一致性就把两个都处理掉了;我们 11 个,靠方向一致性筛不干净。
本课题实测同样指向须标注:共定位「无法判定」最宽档 100% 是 MHC; 免疫通路富集完全由 MHC 承载(剔除后 p 由 7.2e-07 退至 0.047); MHC 蛋白平均横跨 2.7 个并发症而非 MHC 为 1.35 个;SuSiE 版因 LD 面板失配整体降级(s 中位 0.827)。
→ 结论:不设排除步骤;MHC 区蛋白照常计算、照常报告 PP.H4, 但该值不足以单独支撑措辞升级——升级需补 MHC 专用核验。
为什么是「需补核验」而不是「不可解释」(2026-08-06 订正)
本页初稿写的是「PP.H4 在该区不可解释,不升级」。那等于判死刑,过头了:
- MHC 区并非铁板一块。经典段(约 28–33 Mb)的 LD 远比两侧扩展段恶劣; 本课题 11 个 MHC 蛋白里 9 个在经典段、2 个在扩展段(BTN3A2 26.37 / BTN2A1 26.46 Mb), 用同一句话盖住整个 8 Mb 太粗。
- 文献里有可用的补救路径:HLA-TAPAS 等 MHC 专用参考面板 + 条件分析; SSNS 蛋白组 MR 对区内的 TNXB 就是用 HLA 等位基因做共定位处理的。
所以规则改为:照常算、照常报 PP.H4;该值单独不足以升级措辞, 升级需补至少一项 MHC 专用核验——条件分析(GCTA-COJO)/ HLA 等位基因共定位 / 跨平台复现。
⚠️ 如实说明:这条解锁路径本课题目前执行不了(我们没有 HLA 分型/填补数据)。 所以实际效果仍是 MHC 蛋白不升级——但理由从「永远不行」变成了「还缺哪一步」, 并且写清了缺的是什么。
坐标必须写明区间 + build。 本课题采用 chr6:26–34 Mb(GRCh38)。 实测:UKB-PPP 哨兵表按该区间筛,hg19 与 hg38 均命中同一批 26 个蛋白,差集为空,无需 liftover。 ⚠️ 坐标选择有实际后果:BTN3A2(26.37 Mb)与 BTN2A1(26.46 Mb)在 26–34 与 25–35 内, 但不在 29–33 内——用哪套坐标,MHC 层的成员就不同。
四、措辞阶梯(v3 已按共定位后置改写)
| 过了哪些 | 只能说 | 不能说 |
|---|---|---|
| 只过 MR(第 2 步) | "存在关联" | 任何"因果"字眼 |
| + 方向性 / 反向 MR(第 3 步) | "方向与蛋白→疾病一致" | "因果"、"靶点" |
| + 外部复制(第 4 步) | "跨队列关联 / 候选" | ⚠️ 不能说因果——这一批尚未过 LD 检验,按 Zheng 2020 可能约三分之一是 LD 假象 |
| + 共定位支持(第 5 步,PP.H4>0.8 且方向一致) | "与共享同一因果变异一致" | "已验证" |
| + 全部关卡 | "我们提名 X 为候选药物靶点" | "我们确认 X 是因果的" |
| MHC 区蛋白 | "PP.H4 已报告,但在该区域需 MHC 专用核验方能解读" | 任何提名或因果表述(在补齐专用核验之前) |
报告方式:正文写漏斗(每步剩多少 + 重点讨论存活者),完整结果表进补充材料且不贴 A/B/C/D。 MHC 层单独成节。不报告 ≠ 不分析——分析过程中一条记录都不能删。
五、表征为什么仍在共定位之后(旧页 §3.3 迁入)
五篇一致。最直白的是 Zhou 2025:共定位只对 MR 显著的 2 个做,然后
"To explore potential roles of DPEP1 and TYRP1 in other phenotypes, we conducted PheWAS"
Zou 2024 骨关节炎明写共定位 "not used to exclude candidates", PheWAS 只对 3 个核心靶点做、目的是 "to investigate whether side effects existed"。
硬理由:若在共定位之前就做 pheWAS / 单细胞 / 成药性,等于对未分层的一批支付这些成本。 v3 里共定位虽移到第 5 步,但描述性注释仍在其后(第 6 步),这一条不受影响。
六、每步依据与强度
| 步骤 | 依据 | 强度 |
|---|---|---|
| 数据验收(可选) | 两篇最像的论文均无 LDSC(Yuan 2023、C1R 全文零命中)→ 非必需。本课题保留仅因两个具体触发条件 | 非必需 · 自行声明 |
| 1① 统一 build 必须最先 | Zheng 2020 原文:"We first mapped SNPs to genome build GRCh37.p13 coordinates and then used the following criteria…" | 强 |
| 1②③ cis 窗口 · F≥10 · clumping · Steiger filtering | 多篇一致(Schmidt 2020 的 cis 框架;GBMI 工具层含 Steiger filtering) | 强 |
| 1 不设 MHC 排除 | 29 个 MR 质量评估工具均无此条目(Yu J 2026);Zheng 2020 有操作但无删/不删对比;Yuan 2023 与 C1R 全文零命中 | 中 · 三条实证 |
| 2 MR + 多重检验校正 | 全部文献一致 | 强 |
| 3 方向性 / 反向 MR 在复制之前 | C1R 次序即 Steiger/反向 MR → 冰岛队列复制;Zheng 2020 亦为反向因果 → 跨研究复制;GBMI 把 Steiger 提到工具层 | 强 · 多篇一致 |
| 4 三分法:不可评估者保留 | C1R 实例:43 → 40,只剔方向相反的 3 个;本课题代码注释早有同样判断("跨平台复制属未做,不是阴性") | 中 · 一篇实例 + 本课题自证 |
| 5 共定位后置且作为排序 | C1R 小节标题 "colocalization prioritizes"、摘要 "further supported by",位置在复制之后 | 中 · 一篇最像的实例 |
| 5 MHC 标注(照常报、需补核验才升级) | C1R 的 BTN2A1 通过共定位却跨病方向相反(说明高 PP.H4 在该区不足为证);Krishna 2024 记录标准 fine-mapping 与共定位在该区不适用;本课题实测「无法判定」档 100% 来自 MHC、SuSiE 因 LD 面板失配整体降级(s 中位 0.827)。补救路径(HLA-TAPAS / 条件分析 / HLA 等位基因共定位)有先例(SSNS 对 TNXB) | 中 · 实例 + 机制文献 + 自证 |
| 6-1~6-4 描述性注释在共定位之后 | 五篇一致(Zhou 2025、Zou 2024 等,见 §5) | 强 |
| 6-3 跨组学「只能加分不能扣分」 | 文献几乎不讨论。本课题实测:跨层顶信号常非同一变异(r² 仅 0.095 / 0.031);IFNAR1 视网膜层完全阴性而其为证据最硬候选 | 弱 · 自行声明 |
| 6-3 → 6-4 次序 | 无文献可依;按"谁先出结果、谁用来解释"自定 | 弱 · 自行声明 |
| 通路富集用第 4 步存活集 | C1R:富集用 "the validated proteins",小节排在共定位之前 | 中 · 一篇最像的实例 |
| 富集按 MHC 分组 | 定向检索未找到先例。是支撑 §3.2 的核心证据 | 弱 · 自行声明 |
七、开跑前自检
- 这一步有没有否决权? 第 3、4 步有(进漏斗计数);第 5、6 步没有(只分层/标注)
- 顺序对不对? 第 1 步①最先;方向性在复制前;共定位在复制后;注释在共定位后
- 复制的三类判定分清了吗? 「无数据」不许当「阴性」
- MHC 标记按坐标算了吗? 不用蛋白名硬编码;26–34 Mb / GRCh38,26 个应全部命中
- 缓存指纹涵盖这次改的参数了吗? 换口径不改指纹 = 静默复用旧产物(已踩过两次)
- 我要写的这句话,证据层级够到哪一档?(见 §4)
八、参考文献(全部经 PubMed 核对,附 PMID)
- Zheng J, Haberland V, Baird D, et al. Phenome-wide Mendelian randomization mapping the influence of the plasma proteome on complex diseases. Nat Genet. 2020;52(10):1122–1131. PMID 32895551 · PMC7610464
- Zhao H, Rasheed H, Nøst TH, et al. Proteome-wide Mendelian randomization in global biobank meta-analysis reveals multi-ancestry drug targets for common diseases. Cell Genomics. 2022;2. PMID 36388766 · PMC9646482
- Schmidt AF, Finan C, Gordillo-Marañón M, et al. Genetic drug target validation using Mendelian randomisation. Nat Commun. 2020;11:3255. PMID 32591531
- Zuber V, Grinberg NF, Gill D, et al. Combining evidence from Mendelian randomization and colocalization: review and comparison of approaches. Am J Hum Genet. 2022;109(5):767–782. PMID 35452592
- Lin Z, Xue H, Pan W. A robust cis-Mendelian randomization method with application to drug target discovery (cisMR-cML). Nat Commun. 2024;15:6072. PMID 39025905
⚠️ 常被误引为「Chen X 等」,第一作者实为 Lin Z。
- Yu J, et al. Structured tools for assessing quality and risk of bias in Mendelian randomization studies: an updated systematic review. Int J Epidemiol. 2026;55. PMID 41999635
29 个结构化评估工具,MHC 处理不在任何一个的条目里——§3.2 的核心依据。
- Krishna C, et al. The influence of HLA genetic variation on plasma protein expression. Nat Commun. 2024;15:6469. PMID 39085222
504 个蛋白受 HLA 变异影响、94.8% 为 trans;标准 fine-mapping 与共定位在该区不适用。
- Li L, Tang Z, Zhong Z, …, Pan A, Sun X, Liu J, Liu G, Liu J. Proteogenomic mapping of multimorbidity identifies C1R linking coronary artery disease and dementia. medRxiv 2026.07.14.26358022(2026-07-16 posted)
与本课题最像:同一张 UKB-PPP 哨兵表、同 1,954 蛋白、deCODE(N=35,559) 外部复制。v3 三处变更的主要依据。
- Yuan S, Xu F, Li X, Chen J, Zheng J, Mantzoros CS, Larsson SC. Plasma proteins and onset of type 2 diabetes and diabetic complications. Cell Rep Med. 2023;4(9):101174. PMID 37652020 · PMC10518626
- Yuan S, Jiang F, Chen J, …, Ludvigsson JF. Phenome-wide Mendelian randomization analysis reveals multiple health comorbidities of coeliac disease. EBioMedicine. 2024;101:105033. PMID 38382313
⚠️ 常被误引为「Elvers 等人关于克罗恩病的研究」——作者列表无 Elvers,病种为乳糜泻。
- Fernando MM, et al. Defining the role of the MHC in autoimmunity: a review and pooled analysis. PLoS Genet. 2008;4(4):e1000024. PMID 18437207
⚠️ 该文与 MR、因果推断、工具变量选择无关,不可用于论证 MR 中 MHC 的处理方式。
- Common pitfalls in drug target Mendelian randomization and how to avoid them. BMC Medicine. 2024. PMC11481744
- Guidelines for Mendelian randomisation studies — Diabetologia. 期刊公开指南页
九、未决事项
- [ ] ⚠️ C1R 漏斗的具体数字尚未逐字核实(1954→224→44→43→13 可验证→40→9→4)。 本地 PDF 转文本时行号与正文数字混在一起,无法可靠分离;本机与 WSL 均无 PDF 库、
pdftoppm未安装。引用这些数字前必须先解决 PDF 读取。 本页所引 C1R 的结构性事实(步骤顺序、保留未测试者、富集用验证后集合、 LDSC/MHC 零命中)均为关键词级验证,不依赖数字,可用。 - [ ] 逐字通读 Yuan 2023(PMC10518626)STAR Methods 与补充表 S9:确认 MHC 确无处理、 抠出 17 个并发症蛋白完整名单逐个对照、核 HSPA1A/1B 在其富集结论中的权重
- [ ] 数一下改三分法后第 4 步存活者到底几个(从
decode_rep_mr.csv按"相反/一致/无适配体"重新归类即可,不必重跑) - [ ] 核实 GBMI 是否真的"保留全部工具变量并以分层标注 MHC"(此说法未能在其方法节证实)
- [ ] 核实 Diabetologia 指南中「避免按 F 统计量排除工具」一条(若属实,与第 1 步③冲突)
- [ ] MVMR / 两步中介:正式分解"糖尿病驱动 vs 并发症特异"
- [ ] 阳性对照:确认流水线能在糖网端 recover 已知为真的信号
- [ ] 代码侧:
32_targets_table.R/29_enrichment.R的in_MHC由蛋白名硬编码改为按坐标计算