Skip to content

流程答疑 · 每一步为什么放在那里

这一页解决的问题:流程图给的是结论,这一页给的是过程—— 每个位置是怎么定下来的、查了哪些文献、哪些是文献支持的、哪些是我们自己定的、 以及我在这一轮里判错并被纠正的地方

配套:分析流程与文献依据(流程图与依据强度表)

⚠️ 本页多数文献结论来自定向检索 + 工具代读页面(列出 Results/Methods 小标题次序), 未逐字通读原文。凡标注「⚠️需读原文」的,正式写进论文前必须自己读一遍。


快速索引

问题答案依据强度
只标注的几项该拿谁的蛋白做?否决性检验的存活者;计算可以广算,正文窄报
方向性和外部复制谁在前?方向性在前
只标注的几项要不要单独编号?要,独立成第 5 相
该不该加跨组学验证?该加,但只能加分不能扣分弱·自定
先看单细胞还是先看跨组学?先跨组学,表达用来解释它
LDSC 在哪跑?第 0 相,MR 之前
通路富集在哪跑?第 2 相旁路,输入是 MR 显著蛋白集
10 分以上的文章是怎么做的?五条路,我们一条都没占住
有没有人做了和我们一样的?有,Cell Rep Med 2023
网上/AI 说的这两段 MHC 论述对吗?不建议使用,引文多处不可溯源或张冠李戴
「找药靶就不用删 MHC」成立吗?理由不成立,但最终决定不删:留而标注,单列不可解释层
富集该放在方向性之后吗?文献分两派;本课题只能用 A 派

📌 现行流程分析流程定稿 v3(共定位后置) | 历史版本:初版 · v2

v3 相对 v2 的三处变更(依据均来自 C1R 预印本本地全文核对): ① 共定位移到外部复制之后,且改为排序而非否决 ② 外部复制改三分法,「该平台无数据」不再当阴性 ③ LDSC 由「第 0 相」降为可选的数据验收(Yuan 2023 与 C1R 全文均零命中)


Q1. 只标注的 pheWAS / 成药性 / 表达,该拿哪一批蛋白做?

问题:它们该接在 MR+共定位之后,还是接在有否决权的那两道之后?

:接在否决性检验的存活者之后。

依据——GBMI 的 Cell Genomics 多祖先 proteome-wide MR 步骤顺序是显式写出来的:

1-3 工具筛选(含 Steiger) → MR → 多效性检验     ← 过滤
4   共定位                                      ← 过滤
6   Validation MR(独立 pQTL 数据集复制)       ← 过滤
7   多祖先比较                                  ← 过滤
8   性别分层                                    ← 只标注
9   药物数据库 / 临床试验 / 适配体伪影标记      ← 只标注,在最后

Zheng 2020 Nat Genet 同样:成药性注释是套在「295 个同时有 MR + 共定位证据的结果」上, 不是套在 413 个 MR 阳性上。组织表达他们根本没做,写在局限里。

★ 但有个重要限定:因为这几项没有否决权,它们接在哪里对漏斗计数毫无影响。 后移的理由是报告经济性,不是正确性。所以口径拆成两件事:

怎么做
计算仍可对 MR+共定位的全部存活者跑(成本一样,还能出补充表)
流程图 + 正文只画/只写否决性检验存活者的注释结果
补充材料被否决掉的那些,注释结果照样附上——反过来能佐证否决是对的

一句话:广算,窄报。


Q2. 方向性 / 反向 MR 该不该排在外部复制前面?

:该。三条理由,第三条最实际。

① 文献顺序如此。 Zheng 2020 在 MR 之后的次序是 共定位 → PWCoCo → 异质性 → 反向因果(双向 MR + Steiger)跨 pQTL 研究复制。 GBMI 更把 Steiger 提到工具筛选层,比复制早得多。

② 性质不同。

失败意味着
方向性 / 反向 MR这个 MR 估计本身就不是我们以为的那个因果量 → 效力问题
外部复制这个估计在另一平台/人群没重现 → 稳健性问题

效力问题应当先于稳健性问题。方向搞反了的估计,讨论它稳不稳没有意义。

③ ★ 反向因果的信号会复制。 若某关联其实是「疾病 → 蛋白」,它在 deCODE、在 ARIC 照样出现——它是真实存在的关联, 只是方向反了。复制放在前面,等于先给一个反向因果的伪信号发一张 「通过外部复制」的通行证,在漏斗图上构成误导性的证据累积顺序。反过来则无任何信息损失。

换顺序不改变最终存活集合

两道都是纯否决,交集可交换。变的只是漏斗每格的数字、计算成本、叙事的诚实度。 第三样才是理由。重跑时不因此重算任何东西。

外部复制不是无脑否决

跨平台不一致未必说明信号是假的,也可能是测定伪影。 本课题实例:APOL1 在 Olink 与两个 SomaScan 上方向相反 → 判定为表位伪影 → 据此排除的是「血浆水平致病」这一机制,而不是简单记一个「复制失败」。

正确写法:不一致 → 先查 PAV / 表位与适配体结合伪影 → 再判是否否决。


Q3. 只标注的几项要不要从 4-x 改成 5-x?

:要。

共用一个「4」等于宣称有否决权和没否决权是同类操作。虚线框只是视觉暗示, 相号才是结构声明。拆开之后,「漏斗计数到第 4 相为止」可以直接从图上读出来, 不必靠图注解释。

顺带修掉一个我制造的问题:记忆里的编号与 docs 差一位(0a/0b/1/2/3/4 vs 1/2/3/4/5), 这次统一到 docs 那套。


Q4. 该不该加跨组学验证?

:该加,但必须规定它只能加分不能扣分——依据是我们自己的实测。

实测说明什么
跨层顶信号往往不是同一个变异:血浆 pQTL vs eQTL r² 仅 0.095 / 0.031「方向相反」不构成反对——比较的根本不是同一个信号
IFNAR1 视网膜 eQTL 层完全阴性而 IFNAR1 是本课题证据最硬的候选(Ifnar1−/− 激光 CNV 病灶更大 P=0.028、IFN-β 治疗改善 P=0.0038、小胶质特异敲除可复现 P=0.0007)
ERMAP 视网膜 PP.H4 = 0.949 但方向与血浆相反早先「强共定位支持」的说法已撤回

第二行是决定性的:若跨组学有否决权,我们会用一个无法支持阴性推断的层, 杀掉自己最好的候选。

规则:阳性写「机制上一致」;阴性只能写「该层未提供支持」, 不得写「该层不支持因果关系」。

⚠️ 两个纳入前置条件: ① 06_sqtl_smr 目前是孤儿层(只 6 条染色体、走 R13 线、不含视网膜), 要正式纳入必须先补齐或明确声明覆盖范围; ② 该层曾把 HEIDI = NA 当作通过(已修),重跑须复验。

⚠️ 它买的是机制可信度,不是期刊分数:按 Diabetologia 2025 投稿指南, 共定位、反向 MR、功能富集「一般不算独立方法」;跨组学同理, 它与主分析共享同一套遗传工具逻辑与 LD 混杂偏倚来源。


Q5. 先看单细胞表达,还是先看跨组学?

先跨组学,表达用来解释它。

★ 我在这里判错过一次,理由被推翻

我最初排的是「表达在前、跨组学在后」,理由是**「跨组学的阴性必须参照表达才能解读」**。

那句话本身没错,但由它推出「表达必须排在前面」是不成立的—— 它证明的是两者必须一起读,不是谁必须先跑解读上的耦合 ≠ 执行上的先后。

这个错误类型值得单独记住:把「A 是解释 B 的必要条件」当成「A 必须在 B 之前」。

按跨组学的结果分两支看,表达都是在看到跨组学结果之后才去查的,只是角色不同:

跨组学的结果表达扮演什么角色
阳性(疾病组织 eQTL 与 GWAS 共定位、方向一致)细化——是哪一类细胞扛着这个信号
阴性诊断——该组织根本不表达(这层压根没机会检出,零信息),还是表达了但没检出 eQTL(检出力问题)

本课题的 IFNAR1 属阴性里的第二种:小鼠那边做的是小胶质特异敲除并复现了表型, 说明视网膜小胶质确实表达它——所以那个阴性是检出问题,不是「这个组织没有这个蛋白」。

另一条理由:跨组学是这两项里唯一可能改变我们措辞的(阳性了可以写「机制上一致」); 表达单独存在时永远改变不了任何结论,只能修饰别的结论。 能动的放前面,只能修饰的跟在后面。

查证方法(可复用)

不问「应该怎样」,而是查同类论文 Results 小标题的实际次序。查了三篇:

论文次序单细胞的用途
扩张型心肌病(PMC12532413)MR/eQTL/SMR → Phe-MR → 单细胞"we used the DCM single-cell sequencing dataset to explore the expression of the druggable gene"
黑色素瘤多组学 MR(PMC12597094)eQTL MR → pQTL MR → 共定位+反向 MR → … → 单细胞 → 空间转录组"corroborated the function of the targets … through further analysis at the transcriptome level"
结直肠癌(PMC12085524)单细胞 → eQTL/pQTL MR → SMR反例,但用途不同:用单细胞 DEG(4909 个)当 MR 的暴露候选池

规律不是「单细胞在后」,而是看单细胞被拿来干什么

  • 发现/圈定候选(DEG 当暴露池)→ 在 MR 之前(属工具/暴露选择)
  • 定位与解释已锁定的靶点 → 在 MR/共定位之后

我们属后者。

⚠️ 这三篇都在 IF 3–6 区间,证明的是惯例,不是正确性; 高分那边(Zheng 2020)干脆没做组织相关性,写在局限里。


Q6. LDSC 遗传相关在流程哪一步跑?

第 0 相,第 1 相之前的性状层 QC。

位置有据

  • 基底细胞癌那篇(PMC13436695)把 LDSC 放在 Results 第一节: "At the trait level, we first applied LD Score Regression to the BCC GWAS summary statistics to estimate SNP-based heritability and assess potential confounding factors such as population stratification and cryptic relatedness."
  • 乳腺癌×精神疾病(PMC13382130)Results 次序: ① 全基因组遗传相关(LDSC) → ② MiXeR → ③ 局部遗传相关 → ④ 因果分析(MR) → …
  • MRC IEU 的 MR 词典写明:LD score regression 可用来识别值得用 MR 跟进的关系

⚠️ 但我们的用法没找到先例。

文献里 LDSC 有三种记录在案的用法,都不是我们那种

用法位置出处
性状层 QC(遗传度、混杂/膨胀)MR 之前基底细胞癌那篇
遗传相关先行,筛选值得 MR 跟进的关系MR 之前乳腺癌那篇 + MRC IEU 词典
截距估计样本重叠,校正 MR 估计与 MR 绑定MRlap

我们的用法是第四种:拿 rg(T1D, T2D) 与近缘性状比对,判断这份数据测的到底是不是 它自称的那个病,不合格就退役整个数据源(旧源 GCST90475661 即因此退役, rg 从 0.886 降到 0.087)。定向检索到的都是错分校正方法,不是「用 rg 做数据源身份核验」。

位置有据,用途自行声明。

顺带查到一个我们还没用的用法

LDSC 截距可用来估计样本重叠并校正 IVW 估计(MRlap)。 这正好能处理我们「T1D 源含 UKB 5–6% 重叠」那个待办。


Q7. 通路富集在流程哪一步跑?

第 2 相(MR + 多重检验校正)输出引出的旁路,输入是「MR 显著蛋白集」, 不参与筛选,直通第 6 相定稿。

三篇实际排法一致:

论文工具输入集位置
Yuan 2023 Cell Rep Med(与本课题最像)GeneMANIA47 个 MR 显著蛋白T2D 结果之后、反向 MR 之前,小标题「Function and network prediction」
蛋白组 MR × 重症 COVID,PLOS GeneticsKEGG全部 MR 显著蛋白Discussion,敏感性分析之后
乳腺癌 × 精神疾病MAGMA 系列多效基因集Results 第 8 节(共 9 节)

共同点:跑在「显著集」上(不是最后剩的几个候选),位置在 MR 结果之后,从不参与筛选。

★ 但我们「按 MHC 分组跑」这一招没找到先例

本课题实测:

  • 31 个显著蛋白一起跑 → 头号 immune response p=7.2e-07
  • 剔掉 MHC 只留 20 个免疫信号完全消失(最好 p=0.047),变成脂蛋白颗粒

同一批数据,分组方式一变,「机制结论」就翻了。这正说明富集只能当背景,不能当证据。

但它还有第二个用途——当诊断工具,用来检验别人的富集结论。 Yuan 2023 的富集结论是 "protein-folding and catabolism, response to temperature stimulus/heat, … response to oxidative stress",而 HSPA1A(chr6:31.82 Mb)与 HSPA1B(chr6:31.83 Mb) 两个热休克蛋白正在 MHC 区内

⚠️ 这是待验证的假设,不是结论——需要读其补充表确认这两个在富集里的权重。


Q8. 10 分以上的文章是怎么做的?

先看现状。「proteome-wide MR + 共定位 + 靶点」这个模板近两年的落刊:

做法实际落刊IF
PW-MR + coloc + SMR + TWASJ Transl Med~6
PW-MR + coloc(卒中/CKD/强直性脊柱炎/腹主动脉瘤/膝髋 OA)Sci Rep / BMC Neurol / JAHA / MDPI3–6
再加 PPI + 富集 + 单细胞 + 分子对接 + qRT-PCR + CCK-8Discover Oncology~3

注意最后一行:该堆的全堆上了,还是 IF 3。「再多加几种分析方法」这条路已经堵死。

拥堵程度(有数字):MR 论文自 2022 年起几乎每年翻倍,2024 年发表 6500+ 篇PLOS One 一家 2024 年收到近 1800 篇 MR 投稿; Diabetologia MR 投稿接受率 5 年内从 24% 掉到 4%; 隔壁题材已有撤稿(《Mendelian randomization based on immune cells in diabetic nephropathy》)。

★ Diabetologia 的投稿指南直接点了我们的名

"The strongest consideration will be given to those submissions in which MR is presented within a triangulation of evidence framework including at least one other approach with different key sources of potential bias."

"Colocalization, reverse MR, and functional enrichment are generally not considered to be independent approaches."

翻译成我们的话:

我们流程里的算不算三角验证
第 3 相 共定位不算
4-1 反向 MR不算
通路富集不算
4-2 跨平台复制边缘——同为 pQTL,偏倚来源没变
第 5 相全部都是注释,不算

它认的是:RCT、队列/横断面研究、湿实验、阴性对照研究、跨情境比较。 它还明说会拒:只用已发表 GWAS 汇总数据 + 现成方法做 MR

>10 的五条路,我们一条都没完整占住

例子
A 自己产新数据 / 加新测量层Sun 2023 Nature(UKB-PPP 资源);Diabetologia 2026 眼内液+血浆整合蛋白组
B 规模 / 多祖先联盟GBMI Cell Genomics(欧非双祖先)
C 方法学本身是新的Nat Commun 2024 robust cis-MR;Zheng 的 PWCoCo
D 首创 + 闭环证明方法有用Zheng 2020:回头用历史药物开发数据证明 MR+coloc 双支持的靶点获批率更高
E 遗传发现 + 独立实验闭环AJHG 的 PCOS 那篇标题就写着 "and functional studies"

我们手上最接近的资产

IFNAR1 那条线其实已经踩在路 E 上,只是位置放错了。 现有证据链:

遗传 OR 0.782 → 病人房水测不到 IFN-α(独立临床测量)→ DME 的 RCT 阳性(干预)→ Ifnar1−/− 小鼠激光 CNV 病灶更大 P=0.028 / IFN-β 治疗改善 P=0.0038 / 小胶质特异敲除可复现 P=0.0007(实验)。

这四样正好就是 Diabetologia 点名认可的独立证据清单前三项,而我们把它们放在讨论和 补充材料里当「支持性文献」。零新增计算,纯写作重组,但对定位的影响最大。

⚠️ 另有一条待核:指南里似乎写着「避免按 F 统计量排除工具」, 这与本流程第 1 相③的 F≥10 直接冲突。需读原文确认后再决定是否改流程。


Q9. 有没有人做了和我们一样的?

有,而且发在 IF ~11 的刊上,2023 年 8 月。

Yuan S, et al. Cell Reports Medicine 2023;4(9):101174(PMC10518626 · PMID 37652020)

《Plasma proteins and onset of type 2 diabetes and diabetic complications: Proteome-wide Mendelian randomization and colocalization analyses》 ——Karolinska + 西湖 + 浙大 + 瑞金 + Harvard

他们我们
暴露UKB-PPP 54,306 + deCODE 35,559UKB-PPP 54,219 + deCODE 复制
蛋白数1,8861,954
工具cis only,index cis-SNP,p<5e-8,±1Mbcis only,±500kb
结局FinnGen R8,10 个糖尿病并发症FinnGen R9
方法MR + 共定位 + 反向 MR + 复制
结果47 个关联 T2D(11 个强共定位);17 个关联至少一种并发症,但共定位支持很少结构一样

设计几乎一比一。

★ 但他们的头号并发症结果,四个全在 MHC 区

摘要原句:"HLA-DRA, AGER, HSPA1A, and HSPA1B are associated with most microvascular complications."

Ensembl REST 实测坐标(GRCh38):

HLA-DRA   chr6  32.44 Mb   ★在 26–34Mb 内
AGER      chr6  32.18 Mb   ★在 26–34Mb 内
HSPA1A    chr6  31.82 Mb   ★在 26–34Mb 内
HSPA1B    chr6  31.83 Mb   ★在 26–34Mb 内

四个全部落在 Zheng 2020 要求在工具选择阶段排除的区间内。 他们反向 MR 里出现的 MICB 也是(chr6:31.49 Mb)。

而他们没有处理 MHC(两次不同问法的检索:全文 "MHC"、"chromosome 6"、 "long-range LD"、"extended LD" 零命中;HLA 只作蛋白名与生物学讨论出现; 局限性 6 条里没有一条是 MHC/LD 结构)。

最关键的一句:他们把并发症端共定位支持薄弱归因于 "lacked strong colocalization support, possibly due to limited statistical power" ——归因于功效不足,不是归因于 MHC 长程 LD。

⚠️ 以上否定性判断来自两次工具代读,虽两次一致且第二次为逐字检索, 但正式写进论文前必须自己读原文。

这对我们意味着什么

① 位置从「被抢发」变成「方法学纠正」。 我们的实测正好对上:MHC 蛋白平均横跨 2.7 个并发症,非 MHC 平均 1.35 个。 「关联大多数微血管并发症」正是 MHC 长程 LD 假象的典型签名。 而 AGER 按 z 检验是我们的头号命中——我们独立复现了他们的结果, 并能证明它排掉 MHC 后不成立

② 富集那组对比有了外部意义。 原本只是内部敏感性分析, 现在是对一篇已发表高分论文核心结论的直接检验

③ 他们没做的正好是我们要补的:没系统区分「糖尿病驱动 vs 并发症特异」 (只做了弱版本:那 47 个 T2D 蛋白是不是也关联并发症,没有 MVMR / 中介分解)、 没有 pheWAS、没有组织表达、没有跨组学。局限里承认了「T1D/T2D 混合」和 「大血管并发症用非糖尿病人群」——碰到了我们的 estimand 问题,但只列为局限,没有分析

④ IFNAR1 未见 MR 文献报道(检索到的均为 IFNAR2 或其他炎症因子)。


Q10. 网上/AI 给的这两段 MHC 说法对吗?

当天收到两段外部材料,主张「药靶 MR 绝对不能删 MHC」。核查后两段都不建议使用

10.1 引文核查结果

它给的"出处"核查结果
"Due to the highly complex LD structure…the MHC region (chromosome 6, 25–35 Mb) was removed…",称是 Nature Genetics / Lancet / BMJ 论文的「标准通用原文查无此文。逐字检索零命中,且未指向任何一篇具体论文。substance 对,但这不是可引用的原文
Burgess 教科书「指出」常规 clumping 在 MHC 完全失效⚠️ 未能证实。书确实存在(Burgess & Thompson, 2nd ed., Chapman & Hall),但未查到 MHC 专门段落;原文本身也没打引号,属转述
Elvers 等人,eBioMedicine,关于克罗恩病和自身免疫病表型组的 MR 研究」⚠️ 句子真、出处三错 → 实为 Yuan S, Jiang F, Chen J, …, Ludvigsson JF. Phenome-wide MR … of coeliac disease. EBioMedicine 2024;101:105033(PMID 38382313)。作者列表无 Elvers;病种是乳糜泻不是克罗恩病
《Defining the Role of the MHC in Autoimmunity: A Review and Pooled Analysis》论文是真的:Fernando MM, et al. PLoS Genet 2008;4(4):e1000024(PMID 18437207)。⚠️ 但它与 MR、因果推断、工具选择无关——2008 年基于汇总统计的 MR 尚未普及。材料把「任何试图在 MR 中忽略该区域的做法…」这句塞进了它嘴里
「SNPs in the MHC region were not removed… metabolomics and immunomics biomarkers」⚠️ 未能核实(当时搜索额度用尽),且又一次没给期刊/作者/年份
cisMR-cML 引作「Chen X et al., Nat Commun 2024;15」❌ 第一作者实为 Lin Z,卷页 15:6072,PMID 39025905

10.2 一个致命的逻辑错误

材料的核心论证是:「做 T1D 的 MR 时删掉 MHC,就等于抹去它 50% 的核心遗传信号」

这在我们这种设计里是错的。 MR 里删 MHC 删的是暴露侧的工具变量;结局侧的遗传结构从未被动过—— 结局的 GWAS 只是在"暴露的工具 SNP"那几个位点上被读取,我们从来不给结局挑工具。 本课题中糖尿病并发症是结局,剔除 MHC 蛋白抹掉的是它们作为暴露的资格。

它把结局侧的遗传度事实,拿来论证暴露侧的操作。

而且即便免疫病作为暴露,实测结论也是反的:乳糜泻那篇(HLA 驱动到极致的免疫病)做了剔 MHC 的敏感性分析, T1D 与非霍奇金淋巴瘤的关联随之减弱——随水倒掉的不是婴儿,是两个假阳性。

10.3 它提的"解决方案"里两条技术上讲反了

  • 「贝叶斯共定位是顶刊处理 MHC 的黄金标准」coloc.abf单因果变异假设在 MHC 几乎必然被违反。 Krishna 2024 Nat Commun 15:6469 记录标准 fine-mapping 与共定位在该区不适用; 本课题共定位"无法判定"最宽档 100% 是 MHC拿 coloc 救 MHC,方向反了。
  • 「cis-MR 只取 ±500kb~1Mb,范围极小可控多效性」 → MHC 的问题恰恰是长程 LD 跨越整个 8 Mb, 区内画小窗并不能把你和邻居隔开。
  • 唯一对的是:HLA-TAPAS 等 MHC 专用参考面板 + 条件分析。但那需要 HLA 分型数据,且是另一种研究设计。

Q11. 「我们是找药物靶点,所以不用删 MHC」——这个理由成立吗?

理由不成立,但结论值得认真权衡。

理由不成立,是因为 Zheng 2020 本身就是药靶 MR,而且删得最彻底(SNP 与蛋白一起删)。 "药靶研究"这个标签本身不构成豁免。

正确的判别轴不是"免疫不免疫、药靶不药靶",而是:

你在做什么怎么处理
假设无关的全景筛查(1954 个蛋白 × 多个结局)← 本课题工具选择阶段整体排除
单个预先指定、由 MHC 编码的靶点不能删(删了没工具),改用 HLA 分型 + 条件分析,另立一节

当时权衡过的三个方案

做法数字要不要重跑
A 删第 1 相排除 26–34Mb31→20 蛋白、57→27 对,比例数字全部重算
B 留 + 标注最终采纳算进来,共定位后单列 MHC 层,不进提名31/57/61% 原封不动不用
C 折中主分析删 + 敏感性含 MHC + 预先指定例外主分析同 A

最终决定:B。 第 1 相不设 MHC 排除步骤;MHC 区蛋白全程参与分析, 在第 3 相共定位之后单列为"共定位不可解释层",不进入靶点提名,但全部结果予以报告。 详见 分析流程定稿 v2 §2。

为什么最终选 B

  1. "剔除 MHC"不是规范条目:29 个 MR 质量评估工具里没有这一条(Yu J 2026, PMID 41999635), Zheng 2020 也从未做过删/不删对比来证明必须删。既然不是规范,删或不删都要自己给理由。
  2. 删掉的代价具体且难辩护:AGER(chr6:32.18 Mb)是 AGE–RAGE 轴、糖尿病并发症最教科书级的通路, 且是本课题 z 检验头号命中;AMD 线的 CFB / C2 / C4 是已上市补体靶向药所在的通路。
  3. 留而标注提供的信息更多:删掉 → 只能声称 MHC 不可靠; 留下 → 展示 MHC 结果,并用数据证明它不可解释(无法判定档 100% 来自 MHC; 横跨 2.7 vs 1.35 个并发症;免疫富集剔除后 p 由 7.2e-07 退至 0.047)。
  4. 对 Yuan 2023 的论证更直接:MHC 蛋白就在我们的结果表里,可以并排展示 "我们复现了他们的 AGER 等信号"与"这些信号不可用标准共定位解释",不必从被删掉的数据里回溯。
  5. 不用重跑:31 蛋白 / 57 对 / 61% / 37% 全部保留。

但"不删"必须配机制,不能沉默地留着

文献里有意识保留 MHC 的论文都配了额外机制(SSNS 用 HLA 等位基因共定位; DMARD→AD 靶点含 MHC III 区的 TNF)。本课题的机制就是"共定位不可解释 → 单列成节 → 不提名"。


Q12. 通路富集是不是该放在 4-1 方向性之后?

这个问题上我上一轮说过头了:我说"三篇一致",其实文献分成两派。

派别输入集位置实例
A 派全部 MR 显著蛋白MR 结果之后、反向 MR 之前,或 DiscussionYuan 2023 Cell Rep Med(GeneMANIA 跑 47 个显著蛋白);PLOS Genetics COVID(跑全部显著蛋白、写在 Discussion)
B 派筛完的优先集方向性之后,接近末尾CHD/MI J Transl Med(跑 13+7 个因果蛋白,排 Results 第 7 节,Steiger 报在更前面);乳腺癌×精神(通路分析排第 8 节)

所以"药靶文章大家都放在方向性之后"确实存在,是 B 派。

但本课题只能用 A 派,两条硬理由

  1. 富集需要几十个基因才跑得出东西。 CHD 那篇是 13 个已属勉强; 本课题第 4 相之后只剩 3 个存活者——3 个基因做通路富集没有统计意义。
  2. 本课题的富集承担一个别人没有的功能:它是 MHC 诊断工具 (31 个一起跑 immune p=7.2e-07 → 剔 MHC 剩 20 个信号消失,最好 p=0.047)。 这个对比必须有 MHC 蛋白在场才做得出来,放到 3 个存活者上就彻底没了。

→ 依据强度表已相应改为「文献分两派,本课题因存活者仅个位数 + 富集承担 MHC 诊断功能,选 A 派」。


附:本轮我判错并被纠正的地方

留档不是为了自责,是因为这几类错误会重犯,写下来才拦得住。

判错的内容错因怎么纠正的
「表达必须排在跨组学之前」把「A 是解释 B 的必要条件」当成「A 必须在 B 之前」——解读耦合 ≠ 执行先后用户指出;改查同类论文小标题实际次序
PWCoCo / LD check 标为 ★★ 必补没把它和 MHC 重跑连起来看——MHC 一旦在第 1 相排掉,「无法判定」问题基本自动消失自查发现,已降级
「LDSC 对数据源有否决权」写成定论位置有据,但这个措辞没有先例,我当成公认说法了用户要求查文献后订正为「自行声明」
「排除 MHC」在依据强度表标为把「一项研究的操作决定」当成「方法学规范」——Zheng 2020 从未做过删/不删对比;29 个 MR 质量评估工具里没有这一条用户提供的文献综述指出;已下调为「惯例 + 本课题实测自证」
富集位置标为「三篇一致 · 强采样偏了——查到的三篇碰巧同派;第四篇(CHD/MI)正好相反用户质疑后补查;已改为「文献分两派」
「MHC 排除依据弱」等四条(更早)循环论证 / 摘要抹平区分 / 样本为一 / 标注未读却下结论见流程页第三节

修法:① 中性词重搜;② 读原文核对摘要抹平的区分;③ 一篇方法节 ≠ 领域惯例; ④ 标注不确定 ≠ 可以下结论;⑤ 论证排序时先问「这条理由约束的是读法还是跑法」。


参考文献

  1. Zheng J, et al. Phenome-wide Mendelian randomization mapping the influence of the plasma proteome on complex diseases. Nat Genet 2020;52:1122. PMC7610464
  2. Zhao H, et al. Proteome-wide Mendelian randomization in global biobank meta-analysis (GBMI). Cell Genomics 2022. PMC9646482
  3. Yuan S, et al. Plasma proteins and onset of type 2 diabetes and diabetic complications. Cell Rep Med 2023;4(9):101174. PMC10518626
  4. Schmidt AF, et al. Genetic drug target validation using Mendelian randomisation. Nat Commun 2020. 链接
  5. Common pitfalls in drug target Mendelian randomization and how to avoid them. BMC Medicine 2024. PMC11481744
  6. Guidelines for Mendelian randomisation studies — Diabetologia. 链接(社论正文付费墙:doi:10.1007/s00125-025-06484-6
  7. Attention to the misuse of Mendelian randomisation in medical research. PMC11950933
  8. Expectations for Mendelian randomization research in PLOS One. PMC12626271
  9. Proteome-wide MR for severe COVID-19. PLOS Genetics. 链接
  10. Cross-trait genetic architecture between breast cancer and psychiatric disorders. PMC13382130
  11. Leveraging eQTL at single-cell resolution for basal cell carcinoma. PMC13436695
  12. Integrating scRNA-seq and MR for dilated cardiomyopathy. PMC12532413
  13. Druggable targets in melanoma by multi-omics MR. PMC12597094
  14. Integrating single-cell with transcriptome-proteome MR in colorectal cancer. PMC12085524
  15. MRlap:用 LDSC 截距估计样本重叠. GitHub
  16. LD score regression — MRC IEU MR dictionary. 链接

个人科研与运维文档 · 内容持续修订