主题
怎么批判性地读一篇 MR 论文
MR 论文的门槛低、产量大,质量差距极大。这页把 STROBE-MR 清单转译成读别人论文时该问的十个问题,然后拿站内已有的 baseline 文章走一遍。
清单出处
Skrivankova VW, et al. STROBE-MR 声明,JAMA 2021;326(16):1614–1624, DOI 10.1001/jama.2021.18236;解释与详述版 BMJ 2021;375:n2233, DOI 10.1136/bmj.n2233。
下面十问是面向阅读的转译,不是 STROBE-MR 的逐条复述。投稿自检请用原清单。
十个问题
问 1 · 工具从哪来?cis 还是 trans?
- cis(编码基因附近):生物学上直接影响该蛋白,多效性风险低
- trans:可能通过任意通路,多效性风险高得多
看清 cis 窗口定义(±500 kb?±1 Mb?)。只用 trans 工具还声称是药靶验证的,直接降级。
问 2 · F 统计量报了吗?报的是哪个?
没报 F 的,作者自己都不知道工具强不强。报了也要看:报的是最小值、中位数还是均值?
"minimal F > 300" 这种说法要留神
报最小值是好习惯(比报均值诚实)。但如果只报一个笼统的下界而不给分布,仍然看不出有多少工具在勉强及格线上。
问 3 · 暴露和结局的样本重叠了吗?
这是最常被忽略、也最常被写错的一条。 两样本 MR 的"两样本"如果其实有大量重叠,弱工具偏倚的方向就从保守翻成激进。
要问:
- 两侧 GWAS 各自的队列构成写清楚了吗?
- 如果重叠,量化了吗?(重叠比例 × 观察性混杂 ÷ F,见 偏倚方向总表)
- 病例-对照结局要看病例侧的重叠,不是总体的
我们自己在这条上栽过
本课题曾在三处写外部 T1D 源「与 UKB-PPP 无重叠」,是错的(实际含 UKB 44.5%),2026-07-29 全部订正。
量化之后偏倚只有 0.16%、结论不变,但"不重叠"和"重叠但可忽略"是两句不同的话。见 外部 T1D 数据源与样本重叠。
读别人论文时,看到"两个独立队列"就默认无重叠,是同一个错误。
问 4 · 人群祖源匹配吗?
暴露 GWAS 和结局 GWAS 是不是同一祖源?跨祖源会同时带来 LD 结构差异和等位频率差异,工具可能根本不代表同一个信号。
混合祖源的 meta 分析尤其要看有没有做分层。
问 5 · 多重检验怎么校正的?
Bonferroni 还是 FDR?在哪一层校正的——按蛋白数、按结局数、还是按蛋白 × 结局的全部组合?
两阶段设计要特别小心:第一阶段筛完再在第二阶段校正,第一阶段的选择效应不会被第二阶段的校正吸收。
问 6 · 共定位做了吗?覆盖率多少?
cis-MR 里 共定位不是加分项,是必需项——没有它就无法排除"蛋白信号和疾病信号是 LD 拉在一起的两个不同变异"。
要问:
- 做了几个蛋白?占全部阳性结果的多大比例?
- 用什么方法、什么先验?
- 阈值是二值(PP.H4 ≥ 0.8)还是分档?
PP.H3 和 PP.H4 要一起看
PP.H4 低有两种完全不同的原因:确实不共定位(PP.H3 高)和功率不够(PP.H3 也低)。只报 PP.H4 的二值阈值会把这两种写成同一个阴性。
问 7 · 效应量能这样解释吗?
MR 估的是每单位暴露变化对结局的效应。看到"血浆某蛋白每升高 1 SD,患病风险 OR = 1.2"要问:
- 这个线性关系外推到临床可达的干预幅度上还成立吗?
- 效应同质性假设成立吗?不成立时估的是 LATE,不是全人群平均效应
- OR 极端偏离 1 的(比如 0.07 或 15)尤其要警惕——通常意味着分母(暴露效应)很小,而不是效应真的这么大
问 8 · 结局定义与对照是谁?
这条极易漏。 尤其是并发症研究:对照是"没有并发症的糖尿病人",还是"一般人群"?
如果是一般人群,估的其实是**"糖尿病 + 并发症"的复合效应**,里面混着糖尿病本身的易感性。
问 9 · MHC 区怎么处理的?
MHC 区(chr6 ~25–34 Mb)LD 结构极端复杂、基因密度极高,共定位和多效性判断在这个区域都不可靠。
论文有没有说明?把 MHC 区的蛋白和非 MHC 的混在一起报"共同机制"的,通常是 LD 假象。
问 10 · 反向因果查了吗?查到什么程度?
Steiger 过滤只是提示,不是验证。真正的检验是独立跑一遍反向 MR(结局 → 暴露)。
要问:
- 反向 MR 的工具剔除了蛋白自身的 cis 区吗?不剔的话全是假阳性
- 阴性结果的功率够吗?反向显著率主要由工具数决定,工具少时的阴性只能说"未发现证据"
实例走查 · Yuan 2023
对象
Yuan S, Xu F, Li X, Chen J, Zheng J, Mantzoros CS, Larsson SC. Cell Reports Medicine 2023;4(9):101174. DOI 10.1016/j.xcrm.2023.101174(PMC10518626)
这是本课题的 baseline 文章。站内已有逐条对比页,下面按十问重新组织。是好文章——走查是为了演示方法,不是挑刺。
| 问 | Yuan 2023 的答案 | 评价 |
|---|---|---|
| 1 · 工具来源 | index cis-SNP,单个,p<5×10⁻⁸,cis 定义为编码基因 ±1 Mb | ✅ 规范。窗口比我们的 ±500 kb 宽 |
| 2 · F 统计量 | 报了 "minimal F statistic ... more than 300"(p.3) | ✅ 报最小值是好习惯,但没给分布 |
| 3 · 样本重叠 | 暴露 UKB-PPP / deCODE,结局 DIAGRAM + FinnGen R8 | ⚠️ 原文未见量化讨论(据站内对比页的实测记录) |
| 4 · 人群匹配 | 欧洲祖源为主 | ✅ |
| 5 · 多重检验 | T2D 用 Bonferroni(p<2.65×10⁻⁵),并发症用 FDR | ⚠️ 见下方"最大问题" |
| 6 · 共定位 | coloc.abf + SuSiE,先验 p1=p2=1e-4、p12=1e-5,分档 PH4≥0.8 强 / 0.5–0.8 中 | ⚠️ 只覆盖 deCODE 的蛋白(原文自承局限)。分档做法值得学 |
| 7 · 效应量解释 | 主打 AGER 抑制剂的治疗前景 | ⚠️ 从遗传效应跳到药物干预是常见的过度外推 |
| 8 · 结局定义 | 10 个并发症端点,全部 FinnGen R8 | ❌ 未提微血管端点的对照是一般人群。原文局限只提到大血管端点 |
| 9 · MHC 处理 | 主打蛋白含 HLA-DRA | ⚠️ 原文未见 MHC 专门处理的说明 |
| 10 · 反向因果 | 做了 T2D → 47 个蛋白 | ⚠️ 没做并发症 → 蛋白,所以这一层他们看不到 |
走查暴露的最大问题:两阶段漏斗(问 5 + 问 1 交叉)
单看任何一问都不致命,合起来看才暴露设计问题:
Yuan 2023:1,885 蛋白 ──[Bonferroni p<2.65e-5]──> 47 个 T2D 蛋白 ──[FDR]──> 10 个并发症
↑
并发症分析的入口只有这 47 个后果:并发症结果按构造只能是"糖尿病蛋白的下游延伸"。凡是"不影响糖尿病、只影响并发症"的蛋白,在这个设计里根本看不见。他们的四个主打蛋白(HLA-DRA / AGER / HSPA1A / HSPA1B)也确实全部是先在 T2D 上显著才进来的。
这不是算错了,是设计决定了能看见什么。读论文时问"这个设计排除了什么可能性",往往比检查参数更有价值。
走查暴露的第二个问题:问 10 的功率(反向因果)
站内反向 MR(剔除蛋白自身 cis 区 ±1 Mb,MHC 蛋白额外剔整个 MHC)发现:
MANSC4 —— 他们并发症共定位里最强的蛋白(酮症酸中毒 PH4=0.92)—— 在 T1D(β=+0.0117, FDR=0.0023)和 T2D(β=−0.0266, FDR=0.018)两个方向都反向显著。
提示其关联可能部分来自反向因果或 index event bias。他们没做并发症方向的反向 MR,所以看不到这一层。
但也要看住自己的功率
同一份分析里 AGER 在并发症方向未过 FDR(0.082 / 0.098)。
这只能说"未发现反向证据",不能说"已排除"——AGER × Maculopathy 只有 5 个工具,功率不足(反向显著率与工具数 Spearman ρ=0.71)。
批判别人的标准,要同样用在自己身上。
顺带查出的两处硬错误(引用时避开)
走查到问 6 时对着参考文献核,发现两处:
- 共定位的引文与所述方法不对应。原文 p.e3 描述"five exclusive hypotheses"的两性状 coloc,但引的参考文献 48 是 Foley CN, et al. Nat Commun 2021;12:764(HyPrColoc)。5 假设的两性状 coloc 应引 Giambartolomei 2014。且其 Key Resources Table 里只有
Coloc和SuSiE,并未使用 HyPrColoc。 - R 版本与时间线矛盾。原文两处写 "R software (4.4.1)",但该文 2023-08-06 接收、2023-08-30 上线,而 R 4.4.1 于 2024-06-14 才发布。
这说明一件事
参考文献是可以核的,而且值得核。 上面两处都不影响主结论,但说明发表本身不保证细节无误。你自己的稿子同样会被这样核。
把十问用在自己身上
本课题被同样十问查出来的问题,都记在站内,没有藏:
- 方法学审计与已知限制 —— 一次系统审计的全部发现,含已修的数值问题
- 外部 T1D 数据源与样本重叠 —— 问 3 上的自我订正
- 对照定义敏感性分析 · 撤回记录 —— 一条结论被自己推翻的完整过程
- 反向 MR · R9 主线 —— 问 10 的实现与功率限制
不要写成"我们推翻了 baseline"
走查的目的是说清设计差异,不是证明别人错。Yuan 2023 在正向结果上和我们高度一致(AGER 两边都是强命中)。
写 Discussion 时的正确姿势是"他们的设计回答了 A,我们的设计能回答 B",不是"他们错了"。