Skip to content

本轮方案答疑 · 复制验证、R13 定稿、AMD 分家

这一篇把定稿方案里几个容易被问倒、也容易做错的方法学概念讲清楚。都是真实决策里冒出来的问题,用本课题的真实数字回答。 📌 本方案已执行完毕,结果见分家重跑定稿 · AMD 独立家族 × 外部复制结果 配套阅读:R9→R13 并发症差异说明 · 方法学审计与已知限制 · 阶段七 · 靶点验证框架


1. Discovery vs Replication:主分析和复制到底谁是谁

这是最关键、也最容易混的一对概念。

主分析(Discovery)复制(Replication)
用什么数据FinnGen R13独立队列(MVP、IAMDGC)
干什么跑 MR 筛查、算 FDR、跑全部下游把主分析的显著命中拿去独立队列里"再验一次"
看什么谁显著(FDR<0.05)命中的方向是否一致、是否仍显著
进不进多重校正进(FDR 就在这里算)不进,只在结果表加一列 replicated: yes/no

主分析永远是 FinnGen。 复制队列不是用来"扩大样本"或"合并算"的,它是一道独立的确认闸门:一个信号如果只在 FinnGen 里成立、换个国家换套定义就消失,那它很可能是 FinnGen 数据的伪影;如果在 MVP(美国退伍军人)里也成立,才算"真"。

一句话

主分析回答"谁显著",复制回答"换个独立人群还成立吗"。两者数据、样本、目的都不同,绝不能混算。


2. 是不是"有好结果"才需要复制?

准确说:复制针对的是你的阳性命中,但"是否搭复制队列"必须提前定,不能看到好结果才去找。

  • 操作上确实是"有命中才有东西可复制":主分析筛出的显著"蛋白→并发症"(比如本课题的 TNFRSF10A),才拿去复制;没显著的阴性结果一般不逐个搬去复制——没有结论需要确认。
  • 但设计上要 pre-specified(提前声明):高分论文的规矩是"看结果之前就写好用哪个复制队列"。看到结果好看、才去挑一个"刚好能对上"的队列——这叫 cherry-picking,是审稿人最忌讳的。
  • 不复制也要如实报:命中在复制队列里没对上,照样写"未复制"。不复制不是失败,是信息(可能假阳性、可能功效不足、可能人群差异),绝不能藏

结论:复制不是"锦上添花才做",是"提前铺好、专门用来确认那几个阳性命中是不是真的"。


3. 每个并发症的复制数据够不够?

不是每个结局都有可用的外部复制。判定标准很硬:欧洲人 + 全量 summary stats + 与暴露(UKB-PPP)无重叠,三条缺一不可。

并发症有没有可用外部复制数据
糖网 DR✅ 很强MVP GCST90475689(29,668 病例 / 402,541 对照,欧洲)
糖尿病神经病变✅ 很强MVP GCST90475676(59,205 / 375,439,欧洲)
糖尿病肾病⚠️ 二档无 MVP;欧洲 DKD meta 中等规模(~5–8k 病例),功效有限
黄斑病变 / 黄斑水肿❌ 没有现有研究全是"仅显著位点"、样本小,做不了 MR 复制
新生血管青光眼❌ 没有GWAS Catalog 无独立数据
增殖性 DR❌ 没有全是"仅显著位点"、样本极小;R13 也删了这个端点
AMD✅ 已有IAMDGC(Fritsche 2016)

补不上的(黄斑/青光眼/增殖DR)不是失误,是客观没有——FinnGen 单源 + 在 Limitations 里披露即可

base 糖尿病(T2D/T1D)要不要复制?

不要。 base 在设计里是参照(判断"蛋白是打中并发症本身,还是只是打中糖尿病"),不是论文的新发现。而且 base 已经用的是金标准大队列(Mahajan T2D noUKBB、MVP T1D),没有"更权威的复制"可加。复制的火力全压在并发症(novel finding)上。


4. EXMORE vs STRICT:不是换阈值,是两个表型

DM_RETINOPATHY_EXMOREDM_RETINOPATHY_STRICT两个不同的病例定义

Retinopathy EXMORERetinopathy STRICT
病例广义:10 个眼并发症端点的并集(含黄斑病变、新生血管青光眼、增殖DR、玻璃体积血…),须有糖尿病狭义:仅特定编码 ICD‑10 H36.0*、ICD‑9 3620 的糖网,须有糖尿病
对照糖尿病人 且排除 DM_COMPLICATIONS糖尿病人 且排除 视网膜病变+黄斑病变
病例数(R13)15,3536,970
特点功效高、异质性大特异、干净、功效低

两个的对照都是"糖尿病人"(不是全人群)——这是严格设计,是本课题数据的一大加分项。

一个必须知道的坑

EXMORE 的病例包含了黄斑病变和新生血管青光眼。如果你又把 Maculopathy、NeovascGlaucoma 单独当结局报告,三者病例重叠、不独立,网络图/热图会被污染。 所以主 DR 端点用 STRICT(与那两个不重叠),EXMORE 退为敏感性分析并披露重叠。


5. 为什么只用 R13,不把 R9 当"复制"

R9 和 R13 都是 FinnGen,R13 是 R9 的样本超集(同一批人、更新的随访)。两者不是独立队列,把它们并列当"复制验证"会被审稿人一眼看穿(样本重叠 → 虚高置信度)。

  • 用 R13(更大、最新),R9 退役。
  • R9→R13 的一致性只能作为"稳定性说明"写一句,不能当独立复制。
  • 附带事实:R9 那些细分并发症(增殖性DR、多神经病变、酮症酸中毒…)在 R13 里被 FinnGen 官方合并删除了,不是我们没下——所以"保留 R13"不只是偏好,是 R13 能提供的天花板。详见 R9→R13 并发症差异说明

6. AMD 为什么必须和糖尿病分开

AMD(老年黄斑变性)不是糖尿病并发症——它是补体/drusen 机制驱动的独立疾病,和高血糖导致的微血管并发症是两回事。把它归进"糖尿病并发症"是科学硬伤。

落地做法(物理隔离):

  • 糖尿病组 → screen_R13_dm/:自己的热图/森林/网络 + 自己的下游 + 自己的多重校正家族
  • AMD 组 → screen_R13_amd/独立的图、独立的 FDR 家族、独立的下游。AMD 绝不和糖尿病共用任何一张图或一个校正家族。
  • 反而可以把 AMD 当"非糖尿病视网膜病对照":某蛋白打中糖网却不打中 AMD = 并发症特异性,是加分点。

7. 附:删结局要不要重算?——不用

主分析的 **FDR 是"每个结局单独校正"**的(每个结局各自对 ~1659 个蛋白做 BH 校正)。所以:

  • 删掉某个结局(R9 整套、或某个宽松 base)→ 其它结局的 p/FDR/显著性一个都不变
  • 减结局只是"抽走几列",不触发任何重算;下游只需按保留的显著蛋白重新取子集,不用重跑计算。

(唯一要真重跑的情形:新增结局,或换了暴露/引擎。删只需重出图表。)


只记三件事

  1. 主分析永远是 FinnGen R13;MVP/IAMDGC 只做复制确认,不进 FDR。
  2. 复制针对阳性命中,但要提前声明;不复制也如实报。
  3. AMD 和糖尿病彻底分家:分开跑、分开校正、分开作图。

个人科研与运维文档 · 内容持续修订