主题
分析流程定稿 v4 · 复制只分流,否决独立成步
⚠️ 本页已被 v5 取代,仅作历史记录。
v5 的唯一变更是把 MR-Steiger 从第 1 步移入第 3 步,与反向 MR 合并为 「变异层 + 性状层」。结果一个数都不变(每蛋白单一哨兵 → 两种次序等价)。 本页 §5 给「Steiger 属第 1 步」打的「多篇一致 · 强」无出处,已在 v5 撤下。
四个版本的关系(前三版保留不动,仅作历史记录,不再更新):
版本 MHC 共定位位置 外部复制 状态 初版 工具选择阶段排除 第 3 相(硬否决) 二分 已弃用 v2 留而标注 第 3 相(硬否决) 二分 已弃用 v3 不设步骤,共定位处标注 第 5 步(措辞升级关卡) 三分法,"有否决权" 已弃用 v4(本页) 同 v3,但坐标改用数据源自带标记 同 v3 拆 4a/4b/4c,只分流;否决独立成 4X ✅ 现行 v4 相对 v3 的两处变更(§2): ① 第 4 步拆成三个子项,并明确它不否决、只分流; ② 把 v3 写在第 4 步括号里的「再判否决」提出来,成为独立的 4X 表位 / PAV 调查—— 这是全流程唯一可能否决的地方。
一、流程图
图注:第 3 步与 4X 是全流程仅有的两个否决点。第 4 步的三个子项都不否决, 它们的作用是把每一对结果分到「通过 / 送 4X / 不可评估」三个去处。 通路富集挂在 4X 之后(而非 v3 的第 4 步之后),因为只有过了 4X 才谈得上"验证过的蛋白集"。
二、v4 相对 v3 的两处变更
2.1 第 4 步拆成三个子项,并明确它不否决
v3 把「外部复制」当成一个整体,并标了「★否决权」。实际推敲下来这有两个问题。
问题一:外部复制不是一件事,是三件。 一次 MR 估计有两侧数据,换哪一侧、换什么, 测的是完全不同的东西:
| 子项 | 换了 | 没换 | 因此抓不到 |
|---|---|---|---|
| 4a 换暴露平台 | 蛋白测定平台(如 Olink → SomaScan) | 结局数据 | 结局侧的假象(对照定义、确诊方式)会被原样复现 |
| 4b 换结局队列 | 结局 GWAS | 暴露工具(同一 SNP、同一平台) | 表位伪影——纯由结合力造成的假关联会在每个结局队列里"复制成功" |
| 4c 两侧都换 | 两侧 | — | 失败时无法归因于哪一侧,且功效最低 |
★ 关键:4a 与 4b 的盲区恰好互补,谁也替代不了谁。而 4c 虽然最"独立", 却是三者中诊断性最差的——所以它的正确用法是对少数存活者做确证,不是筛查。
问题二:复制本身不该有否决权。 见 §2.2。
★★ 2026-08-07 订正:4a 是「稳健性加分筛」,不是分流器
本页原先把 4a 写成与 4b 并列的分流子项。逐字读了 C1R 原文(Li et al. medRxiv 2026.07.14.26358022)之后,这个定位是错的,据此实现的代码连续三轮判定失效。
原文实际做法(Results 第 119–124 行):
For these five replicated proteins, we conservatively used an alternative set of cis-pQTL instruments derived from the Icelandic cohort ... to evaluate the robustness of the replication. Among them, only C1R retained consistent positive associations ... indicating robustness to instrument selection.
→ 换暴露平台重选工具,是对已存活候选做的加分筛(换套工具还显著同向 = 稳健), 不是一个用来发现"方向相反"的报警器。
这个角色差异有实际后果:加分筛的判据是现成的(还显著且同向), 报警器的判据得自行发明——我因此三次发明、三次推翻。详见 实录 06 页 §历史教训。
修订后的 4a 定位:
| 4a 结果 | 处置 |
|---|---|
| FDR<0.05 且方向一致 | robust_to_instrument_selection —— 措辞可加分 |
| FDR<0.05 且方向相反 | 报警 → 送 4X(原文据此剔除 3 个蛋白) |
| 未达 FDR<0.05 / 不可评估 | 保留,不加分也不减分 |
★ 与「4a 不否决」并不冲突——加分筛同样不否决,否决仍只在 4X。
2.2 否决独立成 4X —— 复制是分流器,不是法官
v3 的第 4 步三分法原文已经写着「方向相反 → 先查 PAV / 表位伪影 → 再判否决」, 也就是说否决权本来就在"调查"那一步,不在"复制"这一步。v3 把两步画在一个框里, 标成「第 4 步有否决权」,是把分流和判决混为一谈。v4 把它拆开并给调查一个编号。
为什么这个区分不是文字游戏——两个实质后果:
① 方向不一致时,错的不一定是发现队列。 PAV 可以破坏 Olink 抗体的表位, 也可以破坏 SomaScan 适配体的表位。谁的测量被污染,要靠调查(哨兵是不是 PAV、 落不落在表位、有没有非 PAV 工具给出一致方向)来定,不能由"谁是复制队列"来定。 若把否决权交给复制,等于默认复制队列永远是对的。
② 本课题的实例正是这样判的。 APOL1 最终撤回「血浆水平致病」这一结论, 依据不是"deCODE 方向相反"单独一条,而是 Olink 与两个 SomaScan 队列都相反 + 哨兵是 PAV 的组合判断—— 那是调查在否决,不是复制在否决。
2.3 ★ ARIC 在 4X 里的专门作用
我们有三份蛋白测定数据,它们的关系不是"一份发现 + 两份复制":
| 数据 | 平台 | 人群 |
|---|---|---|
| UKB-PPP | Olink | 英国 |
| deCODE | SomaScan | 冰岛 |
| ARIC | SomaScan | 美国 |
- UKB-PPP vs deCODE:平台与人群同时不同 → 方向不一致时无法归因
- deCODE vs ARIC:同平台、不同人群 → 这一对才能把差异锁定在平台还是人群
★ 因此 ARIC 不是"第二次跨平台复制"。deCODE 与 ARIC 同为 SomaScan,对表位问题并不独立: 适配体真有表位问题,两个都会显示。「两个 SomaScan 队列都与 Olink 相反」 不等于两倍证据——它只说明这不是队列特异的偶然。ARIC 的增量信息全在 「它与 deCODE 是否一致」这一点上。
⚠️ 本课题现状:results/platform_check/xplat_aric.csv 只有 4 行 / 3 个蛋白 (IFNAR1、APOL1 两条适配体、ERMAP),是当初针对三个候选的定点手工核查, 没有任何脚本产出或消费它。要让 ARIC 进流程,需为全部候选系统性取数 (Zhang J, et al. Nat Genet 2022,公开)。
三、v3 已定、v4 沿用的部分
以下三项 v4 未改,理由与实证见 v3 页 §2–§3,此处只列结论。
3.1 共定位在外部复制之后,且是「措辞升级关卡」
依据 C1R 预印本(小节标题 "Genetic colocalization prioritizes four shared signals", 摘要 "further supported by")。它收窄的是「能说什么」,不是「结果集」: 40 个全部保留报告,只有 4 个拿到"优先候选"的措辞、只有那 4 个进下游深挖。
3.2 LDSC 非必需
Yuan 2023 与 C1R 全文对 ldsc / ld score / genetic correlation / heritability全部零命中。LDSC 的作用单位是「性状 × 性状」,而 cis-pQTL 药靶 MR 的暴露是单个 cis 工具, 不在它的作用单位上。降为可选的数据验收,触发条件:① 换了结局数据源 ② 需要估计样本重叠。
3.3 不设 MHC 排除步骤,但必须处理
三条依据:29 个 MR 质量评估工具均无 MHC 条目(Yu J 2026, PMID 41999635); Zheng 2020 有操作但从未做过删 vs 不删的对比;Yuan 2023 与 C1R 全文零命中。
但必须在第 5 步标注:C1R 的 BTN2A1 通过了共定位却跨病方向相反, 说明高 PP.H4 在该区不足为证;且本课题暴露程度远重于 C1R(11 个 MHC 蛋白 vs 它的 2 个)。
★ v4 更新:MHC 坐标改用数据源自带的标记(2026-08-07)
v3 写的是「本课题采用 chr6:26–34 Mb(GRCh38),命中 26 个蛋白」。 2026-08-07 读了 Sun 2023 原文之后改为直接采用 UKB-PPP 工具表自带的 MHC 列。
原文 Methods 原句:
"We defined primary associations through clumping ±1 Mb around the significant variants using PLINK, excluding the HLA region (chromosome 6: 25.5–34.0 Mb), which is treated as one locus owing to complex and extensive LD patterns."
三个要点:
- "excluding" 不是删掉 HLA 蛋白,而是"该区不做 ±1 Mb 滑窗 clumping、整块当一个 locus"。 MHC 区蛋白照常有工具(实测 cis 27 条记录)。
- 实测:作者
MHC列 ≡ 坐标 25.5–34.0 Mb,双向差集为空,即 27 个蛋白; 与 Zheng 的 26–34 Mb 口径只差一个SCGN(25.660 Mb),而 SCGN 不在显著集, 故两个口径给出相同的 11 个 MHC 显著蛋白。 - 改用作者列的理由:那是数据提供方按其实际施加的规则打的标记,是事实, 不是我们的再定义 —— 比自己划线更可核,也更不容易在换数据时出错。
★ 顺带查明一个该写进 Limitations 的事实:该区每个蛋白在整块内只保留一个 primary 哨兵 (非 MHC 区是每 ±1 Mb 一个)。若某 MHC 蛋白的最强信号距其基因 > 1 Mb, 它会被标为 trans,该蛋白根本不出现在 1,954 个 cis 蛋白里——一种不可见的选择性缺失。 实测缓解:已入选的 27 条哨兵"距基因"多数为 0(落在基因内),其余最大 4,997 bp。
3.4 描述性注释仍在共定位之后
五篇一致(Zhou 2025、Zou 2024 等)。硬理由:若在共定位之前就做 pheWAS / 单细胞 / 成药性, 等于对未分层的一批支付这些成本。
四、措辞阶梯(v4 按 4X 改写)
| 过了哪些 | 只能说 | 不能说 |
|---|---|---|
| 只过 MR(第 2 步) | "存在关联" | 任何"因果"字眼 |
| + 方向性 / 反向 MR(第 3 步) | "方向与蛋白→疾病一致" | "因果"、"靶点" |
| + 外部复制分流(第 4 步) | "在 X 个独立数据源中方向一致" | ⚠️ 不能因为"复制上了"就升级——复制不判真伪 |
| + 4X 调查通过 | "跨队列关联 / 候选" | ⚠️ 不能说因果——这一批尚未过 LD 检验,按 Zheng 2020 可能约三分之一是 LD 假象 |
| + 共定位支持(第 5 步,PP.H4>0.8 且跨病符号一致) | "与共享同一因果变异一致" | "已验证" |
| + 全部关卡 | "我们提名 X 为候选药物靶点" | "我们确认 X 是因果的" |
| MHC 区蛋白 | "PP.H4 已报告,但在该区域需 MHC 专用核验方能解读" | 任何提名或因果表述(在补齐专用核验之前) |
| 只在 4c 通过 / 未通过 | 4c 通过 → "在完全独立的数据中亦成立";4c 未通过 → 不下结论 | ⚠️ 不可用 4c 的阴性去否定 4a/4b 的阳性(功效最低、无法归因) |
报告方式:正文写漏斗(每步剩多少 + 重点讨论存活者),完整结果表进补充材料且不贴 A/B/C/D。 MHC 层单独成节。不报告 ≠ 不分析——分析过程中一条记录都不能删。
五、每步依据与强度(v4 新增/修订行加 ★)
| 步骤 | 依据 | 强度 |
|---|---|---|
| 数据验收(可选) | Yuan 2023 与 C1R 全文零命中 → 非必需 | 非必需 · 自行声明 |
| 1① 统一 build 最先 | Zheng 2020 原文 "We first mapped SNPs to genome build …" | 强 |
| 1②③ cis 窗口 · F≥10 · clumping · Steiger | 多篇一致 | 强 |
| 1 不设 MHC 排除 | 29 个质量工具均无此条目(Yu J 2026);Zheng 2020 无删/不删对比;Yuan 2023 与 C1R 零命中 | 中 · 三条实证 |
| ★ MHC 判定用数据源自带标记 | Sun 2023 Methods 原句(本地全文 XML 逐字核实);实测作者列 ≡ 25.5–34.0 Mb,双向差集为空 | 强 · 原文 + 实测 |
| 2 MR + 多重检验校正 | 全部文献一致 | 强 |
| 3 方向性 / 反向 MR 在复制之前 | C1R 次序;Zheng 2020;GBMI 把 Steiger 提到工具层 | 强 · 多篇一致 |
| 4 三分法:不可评估者保留 | C1R 实例:43 → 40,只剔方向相反的 3 个;本课题代码注释早有同判断 | 中 · 一篇实例 + 自证 |
| ★ 4 拆成 4a/4b/4c | 无直接文献先例。依据是"一次 MR 有两侧数据,换哪侧测的东西不同"这一结构事实,以及 4a/4b 盲区互补的推理 | 弱 · 自行声明(结构推理) |
| ★★ 4a 工具选择:优先用与发现队列重叠的变异;否则取两侧都有的、p 最小的;单工具,不做 IVW | C1R 原文 Methods 第 365–373 行逐字:"overlapping instruments were prioritized to ensure consistency with the discovery analysis";"the cis-pQTL showing the strongest association ... was selected as the instrument" | 强 · 原文 |
| ★★ 4a 判定:FDR<0.05 且方向相反才报警 | C1R 原文 Results 第 113–117 行:"inconsistent effects (PFDR<0.05 and associated in opposite direction)" | 强 · 原文 |
| ★★ 4a 是加分筛而非分流器 | C1R 原文 Results 第 119–124 行:只对 5 个已复制的蛋白做,结论是 "robustness to instrument selection" | 强 · 原文(本页 §2.1 已据此订正) |
| 不可评估者保留(4a) | C1R 漏斗:43 蛋白 → 13 个可在冰岛队列评估 → 只剔除 3 个方向相反的 → 40 个进入下游,即 30 个不可评估者全部保留 | 强 · 原文实例 |
| ★ 4 只分流、否决独立成 4X | v3 自身文本即为「先查…再判」;本课题 APOL1 实例即按此判(Olink vs 两个 SomaScan + PAV 组合判断) | 中 · 自证 + 逻辑一致性 |
| ★ 4X 用 ARIC 区分平台 vs 人群 | 结构事实:deCODE 与 ARIC 同平台不同人群。跨平台比较有专门文献(Katz 2022 Sci Adv;Pietzner 2021 Nat Commun;Haslam 2022;Raffield 2020),但**"作为药靶 MR 流程固定一步"未查证** | 弱 · 现象有文献 · 流程地位未查证 |
| ★ 4c 只作确证不作筛查 | 结构推理:两侧都换 → 失败无法归因、功效最低。未查证他人做法 | 弱 · 自行声明 |
| 5 共定位后置且作措辞关卡 | C1R 小节标题与摘要措辞,位置在复制之后 | 中 · 一篇实例 |
| 5 MHC 需补专用核验才升级 | C1R 的 BTN2A1 通过共定位却跨病方向相反;Krishna 2024;本课题实测 | 中 · 实例 + 机制 + 自证 |
| 6-1~6-4 注释在共定位之后 | 五篇一致 | 强 |
| 6-3 跨组学只能加分 | 文献几乎不讨论;本课题实测跨层顶信号常非同一变异 | 弱 · 自行声明 |
| 通路富集用验证后集合 | C1R:富集用 "the validated proteins" | 中 · 一篇实例 |
| 富集按 MHC 分组 | 定向检索未找到先例;是支撑 §3.3 的核心证据 | 弱 · 自行声明 |
★ 请注意 v4 新增条目的证据强度
v4 相对 v3 的两处变更,没有一条是"某篇论文这么做的"。 它们来自结构推理与本课题自身的实例(APOL1)。
这不等于它们更弱——「复制不判真伪、调查才判真伪」是一条逻辑一致性要求, 比"某篇论文这么做"更硬。但写 Methods 时必须如实声明这是本研究自定的流程, 不能挂靠到文献上。
六、开跑前自检(v4)
- 这一步有没有否决权? 只有 第 3 步 和 4X 有。第 4 步分流、第 5 步升级措辞、第 6 步只标注
- 顺序对不对? 第 1 步①最先;方向性在复制前;共定位在 4X 后;注释在共定位后
- 复制的三类判定分清了吗? 「无数据」不许当「阴性」;「方向一致但不显著」不许当「未通过」
- 报警送对路由了吗? 4a/4c 报警 → 查表位;4b 报警 → 查结局异质性,不是查表位 4b. ★ 4a 的工具选对了吗? 必须优先用与发现队列重叠的同一个变异(C1R 原文规则)。 若让 clump 把发现队列的哨兵扔掉,换成同区另一个变异,得到的差异归因不到平台—— 本课题 IFNAR1 就是这么被误判的(哨兵被 47kb 外更强的变异顶掉)。 4c. ★★ 跑之前定验收标准了吗? 手里有阳性对照(本课题是 APOL1,已知表位伪影) 就必须拿它当验收:任何正确的规则都必须抓到它,抓不到即规则失效。 把验收写成代码里的断言,不通过直接
stop()—— 别等跑完看结果顺不顺眼。 - MHC 用的是数据源自带标记吗? 不用蛋白名硬编码、也不自己划坐标;工具池内应命中 27 个
- 缓存指纹涵盖这次改的参数了吗? 换口径不改指纹 = 静默复用旧产物(已踩过两次)
- 我要写的这句话,证据层级够到哪一档?(见 §4)
- ★ 我引的是文献还是自定? §5 里标「自行声明」的,写 Methods 时不许挂靠文献
七、参考文献
与 v3 页 §8 相同,v4 新增:
- Sun BB, Chiou J, Traylor M, et al. Plasma proteomic associations with genetics and health in the UK Biobank. Nature. 2023;622(7982):329–338. PMID 37794186 · PMC10567551
本课题暴露数据来源。Methods "Definition and refinement of significant loci" 是 §3.3 MHC 判定的直接依据(本地全文 XML 逐字核实)。
- Zhang J, Dutta D, Köttgen A, et al. Plasma proteome analyses in individuals of European and African ancestry identify cis-pQTLs and models for proteome-wide association studies. Nat Genet. 2022;54(5):593–602. PMID 35501419
ARIC 蛋白组数据来源(§2.3)。
- Katz DH, Robbins JM, Deng S, et al. Proteomic profiling platforms head to head: leveraging genetics and clinical traits to compare aptamer- and antibody-based methods. Sci Adv. 2022;8(33):eabm5164. PMID 35984888
- Pietzner M, Wheeler E, Carrasco-Zanini J, et al. Synergistic insights into human health from aptamer- and antibody-based proteomic profiling. Nat Commun. 2021;12:6822. PMID 34819519
16、17 是跨平台比较的方法学文献,支撑 4X 的做法(但它们不是"药靶 MR 流程步骤"的依据,见 §5 警示框)。
八、未决事项(继承自 v3,加 v4 新增)
- [ ] ★ 量 4a 的实际覆盖率:候选蛋白里多少有可用 SomaScan 适配体、多少能算出估计。 覆盖率太低则 4a 退回只做标注,不能让一个大半不可评估的检验挂主关卡的名
- [ ] ★ ARIC 系统性取数:现在只有 3 个蛋白的手工结果,且无脚本产出/消费
- [ ] ★ 核实 MVP / Salem 是否仍是各结局最新最大的独立 GWAS(近年可能有更新)
- [ ] ★ 4c 的文献惯例未查证:我判断"少且应作确证"是结构推理,不是文献结论
- [ ] C1R 漏斗的具体数字尚未逐字核实(PDF 读取问题;结构性事实已验证,不依赖数字)
- [ ] 逐字通读 Yuan 2023(PMC10518626)STAR Methods 与补充表 S9
- [ ] 核实 GBMI 是否真的"保留全部工具变量并以分层标注 MHC"
- [ ] 核实 Diabetologia 指南中「避免按 F 统计量排除工具」一条
- [ ] MVMR / 两步中介:正式分解"糖尿病驱动 vs 并发症特异"
- [ ] 阳性对照:确认流水线能在糖网端 recover 已知为真的信号