Skip to content

13 · 第 5 步 · 共定位

状态:✅ 完成§0–§5 写于运行之前,§6 为运行后回填权限:★ 措辞升级关卡,不是否决点 —— 共定位不支持不得删除任何候选


〇、输入

输入集candidate_status.csvcurrent_status == "retained"
对数52 对(蛋白 × 结局)
蛋白数28(其中 MHC 11
★ 操作单元,不是蛋白 —— 共定位做的是「蛋白 cis 区 × 结局」这个区域

为什么它没有否决权

Wu et al., bioRxiv 2024(doi 10.1101/2024.10.14.617627) 《Benchmarking Bayesian colocalization methods in validating MR-identified targets》 对 1,535 个蛋白 × 5 个心血管代谢性状做基准测试:

在 MR 经 Bonferroni 校正显著的 201 个蛋白-性状关联中, coloc 只支持 40.3%、coloc+SuSiE 46.8%、PWCoCo 45.8%、SharePro 79.6%。

★★ 更直接的依据(L4):Hwang S, Pullin J, Wallace C, Whittaker J, Burgess S. Systematic comparison of colocalization methods using protein quantitative trait loci.bioRxiv 2025-11-07, doi 10.1101/2025.11.07.686776 —— 作者含 coloc 原作者Burgess

"it is unclear whether a non-colocalization result should be taken as a definitive sign that two traits do not share a genetic cause…" "In the worst-case scenario, colocalization was only agreed by all four methods for 20% of proteins, despite our experiment being constructed to select for cases where colocalization is expected. This suggests caution … is warranted."

「不共定位」不能当作「不共享因果变异」的定论。 把它当否决理由,会系统性砍掉真信号。

⚠️ 两篇 bioRxiv 我都只读到摘要(反复 429 / Cloudflare 封禁), 上述数字全部出自摘要,引用时须标注。


一、方法:★ 本轮只用 coloc.abf

方法本轮理由
coloc.abf(Giambartolomei 2014, PLoS Genet 10:e1004383, PMID 24830394)唯一判据两两分析、输出 PP.H0–H4 全谱、可解释
HyPrColoc(Foley 2021, Nat Commun 12:764, PMID 33536417)不做它不输出 PP.H4,给的是簇层 posterior_prob;且旧判定因性状集含 T1D/T2D 而不可移植
coloc + SuSiE(Wallace 2021, PLoS Genet 17:e1009440, PMID 34587156)不做实测出结果率仅 25%(32 对尝试 / 12 对收敛 / 8 对给值)

选型全过程与逐条实测见 共定位方法选型

★ 不纳入 T1D / T2D 对照臂

共定位只回答「是不是同一个因果变异」,不回答「是不是经由糖尿病中介」 —— 阳性推不出中介;而按 L4 基准(见下),阴性也推不出并发症特异。 两个方向都推不出结论的分析不做。「糖尿病驱动」由 MVMR / 两步中介回答。

参数(与既有实现一致):区域 ±500 kb、最少 30 个 SNP、 先验 p1=p2=1e-4p12=1e-5。 蛋白 type="quant", sdY=1(UKB-PPP 做过秩逆正态变换); 疾病 type="cc"s = ncase/(ncase+ncontrol)

1.1 分档(只升降措辞,不删候选

判据用途
strongPP.H4 ≥ 0.8正文可写「共定位支持」
medium0.5 ≤ PP.H4 < 0.8仅进补充表,正文不作为支持证据
weakPP.H4 < 0.5不升级;但不否决
无法判定见 §1.2不得写成阴性

PP.H4 ≥ 0.8 是子刊药靶文章的通用阈值(如 Zhao 2023 Nat Immunol SCALLOP); 亦有文献用 0.7,我们取更严的 0.8。

1.2 ★★ 两条已知局限(写作时必须带上)

  1. PP.H3 随区域宽度膨胀 —— 区域越宽,「两个不同因果变异」的后验越大, H4 被稀释。大区域的低 H4 只能写「无法判定」,不能写「不共定位」。
  2. 本轮不做 SuSiE 复核 —— 故「区域内多因果变异」这一情形未被处理, MHC 尤其受影响。此前实测 SuSiE 出结果率仅 25%、且 estimate_s_rss 的 s 中位数 0.827(汇总统计与 LD 面板系统性失配),故不采用;须写进 Limitations

二、★★ MHC:11 个蛋白 / 29 对,需专用核验

实测(旧仓同口径):52 对里 29 对是 MHC 蛋白,其中 PP.H4 ≥ 0.8 的有 0 对; 非 MHC 的 23 对里有 13 对 ≥ 0.8。

这个 0/29 不能读成「MHC 候选被共定位否掉了」

MHC 区本来就有多个独立因果信号,直接违反 coloc.abf单因果变异假设 —— 该假设不成立时 H4 会被系统性低估(本页 §1.1 的方法说明里早已写明)。

MHC 对的低 H4 是方法局限的产物,不是证据。 它们的 mhc_verification_done 现为 FALSE在补上专用核验之前,既不升级措辞、也不得降级结论。

专用核验该做什么(本步先产出诊断,不下结论): 逐对报告独立信号数、SuSiE 可信集数与 s 值、区域宽度敏感性。


三、★ 预期(写于运行之前)

3.1 机械可验的强预期

本轮 52 对在旧仓 mr-pipeline-r9 全部跑过(重叠 52/52,新增 0 对)。 数据与参数未变 → PP.H4 必须逐对复现(容差 1e-6)。

这与第 3 步的做法一致:先用可复现性证明流水线确定性,再谈结果

3.2 数量预期(来自旧仓同口径实测)

预期
strong(≥0.8)13 对
medium(0.5–0.8)6 对
weak(<0.5)33 对
★ MHC 的 29 对中 strong0 对
非 MHC 的 23 对中 strong13 对

预期进 strong 档的对(旧仓 PP.H4): APOE×Neph 0.998 · NUDT5×Reti 0.977 · ERMAP×Macu 0.967 · PAM×Reti 0.959 · WARS×Reti 0.956 · GALNT3×Reti 0.948 · IFNAR1×Macu 0.940 · APOE×Macu 0.917 · NOTCH2×Macu 0.897 · NOTCH2×Reti 0.896 · SIGLEC5×Macu 0.887 · ACRBP×Reti 0.867 · LACTB2×Reti 0.800

★ 两个值得提前注意的结果

  1. IFNAR1×Maculopathy PP.H4 = 0.940 —— 若复现,它将获得 11 页所说的「措辞升级」。 注意它的外部复制天花板是 platform_only(Maculopathy 无外部队列), 共定位是它能拿到的另一条独立证据
  2. 外部支持最全的 5 对里,只有 NUDT5(0.977) 与 PAM(0.959) 能进 strongAGER/AIF1/TNXB 都是 MHC → 预期 H4 低,但那是方法局限

3.3 验收断言(抓不到即 stop()

#断言
L1输入 = 52 对 / 28 蛋白,与 candidate_status.csvretained 完全一致
L2★★ 52 对的 PP.H4 与旧仓逐对复现(容差 1e-6)—— 不复现说明环境或数据漂移
L3共定位不改变任何候选的去留 —— 跑前跑后 candidate_status.csvretained 集合完全相同
L4MHC 的 29 对必须带 in_mhc=TRUEmhc_verification_done=FALSE 标记,且不得被写成阴性结论
L5产物必须同时含 PP.H0PP.H4 全谱(只报 H4 无法判断是 H3 稀释还是真不共定位)
L6取值全 ASCII、列名无内部流程编号
L7输入不得含 T1D_gcst / T2D_mahajan(对照臂不进共定位,见 选型页 Q5
L8★ 分档取值只能是 strong / medium / weak / undetermined不得出现任何「阴性 / 不共定位」字样的取值

| L10 | ★ 判定表必须并列给出效应方向(防止把 PP.H4 高读成好靶点) | | L11 | ★ 分档只由 PP.H4 决定,不得混入方向(coloc.abf 基于 Z²、方向无关) | | L12 | ★ 判定表并列给出糖尿病对照臂方向,并报告成药性冲突数 |

L2 与 L3 是核心:L2 检验「流水线是否确定性」,L3 检验「我有没有守住 『共定位不是否决点』这条规矩」。


四、产物(预期)

产物内容
results/coloc/coloc_abf_pairs.csv52 对 × PP.H0–H4
results/coloc/coloc_verdict.csv分档 + MHC 标记 + 局限标注
更新candidate_status.csvcolocalization 列(现为 not_done

五、局限(先写下,防止跑完淡化)

  1. coloc 只支持约 40% 的 MR 阳性是常态;且按 L4,即使在本该共定位的构造场景里, 四法全体一致的最坏情形只有 20% ——「非共定位」不能当定论(两篇均仅读到摘要)
  2. MHC 29 对的低 H4 是单因果假设被违反的产物,不是证据
  3. PP.H3 随区域宽度膨胀,大区域低 H4 只能写「无法判定」
  4. 本轮只用 coloc.abf 一种方法 —— 未做 HyPrColoc(无 PP.H4、旧判定不可移植)、 未做 coloc-SuSiE(出结果率 25%)、未引入 SharePro / PWCoCo / prop-coloc。 单一方法的结果不具方法间一致性证据,须如实写进 Limitations
  5. 不含 T1D/T2D 对照臂 —— 「糖尿病驱动」留给 MVMR / 两步中介回答

六、运行结果

执行日期:2026-08-08 脚本analysis/47_coloc_step5.R断言L1–L9 全 PASS 结论:13 对升级措辞,否决 0 对

6.1 ★ 预期对账:全中

§3 预期实际
52 对 PP.H4 与旧仓逐对复现★★ 52/52 复现,最大差 = 0
strong(≥0.8) 13 对13
medium(0.5–0.8) 6 对6(非 MHC 5 + MHC 1)
weak(<0.5) 33 对33(非 MHC 5 + MHC 28)
★ MHC 29 对中 strong = 00
非 MHC 23 对中 strong = 1313

L2 最大差为 0(不是「小于容差」,是逐位相同)—— 继 LDSC、工具选择/MR、反向 MR 之后,共定位是第四层被证明确定性的环节

6.2 strong 档 13 对:全部升级措辞

蛋白结局PP.H3PP.H4升级
APOENephropathy0.0010.998
NUDT5Retinopathy0.0140.977
ERMAPMaculopathy0.0190.967
PAMRetinopathy0.0360.959
WARSRetinopathy0.0430.956
GALNT3Retinopathy0.0220.948
IFNAR1Maculopathy0.0460.940
APOEMaculopathy0.0440.917
NOTCH2Maculopathy0.0920.897
NOTCH2Retinopathy0.1040.896
SIGLEC5Maculopathy0.0330.887
ACRBPRetinopathy0.0280.867
LACTB2Retinopathy0.0350.800

13 对全部是非 MHC 蛋白,故 13 对全部升级;MHC 的 29 对无一进 strong

IFNAR1 拿到了它能拿到的第二条独立证据

IFNAR1 × Maculopathy PP.H4 = 0.940,升级措辞。

它的外部复制天花板是 platform_onlyMaculopathy 没有任何外部结局队列), 4b 对它不可评估。共定位是独立于外部复制的另一条证据线,这一条它拿到了。

6.2b ★★ 方向:coloc.abf 方向无关,必须单独看

PP.H4 高 ≠ 好靶点

coloc.abf 基于 ,只回答「是不是同一个因果变异」, 完全不回答方向合不合理。判定表若只给 PP.H4, 读的人会把「共定位强」直接读成「好靶点」。

→ 判定表已并列给出 beta_discovery / OR_discovery / effect_direction / implied_drug_action,并加断言 L10(方向必须在表里)与 L11(分档只由 PP.H4 决定、不得混入方向)。

strong 档 13 对按方向:升高风险 6 · 降低风险 7

方向蛋白 × 结局(OR)用药含义
升高风险(6)APOE×Neph 1.151 · NUDT5×Reti 3.080 · WARS×Reti 1.385 · APOE×Macu 1.130 · SIGLEC5×Macu 1.105 · ACRBP×Reti 1.450抑制
降低风险(7)ERMAP×Macu 0.329 · PAM×Reti 0.888 · GALNT3×Reti 0.846 · IFNAR1×Macu 0.782 · NOTCH2×Macu 0.481 · NOTCH2×Reti 0.598 · LACTB2×Reti 0.674激动 / 补充

方向一致性:无一冲突

  • APOE(Neph 1.151 / Macu 1.130)—— 均升高风险 ✅
  • NOTCH2(Macu 0.481 / Reti 0.598)—— 均降低风险 ✅
  • SIGLEC5(Macu 1.105 / Reti 1.058)—— 一致 ✅(Reti 那对是 medium 档)

没有出现 C1R 说的那种成药性冲突(其反例为 BTN2A1FGF5 跨病方向相反)。

但这条结论的适用面很窄

11 个有 strong 的蛋白里 8 个只有 1 个结局,方向一致性无从谈起。 真正被检验过的只有 APOENOTCH2SIGLEC5 三个

★ 两点写作时要带上:

  1. 用药方向决定可行性。「抑制」类(小分子/单抗成熟)与「激动·补充」类 (需激动剂或蛋白补充)开发难度不同 —— 第 6 步成药性注释展开
  2. IFNAR1 方向与既有实验证据一致:OR 0.782 = 水平高为保护, 而 Ifnar1−/− 小鼠激光 CNV 病灶更大(P=0.028)、IFN-β 治疗改善(P=0.0038) —— 遗传学与动物模型同向

6.2c ★★ 与糖尿病对照臂的方向比对(新增两列)

全 52 对 direction_conflict = 0 —— 没有出现「降低并发症风险却升高糖尿病风险」 这类成药性冲突(C1R 用 BTN2A1/FGF5 警告的正是同类风险)。

dm_arm_direction对数冲突
risk_decreasing190
risk_increasing180
not_significant15

strong 档 13 对的对照臂表现

蛋白并发症 OR对照臂对照臂 OR方向
NUDT5Reti 3.080T2D1.958同为升高
APOENeph 1.151 / Macu 1.130T2D1.096同为升高
WARSReti 1.385T1D1.276同为升高
SIGLEC5Macu 1.105T1D1.071同为升高
NOTCH2Macu 0.481 / Reti 0.598T1D T2D0.541 / 0.628同为降低
PAMReti 0.888T2D0.872同为降低
ACRBP ERMAP GALNT3 IFNAR1 LACTB2none对照臂不显著

★★ 「同向」是双刃剑,两个含义必须一起写

好消息:没有成药性冲突。

但同向也是「糖尿病驱动」的信号 —— 并发症端与糖尿病端的效应量还很接近APOE 1.151 vs 1.096 · PAM 0.888 vs 0.872 · NOTCH2 0.481 vs 0.541), 提示这些关联很可能经由糖尿病本身,而非并发症特异。

NUDT5 最典型:Reti OR 3.080、T2D OR 1.958,两端都强 —— 而它恰是「两侧外部证据 + 共定位 strong」仅有的两个之一。 这条限定必须跟着它一起写。

反过来:5 个蛋白对照臂完全不显著 → 提示并发症特异

ACRBP · ERMAP · GALNT3 · IFNAR1 · LACTB2

它们与糖尿病本身无显著关联,却与并发症显著且共定位 strong。 IFNAR1 又一次落在这一边(Macu OR 0.782,T1D/T2D 均不显著)。

⚠️ 但**「对照臂不显著」≠「无关联」,也可能是功效不足。 严格分解要靠 MVMR / 两步中介(待办已有);本节只提供提示**,不是判定。

新增列dm_arm_significant · dm_arm_OR · dm_arm_direction · direction_conflict, 断言 L12 强制它们存在并报告冲突数。

6.3 ★★ MHC 的 0/29 必须写成「无法判定」,不是阴性

对数strongmediumweak
非 MHC231355
MHC290128

先纠正一处表述:没有一对精确等于 0 —— 是显示四舍五入所致。 真实值域为 6.35e-01 ~ 2.20e-286,其中 26/29 < 1e-10PP.H3 几乎全部为 1.0000。

三条证据说明这是模型失配而非数据说话:

#证据
区域规模差一倍:MHC 中位 9,248 个 SNP(最大 13,500),非 MHC 中位 3,978。SNP 越多、独立信号越多,单因果假设越站不住
数值荒谬到无统计意义TNXB×Reti 的 PP.H4 = 2.2e-286 —— 这不是「证据弱」,是模型在其不成立的场景里外推
非 MHC 也有同样现象BCL2L15 三个结局 PP.H4 在 1e-6~1e-23、PP.H3=1.0000 —— 是「多信号 + 宽区域」的通病,非 MHC 独有,只是 MHC 最极端

MHC 区本来就有多个独立因果信号,直接违反 coloc.abf单因果变异假设, H4 被系统性低估。加上 L4 基准(即使构造出本该共定位的场景, 四法全体一致的最坏情形也只有 20%),这 29 对只能写「无法判定」

产物里已用 upgrade_blocked_reasonmhc_verification_done=FALSE 标死, 断言 L4 强制校验。

6.4 C1R 的「跨病符号一致」:报告了,但不作判据

取值对数
consistent38
not_assessable_single_outcome14
opposite0

一个都没筛掉,而且 14 对根本无法评估(蛋白只关联 1 个结局)。

为什么不作必要条件 —— 且不能说「依据 C1R」

C1R 原文(Results)

"four had MR effect directions consistent across their associated diseases"; 反例 "BTN2A1 and FGF5 colocalized but exhibited opposite directional effects across diseases, suggesting potential adverse effects if targeted"

→ 它筛的是成药性风险(同一靶点对甲病有益、对乙病有害),不是因果成立与否, 更不是我们第 3 步的反向 MR(那问的是「疾病会不会反过来影响蛋白」)。

C1R 是共病研究,蛋白天然关联 ≥2 个病,该条件有判别力(40 个里筛掉 BTN2A1/FGF5)。 我们是并发症研究,28 个蛋白里 14 个只关联 1 个结局 → 对它们不可评估; 其余 14 个符号全部一致 → 无判别力。

★★ 另一处必须改口:C1R 的 PPH4 是 HyPrColoc 的簇层后验,不是 coloc.abf 的 PP.H4 (其 Methods 只提 hyprcoloc R package,全文无 coloc.abf / Giambartolomei / PP.H0–H3)。 所以我们的 PP.H4 ≥ 0.8 不能说「依据 C1R」,须挂 Zhao 2023 Nat Immunol 或 coloc 原文。

6.4b 28 个蛋白逐个的共定位结果

有 strong 档的 11 个APOE/NOTCH2 各 2 对):

蛋白强/中/弱最高 PP.H4外部支持逐结局 PP.H4
APOE2/0/00.998仅换平台Macu 0.917 · Neph 0.998
NUDT51/0/00.977两侧都有Reti 0.977
ERMAP1/0/00.967无/不可评估Macu 0.967
PAM1/0/00.959两侧都有Reti 0.959
WARS1/0/00.956仅换平台Reti 0.956
GALNT31/0/00.948仅换队列Reti 0.948
IFNAR11/0/00.940仅换平台Macu 0.940
NOTCH22/0/00.897无/不可评估Macu 0.897 · Reti 0.896
SIGLEC51/1/00.887仅换平台Macu 0.887 · Reti 0.731
ACRBP1/0/00.867无/不可评估Reti 0.867
LACTB21/0/00.800无/不可评估Reti 0.800

最高只到 medium 的 5 个VWC2L 0.726 · IL7R 0.709 · TPPP3 0.703 · AOC1 0.673 · BTN2A1 0.635(唯一 MHC)

全部 weak 的 12 个CLPS(0.079/0.000)· BCL2L15(三结局全 ~0)· 以及 10 个 MHC 蛋白BTN3A2 HCG22 TRIM40 LTB ATP6V1G2 AIF1MICB_MICA TNXB AGER CFB

★ 两条证据线基本正交

11 个有 strong 的蛋白里,4 个的外部支持是「无/不可评估」ERMAP NOTCH2 ACRBP LACTB2); 反过来,外部支持最全的 5 对里 3 个是 MHCAGER/AIF1/TNXB),共定位全在 ~1e-78。

同时拿到「两侧外部证据 + 共定位 strong」的只有 NUDT5(0.977) 与 PAM(0.959) 两个。

6.4c ★★ MHC 区必须留在药靶候选里 —— 两个现成的反证

如果按 PP.H4 排序挑靶点,本课题最有药理学基础的两个会被排到最后

蛋白药靶地位本课题证据PP.H4
CFB(补体因子 B)已上市药物靶点 —— factor B 抑制剂 iptacopan 已获批3/4 结局显著(Macu OR 0.624, FDR 3.9e-06);外部支持「仅换平台」1.4e-184
AGER(RAGE)糖尿病并发症领域研究二十年的经典靶点4 个结局全显著(Neuro OR 0.146, FDR 3.1e-20);外部支持「两侧都有~1e-78

11/28(39%)候选在 MHC 区 —— 不是边角料,是四成的盘子。 且 MHC 富集免疫相关基因、糖尿病并发症本身有免疫机制参与, 这些蛋白落在 MHC 有生物学理由,不是巧合

★ 所以 v4 的两条设计现在看是对的:

  1. 工具选择阶段不排除 MHC(不像 Zheng 2020 整块剔除)—— 否则 CFB/AGER 从一开始就没了
  2. 第 5 步 MHC 需专用核验才能升级 —— 现 mhc_verification_done=FALSE既不升级也不降级

待补的 MHC 专用核验(三件,排在第 6 步之后):

#做什么现状
条件分析 —— 区域内对主信号做条件回归,看蛋白信号是否独立存在未做
HLA 等位基因层面共定位 —— 把 SNP 换成经典 HLA 等位基因未做
跨平台复现 —— MHC 哨兵在 deCODE/ARIC 是否同向已有AGER/AIF1/TNXB 在 4a 均判 robust

外部复制这条线不受单因果假设影响 —— 所以这三个 MHC 蛋白的证据并不弱, 弱的只是共定位这一条

6.5 产物

文件内容
results/coloc_R9_dm/coloc_abf_pairs.csv24 脚本原始产物(142 对,含对照臂)
results/coloc/coloc_abf_pairs.csv第 5 步口径 52 对
results/coloc/coloc_verdict.csv52 对判定(含 beta_discovery/OR_discovery/effect_direction/implied_drug_action/dm_arm_direction/direction_conflict/cross_disease_sign,共 24 列)
results/candidate_status.csv★ 已回写 colocalization / coloc_pp_h4 / coloc_wording_upgrade

6.6 ★ 工程改动(本步一并做的)

改动说明
目录改名results/hyprcoloc_<rel>results/coloc_<rel> —— 旧名指向本轮不做的方法,与 T1D_gcst 进论文表、4a 进文件名、同一产物两路径属同一类毛病(第四次)。连带改 16 个脚本;旧仓路径不跟着改(冻结对照)
结局白名单24_coloc_abf.R 加第 2 参数。实测总耗时 45 分钟,但五个并发症的 57 对在第 31 分钟就算完,其余 90 对(63%)是不用的对照臂
单次耗时脚本打印「N 分 M 秒(X 对,平均 Y 秒/对)」。此前只能靠 stat 反推,而反推值会把改代码、查文献、等回话的墙钟时间算进去 —— 4X 因此被误显示成 160 分钟(实际分钟级)

6.7 各步实测耗时(首次系统记录)

步骤耗时
第 0 步 LDSC21 分
第 1+2 步 工具选择 + MR6 分
第 3 步 反向 MR34 分
4a 换平台 / 4b 换队列各约 2 分
ARIC 取数5 分
第 5 步 coloc.abf45 分(加白名单后约 13 分)

★ 两个瓶颈的正解都不是并行:coloc 是别算不用的(省 63%), 反向 MR 是给 clump 加指纹缓存。并行留到第 6/7 步真出现瓶颈再说。


七、★★ 与既有 HyPrColoc 结果的对账(2026-08-08 补)

一份此前由他人用同一批数据跑的 HyPrColoc 结果(F:\project\12\{sum_plot,bin}.csv, 覆盖 20 个蛋白、4 个并发症 + T1D/T2D)拿来与本步 coloc.abf 对账。 这是第 5 步唯一的外部旁证,方法与执行人都不同。

方法差异、正确读法与三条官方依据见 共定位方法选型 · Q8–Q12

7.1 结果:19 个可比蛋白,排序几乎相同

类别数量蛋白
完全一致7APOE NUDT5 ERMAP WARS PAM GALNT3 IFNAR1
分歧(均可解释)2APOL1 · NOTCH2
蛋白未进簇 → 我们 weak10AGER AIF1 ATP6V1G2 BCL2L15 BTN3A2 CFB HCG22 LTB TNXB TRIM40
蛋白未进簇 → 我们 medium1BTN2A1(0.635,擦边)

逐蛋白对照(蛋白进簇的一侧):

蛋白HyPrColoc我们 PP.H4我们的档
APOE0.99970.998strong
NUDT50.93370.977strong
ERMAP0.89890.967strong
WARS0.89430.956strong
PAM0.89130.959strong
GALNT30.84370.948strong
IFNAR10.83700.940strong
APOL10.8106★ 4X 已因表位伪影否决
NOTCH20.77600.897strong(阈值边缘)

两处分歧都有明确原因APOL1 说明共定位识别不出表位伪影(两者查的不是同一件事); NOTCH2 是 0.776 / 0.897 卡在 0.8 两侧。

7.2 未进簇的 11 个,在我们这里的档位

BTN2A1   0.635    medium   ← 唯一擦边
BCL2L15  4.1e-06  weak
BTN3A2   6.9e-14  weak
HCG22    9.3e-19  weak
TRIM40   2.0e-25  weak
LTB      2.9e-37  weak
ATP6V1G2 3.8e-40  weak
AIF1     8.9e-41  weak
TNXB     1.7e-69  weak
AGER     1.5e-72  weak
CFB      4.0e-108 weak

11 个里 10 个我们判 weak、1 个擦边 medium —— 与「蛋白未进簇」完全对得上。 两法的 PP.H3 高蛋白不在簇内 对应关系在实测上成立。

7.3 ★ LTB:一个连贯但未定论的解释

LTB 在我们结果里,状态 retained(3 个结局、rs2395470、OR 2.908/2.328/1.919、 方向性 pass、视网膜在 MVP 换队列复制上了),只是共定位 weak 故未升级。

把两边拼起来:

  • 糖尿病对照臂 T1D 的 OR = 3.387,比三个并发症都大
  • HyPrColoc 的簇是 {T1D, 肾病} 0.9938、{T1D, 视网膜} 0.9948, 候选变异 chr6:31.74 Mb —— T1D 与并发症共享该变异,蛋白不在其中
  • LTB 位于 chr6:31.58 Mb,而 T1D 最强的遗传信号就是 HLA

LTB 与并发症的 MR 关联很可能是被 LD 上的 HLA-T1D 信号带出来的

⚠️ 仍非定论 —— 两个方法共享同一个「单因果变异」假设,MHC 内该假设不成立。 就目前证据看,LTBCFB / AGER 更像「HLA 信号的搭车者」, 但要坐实仍须条件分析与 HLA 等位基因层面核验。

7.4 ★ 对 MHC 措辞的修正

本页 §6.3 原写「MHC 是 coloc.abf 方法失效」。 现有第二个方法同样把这些蛋白排除在簇外,应改写为:

两种共享同一假设的方法一致提示蛋白与疾病信号不同,待条件分析核验。

不构成独立确证(两法共享同一假设,可能同样失效), 但比「单一方法失效」更值得重视。CFB / AGER 的处置不变: 不排除(外部复制稳健、CFB 是已上市药靶),但也不再说「只是方法失效」

个人科研与运维文档 · 内容持续修订