主题
baseline 文章逐条对比 · Yuan 2023 Cell Reports Medicine
对象:Yuan S, Xu F, Li X, Chen J, Zheng J, Mantzoros CS, Larsson SC. Plasma proteins and onset of type 2 diabetes and diabetic complications: Proteome-wide Mendelian randomization and colocalization analyses.Cell Rep Med. 2023;4(9):101174. DOI 10.1016/j.xcrm.2023.101174(PMC10518626)
本页依据:本地全文 PDF
F:\project\mmc12.pdf(正文 9 页 + STAR Methods e1–e3 + 补充图 S1–S4,共 18 页),逐页读完,提取文本 1,041 行全部覆盖。 引号内英文均为原文原句并标注页码;我方数字均来自results/实测产物。
一句话结论
最大的差异不在参数,在设计:Yuan 2023 的并发症分析是两阶段漏斗——先筛出 47 个 2 型糖尿病相关蛋白,只把这 47 个拿去测 10 个并发症。凡是"不影响糖尿病、只影响并发症"的蛋白,在他们的设计里看不见。
我们是对并发症结局直接做全池筛查(1,587 个蛋白 × 每个眼病结局)。我们的三个 A 级候选 ERMAP / IFNAR1 / APOL1 全部落在他们的盲区内——这是本课题相对 baseline 最硬的 novelty,比"数据更新"强。
一、设计差异(关键,先看这个)
原文两处明确:
"we estimated the associations of diabetes-associated proteins with ten diabetic complications"(STAR Methods, p.e1)
"Figure 3 displays the result summary of the analyses of 47 diabetes-associated plasma proteins in relation to major diabetic complications."(Results, p.4)
Yuan 2023: 1,885 蛋白 ──[Bonferroni p<2.65e-5]──> 47 个 T2D 蛋白 ──[FDR]──> 10 个并发症
↑
并发症分析的入口只有这 47 个
我们: 1,587 蛋白 ──[FDR]──> 直接对每个并发症结局筛
Retinopathy 24 / Maculopathy 19 / Nephropathy 9 / Neuropathy 5 / NeovascGlaucoma 0后果:他们的并发症结果按构造只能是"糖尿病蛋白的下游延伸",无法回答"有没有并发症特异的蛋白"。他们的四个主打蛋白 HLA-DRA / AGER / HSPA1A / HSPA1B 也确实全部是先在 T2D 上显著才进来的。
二、逐项参数对比(实测)
| 项 | Yuan 2023 | 我们(R9 主线) |
|---|---|---|
| 蛋白数据 | UKB-PPP 54,306(Olink)+ deCODE 35,559(SomaScan,4,907 aptamer) | UKB-PPP 34,557 discovery(Olink Explore 3072) |
| 主分析用哪套 | deCODE 优先(509 个重叠蛋白取 deCODE) | UKB-PPP 主,deCODE 作独立复制 |
| 蛋白池规模 | 1,797(DIAGRAM)/ 1,835(FinnGen R8)/ 1,885(合并) | 1,954 个 cis 蛋白,实际进入筛查 1,587(眼病)–1,722(T1D) |
| 工具变量 | index cis-SNP,单个,p<5×10⁻⁸ | 哨兵 cis-SNP,单个,p<5×10⁻⁶ |
| cis 定义 | 编码基因 ±1 Mb | 共定位窗 ±500 kb(config.yaml:29) |
| 效应估计 | Wald ratio + delta method | Wald ratio(同法) |
| 工具强度 | "minimal F statistic ... more than 300"(p.3) | minF 43.8,中位 F 784 |
| 代理 SNP | R²≥0.8(1000G EUR),无代理者剔除(190 个) | 同策略 |
| 糖尿病结局 | DIAGRAM(74,124) + FinnGen R8(33,043),METAL 合并 107,167 例 | T2D Mahajan noUKBB(55,005) + T1D GCST90824163(20,355) |
| 并发症结局 | 10 个,全部 FinnGen R8 + CAD/卒中外部 | 5 个 FinnGen R9(眼病为主) |
| 多重检验 | T2D 用 Bonferroni 2.65e-5;并发症用 FDR | 全部 FDR(BH) |
| 共定位覆盖 | 只有 deCODE 的蛋白(自承局限,见下) | 100%(2026-07-30 补齐 49 个 tar 后) |
| 共定位方法 | coloc.abf + SuSiE | HyPrColoc + coloc.abf + SuSiE(三法) |
| 共定位先验 | p1=1e-4, p2=1e-4, p12=1e-5 | 完全相同(config.yaml:59-61) |
| 共定位分档 | PH4≥0.8 强;0.5<PH4<0.8 中 | 目前二值 PP≥0.8(建议照抄中间档,见下) |
| SuSiE 参考面板 | 1000G Phase 3 EUR | 同一套(503 人) |
| 反向 MR | T2D → 47 个蛋白 | 疾病 → 蛋白,142 对,且剔除蛋白自身 cis 区 |
并发症样本量:我们的 R9 比他们的 R8 大
| 结局 | Yuan 2023(R8) | 我们(R9) |
|---|---|---|
| 糖尿病视网膜病变 | 8,942 / 283,545 | 10,413 / 308,633 |
| 糖尿病黄斑病变 | 3,115 / 283,472 | 3,572 / 308,547 |
| 糖尿病肾病 | 3,676 / 283,456 | 4,111 / 308,539 |
| 糖尿病神经病变 | 2,444 / 249,480 | 2,843 / 271,817 |
| 新生血管性青光眼 | — | 1,100 / 366,206(他们没有此端点) |
三、他们做了、我们没做的
| 分析 | 内容 |
|---|---|
| BMI 两阶段网络中介 MR | 47 个蛋白里 18 个与 BMI 相关;中介比例 15.8%(GCKR)–60.6%(HYOU1)。因蛋白间共表达高,中介比例之和 >100%(原文自承) |
| GeneMANIA 功能网络 | cis 基因的共表达/物理互作网络;富集到蛋白折叠与降解、热应激反应、内源凋亡通路、氧化应激反应 |
| 急性并发症 | 酮症酸中毒(7,201)、低血糖(6,500) |
| 大血管并发症 | 外周循环并发症、心肌病、CAD(60,801)、缺血性卒中(34,217) |
| 功效估计 | 假定患病率 2% 的 power 曲线(Figure S1) |
这几项里大血管并发症与急性并发症是可以低成本补的;BMI 中介 MR 若要做需注意他们自己踩的坑(中介比例和 >100%)。
四、我们做了、他们没做的
| 分析 | 我们的产物 |
|---|---|
| HyPrColoc 多性状共享簇 | results/hyprcoloc_R9_dm/hyprcoloc_shared.csv |
| 糖尿病易感性对照 | 27_diabetes_contrast.R —— 判定哪些关联是"糖尿病本身驱动" |
| 反向 MR(疾病 → 蛋白) | 142 对,剔除蛋白自身 cis 区 |
| LDSC 遗传相关 | results/ldsc_R9_dm/ |
| PheWAS 多效性扫描 | results/phewas/(15,789 条关联) |
| 单细胞定位 / 视网膜 eQTL | 组织落位层 |
| 跨平台独立复制 | deCODE SomaScan 作复制(他们是把 deCODE 当主数据) |
| Steiger 定向过滤 | 已实现(units/prevalence 待终稿修) |
| 可成药性注释 | results/druggability.csv |
| 手工独立复算 | tools/manual_verify_*.py |
五、★ 我们的反向 MR 直接触到他们的主打结论
他们最看重的是 AGER,专门讨论了 AGER 抑制剂的治疗前景:
"Many small molecule AGER inhibitors or antagonists have been proposed to treat diabetic complications and cancer progression with a good tolerance in humans."(p.8)
并发症共定位里最强的是 MANSC4:酮症酸中毒 PH4=0.92、低血糖 0.67(SuSiE 0.96)、糖网 0.63(SuSiE 0.85)。
我们的反向 MR(已剔除蛋白自身 cis 区 ±1 Mb;MHC 蛋白额外剔除整个 MHC):
| 蛋白 | 方向 | n_iv | 剔除 cis 工具 | β | p | FDR | 反向显著 |
|---|---|---|---|---|---|---|---|
| AGER | ← Retinopathy | 19 | 7 | −0.0359 | 0.032 | 0.082 | ✗ |
| AGER | ← Maculopathy | 5 | 6 | −0.0341 | 0.041 | 0.098 | ✗ |
| AGER | ← T1D | 83 | 9 | −0.0212 | 2.9e-4 | 0.0023 | ✔ |
| MANSC4 | ← T1D | 92 | 0 | +0.0117 | 3.1e-4 | 0.0023 | ✔ |
| MANSC4 | ← T2D | 97 | 1 | −0.0266 | 4.0e-3 | 0.018 | ✔ |
含义:
- MANSC4(他们并发症共定位最强的蛋白)在 T1D、T2D 两个方向都反向显著 —— 提示其关联可能部分来自反向因果或 index event bias,而不是纯粹的"蛋白→并发症"。
- AGER 在并发症方向未过 FDR(0.08–0.10)。这只能说"未发现反向证据",不能说"已排除"——AGER×Neuropathy 只有 2 个工具、×Maculopathy 只有 5 个,功率不足(反向显著率与工具数 Spearman ρ=0.71)。在 T1D 方向(83 个工具)则明确反向显著。
- 他们的反向 MR 只做了 T2D → 蛋白,没做并发症 → 蛋白,所以这一层他们看不到。
顺带:AGER 在我们的正向筛查里同样是强命中——
rs204993,AGER × Maculopathy,OR 0.071(95%CI 0.052–0.098),FDR 8.7e-55。两方研究在正向结果上是一致的。
六、两处他们自己的问题(引用时避开)
1. 共定位的引文与所述方法不对应。
原文(p.e3):
"The analysis was based on a Bayesian model that assesses the support for five exclusive hypotheses ... ⁴⁸"
而参考文献 48 是 Foley CN, et al. Nat Commun. 2021;12:764 —— 即 HyPrColoc。5 假设的两性状 coloc 应引 Giambartolomei 2014 (PLoS Genet)。且他们的 Key Resources Table 里只有 Coloc 和 SuSiE,并未使用 HyPrColoc。属引用错误。
2. R 版本与投稿时间矛盾。
原文两处写 "R software (4.4.1)"(p.e2 与 p.e3),但该文 2023-08-06 接收、2023-08-30 上线,而 R 4.4.1 于 2024-06-14 才发布。写错了。
七、一个双方都踩、但只有我们处理了的坑
他们的局限第五条只提到大血管并发症:
"data on coronary artery disease, ischemic stroke, and cardiomyopathy were not obtained from a diabetic population"(p.8)
没有提到 FinnGen 微血管端点的对照同样是一般人群(不是"无并发症的糖尿病人")。也就是说他们那 6 个 FinnGen 端点估计的其实都是"糖尿病 + 并发症"的复合效应。
我们用 27_diabetes_contrast.R 明确处理了这一步,据此把 APOE / PAM / NOTCH2 那批判为"糖尿病驱动"并降级。
详见 FinnGen 端点对照定义问题。 注意:另一条
ctrl_sensitivity路线的因果归因已撤回,见 撤回记录——真正回答"是不是糖尿病效应"的是27_diabetes_contrast。
八、可以从他们身上抄的两件事
1. 共定位加中间档。
他们:PH4≥0.8 = strong,0.5<PH4<0.8 = medium。
我们目前是二值 pp_h4_threshold: 0.8。实测 coloc_abf_pairs.csv 142 对分布:
| 档 | 对数 | 占比 |
|---|---|---|
| strong ≥0.8 | 32 | 23% |
| medium 0.5–0.8 | 28 | 20% |
| weak 0.3–0.5 | 6 | 4% |
| none ≤0.3 | 76 | 54% |
这 28 对的 PP.H3 全在 0.03–0.47(多数 <0.15)——PP.H3 低意味着"不是两个不同的因果变异",只是功率不够。二值阈值把"确实不共定位"和"功率不足"写成同一个阴性。加一列 coloc_tier 即可,纯打标签不重算。
⚠️ 只进补充表,不进候选层:中间档里 ITGB7×Retinopathy(0.756)、SIGLEC5×Retinopathy(0.731)、TIGIT×Retinopathy(0.704) 正是反向 MR 里并发症方向显著的那批,抬上来会自相矛盾。
2. 明确写出共定位的覆盖范围。
他们坦白写了"只有 deCODE 的蛋白做了共定位"。我们已经做到 100% 覆盖,这一点要在正文里明说,是相对 baseline 的实质改进。
九、写作时该怎么用这篇
| 场景 | 怎么写 |
|---|---|
| Introduction | 引 Yuan 2023 作为"已有的糖尿病蛋白组 MR",点出其并发症分析限于 47 个糖尿病蛋白 |
| Methods | 共定位先验与我们一致可直接对标;工具变量策略(单哨兵 Wald ratio)也一致 |
| Results | 正向结果一致处(如 AGER)作为验证性证据;ERMAP/IFNAR1/APOL1 作为其设计无法发现的新发现 |
| Discussion | ① 全池筛并发症 vs 两阶段漏斗;② 共定位 100% 覆盖 vs 仅 deCODE;③ 糖尿病易感性对照;④ 反向 MR 覆盖并发症方向(MANSC4 的发现) |
| Limitations | 我们缺急性/大血管并发症与 BMI 中介,应主动写明 |
不要写成"我们推翻了 Yuan 2023"
正向结果在重叠蛋白上是一致的(AGER 双方都强)。我们的增量是设计覆盖面与反向/对照两层排查,不是结论对立。