Skip to content

汇报 PPT 数据核查与修订记录(2026-07-27)

对两份组会汇报 PPT(《糖尿病并发症的多组学孟德尔随机化研究》《老年黄斑变性的多组学孟德尔随机化研究》)做的一次逐数字回溯核查:把幻灯片上的每个数字回到结果文件比对,并把用到的每套数据的引用逐条联网确认。

一句话结论:主干数字全部复算一致;查出 6 处事实错误、1 处结构性错放、若干口径不清,均已修正。本页同时作为"本研究用了哪些数据、准确引用是什么"的权威索引。


一、复算一致的结果(可放心引用)

结果文件核对
发现层病例数与显著蛋白数糖网 6,970/10、黄斑 4,766/9、神经 4,145/4、糖肾 6,043/6、NVG 1,576/0;AMD 13,947/33、湿 7,529/26、干 9,533/25✅ 全部一致
工具变量数1,659 蛋白有 cis 工具(minF 43.8 / medianF 777)
AGER × 糖网p = 5.6179×10⁻⁶¹
MVP / Salem 复制糖网 4/10、神经 1/4、糖肾 1/6
IAMDGC 复制True 59 / 有判定 81 = 72.8%
TNFRSF10A共定位 PP = 0.9219;IAMDGC 复制 p = 1.63×10⁻⁹
AMD 9 个共定位候选名单完全一致
deCODE 全套(136 配对重算)方向一致 108/136 = 79.4%;两平台都显著 67、其中同向 56 = 83.6%;翻转 11 点 / 6 蛋白(CSF2·CTRL·FABP6·FGFR2·PON1·TGFB1);每结局都显著 AMD 26 / 湿 20 / 干 19 / DR 2✅ 逐个吻合
SCALLOP 全套AMD 16·33·81%、湿 12·26·82%、干 15·25·81%、DR 8·10·81%;共测 740
LDSC湿↔干 rg = 0.865;糖网×糖肾 0.617 / ×T1D 0.795 / ×T2D 0.066
MERTK 单细胞定位小胶质/髓系平均表达 0.7126、阳性率 25%;其他细胞类型按细胞数加权 7.03%
bulk limma(DR)MERTK FDR 0.01152、SPRY2 FDR 0.00077
SlingshotMERTK ρ = −0.307、CX3CR1 ρ = −0.398
伪 bulk(AMD)Wilcoxon p = 0.8175
组织定位(RPE vs NSR,logFC)CFH +2.451、MERTK +0.627、CASP10 +0.705、TNFRSF10A −1.21/−1.19

二、查出并已修正的事实错误

1. APOL1 指向的疾病写错了(最严重)

  • 原写:A 组唯一共定位命中 = APOL1 → 糖尿病肾病(并补了一句"经典肾病风险基因")
  • 实际table_S_coloc_dm.csvdiseases_shared = Maculopathytable_S_significant_associations.csv 中 APOL1 只有黄斑病变一条显著关联,没有糖尿病肾病
  • 为什么危险:APOL1 与肾病的关联是教科书知识,错误"看起来很合理",反而更难被发现;而且顺带的那句解释等于给错误做了背书
  • 已改:PPT 三处 + 本站两处(分家重跑定稿文献核查

2. AMD 多组学矩阵中 CFH 与 TNFRSF10A 的层级标注互相颠倒

严格数值核对(eqtl_mr_full.csv × eqtl_coloc.csv):

靶点蛋白层共定位血 cis-eQTL
CASP10✅ PP 0.85✅ FDR 0.016 / H4 0.969
TNFRSF10A✅ PP 0.92⚠️ FDR 0.0012 / H4 0.351 → 仅 MR、共定位不支持
CFH❌ 无共享簇(n_cluster=0✅ FDR 5.2×10⁻⁴ / H4 0.973
MERTK❌ PP 0.56❌ FDR 0.78 / H4 0.056

原矩阵把 CFH 标成"共定位 ✅、eQTL ⚠️",把 TNFRSF10A 的 eQTL 标成 ✅——两者恰好都反了。已按实测重做矩阵,并把判据写进脚注。

3. 代谢物层在两份 PPT 里放反了

  • 68 个检验中 FDR<0.05 的 3 个(Total_TG、MUFA、Omega_3)全部落在 AMD 侧,DR 侧 0 个
  • 但原先 DR 篇有代谢物火山图(还写着"红点为稳健命中"),AMD 篇反而没有
  • 已改:DR 篇改为明确的阴性表述;AMD 篇补上结果页
  • 口径精确化:3 个是 FDR<0.05;再卡"加权中位数同向且 p<0.05 + Egger 截距 p>0.05",通过全部敏感性检验的是 2 个(MUFA 的 wm_p = 0.139 未过)

4. IAMDGC 队列版本不一致

目标页/方法页写 Fritsche 2016,数据来源页写 IAMDGC 2.0 (Gorski/Grunin 2025)。脚本实际读 IAMDGC_lateAMD_related_EUR_annotated.txt,注释与 mr_funcs.R 均为 IAMDGC 2.0(15,616 / 16,723)。已全站统一为 2.0,并注明 Fritsche 2016(16,144 / 17,832)为历史版本。

5. 视网膜层的两套数据被混用

数据样本量
自建EGA METR-GTEGAD50000002082神经视网膜 NSR 183 / RPE 176
外部Advani 2024 视网膜 QTL403 眼

PPT 里两者都叫"视网膜 eQTL",导致局限页的 N=176 与数据页的 403 眼看起来自相矛盾;DR 篇更引错了组织(DR 侧用 NSR 183,却写 176)。已拆分标注。

Advani 数据的实际显著性:DR 侧 CFH / SPRY2 / TNXB 达 FDR<0.05;AMD 侧仅 CFH(FDR 0.0099)。13 个候选靶点中只有 5 个在视网膜有可用 cis 工具。

6. 参考文献条目错误

原引 "Advani J, et al. Genome-wide analysis of the human retina... " —— 标题是错的。正确条目见下表。


三、口径澄清(非错误,但会被追问)

澄清
AGER 的 p 值"两边均 p≈5e-58"实为 FDR(SCALLOP 4.9e-58 / UKB-PPP 9.3e-58);UKB-PPP 原始 p = 5.6×10⁻⁶¹
SCALLOP × 糖网原写"其余靶点两边都不显著",实际两边都显著的有 3 个(含 AGER)。已在表中增列"两者都显著":DR 3 / AMD 6 / 湿 5 / 干 5
deCODE 的 34 与 1145 个候选靶点中 34 个在 SomaScan 有适配体36 条适配体:仅 APOL1、TNFSF14 各 2 条;多适配体取最强工具);其余 11 个无适配体
deCODE 适配体口径(★2026-08-03 订正)上一行有两处需改:①「仅 APOL1、TNFSF14 各 2 条」是错的,多适配体基因实为 APOL1、NPPB、TNFSF14②「36 条」是当时的可用数而非准备数——共下载 38 条,其中 4549_78_FUT57655_11_NT-proBNP 两个文件下载截断损坏,被 fread 读空后静默跳过,故实际只用了 36 条。两个文件已于 2026-08-03 重下并通过 gzip -t目录内 40 个蛋白文件现已全部完整
但复制层的数值(方向一致率等)仍是按 36 条算出来的——run_decode_rep_full.R 需重跑才能纳入这 2 条。该脚本属第一篇 R13(DR/AMD) 线,需扫 38×5=190 个大文件约 171 GB,不在 R9 主线的关键路径上,故推迟到第一篇定稿时再跑。在此之前,凡引用 deCODE 复制层数字处须注明「基于 36 条适配体」
★ 另:那 11 个「无适配体」的判断已用 Eldjarn 2023 ST2 的 SomaScan 全清单(5,029 条)逐个核对,11 个全部确认属实,0 个记错
WARS蛋白层共定位 ✅,但 IAMDGC 复制未通过(p_repl = 0.588)。不应列入"双双复制"的核心候选
DR 侧甲基化层★2026-07-27 订正:通过"FDR<0.05 且 HEIDI p>0.05"的靶点基因为 AGER 与 TNXB 两个(原记"只有 TNXB"),二者均在 chr6 MHC 区 → 该层对 DR 实质仍为阴性。AMD 侧同样订正为 5 个(APOE/CASP10/TNFRSF10A/AGER/TNXB),扣除 MHC 后可用 3 个
甲基化层(★2026-08-01 再订正)上一行的判据把 p_HEIDI = NA(算不出来)当成了"通过"。"算不出来"是无法排除连锁,不是排除了连锁。 改为三分类后:DR = TNXB 1 个(扣 MHC 后 0 个,阴性结论不变);AMD(FinnGen) = CASP10/TNFRSF10A/TNXB 3 个(扣 MHC 后 2 个);AMD(IAMDGC) = TNFRSF10A/TNXB 2 个(扣 MHC 后 1 个)AGER 三个结局全掉、APOE 在 AMD 两个结局全掉。全基因组层面旧口径虚高 DR 43.7% / AMD 19.6–25.0%。详见多组学定向验证页 §6
DR 侧血 eQTL最大 PP.H4 = 0.100(PROS1),全部 <0.5,"DR 侧无稳健命中"成立
PheWAS 阈值phewas_provenance.csv 记录 n_datasets_source = 退化:返回结果里的数据集数 → Bonferroni 分母偏小、阈值偏松,该层只作方向性解读

四、本研究用到的数据与准确引用(逐条联网确认)

层次数据规模引用
暴露 cis-pQTLUKB-PPP面板 2,923 蛋白,1,659 有 cis 工具,N=34,557Sun BB, et al. Nature 2023;622:329-338
结局FinnGen R13见发现层表Kurki MI, et al. Nature 2023;613:508-518
复制(DR/神经)MVPVerma A, et al. Science 2024;385:eadj1182
复制(糖肾)Salem JDRF-DNCRI~19,406Salem RM, et al. JASN 2019;30:2000-2016
复制(AMD)IAMDGC 2.0 TOPMed(EUR 子集)15,616 / 16,723Gorski M*, Grunin M*, et al. IOVS 2025;66(13):51
换平台复制deCODE SomaScan34 靶点 / 36 适配体,N=35,559Ferkingstad E, et al. Nat Genet 2021
外部 pQTL 对照SCALLOP-UKBB-MA cis共测 740 蛋白Koprulu/Smith-Byrne, Cell 2026, PMID 42097137
血 cis-eQTLeQTLGenN=31,684Võsa U, et al. Nat Genet 2021;53:1300-1310
血 meQTLUKHLS / Understanding Society(EPIC 芯片)≈1,111 人 / 126,457 CpGHannon E, et al. Am J Hum Genet 2018;103(5):654-665
视网膜 eQTL(外部)Advani 2024 视网膜 QTL403 眼Advani J, et al. QTL mapping of human retina DNA methylation identifies 87 gene-epigenome interactions in AMD. Nat Commun 2024;15:1972. PMID 38438351
视网膜/RPE bulk(自建)EGA METR-GT(EGAD50000002082NSR 183 / RPE 176(源库 201 眼)Sampson J, et al. Nat Commun 2026. doi:10.1038/s41467-026-72979-4
代谢物 NMRNightingale meta_EURN=599,249(源研究 619,372)Tambets R, et al. Nature 2026;655(8124):971-978
代谢物 MetabolonChen 20238,299Chen Y, et al. Nat Genet 2023;55:44-53
单细胞图谱HRCA 人视网膜细胞图谱(CELLxGENE 公开)265,767 细胞 / 18 细胞类型HRCA via CELLxGENE Discover
单细胞(DR 病变)GEO GSE1657846 例 · 质控后 10,074 细胞Hu Z, et al. Diabetes 2022;71(4):762-773. PMID 35061025
单细胞(AMD)GEO GSE230348全库 75 份 → RPE 子集 36 份 · 50,723 细胞GEO GSE230348(Stambolian D 投稿,GEO 尚无关联发表
bulk(DR)GEO GSE60436(GPL6884)3 正常视网膜 + 6 FVM = 9Ishikawa K, et al. IOVS 2015;56(2):932-946. PMID 25604687
bulk(AMD)GEO GSE29801(GPL4133)RPE-脉络膜 AMD vs 正常Newman AM, et al. Genome Med 2012;4(2):16. PMID 22364233
PheWASOpenGWAS(ieugwasr 1.1.0.9000117 SNP × 50,164 数据集(2026-07-27 订正分母)Elsworth B, et al. bioRxiv 2020. doi:10.1101/2020.08.10.244293
可成药性Open TargetsOchoa D, et al. NAR 2023;51:D1353-D1359
LD 参考1000G EUR panel1000 Genomes 2015

加粗条目为本轮新确认或订正的引用。GSE230348 在 GEO 上标注 "Citation missing",只能引登录号,不能编造论文。


五、方法学教训:核查脚本本身也会骗人

本轮核查中,我一度报告"共定位 PP.H4 出现 >1 的非法值(AGER 2.239、TNXB 3.985)",判定为分析层 bug。

实为核查脚本的显示 bug:读 CSV 后用 x["PP.H4"][:5] 截断字符串显示,把科学计数法的 2.23926305578825e-10 截成了 2.239。改用数值比较后,真实值是 2.2×10⁻¹⁰、4.0×10⁻¹¹⁴,全部远小于 0.5。

教训:核查数值时永远 float() 后比较,不要对字符串做截断展示再判断——否则科学计数法会被截成一个看起来"超范围"的数。同类风险也存在于任何用 head/cut 肉眼扫结果文件的场合。


六、汇报 PPT 的最终构成

糖尿病并发症篇AMD 篇
总页数4039
方法段(PART TWO)流程 + Fig1 + 多组学方法与数据 + 功能验证方法与数据同左
结果段新增APOL1 共定位区域图、甲基化 SMR(阴性)、多组学整合矩阵、HRCA 图谱、PheWAS蛋白层共定位区域图、血 eQTL 森林图、代谢物、视网膜 eQTL、HRCA 图谱、PheWAS
参考文献25 条(分 2 页)24 条(分 2 页)

结构原则:方法在 PART TWO 一次讲完,结果段不再被方法页打断(此前方法页夹在结果中间,会让顶栏章节高亮来回跳)。

生成脚本:F:\project\汇报PPT\make_ppt.py,改后直接运行即重建两份 PPT。


核查日期:2026-07-27。所有数字均回溯至 results/ 下的实际产物文件;所有文献引用均经联网确认,未确认者已明确标注。

个人科研与运维文档 · 内容持续修订