Skip to content

外部 T1D 数据源换代与样本重叠核查(2026-07-29)

这页干什么

回答三个被追问到底的问题: ① 新 T1D 数据是不是"机器学习产的"? ② 它含 UK Biobank,和我们的暴露重叠了怎么办? ③ 有没有不重叠的替代? 每个结论都配实测数字,可复核。

一、结论速览

问题结论
新源是不是传统 GWAS。ML 只用于下游风险评分 T1GRS,不参与病例定义
旧源 GCST90475661 能不能用不能。表型被 T2D 主导,六项标志位点检验全部失败
新源含 UKB 吗。1,445 例 + 362,050 对照 = 363,495 人,占 44.5%
重叠有多严重结局侧 5%–6%(上界 6.6%),病例侧仅 0.9%,偏倚约 0.16%
有无零重叠替代有:Crouch 2025 (GCST90013791),已下载,作复制用
最终配置主分析 McGrail 2026 + 零重叠复制 Crouch 2025

二、"机器学习的数据不可靠"——不适用于这篇

McGrail et al. Nat Genet 2026;58:1062–1072(PMID 42062540,正刊 PDF F:\project\s41588-026-02578-y.pdf包含两部分

  1. 一个传统 GWAS —— 20,355 例 vs 797,363 对照
  2. 一个机器学习风险评分 T1GRS —— 拿第 1 步选出的 199 个变异训练 CatBoost

我们只下载第 1 步的汇总统计。 原文 Data availability:

"Summary statistics from the T1D GWAS are available in the GWAS catalog with accession GCST90824163"

关联分析方法(Methods, Association testing and meta-analysis):

"We used the first bias-corrected LogReg in EPACTS (v3.3.0)... including the first four genotype PCs and sex as covariates... we combined summary statistics from all tested cohorts using a fixed-effects inverse variance-weighted meta-analysis."

LD score 回归查混杂,截距偏离 1 仅 0.0844,原文称 "supported a minimal effect of residual population structure"。

病例来源是经典临床队列,不是自动表型扫描。FinnGen 那部分定义严格:

"the r10 version of 'T1D_Early', which includes 2,832 individuals diagnosed with T1D under the age of 20 years and excludes individuals with T2D"

论文自身的一处不一致

补充表 1 写 FinnGen "freeze 9",正文 Methods 写 "the r10 version"。引用版本号时以补充表为准(412,181 这个数出自该表)。

三、旧源为什么必须换:六项标志位点实测

同一组位点,三份数据本地实测:

位点性质旧 GCST90475661新 GCST90824163Crouch GCST90013791
PTPN22 rs2476601T1D 头号非 HLAOR 1.1331.908 (p=5.8e-184)1.72 (p=4.5e-135)
INS rs689T1D 第二位点OR 0.9422.081 (p=2.8e-305)1.79 (p=3.0e-152)
TCF7L2 rs7903146T2D 头号位点p=9.5e-66p=0.67p=0.075
SLC30A8 rs13266634T2Dp=8.9e-8p=0.072p=0.94
PPARG rs1801282T2Dp=7e-5p=0.061p=0.0064
FTO rs1421085肥胖p=0.39
MHC 区最大效应1.28 倍69.4 倍6.60 倍
rg 与 T2D0.8860.087

旧数据里 T1D 的招牌位点几乎没信号、T2D 的招牌位点显著到 1e-66;新数据完全反过来。这不是"稍好",是两个不同的表型。

rg 的文献参照:Nyaga Sci Rep 2021 (PMC8260770) 报 rg = 0.17, p = 5.9e-2(不显著); Inshaw Diabetologia 2021 (PMC8099827) 全基因组仅 5 个共定位信号且前 4 个方向相反。

四、UKB 重叠:实测队列构成

补充材料 F:\project\41588_2026_2578_MOESM3_ESM.xlsx 的 Supplementary Table 1:

队列病例对照合计
UK Biobank1,445362,050363,495 (44.5%)
FinnGen2,832409,349412,181 (50.4%)
11 个临床队列(T1DGC / DCCT-EDIC / GoKinD / WTCCC1&2 / GENIE / eMERGE / HRS / CSGNM 等)16,07825,96442,042 (5.1%)
合计20,355797,363817,718

逐列加总与正文报告分毫不差。另可用汇总统计自带的逐变异 n 列独立验证:n=363,495 覆盖 31.6% 的变异、775,676 = 363,495 + 412,181、最大值 817,718 —— 与补充表完全吻合。

重叠量化

  • UKB-PPP 共 54,219 人,全部是 UKB 参与者;该 GWAS 用了 363,495 名 UKB 参与者
  • 估计约 4.4–4.8 万人同时在两边 → 占结局样本 5.4%–5.9%上界 6.6%(即便 UKB-PPP 全员入选)
  • 病例侧仅 ≈0.9%(UKB 只贡献 1,445 例病例)—— 病例-对照结局的信息量由病例数决定

哪些是实测、哪些是估算

"UKB 贡献 363,495 人"是实测(补充表 + n 列双重确认); "其中多少人同时在 UKB-PPP 里"是估算(补充材料不可能给到个体层面),故报区间 + 上界。

偏倚有多大:用我们自己的工具算

样本重叠的偏倚 ≈ 重叠比例 × (观察性混杂 ÷ F)(Burgess, Davies & Thompson, Genet Epidemiol 2016)。 R9 全部 1,740 个蛋白-SNP 工具的 F 统计量实测:

F 值
最小值40.6
1% / 5% 分位47.7 / 63.4
中位数763.1
最大值23,802.7
F < 10 的比例0

→ 按实际 6.6% 重叠算偏倚 0.16%;即便按 100% 重叠的不可能假设算也只有 2.5%

我们自己写错过的一句

manifest / 记忆 / docs 三处都曾写 GCST90824163「非 UKB,与 UKB-PPP 暴露无重叠」——这是错的,写时未读正刊原文。2026-07-29 已全部订正。

五、有没有零重叠的替代?——98 项研究全扫

数据欧洲病例含 UKB全基因组结论
GCST90824163 McGrail 202620,355✓ 56.4M 变异主分析
GCST90013445 Robertson 202120,065✗ ImmunoChip 仅 188 免疫区不可用
GCST90013791 Crouch 202515,573✓ 6.28M 变异零重叠复制
GCST001255 Bradfield 20119,934否(早于 UKB)HapMap 时代偏小偏旧
GCST010681 Forgetta 20209,266偏小
GCST90000529 Inshaw 20217,467偏小

Robertson 2021 病例数几乎与新源持平且不含 UKB,但原文明言:

"restricted to ImmunoChip content, which provides dense coverage in 188 immune-relevant genomic regions... This design restricts the scope of discovery"

我们的工具散布全基因组,绝大多数在该数据里不存在 → 不是精度问题,是数据缺失问题

六、Crouch 2025 实测核查

来源五队列,UK Biobank 不在其中(原文称 UKB 数据仅用于计算 LD):

来源病例对照
UK Illumina 550K3,9833,994
UK Affymetrix 500K1,9263,342
Sardinia1,5582,882
T1DGC 三体家系3,173
FinnGen4,933148,190
合计15,573158,408

工具覆盖率实测(文件 md5 2ef55eb63f7c4bc09c8ef1ac6e329eed,与官方一致):

覆盖我们 1,729 个工具
McGrail 20261,673 = 96.8%
Crouch 20251,196 = 69.2%

阳性结果的可复制性:R13 新源下 T1D 有 57 条显著关联,Crouch 能测 40 条(70%)。 丢掉的 17 条以 MHC 区为主:TNXB (FDR 3.8e-174)、HLA-DRA (6.6e-96)、LTB (2.2e-31)、MICB/MICA、MOG、CDSN、AGER 等。

这个限制反而合适

丢掉的那批全在 MHC 区,而 MHC 区信号本就是我们判定为不可靠的那批—— 导师"共定位 20 个"里 11 个不成立的蛋白,10/11 在 MHC;共定位成立的 10 个,0/10 在 MHC (见 R9 复现重跑)。 Crouch 能复制的 40 条,正是非 MHC、共定位支持、真正要写进结论的那批。

七、最终配置与 Methods 写法

角色数据与暴露重叠
主分析GCST90824163(McGrail 2026)5%–6%,偏倚 0.16%
零重叠复制GCST90013791(Crouch 2025)0(仅能测 40/57,需写明)
备用FinnGen T1D(R9 4,196 例)0,检验力弱

Methods 需披露:① 外部 T1D GWAS 含 UK Biobank,与暴露 UKB-PPP 部分重叠(结局侧 5%–6%、病例侧 0.9%); ② 工具 F 值范围 40.6–23,803(中位 763),弱工具偏倚可忽略; ③ 以 Crouch 2025 作零重叠敏感性分析,说明其仅覆盖 40/57 条、未覆盖者以 MHC 区为主。

八、代码改动

文件改动
outcome_manifest.csvR9_dm 的 T1D 换源;旧源移入 R9_retired;新增 R9_sens 两行(T2D_mvp / T1D_crouch)
analysis/_region_io.R区域读取器加 gcst_beta 分支(GWAS-SSF harmonised);两类 GCST 一律按列名解析列号;缓存键加入文件签名
analysis/05_hyprcoloc.RFMT_MAP 由两分支扩为三分支

为什么必须按列名解析列号

实测 GCST90824163rsid第 9 列GCST90013791第 10 列。 写死列号会读到错误的列且完全静默(区域读到 0 行 → 该位点被跳过,不报错)。

区域读取器改完做过烟测(含阴性对照):T1D_gcst 8,059 行 / T1D_crouch 548 行 / Retinopathy 2,498 行; 不存在的坐标返回 0 行。

九、另一个更严重的问题(独立记录)

核查过程中发现 FinnGen 并发症端点的对照是一般人群,不是"没有并发症的糖尿病人", 导致估计目标是"糖尿病 + 并发症"的复合效应。实测 TCF7L2 / PTPN22 / FTO 在四个端点上全部显著。 这比 UKB 重叠严重两个数量级 —— 详见 FinnGen 端点对照定义问题

个人科研与运维文档 · 内容持续修订