主题
外部 T1D 数据源换代与样本重叠核查(2026-07-29)
这页干什么
回答三个被追问到底的问题: ① 新 T1D 数据是不是"机器学习产的"? ② 它含 UK Biobank,和我们的暴露重叠了怎么办? ③ 有没有不重叠的替代? 每个结论都配实测数字,可复核。
一、结论速览
| 问题 | 结论 |
|---|---|
| 新源是不是传统 GWAS | 是。ML 只用于下游风险评分 T1GRS,不参与病例定义 |
| 旧源 GCST90475661 能不能用 | 不能。表型被 T2D 主导,六项标志位点检验全部失败 |
| 新源含 UKB 吗 | 含。1,445 例 + 362,050 对照 = 363,495 人,占 44.5% |
| 重叠有多严重 | 结局侧 5%–6%(上界 6.6%),病例侧仅 0.9%,偏倚约 0.16% |
| 有无零重叠替代 | 有:Crouch 2025 (GCST90013791),已下载,作复制用 |
| 最终配置 | 主分析 McGrail 2026 + 零重叠复制 Crouch 2025 |
二、"机器学习的数据不可靠"——不适用于这篇
McGrail et al. Nat Genet 2026;58:1062–1072(PMID 42062540,正刊 PDF F:\project\s41588-026-02578-y.pdf)包含两部分:
- 一个传统 GWAS —— 20,355 例 vs 797,363 对照
- 一个机器学习风险评分 T1GRS —— 拿第 1 步选出的 199 个变异训练 CatBoost
我们只下载第 1 步的汇总统计。 原文 Data availability:
"Summary statistics from the T1D GWAS are available in the GWAS catalog with accession GCST90824163"
关联分析方法(Methods, Association testing and meta-analysis):
"We used the first bias-corrected LogReg in EPACTS (v3.3.0)... including the first four genotype PCs and sex as covariates... we combined summary statistics from all tested cohorts using a fixed-effects inverse variance-weighted meta-analysis."
LD score 回归查混杂,截距偏离 1 仅 0.0844,原文称 "supported a minimal effect of residual population structure"。
病例来源是经典临床队列,不是自动表型扫描。FinnGen 那部分定义严格:
"the r10 version of 'T1D_Early', which includes 2,832 individuals diagnosed with T1D under the age of 20 years and excludes individuals with T2D"
论文自身的一处不一致
补充表 1 写 FinnGen "freeze 9",正文 Methods 写 "the r10 version"。引用版本号时以补充表为准(412,181 这个数出自该表)。
三、旧源为什么必须换:六项标志位点实测
同一组位点,三份数据本地实测:
| 位点 | 性质 | 旧 GCST90475661 | 新 GCST90824163 | Crouch GCST90013791 |
|---|---|---|---|---|
| PTPN22 rs2476601 | T1D 头号非 HLA | OR 1.133 | 1.908 (p=5.8e-184) | 1.72 (p=4.5e-135) |
| INS rs689 | T1D 第二位点 | OR 0.942 | 2.081 (p=2.8e-305) | 1.79 (p=3.0e-152) |
| TCF7L2 rs7903146 | T2D 头号位点 | p=9.5e-66 | p=0.67 | p=0.075 |
| SLC30A8 rs13266634 | T2D | p=8.9e-8 | p=0.072 | p=0.94 |
| PPARG rs1801282 | T2D | p=7e-5 | p=0.061 | p=0.0064 |
| FTO rs1421085 | 肥胖 | — | — | p=0.39 |
| MHC 区最大效应 | — | 1.28 倍 | 69.4 倍 | 6.60 倍 |
| rg 与 T2D | — | 0.886 | 0.087 | — |
旧数据里 T1D 的招牌位点几乎没信号、T2D 的招牌位点显著到 1e-66;新数据完全反过来。这不是"稍好",是两个不同的表型。
rg 的文献参照:Nyaga Sci Rep 2021 (PMC8260770) 报 rg = 0.17, p = 5.9e-2(不显著); Inshaw Diabetologia 2021 (PMC8099827) 全基因组仅 5 个共定位信号且前 4 个方向相反。
四、UKB 重叠:实测队列构成
补充材料 F:\project\41588_2026_2578_MOESM3_ESM.xlsx 的 Supplementary Table 1:
| 队列 | 病例 | 对照 | 合计 |
|---|---|---|---|
| UK Biobank | 1,445 | 362,050 | 363,495 (44.5%) |
| FinnGen | 2,832 | 409,349 | 412,181 (50.4%) |
| 11 个临床队列(T1DGC / DCCT-EDIC / GoKinD / WTCCC1&2 / GENIE / eMERGE / HRS / CSGNM 等) | 16,078 | 25,964 | 42,042 (5.1%) |
| 合计 | 20,355 ✓ | 797,363 ✓ | 817,718 ✓ |
逐列加总与正文报告分毫不差。另可用汇总统计自带的逐变异 n 列独立验证:n=363,495 覆盖 31.6% 的变异、775,676 = 363,495 + 412,181、最大值 817,718 —— 与补充表完全吻合。
重叠量化
- UKB-PPP 共 54,219 人,全部是 UKB 参与者;该 GWAS 用了 363,495 名 UKB 参与者
- 估计约 4.4–4.8 万人同时在两边 → 占结局样本 5.4%–5.9%,上界 6.6%(即便 UKB-PPP 全员入选)
- 病例侧仅 ≈0.9%(UKB 只贡献 1,445 例病例)—— 病例-对照结局的信息量由病例数决定
哪些是实测、哪些是估算
"UKB 贡献 363,495 人"是实测(补充表 + n 列双重确认); "其中多少人同时在 UKB-PPP 里"是估算(补充材料不可能给到个体层面),故报区间 + 上界。
偏倚有多大:用我们自己的工具算
样本重叠的偏倚 ≈ 重叠比例 × (观察性混杂 ÷ F)(Burgess, Davies & Thompson, Genet Epidemiol 2016)。 R9 全部 1,740 个蛋白-SNP 工具的 F 统计量实测:
| F 值 | |
|---|---|
| 最小值 | 40.6 |
| 1% / 5% 分位 | 47.7 / 63.4 |
| 中位数 | 763.1 |
| 最大值 | 23,802.7 |
| F < 10 的比例 | 0 |
→ 按实际 6.6% 重叠算偏倚 0.16%;即便按 100% 重叠的不可能假设算也只有 2.5%。
我们自己写错过的一句
manifest / 记忆 / docs 三处都曾写 GCST90824163「非 UKB,与 UKB-PPP 暴露无重叠」——这是错的,写时未读正刊原文。2026-07-29 已全部订正。
五、有没有零重叠的替代?——98 项研究全扫
| 数据 | 欧洲病例 | 含 UKB | 全基因组 | 结论 |
|---|---|---|---|---|
| GCST90824163 McGrail 2026 | 20,355 | 是 | ✓ 56.4M 变异 | 主分析 |
| GCST90013445 Robertson 2021 | 20,065 | 否 | ✗ ImmunoChip 仅 188 免疫区 | 不可用 |
| GCST90013791 Crouch 2025 | 15,573 | 否 | ✓ 6.28M 变异 | 零重叠复制 |
| GCST001255 Bradfield 2011 | 9,934 | 否(早于 UKB) | HapMap 时代 | 偏小偏旧 |
| GCST010681 Forgetta 2020 | 9,266 | — | — | 偏小 |
| GCST90000529 Inshaw 2021 | 7,467 | — | — | 偏小 |
Robertson 2021 病例数几乎与新源持平且不含 UKB,但原文明言:
"restricted to ImmunoChip content, which provides dense coverage in 188 immune-relevant genomic regions... This design restricts the scope of discovery"
我们的工具散布全基因组,绝大多数在该数据里不存在 → 不是精度问题,是数据缺失问题。
六、Crouch 2025 实测核查
来源五队列,UK Biobank 不在其中(原文称 UKB 数据仅用于计算 LD):
| 来源 | 病例 | 对照 |
|---|---|---|
| UK Illumina 550K | 3,983 | 3,994 |
| UK Affymetrix 500K | 1,926 | 3,342 |
| Sardinia | 1,558 | 2,882 |
| T1DGC 三体家系 | 3,173 | — |
| FinnGen | 4,933 | 148,190 |
| 合计 | 15,573 ✓ | 158,408 ✓ |
工具覆盖率实测(文件 md5 2ef55eb63f7c4bc09c8ef1ac6e329eed,与官方一致):
| 覆盖我们 1,729 个工具 | |
|---|---|
| McGrail 2026 | 1,673 = 96.8% |
| Crouch 2025 | 1,196 = 69.2% |
阳性结果的可复制性:R13 新源下 T1D 有 57 条显著关联,Crouch 能测 40 条(70%)。 丢掉的 17 条以 MHC 区为主:TNXB (FDR 3.8e-174)、HLA-DRA (6.6e-96)、LTB (2.2e-31)、MICB/MICA、MOG、CDSN、AGER 等。
这个限制反而合适
丢掉的那批全在 MHC 区,而 MHC 区信号本就是我们判定为不可靠的那批—— 导师"共定位 20 个"里 11 个不成立的蛋白,10/11 在 MHC;共定位成立的 10 个,0/10 在 MHC (见 R9 复现重跑)。 Crouch 能复制的 40 条,正是非 MHC、共定位支持、真正要写进结论的那批。
七、最终配置与 Methods 写法
| 角色 | 数据 | 与暴露重叠 |
|---|---|---|
| 主分析 | GCST90824163(McGrail 2026) | 5%–6%,偏倚 0.16% |
| 零重叠复制 | GCST90013791(Crouch 2025) | 0(仅能测 40/57,需写明) |
| 备用 | FinnGen T1D(R9 4,196 例) | 0,检验力弱 |
Methods 需披露:① 外部 T1D GWAS 含 UK Biobank,与暴露 UKB-PPP 部分重叠(结局侧 5%–6%、病例侧 0.9%); ② 工具 F 值范围 40.6–23,803(中位 763),弱工具偏倚可忽略; ③ 以 Crouch 2025 作零重叠敏感性分析,说明其仅覆盖 40/57 条、未覆盖者以 MHC 区为主。
八、代码改动
| 文件 | 改动 |
|---|---|
outcome_manifest.csv | R9_dm 的 T1D 换源;旧源移入 R9_retired;新增 R9_sens 两行(T2D_mvp / T1D_crouch) |
analysis/_region_io.R | 区域读取器加 gcst_beta 分支(GWAS-SSF harmonised);两类 GCST 一律按列名解析列号;缓存键加入文件签名 |
analysis/05_hyprcoloc.R | FMT_MAP 由两分支扩为三分支 |
为什么必须按列名解析列号
实测 GCST90824163 的 rsid 在第 9 列、GCST90013791 在第 10 列。 写死列号会读到错误的列且完全静默(区域读到 0 行 → 该位点被跳过,不报错)。
区域读取器改完做过烟测(含阴性对照):T1D_gcst 8,059 行 / T1D_crouch 548 行 / Retinopathy 2,498 行; 不存在的坐标返回 0 行。
九、另一个更严重的问题(独立记录)
核查过程中发现 FinnGen 并发症端点的对照是一般人群,不是"没有并发症的糖尿病人", 导致估计目标是"糖尿病 + 并发症"的复合效应。实测 TCF7L2 / PTPN22 / FTO 在四个端点上全部显著。 这比 UKB 重叠严重两个数量级 —— 详见 FinnGen 端点对照定义问题。