Skip to content

MR 流水线 · 文档导航

这套流水线做的是孟德尔随机化(MR)——用基因变异当"天然实验",推断"某个蛋白水平高低会不会导致某种病"。 下面是全部文档,按"先懂方法 → 再动手 → 后原理"的顺序排好,照着走不会乱。


📁 本栏现按 入门与配置 / 方法引擎 / 流水线与筛查 / 数据与结局 / 研究结果与结论 五组归类(见左侧折叠目录)。多组学 MR、靶点功能验证、湿实验方案已独立成栏 → 顶部导航 多组学与靶点验证

🗺️ 一张图看懂整条分析链

两个病种各一版(结局与复制队列不同,方法主干一致)。同一份图也用作两份汇报 PPT 的 Fig 1。 源码 F:\project\汇报PPT\make_design_fig.py,矢量版:DR PDF · AMD PDF

糖尿病并发症

糖尿病并发症研究设计示意图

老年黄斑变性(AMD)

AMD 研究设计示意图

五段的详细做法分别对应:因果估计方法引擎共定位与复制分家重跑定稿deCODE 平台复制多组学多组学 MR 代码引擎 01–07功能定位功能验证代码引擎 08–10


📚 完整文档地图(推荐阅读顺序)

给导师/想看进展的:从这页开始

👉 研究进展总览 · 新增分析一览 —— 一页看全整条分析链、每步状态、本轮 AMD 靶点验证新增了什么、以及主打靶点 TNFRSF10A 的证据链。

想系统补方法学基础:看学习指南

👉 MR 学习指南 🆕 —— 三页,补的是本站其他页面有意不覆盖的部分: 学习路径与文献地图(该读哪些文献、按什么顺序、为什么读它)· 理论与公式逐项拆解(形式化定义 + 偏倚方向总表)· 怎么批判性地读一篇 MR 论文(十问 + 拿 Yuan 2023 实例走查)。

文献均已逐条经 Crossref 核实到卷期页 / DOI。

🟢 第一阶段:先懂概念,再照着跑(入门必读)

顺序文档一句话难度
1从零读懂 MR(小白入门)先看这个:为什么能用基因推因果、三大假设、整条流程怎么串、每步在防什么错。完全不懂统计也能读
2新手快速上手懂了概念后,登录 RStudio、5 步跑出第一份报告
3结果怎么看跑完必读:每一列什么意思、图怎么读、哪些结果算数(用本课题真实数字讲)
3b图表清单与解读🆕 11 类投稿图在哪、怎么读、能下什么结论;含 4 条"不能这么读"的硬限制与有意不做的图⭐⭐
3c方法学审计与已知限制🆕 一次系统审计的全部发现:已修的 5 处数值问题(含 PILRB/ICAM4 用错暴露 β、Mahajan 漏 42% 工具、LDSC h² 口径)· 声明与实现不符的 Steiger · 候选靶点定义排除单病蛋白这一设计选择 · 写 Limitations 直接取材⭐⭐⭐
3dR9→R13 并发症差异说明🆕 答辩必备:为什么 R13 的糖尿病并发症显著数少于导师 R9——表型删减(FinnGen 官方)+ 边缘信号跌破 FDR(信号衰减非矛盾)+ 13 个核心 hub 蛋白全复现;含诚实边界与一句话回应⭐⭐
3e本轮方案答疑 · 复制验证/R13定稿/AMD分家🆕 定稿必读:Discovery vs Replication 谁是谁、是不是有好结果才复制、每个并发症的复制数据够不够、EXMORE vs STRICT、AMD 为什么分开、删结局要不要重算⭐⭐
3c换数据重新开始🆕 换课题/换数据必读:批量筛查主线要改哪些文件、哪些阶段是本课题专用、最小可用清单、换完的四项自查⭐⭐
4代码结构详解(入门向)用工厂流水线的比喻讲清每个文件干嘛、10 道工序是什么
5使用教程换课题完整流程:放数据 → 改配置 → 跑 → 读结果⭐⭐

🟡 第二阶段:自己动手配置和批量分析(会用了往这走)

顺序文档一句话难度
6config.yaml 逐字段详解配置文件每个字段的含义、可选值、怎么填⭐⭐
7批量筛查一个蛋白扫几十个病(本课题实际主力流程)+ 删/加结局快速重分析⭐⭐
8本地环境本地 WSL RStudio 怎么用(数据大、不跨墙)⭐⭐
8b换机复现指南🆕 换电脑要装什么、拷什么、怎么证明算得一样:三种方案对比(只读出图 / 远程连回 / 完整独立)· 精确清单(125G 数据分项 + 42 个顶层 R 包 + 137 条 apt)· 四层验证(环境自检→有断言的 smoke test→独立复算→全链对数)· 实测 9p IO 代价与 EGA 受控数据的不可再生性⭐⭐

🔵 第三阶段:懂每一步的统计原理(想深入/写论文方法学)

顺序文档一句话难度
9方法引擎详解每道工序的统计方法与公式(8 篇引擎 + 2 篇驱动脚本代码)⭐⭐⭐
10下游分析PheWAS(多效性)· LDSC(遗传相关)· HyPrColoc(共定位)⭐⭐⭐
11阶段六 · 靶点网络整合 MR+共定位+PheWAS 筛出候选靶点与用药方向(本课题最终结论)⭐⭐⭐
11b阶段七 · 靶点验证框架组织落位(eQTL/单细胞)· 独立复制✅(IAMDGC,方向 100% 一致,TNFRSF10A 强复制)· 可成药性✅(CSF2/TNFRSF10A)+ 数据可及性 + 排期⭐⭐⭐
12流水线架构引擎内部怎么编排、模块怎么串⭐⭐⭐

📕 随时查的手册 / 课题资料

文档用途
可补充的 MR 方法(带文献)想让结论更硬时可补的方法 + 准确文章
差异对照 · vs 原始实现我们的流水线和原始实现代码在方法/数据/结果上的异同
案例-糖尿病 pQTL 研究真实课题从头到尾走一遍
R9 糖尿病并发症清单 · R13 清单每个结局的编码/中英文名/病例数/定义(中英对照)
参考文献所有方法的原始文献(代码内联引用,无卷期页码,投稿前需自己补全)
学习路径与文献地图🆕 该读哪些文献、按什么顺序读、外部教材与课程资源(出处已核到卷期页/DOI)
怎么批判性地读一篇 MR 论文🆕 读文献/写 Discussion/审稿时的十个问题

只记一件事

把数据放 data/,改 config.yaml(或批量筛查的 outcome_manifest.csv),运行 Rscript run_all.R(或 Rscript analysis/01_screen.R R9),去 results/ 看报告。其余全是帮你理解和查证的。

两种运行方式别搞混

  • 单条精细分析(一个暴露×少数结局,出完整报告+共定位)→ run_all.R + 改 config.yaml
  • 批量筛查(一个蛋白扫几十个病)→ analysis/01_screen.R + 改 outcome_manifest.csv本课题实际用这个

换数据/换课题时两条线要改的东西完全不同,见 换数据重新开始

👉 新手三步走:从零读懂 MR(懂原理)→ 新手快速上手(跑起来)→ 结果怎么看(读得懂)。

个人科研与运维文档 · 内容持续修订