主题
MR 流水线 · 文档导航
这套流水线做的是孟德尔随机化(MR)——用基因变异当"天然实验",推断"某个蛋白水平高低会不会导致某种病"。 下面是全部文档,按"先懂方法 → 再动手 → 后原理"的顺序排好,照着走不会乱。
📁 本栏现按 入门与配置 / 方法引擎 / 流水线与筛查 / 数据与结局 / 研究结果与结论 五组归类(见左侧折叠目录)。多组学 MR、靶点功能验证、湿实验方案已独立成栏 → 顶部导航 多组学与靶点验证。
🗺️ 一张图看懂整条分析链
两个病种各一版(结局与复制队列不同,方法主干一致)。同一份图也用作两份汇报 PPT 的 Fig 1。 源码
F:\project\汇报PPT\make_design_fig.py,矢量版:DR PDF · AMD PDF
糖尿病并发症

老年黄斑变性(AMD)

五段的详细做法分别对应:因果估计 → 方法引擎;共定位与复制 → 分家重跑定稿、deCODE 平台复制;多组学 → 多组学 MR 代码引擎 01–07;功能定位 → 功能验证代码引擎 08–10。
📚 完整文档地图(推荐阅读顺序)
给导师/想看进展的:从这页开始
👉 研究进展总览 · 新增分析一览 —— 一页看全整条分析链、每步状态、本轮 AMD 靶点验证新增了什么、以及主打靶点 TNFRSF10A 的证据链。
想系统补方法学基础:看学习指南
👉 MR 学习指南 🆕 —— 三页,补的是本站其他页面有意不覆盖的部分: 学习路径与文献地图(该读哪些文献、按什么顺序、为什么读它)· 理论与公式逐项拆解(形式化定义 + 偏倚方向总表)· 怎么批判性地读一篇 MR 论文(十问 + 拿 Yuan 2023 实例走查)。
文献均已逐条经 Crossref 核实到卷期页 / DOI。
🟢 第一阶段:先懂概念,再照着跑(入门必读)
| 顺序 | 文档 | 一句话 | 难度 |
|---|---|---|---|
| 1 | 从零读懂 MR(小白入门) | 先看这个:为什么能用基因推因果、三大假设、整条流程怎么串、每步在防什么错。完全不懂统计也能读 | ⭐ |
| 2 | 新手快速上手 | 懂了概念后,登录 RStudio、5 步跑出第一份报告 | ⭐ |
| 3 | 结果怎么看 | 跑完必读:每一列什么意思、图怎么读、哪些结果算数(用本课题真实数字讲) | ⭐ |
| 3b | 图表清单与解读 | 🆕 11 类投稿图在哪、怎么读、能下什么结论;含 4 条"不能这么读"的硬限制与有意不做的图 | ⭐⭐ |
| 3c | 方法学审计与已知限制 | 🆕 一次系统审计的全部发现:已修的 5 处数值问题(含 PILRB/ICAM4 用错暴露 β、Mahajan 漏 42% 工具、LDSC h² 口径)· 声明与实现不符的 Steiger · 候选靶点定义排除单病蛋白这一设计选择 · 写 Limitations 直接取材 | ⭐⭐⭐ |
| 3d | R9→R13 并发症差异说明 | 🆕 答辩必备:为什么 R13 的糖尿病并发症显著数少于导师 R9——表型删减(FinnGen 官方)+ 边缘信号跌破 FDR(信号衰减非矛盾)+ 13 个核心 hub 蛋白全复现;含诚实边界与一句话回应 | ⭐⭐ |
| 3e | 本轮方案答疑 · 复制验证/R13定稿/AMD分家 | 🆕 定稿必读:Discovery vs Replication 谁是谁、是不是有好结果才复制、每个并发症的复制数据够不够、EXMORE vs STRICT、AMD 为什么分开、删结局要不要重算 | ⭐⭐ |
| 3c | 换数据重新开始 | 🆕 换课题/换数据必读:批量筛查主线要改哪些文件、哪些阶段是本课题专用、最小可用清单、换完的四项自查 | ⭐⭐ |
| 4 | 代码结构详解(入门向) | 用工厂流水线的比喻讲清每个文件干嘛、10 道工序是什么 | ⭐ |
| 5 | 使用教程 | 换课题完整流程:放数据 → 改配置 → 跑 → 读结果 | ⭐⭐ |
🟡 第二阶段:自己动手配置和批量分析(会用了往这走)
| 顺序 | 文档 | 一句话 | 难度 |
|---|---|---|---|
| 6 | config.yaml 逐字段详解 | 配置文件每个字段的含义、可选值、怎么填 | ⭐⭐ |
| 7 | 批量筛查 | 一个蛋白扫几十个病(本课题实际主力流程)+ 删/加结局快速重分析 | ⭐⭐ |
| 8 | 本地环境 | 本地 WSL RStudio 怎么用(数据大、不跨墙) | ⭐⭐ |
| 8b | 换机复现指南 | 🆕 换电脑要装什么、拷什么、怎么证明算得一样:三种方案对比(只读出图 / 远程连回 / 完整独立)· 精确清单(125G 数据分项 + 42 个顶层 R 包 + 137 条 apt)· 四层验证(环境自检→有断言的 smoke test→独立复算→全链对数)· 实测 9p IO 代价与 EGA 受控数据的不可再生性 | ⭐⭐ |
🔵 第三阶段:懂每一步的统计原理(想深入/写论文方法学)
| 顺序 | 文档 | 一句话 | 难度 |
|---|---|---|---|
| 9 | 方法引擎详解 | 每道工序的统计方法与公式(8 篇引擎 + 2 篇驱动脚本代码) | ⭐⭐⭐ |
| 10 | 下游分析 | PheWAS(多效性)· LDSC(遗传相关)· HyPrColoc(共定位) | ⭐⭐⭐ |
| 11 | 阶段六 · 靶点网络 | 整合 MR+共定位+PheWAS 筛出候选靶点与用药方向(本课题最终结论) | ⭐⭐⭐ |
| 11b | 阶段七 · 靶点验证框架 | 组织落位(eQTL/单细胞)· 独立复制✅(IAMDGC,方向 100% 一致,TNFRSF10A 强复制)· 可成药性✅(CSF2/TNFRSF10A)+ 数据可及性 + 排期 | ⭐⭐⭐ |
| 12 | 流水线架构 | 引擎内部怎么编排、模块怎么串 | ⭐⭐⭐ |
📕 随时查的手册 / 课题资料
| 文档 | 用途 |
|---|---|
| 可补充的 MR 方法(带文献) | 想让结论更硬时可补的方法 + 准确文章 |
| 差异对照 · vs 原始实现 | 我们的流水线和原始实现代码在方法/数据/结果上的异同 |
| 案例-糖尿病 pQTL 研究 | 真实课题从头到尾走一遍 |
| R9 糖尿病并发症清单 · R13 清单 | 每个结局的编码/中英文名/病例数/定义(中英对照) |
| 参考文献 | 所有方法的原始文献(代码内联引用,无卷期页码,投稿前需自己补全) |
| 学习路径与文献地图 | 🆕 该读哪些文献、按什么顺序读、外部教材与课程资源(出处已核到卷期页/DOI) |
| 怎么批判性地读一篇 MR 论文 | 🆕 读文献/写 Discussion/审稿时的十个问题 |
只记一件事
把数据放 data/,改 config.yaml(或批量筛查的 outcome_manifest.csv),运行 Rscript run_all.R(或 Rscript analysis/01_screen.R R9),去 results/ 看报告。其余全是帮你理解和查证的。
两种运行方式别搞混
- 单条精细分析(一个暴露×少数结局,出完整报告+共定位)→
run_all.R+ 改config.yaml - 批量筛查(一个蛋白扫几十个病)→
analysis/01_screen.R+ 改outcome_manifest.csv(本课题实际用这个)
换数据/换课题时两条线要改的东西完全不同,见 换数据重新开始。