解决方案 人群队列研究方案
人群队列研究

人群队列研究
多组学解决方案

依托基因组、表观组与多组学联合技术,支持大型人群队列研究的设计、检测与数据分析,为精准医学、基因型-表型关联研究和公共卫生决策提供科学依据。

研究痛点

人群队列研究面临的挑战

多维度复杂性对研究方法提出了新的要求

样本规模庞大

队列研究样本量大、周期长,对检测通量、数据质量和成本控制均提出高要求。

数据维度复杂

队列研究涉及基因组、表型、环境、生活方式等多维数据整合,分析难度大。

关联分析效能低

复杂疾病的遗传度解析需要大样本和多组学联合策略才能获得足够的统计效能。

转化应用难度大

将队列研究发现的遗传和分子标志物转化为临床可用的风险评估工具面临诸多挑战。

技术路线

从队列设计到精准医学应用的完整研究路径

一站式人群队列研究服务,从样本收集到多组学数据挖掘与临床转化

队列设计

研究设计与样本量估算

样本采集

大队列样本收集与质控

高通量检测

基因组/表观组/蛋白组检测

关联分析

GWAS与多组学关联分析

模型构建

风险预测与疾病分型模型

转化应用

精准医学与公共卫生应用

核心技术

四大核心技术组合

多维度技术平台全面支撑人群队列研究

基因组学

基因芯片 + 全基因组测序

应用场景:全基因组关联分析(GWAS)、遗传结构解析、孟德尔随机化分析、多基因风险评分构建。

了解详情

表观组学

甲基化芯片 + 表观遗传时钟

应用场景:队列表观基因组关联分析(EWAS)、环境表观遗传学研究、生物年龄评估、疾病表观Biomarker发现。

了解详情

蛋白组学

Olink 蛋白组平台

应用场景:大队列蛋白Biomarker筛选、循环蛋白与疾病关联分析、蛋白质组关联研究(PWAS)、蛋白组风险预测。

了解详情

多组学联合分析

组学联合 + 孟德尔随机化

应用场景:多组学关联整合分析、基因型-表型关联研究、疾病风险预测模型构建、因果推断与机制解析。

了解详情
特色方案

中科普瑞特色队列研究方案

基于5万+样本「表观星图」技术服务经验,助力科研单位开展高水平大队列研究

技术平台 · 表观星图

935K甲基化芯片 大队列EWAS研究方案

面向大样本人群队列的全基因组甲基化关联分析研究,高效发现与疾病/表型相关的甲基化标志物

EPIC 935K EWAS 大队列 表观星图
技术路线
  1. 大规模样本收集与质量控制(上千~上万例样本)
  2. EPIC 935K甲基化芯片高通量检测(93.5万个CpG位点全覆盖)
  3. 标准化数据预处理与质量控制(探针过滤、背景校正、归一化、批次校正)
  4. EWAS全基因组关联分析 + 孟德尔随机化 + 甲基化年龄 + 功能富集分析
核心优势
  • 表观星图50,000+样本技术服务经验:涵盖中科院、复旦等多家科研机构的EWAS项目
  • 935K芯片覆盖最全的CpG位点,EWAS分析效能最高
  • Illumina芯片平台,高通量检测、交付稳定、项目经验丰富
  • 成熟的EWAS分析流程,支持复杂队列设计(病例对照、出生队列、纵向队列等)
  • 支持高级分析:多组学联合、MR因果推断、甲基化时钟、机器学习预测模型
适用场景

全基因组甲基化关联研究(EWAS)、疾病标志物筛选、出生/衰老队列研究、肿瘤早筛队列

双组学联合 · Biomarker发现

甲基化芯片 + Olink蛋白组 双组学队列Biomarker发现方案

整合甲基化表观组与蛋白功能组,大队列中筛选更可靠的疾病生物标志物

双组学联合 甲基化+蛋白组 Biomarker 队列验证
技术路线
  1. 队列样本(病例/对照配对,或纵向队列基线+随访)
  2. EPIC 935K甲基化芯片 + Olink蛋白组(Explore HT 5300+蛋白/Target Panel)双平台检测
  3. 单组学差异筛选 + 甲基化-蛋白关联分析 + 共调控网络分析
  4. 独立队列验证 + 预测模型构建(机器学习)
核心优势
  • 双组学交叉验证,显著降低假阳性,标志物可靠性更高
  • 甲基化发现表观标志物,蛋白组验证功能表型,从机制到功能形成闭环
  • Olink样本量小(1μL),适合珍贵的队列样本
  • 支持大样本通量:芯片+Olink均可高效处理千级样本量
  • 有成熟的双组学联合分析流程和项目经验
适用场景

疾病早诊/预后标志物、药物疗效预测、疾病风险分层、多组学分型研究

基因组学 · 大队列GWAS

Illumina SNP芯片 大队列GWAS研究方案

面向大样本人群队列的全基因组关联分析,高效发现与疾病/表型相关的遗传变异

SNP芯片 GWAS MR / PRS
技术路线
  1. Illumina SNP芯片高通量检测(覆盖基因组范围高密度SNP位点)
  2. 数据质控与基因型填充(质量控制、SNP过滤、imputation填充)
  3. GWAS全基因组关联分析(质量控制、群体分层、关联分析、多重检验校正)
  4. 高级分析:孟德尔随机化MR + 多基因风险评分PRS + 精细定位
核心优势
  • Illumina芯片平台,数据稳定、批次效应小,适合大队列研究
  • 成熟的GWAS分析流程,支持病例对照、队列研究等多种研究设计
  • 具备孟德尔随机化、PRS多基因风险评分等高级分析能力
  • 大样本项目管理经验,数千至万例样本标准化交付
适用场景

疾病易感基因定位与风险位点发现、孟德尔随机化因果推断研究、多基因风险评分模型构建、药物基因组学与精准用药研究

微生态 · 菌群研究

宏基因组 + 多组学 肠道微生态队列方案

从粪便样本采集到菌群-宿主多组学关联,完整支撑肠道微生态大队列研究

宏基因组 肠道微生态 菌群标志物
技术路线
  1. 粪便样本采集与DNA提取(标准化采集盒,含保护液)
  2. 宏基因组测序(shotgun metagenomics,高通量测序)
  3. 物种组成与功能通路注释分析(菌株水平解析)
  4. 多组学整合与菌群标志物筛选(关联分析、预测建模)
核心优势
  • 成熟的粪便样本采集与处理流程,保障大队列样本质量稳定
  • 菌株水平解析能力,物种注释精度高,功能信息丰富
  • 宏基因组+代谢组+蛋白组多组学整合分析经验
  • 大队列项目管理,标准化质控体系,千级样本稳定交付
适用场景

肠道菌群与疾病关联研究、代谢性疾病及消化系统疾病微生态研究、菌群标志物筛选与诊断模型开发、饮食/药物干预下的菌群应答研究

全流程服务

队列多组学全流程服务能力

一站式队列研究解决方案,覆盖样本、检测、分析、验证全链条

01

队列样本收集

Sample Collection & Management

大型人群队列生物样本采集与标准化管理,涵盖血液、组织、唾液、粪便等多种样本类型,配备规范的样本编号、存储与追踪体系

02

表型数据结构化

Phenotype Data Curation

临床表型、生活方式、流行病学等多维度数据的结构化整理与质量控制,支持电子病历、问卷数据的标准化清洗与整合

03

多组学检测

Multi-Omics Detection

整合甲基化、蛋白组、基因组、转录组、宏基因组等多维度组学检测,构建全景分子图谱

DNA甲基化测序/芯片 Olink蛋白组学 基因组/SNP芯片 转录组/单细胞 宏基因组/微生物组
04

关联分析挖掘

Data Analysis & Mining

表型-分子关联分析、生物标志物筛选、多组学整合建模与深度生物信息挖掘,涵盖GWAS/EWAS/孟德尔随机化/机器学习等多种分析策略

05

结果独立验证

Result Verification

在独立验证队列中对发现的分子标志物进行严格验证,采用多中心、多平台交叉验证策略,确保研究结果的可靠性与可重复性

06

临床转化应用

Clinical Translation

基于验证结果开发临床级检测产品,推动科研成果向临床应用转化,包括伴随诊断、疾病风险预测模型、早筛早检产品等

国际视野

国际知名大型人群队列研究盘点

全球顶级队列项目选择的技术平台,也是我们为您提供服务的标准

UK

UK Biobank

英国生物银行

50万人规模,全球最具影响力的人群队列之一

基因组层面:已完成全部50万人SNP基因分型,产出海量GWAS研究成果

多组学整合:涵盖基因组、甲基化、蛋白组、影像等多层组学数据

FI

FinnGen

芬兰基因组研究

50万人目标规模,结合芬兰独特的遗传隔离人群特征

基因组核心:基于全基因组SNP芯片与基因型填充,开展大规模GWAS研究

深度整合基因组数据与全国电子健康档案,支持共病与药物基因组学研究

JP

Biobank Japan

日本生物银行

26万+人样本,亚洲最大的人群生物样本库之一

基因组研究:基于高密度SNP芯片,针对20+种常见疾病开展大型GWAS

重点关注常见疾病的遗传与环境因素交互作用研究

CN

CKB

中国慢性病前瞻性研究

51万人样本,覆盖中国10个地区城乡人群

基因组研究:已完成大规模SNP基因分型,探索中国人群特有遗传易感位点

前瞻性随访研究,致力于慢病危险因素发现与精准防控

标杆案例 · UK Biobank 选择 Olink

UK Biobank 采用 Olink 蛋白组学平台,开展全球最大规模人群队列蛋白组研究

UK Biobank 使用 Olink Explore 平台对数万份人群样本进行高通量蛋白质组检测,产出了丰富的蛋白组学数据资源,已发表大量高影响力研究成果,成为全球人群队列蛋白组研究的标杆。其选择 Olink 的核心原因在于:PEA 技术的高特异性和高重复性、极小的样本需求量(1μL)、以及适合大队列的高检测通量。

50万+
总队列规模
5300+
蛋白标志物检测
1μL
仅需微量样本
中科普瑞 · Olink全系列认证服务商

与 UK Biobank 同平台、同标准、同质量

  • Explore HT 5300+蛋白全系列认证
  • 千级样本大队列服务经验
  • 严格质控 · 批次间稳定一致
了解 Olink 服务
服务套餐

三档服务方案灵活选择

根据研究规模和目标,选择最适合您的人群队列研究方案

基础版

基因芯片 + 标准GWAS分析

适用场景

适合初步遗传关联与队列基线分析

推荐指数

包含内容

  • 全基因组SNP芯片检测
  • 标准质量控制与基因型填充
  • GWAS关联分析与曼哈顿图
  • 遗传结构与祖先成分分析
  • 标准化报告交付

定制版

多组学全景 + 队列全流程研究支持

适用场景

适合大型队列、精准医学与转化研究

推荐指数

包含内容

  • 三组学及以上全景检测(基因组+表观组+蛋白组)
  • 队列研究设计与统计分析方案咨询
  • 多组学联合关联与因果推断分析
  • 疾病风险预测模型构建与验证
  • 大队列数据管理与分析平台支持
  • 专属技术团队全程跟进
  • 论文撰写与投稿协助
  • 转化研究与公共卫生应用咨询
合作案例

人群队列研究合作成果

助力科研人员在高水平期刊发表人群队列研究论文

典型项目案例

大型队列项目实战经验

从设计到交付,见证万级样本量队列项目的完整技术服务能力

01
表观星图 · 国家级科研项目技术服务

大型中国人群甲基化图谱构建与慢病EWAS研究技术服务

项目背景

为某国家级科研项目提供甲基化芯片检测与分析技术服务,助力构建中国人群大规模甲基化图谱,挖掘常见慢病的甲基化风险标志物

方案设计
  • 12,000+例社区人群外周血样本(涵盖6个省市,年龄30-79岁),样本由合作科研单位提供,我方提供检测与分析技术服务
  • 技术服务:Illumina EPIC 935K 甲基化芯片检测 + 全流程EWAS分析
  • 分析内容:人群甲基化基线图谱构建、8种慢病EWAS全基因组关联分析、甲基化年龄与慢病风险关联、多疾病风险预测模型构建、孟德尔随机化因果推断
关键结果
  • 完成12,000+例样本的甲基化芯片检测和标准化数据分析,批次整合质量优良
  • 构建了首个大规模中国人群甲基化参考图谱(含6个地域亚群)
  • 鉴定出与高血压、糖尿病、冠心病等8种慢病相关的差异甲基化位点共237个
  • 构建的慢病风险预测模型AUC达0.83,优于传统危险因素模型
  • 通过MR分析确定了15个具有潜在因果关系的甲基化位点
服务价值:高质量的检测与分析数据为合作单位的精准医学研究和慢病风险筛查提供了可靠的技术支撑,项目成果已发表于高水平期刊并应用于多个子课题研究
02
肿瘤早筛 · 临床转化

肿瘤早筛大队列甲基化标志物筛选与验证研究

项目背景

与某三甲医院合作,基于大型回顾性队列筛选和验证肺癌早期诊断的甲基化标志物,我方提供检测与分析技术服务

方案设计
  • 2,000+例样本:发现阶段500例(肺癌250+健康对照250)+ 验证阶段1500例(多中心独立队列)
  • 技术平台:EPIC 935K甲基化芯片(发现阶段)+ 靶向甲基化测序(验证阶段)
  • 分析内容:差异甲基化筛选、LASSO特征选择、诊断模型构建、多中心验证、亚组分析(组织学类型/分期)
关键结果
  • 筛选出由12个CpG位点组成的肺癌甲基化诊断Panel
  • 发现集AUC=0.94,验证集AUC=0.91
  • I期肺癌灵敏度85%,特异性90%,优于现有血清标志物
  • 鳞状细胞癌和腺癌均有良好诊断性能
服务价值:诊断模型已转化为临床检测试剂盒,正在进行多中心临床验证,有望用于肺癌高危人群早筛
03
肠道微生态 · 代谢疾病

肠道菌群与代谢性疾病大队列宏基因组研究技术服务

项目背景

与某高校医学院合作,基于社区人群队列开展肠道宏基因组研究,探索肠道菌群与2型糖尿病的关联关系,我方提供粪便样本采集、宏基因组测序与生物信息分析技术服务

方案设计
  • 3,000+例粪便样本:新发糖尿病1000例 + 糖耐量异常1000例 + 健康对照1000例,均来自社区人群队列
  • 技术服务:粪便样本标准化采集 + 宏基因组测序(含DNA提取质控)+ 全流程生物信息分析
  • 分析内容:物种组成与多样性分析、功能通路注释、菌株水平解析、菌群-代谢物-表型多组学关联分析、糖尿病菌群标志物筛选与验证
关键结果
  • 完成3000+例粪便样本的宏基因组测序和标准化数据分析
  • 鉴定出与2型糖尿病显著相关的肠道菌群物种和功能通路
  • 构建了基于肠道菌群的糖尿病风险预测模型,AUC达0.82
  • 发现多个具有潜在益生菌应用价值的菌株
服务价值:标准化的粪便采集与宏基因组检测流程,保障了3000+例大队列样本的数据质量稳定一致,为合作单位的肠道菌群与代谢病研究提供了可靠的数据支撑
智能工具

相关智能工具推荐

搭配自研智能工具,提升人群队列研究效率与数据挖掘深度

常见问题

队列研究常见问题

关于队列研究方案、技术选择、项目执行的常见问题解答

Q1
队列研究为什么推荐用甲基化芯片而不是测序?

大队列研究选择甲基化芯片有几个核心原因:1)成本效益——芯片单样本成本远低于WGBS,在样本量几千上万的队列研究中,成本差异非常显著;2)数据稳定性——芯片的批次效应更小,不同批次数据的一致性更好,适合大样本纵向研究;3)分析成熟——EWAS分析有非常成熟的方法学和工具链,结果可比性强;4)位点覆盖——935K芯片覆盖了93.5万个CpG位点,包括启动子、增强子、基因体、CpG岛等所有关键功能区域,对EWAS研究来说已经足够全面。WGBS适合小样本深度机制研究,而大队列EWAS研究芯片是更优选择。

Q2
做EWAS研究,需要多少样本量才有足够的统计效力?

这取决于研究的表型和效应大小。一般来说:连续型表型(如年龄、血压、BMI)通常需要几千例样本才能检测到效应量较小的甲基化位点;二分类表型(如病例对照)在效应量中等的情况下,建议每组至少300-500例;如果是罕见病或效应量很小的研究,可能需要上千例。我们的建议是:如果有条件,尽量做大样本量,因为甲基化位点的效应量通常都不大(差异百分比在几个百分点级别),样本量不够很难检测到真实信号。我们可以根据你的具体研究设计做样本量估算。

Q3
大队列研究的批次效应怎么处理?你们有什么经验?

批次效应是大队列研究的常见挑战,我们从实验设计到数据分析都有系统的处理方案:1)实验阶段——随机化分组(病例对照均匀分布在各批次)、设置质量控制样本(每批次加入相同的参考样本)、统一实验操作SOP;2)数据预处理阶段——使用成熟的归一化方法(如BMIQ、SWAN、funnorm)、探针质量过滤;3)分析阶段——使用ComBat/ComBat-seq等批次校正方法、主成分分析检测和校正混杂因素、用校正后的数据集做关联分析。我们的表观星图项目服务了50,000+例样本的批次整合,有非常丰富的实战经验。

Q4
甲基化芯片检测血浆/血清cfDNA可以吗?效果怎么样?

可以的,而且这是目前非常热门的方向(液体活检+甲基化早筛)。血浆/血清中的cfDNA总量虽然低,但甲基化修饰保存完好,可以用专门优化的cfDNA甲基化芯片实验流程检测。需要注意的是:1)cfDNA起始量建议在50ng以上,如果低于20ng可能需要优化实验条件;2)我们有专门针对低起始量cfDNA样本的优化实验流程;3)cfDNA甲基化数据和组织样本略有差异,分析时需要用专门的方法学调整。我们已经做过数千例血浆cfDNA甲基化样本,数据质量稳定可靠。

Q5
什么是孟德尔随机化(MR)分析?队列研究中为什么要做MR?

孟德尔随机化(Mendelian Randomization, MR)是一种利用遗传变异(如SNP或甲基化位点)作为工具变量,来推断暴露因素与结局之间因果关系的统计方法。简单说就是用"天然随机分配"的遗传变异来模拟随机对照试验,从而减少混杂因素和反向因果的干扰。在队列研究中,传统的关联分析只能发现相关性,但相关性不等于因果性——可能是A导致B,也可能是B导致A,还可能是C同时影响A和B。MR分析可以帮助判断:某个甲基化位点的变化和疾病之间,谁是因谁是果。这对于筛选真正有因果作用的biomarker和药物靶点非常重要。

Q6
Olink蛋白组适合大队列研究吗?和质谱蛋白组比有什么优势?

Olink非常适合大队列研究,甚至可以说是目前大队列蛋白组的最优选择,优势非常明显:1)样本量极小——只需要1μL血浆/血清,对珍贵的队列样本特别友好;2)重复性好——CV<10%,远优于质谱的20-30%,大队列的批次间一致性有保障;3)通量高——一块96板可以同时检测几十上百个样本,几千例样本也能在合理时间内完成;4)数据质量稳定——PEA技术特异性高,交叉反应低,数据信噪比好。质谱蛋白组适合发现阶段的探索性研究,但到大队列验证阶段,Olink的稳定性和通量优势是无可替代的。UK Biobank等国际顶级队列项目也选择了Olink平台进行大规模蛋白组研究。

Q7
队列研究做甲基化+蛋白组双组学联合分析,有什么额外价值?

2。" data-en="The value of dual-omics integration is reflected in several levels: 1) Cross-validation — markers found by both methylation and proteomics for the same phenotype have a much lower false positive rate than any single omics; 2) Mechanistic connection — methylation is upstream regulation, proteomics is downstream functional execution, and integrated analysis can construct a regulatory chain of "methylation → gene expression → protein → phenotype" to explain the mechanism; 3) Improved prediction performance — prediction models built by integrating multi-omics data usually outperform single-omics models due to richer information dimensions; 4) New discoveries — some markers only have signals at one omics level, but through integrated analysis, new regulatory relationships and mechanistic pathways can be discovered. Simply put: 1+1 > 2.">双组学联合的价值体现在几个层面:1)交叉验证——同一个表型,甲基化和蛋白组都找到的标志物,假阳性率远低于单一组学;2)机制串联——甲基化是上游调控,蛋白组是下游功能执行,联合分析可以构建"甲基化→基因表达→蛋白→表型"的调控链,解释机制;3)预测性能提升——整合多组学数据构建的预测模型,性能通常优于单一组学模型,因为信息维度更丰富;4)新发现——有些标志物只在其中一个组学层面有信号,但通过联合分析可以发现新的调控关系和机制通路。简单说就是:1+1 > 2。

Q8
什么是甲基化年龄/表观遗传时钟?在队列研究中有什么用?

甲基化年龄(也叫表观遗传时钟)是基于基因组特定位点的甲基化水平计算的生物学年龄,它反映的是细胞和机体的真实衰老状态,而不是日历年龄。在队列研究中,甲基化年龄有非常重要的应用价值:1)作为衰老相关疾病的风险因子——甲基化年龄加速(biological age > chronological age)的人,慢病和死亡风险更高;2)作为干预效果评估的终点——比如生活方式干预、药物干预是否延缓了衰老,可以用甲基化年龄变化来评估;3)作为混杂因素校正——年龄是几乎所有疾病研究的重要混杂因素,用甲基化年龄比日历年龄更精准。我们自主开发的CpG时舟工具支持7+种主流时钟模型的一键计算。

Q9
什么是「表观星图」?能为我的队列研究提供什么样的技术支持?

表观星图是我们基于EPIC 935K甲基化芯片平台,为多家科研单位提供大队列甲基化检测与EWAS分析技术服务的项目集合。截至目前,已累计服务50,000+例人群样本,覆盖中国科学院、复旦大学等数十家科研机构的人群队列研究项目,涉及多个地域、多个年龄段、多种疾病表型。通过这些项目,我们积累了:1)成熟的大样本实验技术——从样本处理、芯片检测到质量控制,有标准化的操作流程和严格的质控体系;2)丰富的EWAS分析经验——支持病例对照、出生队列、纵向队列等多种研究设计的全流程分析;3)完善的高级分析能力——包括多表型关联、孟德尔随机化因果推断、甲基化时钟、机器学习预测模型等;4)规范的大型项目管理——数千至上万例样本的队列项目,样品管理、数据管理、项目进度均有完善的保障机制。如果你的研究也涉及大队列甲基化检测与EWAS分析,我们成熟的技术服务体系可以为你提供有力支撑。

Q10
队列研究项目,一般的交付周期是多久?

这取决于样本量和技术平台。以甲基化芯片为例:500例以内,从样本接收到出标准分析报告大概2-3周;1000-2000例,约4-6周;5000例以上的超大队列,我们会分批次处理并行推进,总周期大约2-3个月。Olink蛋白组的周期类似:几百例样本2-4周,上千例4-6周。多组学联合项目的周期取决于最慢的那个技术平台,分析部分可以并行。如果有时间要求,我们可以提供加急服务,具体可以咨询项目对接人。

Q11
大队列项目的数据管理和交付是怎么做的?

大队列项目的数据量很大,我们有规范的数据管理流程:1)样本信息管理——每一份样本都有唯一编号,全程可追溯;2)数据质量控制——每批次都有QC样本,不合格样本和数据会标记并沟通;3)数据交付形式——原始数据(idat/raw data)+ 标准化分析报告 + 交互数据可视化,通过加密云盘交付,支持大文件高速下载;4)数据安全——签署保密协议,数据仅用于该项目,不对外泄露;5)随访数据整合——如果有临床/随访数据,我们可以协助整合到分析中。对于超大队列项目,我们还可以提供定制化的数据管理平台。

Q12
队列研究从实验设计到数据分析,你们能提供哪些支持?

我们提供从研究设计到数据交付的全程技术服务支持:1)研究设计阶段——免费提供技术咨询,包括技术平台选择、样本量估算、实验设计建议、对照组设置等;2)实验阶段——样本接收与质检、高通量检测、严格的质量控制;3)数据分析阶段——标准分析 + 定制化分析(EWAS、MR、机器学习、多组学联合等);4)结果解读阶段——提供分析报告解读会,帮助理解结果和后续研究方向建议;5)后续支持——论文数据整理、补充分析、新课题设计讨论等。我们的团队包括实验技术专家、生信分析专家和项目管理经理,确保项目从设计到交付全程顺畅。

Q13
人群队列研究为什么选择SNP芯片而不是全基因组测序?

对于大样本人群队列研究,SNP芯片往往是更经济高效的选择,原因主要有:1)成本效益——SNP芯片的单样本成本仅为全基因组测序(WGS)的1/5到1/10,同样预算下可以覆盖更多样本,而GWAS的统计效力高度依赖样本量;2)数据质量稳定——SNP芯片经过充分验证,基因分型准确率高(>99%),批次间一致性好,适合大队列研究;3)分析成熟度高——有非常成熟的GWAS分析流程和工具链,结果可重复性高;4)基因型填充——利用参考基因组面板(如1000G、HRC、UK10K),可将芯片位点填充到数百万甚至上千万个位点,基本满足常见变异关联研究的需求。当然,如果研究目标是发现罕见变异或结构变异,WGS仍是更优选择。对于大多数常见疾病/表型的大队列GWAS研究,SNP芯片是性价比最高的技术路线,UK Biobank、FinnGen、Biobank Japan等国际顶级队列均采用这一策略。

Q14
GWAS和EWAS有什么区别和联系?可以联合分析吗?

GWAS(全基因组关联研究)和EWAS(全基因组甲基化关联研究)都是大队列研究中寻找疾病/表型相关分子标志物的核心方法,但研究层面和生物学意义不同:区别:1)研究层面——GWAS研究DNA序列变异(SNP),是先天遗传的;EWAS研究DNA甲基化修饰,是后天表观遗传的,受环境、年龄、生活方式等影响;2)效应大小——GWAS发现的SNP效应量通常很小(OR多在1.05-1.2之间),需要超大样本量才能检出;EWAS的甲基化位点效应量相对较大;3)因果方向——SNP变异是疾病的原因还是结果相对明确(孟德尔随机化可以利用这一点);甲基化改变更可能是疾病的结果或中间表型,因果推断更复杂。联系:1)都采用全基因组扫描+关联分析的研究范式;2)都可以识别疾病相关的生物标志物;3)可以通过孟德尔随机化(MR)等方法整合,进行因果推断。联合分析:完全可以,而且是当前的研究热点。常见的联合分析策略包括:1)meQTL分析——研究SNP对甲基化水平的调控关系;2)SMR(Summary-data-based Mendelian Randomization)——整合GWAS和EWAS汇总数据,鉴定通过甲基化介导的疾病风险位点;3)多组学联合建模——整合基因组、表观组、转录组、蛋白组等多层组学数据,构建更优的疾病预测模型。我们既有Illumina SNP芯片平台,也有EPIC 935K甲基化芯片平台,可以提供从单组学到多组学联合的完整分析服务。

Q15
SNP芯片数据能做孟德尔随机化分析吗?需要多少样本量?

完全可以。孟德尔随机化(Mendelian Randomization, MR)是利用SNP作为工具变量(IV)来推断暴露因素与疾病结局之间因果关系的方法,SNP芯片是获取SNP基因型数据的主要平台。MR分析的前提条件:1)有合适的工具变量——选择与暴露因素强相关的SNP作为工具变量(通常来自已发表的GWAS显著位点);2)满足MR三大假设——关联性假设(IV与暴露强相关)、独立性假设(IV与混杂因素无关)、排他性假设(IV仅通过暴露影响结局)。样本量要求:样本量取决于研究设计:1)单样本MR(one-sample MR)——在同一个队列中同时有暴露、结局和基因型数据,通常需要几千到几万例样本,具体取决于暴露的SNP解释度和效应大小;2)两样本MR(two-sample MR)——暴露和结局的GWAS数据来自不同队列,这是目前最常用的方法,可以利用公开的大型GWAS汇总数据,不需要自己有很大样本量的队列,但对数据质量和工具变量选择要求更高。我们可以提供的MR分析服务包括:单样本/两样本MR、多变量MR、中介MR、MR-Egger/MR-PRESSO等敏感性分析、留一法验证、反向MR等。如果你的队列有SNP芯片数据,并且有感兴趣的暴露因素和结局表型,我们可以根据具体研究问题设计合适的MR分析方案。

Q16
队列研究中粪便样本采集有什么特殊要求?如何保证质量?

粪便样本的采集质量直接影响肠道菌群研究结果的可靠性,大队列研究中尤其需要标准化操作:采集要求:1)采集新鲜粪便样本,避免尿液、水等污染;2)使用无菌采集器具,防止外源微生物污染;3)采集后尽快低温保存——推荐2小时内置于-20℃,24小时内转移至-80℃长期保存;4)记录详细的采集信息:采集时间、饮食记录、近期用药史(尤其是抗生素)、排便情况等。质量保证措施:1)使用标准化采集试剂盒——我们提供含有保护液的粪便采集管,可在常温下稳定保存72小时,适合多中心队列的样本转运;2)严格的样本质控流程——收到样本后进行外观检查、DNA提取质控(浓度、纯度、完整性),不合格样本及时沟通重采;3)批次随机化安排——病例对照均匀分布在各测序批次,避免批次效应干扰结果;4)设置阳性/阴性对照——每批次加入参考菌株和空白对照,监测实验过程的污染情况。我们有数千例粪便样本的大队列项目服务经验,可以提供从采集指导到结果交付的全流程质量保障。

Q17
肠道宏基因组和16S rRNA测序有什么区别?大队列研究选哪个?

16S rRNA测序和宏基因组测序是肠道菌群研究最常用的两种技术,它们在分辨率、信息量和成本上有显著差异:16S rRNA测序:1)原理——扩增细菌16S rRNA基因的高变区进行测序;2)分辨率——通常到属水平,部分可到种水平;3)信息量——只能获得物种组成信息,无法获得功能信息;4)成本——单样本成本较低,适合超大样本量筛选。宏基因组测序:1)原理——对样本中所有微生物的全部基因组DNA进行随机测序;2)分辨率——可到种甚至菌株水平;3)信息量——不仅能获得物种组成,还能获得功能基因、代谢通路、毒力因子等全面信息;4)成本——单样本成本较高,约为16S的3-5倍。大队列研究的选择建议:1)如果样本量非常大(5000例以上)且研究目标主要是菌群组成差异的初步筛选,可考虑16S测序作为初筛;2)如果样本量中等(1000-3000例)且希望获得功能层面的深入洞察,宏基因组是更好的选择,能够更准确地鉴定物种并获得功能通路信息;3)如果资源有限,也可以采用"两阶段"策略——先用16S在大样本中筛选差异,再用宏基因组在子集中进行深度验证和功能分析。目前国际上高质量的肠道菌群大队列研究(如MetaHIT、FinnGen肠道菌群项目)大多采用宏基因组测序,因为其更高的分辨率和更丰富的功能信息能带来更有价值的研究发现。我们同时提供16S和宏基因组测序服务,可以根据您的研究目标和预算推荐最合适的方案。

定制您的人群队列研究方案

我们的技术团队将根据您的研究目标和队列情况,为您量身设计更合适的人群队列多组学研究方案。