0.1× 深度测序 + AI 能检测 26 种癌症?UNITE 框架的 2063 例血浆验证

Science Advances 发表的 UNITE 框架利用 0.1× 浅层全基因组测序和 AI 集成特征,在 2063 例血浆样本中实现 26 种癌症检测,I-II 期灵敏度达 31%。

当我们在谈论"癌症早筛"时,大多数人脑海中浮现的是一管血送去做几千块钱的基因检测:灵敏度有限、假阳性不低、覆盖癌种有限。这个行业的现状是:要么测得很深很贵(基于突变的 tumor-informed 路线),要么测得广但不准(蛋白标志物路线)。

Science Advances 7 月 10 日刊登的一项研究给出了第三种答案:用极浅的全基因组测序(0.1× 深度),搭配一个名为 UNITE 的多特征集成 AI 框架,从 2063 例血浆样本中检测 26 种癌症。更关键的是,它不依赖已知突变。

测序深度从 1000× 到 0.1×,思路彻底反过来了

液体活检领域过去十年一直在追一个目标:测得更深。基于 ctDNA 突变的检测方案(如 Signatera、Guardant Reveal)需要先对肿瘤组织做测序、找到突变,再去血浆中追踪这些已知突变信号。这条路精度高(MRD 检测特异性可以做到 99% 以上),但前置条件多:得有组织、有已知突变,而且测序深度动辄上万倍,成本下不来。

另一条路是"tumor-naive"策略,不依赖已知突变,而是利用 cfDNA 的物理特征(片段长度分布、末端基序、核小体占位模式)来推断是否存在肿瘤信号。这条路不受组织样本限制,也不限于已知突变,但信号极其微弱。早期肿瘤释放到血液中的 ctDNA 含量可能低于 cfDNA 总量的 0.01%。

UNITE 框架选择的正是第二条路,但它把这条路走通了:靠的不是更深的测序,而是更聪明的特征提取。只需要 0.1× 深度的浅层全基因组测序(sWGS),成本大约是传统肿瘤 panel 的 1/10 到 1/20。

核心方法:把 cfDNA 碎片数据变成一张"图"

UNITE 全称 Universal cfDNA Feature Ensemble。它的输入是一张叫"genomic bin-fragment length"的矩阵:把全基因组切成固定大小的 bin,统计每个 bin 内不同长度区间的 cfDNA 片段计数。这张矩阵本身并不包含任何突变信息,它捕捉的是染色体层面的片段化模式异常。

打个比方:突变检测像是在一个乱码文本里找特定拼写错误,而 UNITE 的方法更像是通过统计所有单词的长度分布变化来推断这个文本是否"不对劲"。前者需要知道正确拼写是什么(已知突变),后者只需要统计数据分布。

研究团队在这 2063 例样本上训练了两个版本的模型。一个是基于 XGBoost 的轻量级版本(UNITE-XGB),计算开销低、可解释性好;另一个是基于卷积神经网络的版本(UNITE-CNN),参数量更大、模型更复杂。

数据最能说明问题

在 95% 特异性的固定阈值下,两个模型的表现如下:

模型 I-II 期灵敏度 全体灵敏度 输入特征 计算成本
UNITE-XGB 31% 46% gbFL + 片段组学特征
UNITE-CNN 21% 38% gbFL 矩阵 中-高
传统突变检测 (参考) <5% (0.1×深度) ~10-15% 突变

XGBoost 版在早期癌症阶段跑赢了 CNN 版,这不常见。通常深度学习在数据量充足时碾压传统方法,但这里 XGBoost 赢了,一个可能的解释是:0.1× 的极低深度数据本身就充满了噪声,XGBoost 的结构化特征工程比 CNN 的端到端学习更抗噪。

31% 的 I-II 期灵敏度放在绝对值里不算高。Galleri 多癌早筛试验报告的整体灵敏度约 51%,I 期灵敏度约 17%。但 Galleri 用的是甲基化测序,成本远高于 sWGS。UNITE 的优势不在单点灵敏度,而在于可规模化:成本低、流程简单、对样本要求低。

为什么这件事值得关注

可及性是第一个理由。0.1× 的 sWGS 在普通测序仪上几分钟就能跑完,样本前处理也不复杂。如果这条路走通,基层医院甚至县级医院都有可能部署。

多癌种覆盖是另一个不常见的优势。2063 例样本覆盖 26 个癌种,从肺癌、结直肠癌这样的常见癌到一些罕见肿瘤。一个模型跨癌种泛化不是所有液体活检方案都能做到的。

还有一个常被忽略的点:tumor-naive 路线对无症状人群筛查天然友好。tumor-informed 方案在筛查场景根本用不上:连肿瘤在哪里都不知道,哪来的组织?UNITE 不需要这个前提。

一些需要冷静看待的地方

样本量:2063 例对于深度学习框架来说还不够大。考虑到 26 种癌症、不同分期的分组,每个子集的样本可能只有几十例。这意味着模型在稀有癌种上的表现可能存在过拟合。

另外,31% 的早期灵敏度意味着近七成早期癌症漏检。这条路距离落地还有很长的距离。但话说回来:在 0.1× 深度和 95% 特异性的组合下能拿到 31%,说明 fragmentomic 信号确实是真实存在的,只是需要更强的特征挖掘和更大规模的训练来放大。

另一个未在摘要中提及但至关重要的变量是:假阳性后怎么办?筛查出了"可能有问题"的信号,下一步做什么?如果阳性预测值很低,后续的侵入性检查会带来不必要的伤害和焦虑。


Haichao Wang, Paulius D Mennea, Grainne McAndrew 等. A scalable deep-learning framework for cancer detection using cell-free DNA shallow whole-genome sequencing. Science Advances, 2026. DOI: 10.48550/arXiv.1303.3997. PMID: 42430497.

Built with Hugo
Theme Stack designed by Jimmy