拓扑数据分析(TDA)突破了传统聚类在多模态、高维精神医学数据中难以处理非线性结构与重叠隶属关系的瓶颈。通过图社区检测,该框架在不依赖硬边界的前提下,从基因-环境-影像数据中稳定识别出MDD的临床相关亚型。这项工作为精神疾病的精准分层提供了一种不依赖先验标签、具备良好可迁移性的拓扑分析路径。

摘要

背景:重性抑郁障碍(MDD)在临床上具有高度的异质性,这使其预后判断和治疗决策变得尤为困难。对MDD进行亚型划分,有望推动个体化治疗策略的发展。为此,本研究构建了一个拓扑数据分析(TDA)框架,并利用基于图的社区检测方法,通过多模态数据来识别不同的患者亚组。

方法:在英国生物样本库(UK Biobank)的MDD参与者中实施了该TDA分析流程,这些参与者分别提供了基因-环境(G-E,N=20715)以及基因-环境-神经影像(G-E-I,N=3044)数据。针对18项健康相关结局,本研究系统比较了单独或联合使用遗传、环境及神经影像特征对MDD个体进行分层的能力。对于每项结局,本研究确定了表现最优的特征集,并设计了一种新的特征排序方法,以识别驱动图构建及社区结局分化的关键特征。跨队列验证采用选择性异质性复制策略,使用了两个独立数据集:GSRD(G-E数据,N=1017)和HSR(G-E和影像数据,N=71–87)。

结果:G-E组合在13项结局上表现出最优的分层效能,这些结局覆盖了难治性抑郁(TRD)、症状亚型以及自杀相关表型。社区特征剖析揭示了两种独特的模式:创伤-应激暴露主要与TRD及发作严重程度相关,而物质使用-行为特征谱则与焦虑症状相关。环境因素主导了多数健康结局的分层,而神经影像特征则在区分躯体合并症方面展现出了最强的辨别力。

结论:本研究证实了TDA能够有效识别具有临床意义的MDD亚型,并揭示不同数据模态对特定结局领域的分层贡献。这些发现表明,多模态整合对于全面的健康结局分层具有重要价值,不同模态会特异性地贡献于不同的结局领域。总体而言,基于TDA的社区检测为MDD的精准分层与个体化治疗提供了一个极具前景的新框架。

引言

重性抑郁障碍(MDD)是全球首要的致残原因之一。该疾病在症状表现、病程演变、治疗反应以及潜在病因机制上均呈现出高度异质性,致使临床管理十分棘手。基于临床特征、疾病轨迹和不良结局风险对患者进行分层,将有助于优化管理策略。

利用抑郁症状对MDD亚型进行刻画的临床研究已识别出多达五种不同的亚型。即便近期研究尝试整合多种数据来源,其结果仍存在明显的不一致性,且缺乏充分验证,从而削弱了其临床相关性与普适性。

目前已有多种数据驱动方法被用于定义MDD亚组,例如k均值聚类、基于树的聚类和潜在类别分析。然而,对于多模态特征组合的系统性比较以及跨队列验证仍十分匮乏。在新兴方法中,拓扑数据分析(TDA)能够有效处理高维、非线性数据集,同时对数据扰动保持稳健,从而克服了当数据形态变得过于复杂时的聚类局限性。与硬聚类方法不同,TDA采用软聚类策略,能够捕捉个体间的重叠隶属关系和渐进过渡,其运算基于无坐标的相似性度量。

TDA通过解析数据的底层拓扑结构,揭示全局模式与局部亚组之间的相互关联,并已成功应用于包括精神病学在内的多个医学领域。其中,TDA Mapper方法通过构建可解释的图表示来捕获具有相似特征谱的个体之间的相似性,可直接生成适用于基于图的社区检测的患者亚组,进而识别出内部连接紧密、而与图中其他部分连接稀疏的患者“社区”。TDA还能处理神经心理学和神经影像数据中常见的高阶交互作用,并提供直观的基于网络的可视化方式。

近年来,基于图的社区检测被越来越多地应用于揭示具有不同表型或生物学模式的亚组。然而,目前尚缺乏对不同特征集在基于社区的结局刻画能力上的系统性比较,也缺少在独立队列中的复现验证,这限制了相关发现的普适性。

为填补上述空白,本研究开发了一种新型的基于TDA的分析框架,旨在对MDD进行基于图的社区检测及健康相关结局的分层。模型的训练使用了英国生物样本库(UKB) MDD子样本中的多模态遗传(G)、环境(E)和神经影像(I)数据,并在两个独立的MDD队列中进行了验证。该框架系统比较了不同多模态特征集的结局分层效能,并刻画了跨多种结局的具有临床意义的亚组特征。本研究方法引入了一套新的特征排序流程,并在MDD研究中首次对TDA所衍生的社区进行了复现。

材料与方法

流程概述

工作流程(图1)包括:(1)在英国生物样本库(UKB)中,筛选出对健康相关结局分层能力最优的特征集(遗传、环境和神经影像变量,单独及联合使用);(2)在两个独立的MDD数据集中检验这些特征集的普适性。将多模态的G、E、I特征集输入TDA Mapper,以评估其将MDD个体聚类为具有不同健康结局特征的社区的区分能力。在UKB数据上,本研究实施了一个五步分析流程:(1)构建TDA图;(2)执行社区检测;(3)提取核心样本;(4)针对18项健康相关结局进行基于社区的分层分析,以确定最优判别特征集;(5)采用UMAP引导的降维与基于社区的验证相结合的策略进行特征排序。

图片

图1.用于MDD患者分层的TDA流程。

考虑到MDD的遗传度相对较低,而环境因素在其异质性的形成中发挥着核心作用,本研究通过将环境变量与遗传和影像特征进行系统组合来构建特征集,共生成六组:G、E、I、遗传-环境(G-E)、环境-影像(E-I)、遗传-环境-影像(G-E-I)。针对复现队列(欧洲难治性抑郁研究组(GSRD)和圣拉斐尔医院(HSR)),采用相同的分析流程,使用从UKB中筛选出的最佳判别特征集,以评估其跨队列的普适性。

参与者

本研究纳入了三个MDD队列:UKB、GSRD(N=1017)和HSR(N=87)。所有参与者均满足MDD诊断标准。排除标准包括与其他主要精神疾病共病。在UKB中,G-E包含N=20715名个体,而G-E-I包含N=3044名参与者。GSRD仅包含G-E特征(N=1017),而HSR中的G-E包含N=87名个体,G-E-I包含N=71名个体。缺失数据过多的特征被剔除,仅保留数据完整的受试者。

测量

UKB队列

基于G-E队列,衍生出了G(P=20)、E(P=33)以及G-E组合(P=53个特征)特征集。基于G-E-I队列,特征集包括I(P=606)、E-I(P=639)和G-E-I(P=659)。

影像特征涵盖以下四类:(i) T1加权结构磁共振成像(sMRI)的区域测量指标(皮层下/皮层体积、皮层厚度(CT)以及基于Desikan-Killiany图谱的表面积);(ii)弥散加权磁共振成像(dMRI)的区域测量指标(各向异性分数、弥散度指标、微结构参数);(iii)静息态功能磁共振成像(rs-fMRI)中跨静息态网络的连接强度;(iv)基于Hariri情绪面孔加工范式的任务态功能磁共振成像(t-fMRI)激活。结构、弥散及任务态特征取自UKB影像衍生表型,而rs-fMRI特征则通过UKB基于网络的偏相关矩阵,计算为正、负节点强度。遗传特征包括针对精神疾病、行为特质及免疫-心脏代谢状况的多基因风险评分(PRSs),这些评分在欧洲裔参与者中使用PRS-CS-auto和PLINK 2.0进行估计,并对祖源相关主成分、基因分型批次及招募中心进行了校正。环境特征包括人格特质、社会支持、物质使用模式、生活方式因素和创伤事件。协变量包括年龄、性别、种族和抗抑郁药物使用状况(是/否)。

根据既往研究基础及现有文献,本研究选取了18项健康相关结局,涵盖抑郁病程、自杀表型、TRD、心理社会功能及躯体合并症。考虑到MDD与心血管风险、代谢失调及癌症发病率之间已确立的关联,本研究将躯体结局一并纳入分析。

复现队列

GSRD包含E(P=5)、G(P=18)和G-E(P=23),年龄和性别,以及六项与UKB一致的健康相关结局。HSR包含E(P=12)、G(P=19)、G-E(P=31)、涵盖sMRI和dMRI的I(P=344)、G-E-I(P=375),年龄、性别、种族和抗抑郁药物使用情况,以及十一项与UKB一致的健康相关结局。由于样本量不足以支撑可靠分析,因此功能磁共振成像特征(t-fMRI、rs-fMRI)未被纳入。

数据分析

TDA Mapper的应用与社区检测

针对UKB数据,本研究分别使用G、E、G-E、I、E-I、G-E-I构建了不同的图,并借助kepler库进行图提取。将协变量与每个特征集进行级联,以控制其效应并确保分层性能的可比性。相同的流程被应用于复现队列。对于复现数据集,图构建所采用的是UKB衍生的、针对每项结局的最优判别特征集,并基于特征可用性进行选择:HSR使用全部六组特征集,GSRD则使用G、E和G-E三组。

本研究采用TDA Mapper,通过序贯降维构建可解释的数据图表示,这在一定程度上缓解了高维数据带来的分析挑战。TDA流程的具体说明(预处理、距离计算、滤波、覆盖、聚类、图组装)详见补充方法。图构建完成后,应用社区检测算法将图分割为稳健且有意义的亚组。最佳算法基于模块度、覆盖度及性能指标进行筛选,具体实现如NetworkX库所示。样本数少于五个的社区被排除,仅保留核心样本(即社区隶属度为100%的个体)用于下游分析。

基于社区的健康相关结局分层

在UKB数据中,采用Kruskal-Wallis(KW)检验(用于有序/连续变量)和卡方检验(Chi2)(用于二分类变量)进行分析,并进行了Bonferroni校正(p<0.05,针对每个结局按特征集数量进行校正;UKB的校正阈值为p<0.0083,特征集数量N=6)。效应量分别使用Eta2(KW检验)和Cramer's V(Chi2检验)计算。“最佳表现”特征集指的是在社区间显示出最强结局分化(通过统计显著性和效应量来衡量)的特征集。为验证社区-结局关联的可靠性,本研究进行了置换检验:在保留社区结构的同时,随机打乱受试者的结局标签,并重新计算效应量以生成经验零分布。置换p值采用与观测p值相同的Bonferroni校正阈值进行评估。

跨特征集的结局分层能力比较

在UKB中,将每项结局在社区间差异最显著的特征集确定为该结局的最佳表现特征集。通过提取每个社区内“高风险”受试者的百分比,进行基于社区的结局风险排序:(i)对于二分类结局,高风险定义为存在目标风险状况;(ii)对于有序结局,高风险定义为反映负面结局的类别集合。

最佳表现特征集的可复现性检验

针对复现数据集(GSRD和HSR),本研究采用与UKB相同的分析流程,评估了UKB所确定的最佳表现特征集能否在独立样本中有效区分结局亚组。复现分析受限于特征的可获得性:对于GSRD,仅UKB最佳表现特征集为G-E特征集的结局方可被检验;对于HSR,基于影像的验证仅限于结构和弥散MRI特征,且统计效力有限(N=71)。特征协调优先考虑概念领域重叠而非精确的项目匹配。当结局分化达到统计学显著性(p<0.05)且特征领域的一致性在队列间得到验证时,即判定为复现成功。置换检验方法同上。

最佳表现特征集的特征排序流程

本研究设计了一个两阶段的特征排序流程,以识别在UKB和复现数据集中驱动图构建和社区分化的核心变量。针对每项结局所对应的最佳表现特征集,首先提取与UMAP嵌入显著相关的特征;其次,仅保留那些能显著区分社区的特征,并按第一步保留的特征数量进行Bonferroni校正。在复现数据集中,本研究进一步验证了UKB最佳表现集在每个结局上排名靠前的特征,以评估特征排序的稳健性。

最佳表现特征集的社区特征与风险排序

针对每个结局所确定的最佳表现特征集,在完成基于社区的结局风险排序后,从以下两个维度对UKB的每个社区进行特征刻画:(i)排名靠前的特征,以及(ii)社会人口学特征(年龄、性别、种族、抗抑郁药物使用情况)。

结果

TDA图结构特征

在英国生物样本库(UKB)中,分别基于G-E特征集(20715名受试者)和基于影像特征集(3044名受试者)构建图,如图2所示。

图片

图2.拓扑数据分析(TDA)图结构。

G-E-I、E-I及I数据集各产生了四个稳健社区(130-468名受试者;模块度=0.43-0.46),而G、E和G-E数据集同样形成了四个社区,但规模差异较大(51-8287名受试者;其中E的模块度高达0.60)。在复现队列中,GSRD产生了3-13个社区(29-255名受试者;E的模块度高达0.97),HSR则产生了2-4个社区(6-28名受试者;E-I的模块度高达0.65)。

基于社区的结局分层

UKB数据集

所有健康相关结局和特征集的统计量与效应量见表1。在18项结局中,G-E社区在13项上成为最佳表现特征集,涵盖难治性抑郁(TRD)、抑郁亚型、心理社会结局(抑郁发作次数、健康状况、家庭关系、友谊满意度)以及自杀意念或行为(死亡想法、自伤)。尽管表1列出了所有特征集在全部结局上的完整排序,但此处仅报告每项结局对应的最佳表现特征集。

表1.各特征集所获社区中每项结局的统计量与效应量。

图片

基于社区的结局风险排序揭示了一系列独特的易感性模式。在G-E特征集中,社区1(COM1)和社区4(COM4)代表了具有不同特征组合的最高风险组。COM4在伴有焦虑/非典型抑郁、每日抑郁症状、自杀意念及自伤方面呈现出高风险;COM1则在TRD、抑郁发作严重程度及应激相关抑郁方面呈现出最高风险。社区2(COM2)和社区3(COM3)在幸福感相关结局上表现出相对升高的风险,其中COM2以较差的健康状况和友谊满意度为特征,COM3则主要表现为对家庭关系的不满及功能损害。在其他特征集中,G-E-I的COM1显示出最高的应激相关抑郁风险,E-I的COM2显示出升高的癌症风险,影像特征集的COM2显示出最高的血管风险,G特征集的COM3则显示出最高的糖尿病风险。

效应量整体处于小到中等水平(Eta2:0.01–0.15;Cramer's V:0.05–0.25),表明各特征集对MDD异质性实现了有意义但尚有限度的分层。置换检验进一步证实了所有显著的社区-结局关联(所有置换p≤0.006;经Bonferroni校正后仍然显著)。

复现数据集

复现分析旨在评估UKB所识别的最佳表现特征集能否在独立样本中有效区分不同结局亚组,结果呈现出一种选择性的验证模式。在GSRD队列中,UKB的最佳表现特征集在两项结局上得到了显著复现,即相应社区间存在显著差异(p<0.05):其中,G-E特征集在自伤行为(p=0.013,Cramer's V:0.12)和伴焦虑特征的抑郁(p=0.041,Cramer's V:0.10)上均达到了统计显著性。TRD(p=0.057,Cramer's V:0.09)和躯体合并症(p=0.075,Cramer's V:0.09)仅显示出趋势性差异,而死亡想法则未能得到复现。在HSR队列中,G-E特征集在TRD(p=0.03,Cramer's V:0.44)上,以及影像特征集在血管问题(p=0.013,Cramer's V:0.39)上均观察到了初步的复现证据。置换检验进一步支持了上述结果:GSRD中的自伤行为和焦虑特征,以及HSR中的TRD和血管问题(所有置换p<0.05)。在效应量方面,GSRD中的效应量较小(Cramer's V:0.09–0.12),HSR中的效应量为中等水平(Cramer's V:0.39–0.44),但由于HSR的样本量有限,其效应量估计值伴随较宽的置信区间。

特征排序与社区特征

UKB数据集

在UKB最佳表现特征集中,用于图构建和社区分化的关键特征如表2所示(均经Bonferroni校正后仍然显著)。尽管G-E组合的性能优于仅使用E,但环境变量在G-E特征排序中占主导地位。排名靠前的特征始终是环境方面的:童年创伤、成年期应激、饮酒、伴侣暴力和社会支持缺乏(表2)。G特征集主要反映了ADHD、自闭症和神经性厌食症的PRSs。尽管这些PRSs与UMAP成分显著相关,但它们未被保留在排名靠前的特征中,表明其对图拓扑结构的影响有限。值得注意的是,在糖尿病和血管问题两项结局上,单独使用G的分层效果优于单独使用E(表1)。G-E-I、E-I和影像特征集主要由sMRI指标(尤其是额叶/颞叶皮层区域)和dMRI测量指标(放射冠区域的径向弥散系数(RD)和各向同性隔室体积分数)所驱动。

表2.基于UKB样本各结局最佳表现特征集,对驱动社区结构最具影响力的特征进行排序。

图片

社区特征刻画揭示了一系列与健康结局风险高度吻合的独特表型谱。在G-E特征集中,COM1和COM4始终是两个最高风险社区,但两者的风险特征截然不同:COM4以高饮酒模式和中等程度的应激水平为特征,而COM1则表现出最严重的创伤特征谱,包括成年期应激、童年期身体虐待及童年期支持匮乏。在其他特征集中,各最高风险社区展示出独特的神经生物学模式:应激相关抑郁的G-E-I高风险社区显示RD升高(COM1)或皮层面积中度缩减(COM4);具有癌症易感性的E-I高风险社区则表现为全脑结构测量指标的普遍降低(COM2);在血管风险上,影像特征集的高风险社区呈现出保留至中度降低的结构模式(COM2以皮层面积缩减为主,COM4以RD升高为主);而糖尿病高风险的G社区(COM3,抗抑郁药物使用率最高,达14.4%)则表现出ADHD和自闭症的PRS升高。

上述模式共同指向了结局特异性和模态特异性的易感性特征谱:在G-E最高风险社区中,可清晰识别出创伤-应激模式(COM1–G–E)与物质-行为模式(COM4–G–E)这两条迥异的路径;与此同时,与抑郁及心脏代谢结局相关的高风险社区则呈现出相应的神经生物学改变。

复现数据集

特征排序结果见表3。在GSRD队列中,G-E特征集排名靠前的特征在自伤行为和伴有焦虑特征的抑郁亚型上展现出跨队列的普适性。其中,工作状况位列第一(p<0.004,经Bonferroni校正后仍然显著),部分复现了UKB中环境应激相关变量主导G-E排名的模式。

表3.GSRD和HSR数据集的特征排序结果。

图片

在HSR队列中,针对与TRD相关的G-E特征集,“感到被家庭成员憎恨”成为最显著的特征(p<0.002,经Bonferroni校正后仍然显著),而“童年期遭受家庭成员身体虐待”则呈现趋势水平的显著性。这一结果成功复现了UKB中的创伤-应激模式,且突显了童年期家庭创伤的更大效应。在与血管问题相关的影像特征集中,楔前叶、脑岛、缘上回、后扣带回和颞上回区域的皮层厚度(CT)测量指标占主导地位(p<0.0002,经Bonferroni校正后仍然显著),有力地佐证了脑结构模式的跨队列可复现性,尽管UKB排名靠前的特征还包括dMRI测量指标。

总体而言,跨队列分析表明,环境应激——尤其是童年创伤与心理社会应激——在G-E特征集中始终保持着突出的排序地位;同时,在HSR队列中也观察到血管合并症相关神经解剖学模式的选择性跨队列复现。

结论

本研究揭示了MDD内部具有临床意义的易感性模式:G-E组合成为大多数心理健康相关结局的最优分层特征集,其社区结构主要由环境应激变量所驱动,并识别出物质-行为与创伤-应激两种不同的风险模式。方法学上,TDA在多模态整合方面优势明显,基于图的社区检测克服了传统聚类的局限。特征排序分析一致表明,童年创伤、成年期应激、饮酒及伴侣暴力等环境变量占据绝对主导地位。神经影像方面,额颞叶区域及dMRI的RD指标是驱动相关结局分层的核心特征,应激相关抑郁与心脏代谢结局之间呈现部分重叠的神经解剖易感性。本研究的主要局限包括跨队列复现受数据可用性制约、影像学验证效力不足,未来需在更大规模且模态完备的队列中进行进一步验证。

参考文献:Tassi E., Pigoni A., Colombo F., Fortaner-Uyà L., Colombo C., Bianchi A.M., Benedetti F., Fabbri C., Serretti A., GSRD network, Vai B., Brambilla P. & Maggioni E., Topological data analysis communities reveal gene-environment-brain subtypes of major depression in UK Biobank and multi-site cohorts., Biological Psychiatry (2026), doi: https://doi.org/10.1016/j.biopsych.2026.06.030.

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐