IF=10.0!柳叶刀核心期刊复现-慢性肾病CKD机器学习预测模型
作者Toby,来源公众号:Python生物信息学,慢性肾病CKD机器学习预测模型
期刊论文概述
大家好,我是重庆未来之智的Toby老师,今天为大家复现一篇IF=10.0!柳叶刀核心期刊-慢性肾病CKD机器学习预测模型。我方公司有慢性肾病数据集可复现该论文,并提供更好创新点和实证分析。如果有相关需求可以联系微信drug666123.
接下来为大家分享这篇论文。论文发表官网介绍截图如下。

1. 论文标题
Identification and validation of an explainable early-stage chronic kidney disease prediction model: a multicenter retrospective study
2. 发表期刊
EClinicalMedicine
-
这是全球顶尖医学期刊《柳叶刀》(The Lancet)旗下的开放获取子刊,属于医学领域的高水平期刊。
3. 基本信息
-
DOI: 10.1016/j.eclinm.2025.103286
-
官网链接:https://www.thelancet.com/journals/eclinm/article/PIIS2589-5370(25)00218-4/fulltext
-
发表年份: 2025年
-
作者: J He, X Wang, P Zhu, X Wang, Y Zhang, J Zhao, W Sun, K Hu, W He, J Xie
4. 研究概述
仅凭血常规和尿检,AI模型如何实现早期慢性肾病的高精度预测?
慢性肾脏病(CKD)被称为“沉默的杀手”,早期症状隐匿,全球约10%的成年人深受其扰。许多患者直到疾病晚期才被确诊,错失了最佳干预时机。
近日,一项发表在《柳叶刀》旗下子刊《EClinicalMedicine》 上的重磅研究,为我们带来了一个高效、低成本且易于理解的早期CKD预测新工具。
临床价值与未来展望
这项研究的价值在于其极高的临床转化潜力。在医疗资源有限的地区或常规体检场景中,无需昂贵的专项检查,仅利用最常规的血常规和尿检结果,就能有效筛出潜在的早期CKD高风险个体,从而实现早发现、早干预,延缓疾病进展。
研究团队也指出,未来将纳入前瞻性数据、影像学、组学等多模态信息,以进一步提升模型的精准度和普适性。
-
最佳模型: XGBoost模型在“血常规+尿检+基本信息”特征组合下,预测性能最佳(内部验证AUC = 0.9235,外部验证AUC = 0.8962)。
-
核心优势: 该模型仅使用低成本、易获取的临床指标,即可实现高精度的早期CKD风险预测,具有很高的临床转化潜力。
-
应用成果: 研究还开发了一个在线网页工具,以方便该预测模型在临床实践中的推广应用。
-
意义: 该研究为在广大人群中早期、低成本地筛查CKD提供了有效的工具,有助于延缓疾病进展。
6. 关键词
Chronic kidney disease; Early prediction; Machine learning; SHAP; Prediction model
期刊论文绘图展示
实证分析数据收集,模型多算法比较,模型解释和web可视化展示


入模变量
数据量
-
CKD:慢性肾病组,样本量为11,436。
-
Non-CKD:非慢性肾病组,样本量为10,004。
基本信息:
-
年龄(Age):单位为年,两组数据分别为58(44,68)和57(51,62),P值小于0.0001。
-
性别(Male):以人数和百分比表示,第一组为4538/11436(39.68%),第二组为2766/10004(27.65%)。
血液常规:
-
白细胞计数(WBC):单位为10^9/L,两组数据分别为6.06(5.09,7.3)和5.91(5.02,6.95),P值小于0.0001。
-
红细胞计数(RBC):单位为10^12/L,两组数据分别为4.58(4.24,4.97)和4.53(4.3,4.83),P值小于0.0001。
-
血小板计数(PLT):单位为10^9/L,两组数据分别为217(180,257)和226(193,265),P值小于0.0001。
-
血红蛋白(HGB):单位为g/L,两组数据分别为138(128,149)和138(131,148),P值小于0.0001。
-
嗜碱性粒细胞百分比(BASO%):两组数据分别为0.4(0.3,0.6)和0.4(0.3,0.6),P值小于0.0001。
-
嗜酸性粒细胞百分比(EOS%):两组数据分别为1.8(1.1,2.9)和1.8(1.2,2.8),P值为0.0052。
-
平均血小板体积(MPV):单位为fL,两组数据分别为10(9.4,10.7)和10.2(9.5,11.1),P值小于0.0001。
-
中性粒细胞与淋巴细胞比值(NLR):两组数据分别为1.61(1.05,2.25)和1.56(1.23,1.98),P值为0.9662。
血液生化:
-
葡萄糖(GLU):单位为mmol/L,两组数据分别为5.33(4.97,5.83)和5.25(4.88,5.82),P值小于0.0001。
-
总胆固醇(TC):单位为mmol/L,两组数据分别为5(4.28,5.74)和4.91(4.31,5.54),P值小于0.0001。
-
高密度脂蛋白胆固醇(HDL-C):单位为mmol/L,两组数据分别为1.39(1.19,1.64)和1.4(1.18,1.65),P值为0.8146。
-
低密度脂蛋白胆固醇(LDL-C):单位为mmol/L,两组数据分别为2.81(2.26,3.4)和3(2.44,3.61),P值小于0.0001。
-
丙氨酸氨基转移酶(ALT):单位为U/L,两组数据分别为19(14,28)和17(13,25),P值小于0.0001。
-
天门冬氨酸氨基转移酶(AST):单位为U/L,两组数据分别为20(17,25)和20(17,24),P值小于0.0001。
-
尿酸(UA):单位为μmol/L,两组数据分别为333(280,395)和284.6(241,336.83),P值小于0.0001。
-
甘油三酯(TG):单位为mmol/L,两组数据分别为1.39(1,2.01)和1.33(0.94,1.92),P值小于0.0001。



ROC曲线(受试者工作特征曲线)和混淆矩阵是评估分类模型性能的两种重要工具。ROC曲线通过展示不同阈值下真正例率(TPR)和假正例率(FPR)的关系,直观地反映了模型在区分正负样本时的能力,曲线下面积(AUC)越大,表示模型的分类性能越好。混淆矩阵则以表格形式详细列出模型预测结果与实际标签的匹配情况,包括真正例(TP)、假正例(FP)、真负例(TN)和假负例(FN),从而可以直接计算出准确率、召回率、精确率等关键指标,帮助我们全面了解模型在各个类别上的表现。


研究方法:
-
-
类型: 中国多中心回顾性研究。
-
数据: 使用了来自三家医院的临床数据,分为训练集/内部验证集(CKD: 11,436例,非CKD: 10,004例)和外部验证集(CKD: 350例,非CKD: 473例)。
-
技术: 比较了六种机器学习算法,最终XGBoost模型表现最佳。
-
特征: 测试了不同特征组合,发现“血常规 + 尿检 + 基本信息”的组合在成本和性能上达到最佳平衡。
-
可解释性: 应用SHAP方法对模型预测结果进行解释,明确各特征的重要性。
-
主要发现与结论
这项多中心回顾性研究纳入了国内三家医院超过2.1万例数据。在对比了六种主流机器学习算法后,XGBoost模型脱颖而出。
-
最优特征组合:“血常规 + 尿检 + 基本信息”。该组合在保证低成本的同时,实现了极高的预测性能:
-
内部验证AUC:0.9235
-
外部验证AUC:0.8962
-
准确率:85.61%
-
-
模型的可解释性:研究采用SHAP方法对模型的决策过程进行“解读”,让AI的预测不再是“黑箱”。
-
最关键预测因子:尿蛋白(PRO) 和年龄(AGE) 是模型中贡献度最高的两个特征,这与临床认知高度一致。
-
可视化解释:对于单个患者,模型能生成一份“贡献度报告”,清晰展示每个指标是拉高了还是降低了其患病风险,辅助医生决策。
-



-
可解释性: 下图为论文应用SHAP方法对模型预测结果进行解释,明确各特征的重要性。




-
应用成果:下图为论文作者研究还开发了一个在线网页工具,以方便该预测模型在临床实践中的推广应用。输入患者血液和尿液检测结果后,web端输出用户慢性肾病概率和各个变量权重,下图患者慢性肾病概率88.24%,非常高。


DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)