无需手动调参!自动机器学习(AutoML)带你全流程实现预测因子筛选与模型优化
源自风暴统计网:一键统计分析与绘图的网站
在药物发现中,预测化合物能否透过肠壁(Caco-2通透性)是关键一步。传统方法依赖专家手动选特征、调模型,耗时费力且难复现。
最近一项研究走了另一条路,他们让自动机器学习(AutoML) 系统性评估了8类分子表征(从2D/3D描述符到深度学习嵌入),完全自动化完成特征提取、模型选择与优化。

其实施流程具体且系统,可分为以下三个阶段:
第一阶段,研究者为同一分子库系统生成了八类截然不同的特征表征,涵盖从简单的二维指纹到复杂的二维与三维描述符。
随后,他们将每一类特征的完整集合,不作任何人工筛选,直接输入AutoML平台。平台自动执行数据预处理、模型选择(同时尝试梯度提升树、神经网络等多种架构)与超参数优化,最终为每一种表征独立生成一个当前最优的集成模型。
这一步骤的关键在于,AutoML以完全自动化和标准化的方式,为所有参与“竞赛”的特征集提供了一个公平的、基准性能成绩单。

第二阶段,基于“初步成绩单”,研究者锁定了表现优异的特征类型。
并利用AutoML流程中可获取的模型解释工具(如SHAP值),自动识别出每类特征中对预测贡献最大的关键子集。

这并非人工挑选,而是数据驱动的结果。
第三阶段,研究者再次启动AutoML,但此次仅使用第二阶段筛选出的关键特征子集作为输入,进行新一轮的、更深度的模型训练与超参数优化。
这一“特征精炼+模型再优化”的闭环,完全由AutoML框架高效执行,最终得到了高度优化且可解释性更强的预测模型。
AutoMl优势:效率高
这一自动化流程产生了清晰而有力的结果。首先,它以前所未有的效率完成了系统性评测,明确指出PaDEL和Mordred描述符(尤其是包含三维信息时)在预测Caco-2通透性上最具优势。

AutoMl优势:性能强
其次,通过上述闭环优化得到的最终模型——CaliciBoost,其性能超越了所有传统手动构建的基准模型,在权威的TDC公开排行榜上取得了领先排名。

这直接证明,通过AutoML优化的模型不仅能匹配甚至能超越专家精心设计的模型。
总结而言,该研究成功地将自动机器学习从一种便捷工具,转化为驱动科学发现的方法论核心。它不仅高效地回答了“哪种表征更好”这一长期问题,更重要的是展示了一种可复现的研究范式:面对高维、多元的特征空间与有限的样本数据时,AutoML能够以客观、系统的方式,自动化完成从特征评估、筛选到模型构建、优化的全流程。
这极大地降低了建模门槛,将研究者从重复的劳动中解放出来,使其能更专注于问题本质与结果洞察,从而加速药物发现领域的数据驱动决策进程。
关于郑老师团队及公众号
学统计就找郑老师团队,我们有全面的医学统计课程!
1.医院临床数据分析课程
临床试验(RCT)研究设计与数据分析;临床预测模型和基于R语言/Python的机器学习方法在临床预测模型中的应用(附赠全套代码);医院回顾性数据与真实世界临床研究,涵盖目标模拟试验(模拟RCT)、缺失数据填补下真实世界研究、倾向性评分方法(包括倾向性得分匹配、逆概率加权,重叠加权)等
2.纵向数据分析课程
重复测量资料分析方法培训;轨迹模型在纵向数据分析中的深度应用(全套R代码奉送)
3.公共数据库挖掘与分析课程
NHANES(美国国家健康和营养检查)公共数据库、GBD(全球疾病负担)公共数据库、七大老年健康数据库挖掘与分析课程;孟德尔随机化方法快速发表SCI初级班、高级班以及进阶攻略:整合网络药理学&单细胞测序
4.其他课程
零基础两天学会R语言;Meta分析培训课程,包含网状Meta内容;量表与中介研究数据分析培训班
26年预开课程:
剂量反应网状Meta分析(DR-NMA)、缺失数据预测模型、时依协变量模型与多状态模型在纵向数据中的应用、高级倾向性评分课程、机器学习在医学影像图片数据中的应用、HRS数据库应用与分析
需以上统计课程,请联系郑老师团队(微信:aq566665)

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)