Nature Medicine IF=50.0 | PreA:基于多方协同设计的LLM聊天机器人优化初级到专科医疗转诊流程
引言
在医疗资源紧张、患者就诊流程冗长的背景下,如何高效、精准地完成从初级到专科医疗的转诊,是全球医疗系统面临的共同痛点。现有的大语言模型(LLM)应用多局限于辅助医护人员,缺乏直接面向患者、并能整合到真实高压临床工作流中的有效工具。
近日,发表于《Nature Medicine》的一项随机对照试验带来了突破。一个联合研究团队开发并验证了一款名为PreA的LLM聊天机器人。该工具通过与当地利益相关者共同设计,能自主完成面向患者的病史采集、初步诊断和检查建议,并生成转诊报告,显著缩短了专科医生问诊时间,同时提升了医患沟通体验与照护协调性。
基本信息
• 文章标题:An LLM chatbot to facilitate primary-to-specialist care transitions: a randomized controlled trial
• 期刊:Nature Medicine
• 影响因子:50.0
• 发表时间:2025年12月11日
• 研究单位:中国医学科学院 & 北京协和医学院;桂林医学院第一附属医院;北京师范大学;北京大学;哈尔滨工业大学;华东师范大学;甘肃医学院附属医院;腾讯微信AI
• Github地址:https://github.com/ShashaHan-collab/PreA-OutpatientRCT
• 论文地址:https://doi.org/10.1038/s41591-025-04176-7
研究内容与方法
数据集构建
- 本地临床对话数据集
- 数据来源:采集中国11个省份城乡基层医疗机构的515份医患诊疗音频转录文本,包含199145个中文词汇,覆盖低/高收入区域(77.9%来自低收入区域,51.7%来自农村)
- 数据处理:由本地协同设计团队校准转录文本,去除噪声、歧义语言与非临床内容,严格匿名化处理以符合HIPAA隐私标准
- 虚拟患者数据集
- 构建方法:基于真实病例,通过大语言模型(LLM)生成600个虚拟患者档案,其中50%档案设置为需多学科会诊的复杂病例
- 医学验证:由5名认证临床医生对所有档案的医学合理性与完整性进行审核,达成5/5的共识性验证
PreA模型协同设计架构
-
双接口整体架构
- 组件构成:包含患者端聊天机器人与临床医生端接口两个核心模块
- 工作流程:患者/家属优先与患者端交互完成预问诊,模型自动生成结构化转诊报告,供专科医生面诊前查阅
【PreA协同设计架构与临床集成示意图】
-
患者端聊天机器人(两阶段临床推理模型)
- 主动问诊阶段:采用多轮对话机制,遵循通用医学诊疗指南收集全面健康信息,基于 stakeholder 反馈将对话轮次控制在8-10轮以优化时间效率
- 鉴别诊断阶段:生成1-3个相关鉴别诊断结果,每个结果附带支持性与反驳性临床证据,降低临床认知锚定风险
-
医生端专科接口
- 转诊报告内容:涵盖患者人口统计学信息、病史、主诉、症状、家族史、建议检查项目、初步诊断、治疗建议及临床推理摘要,符合标准化临床文档评估工具要求
- 可访问性优化:支持患者与家属共享访问权限;内置LLM意图分析模块,实时生成共情化、适配低健康素养人群的交互内容,输出格式采用JSON以实现流程简化
-
双循环协同优化机制
-
第一循环:对抗式 stakeholder 测试
- 参与主体:120名患者/家属、36名社区卫生工作者、15名医生、38名护士(覆盖11个省份城乡区域)
- 优化方法:通过多轮反馈迭代调整模型的对话逻辑、语言适配性与内容完整性,确保符合WHO公平AI部署指南
【PreA双循环协同优化流程图】
-
第二循环:虚拟患者模拟优化
- 模拟场景:使用300个未参与训练的虚拟患者档案,模拟低健康素养等真实诊疗挑战场景
- 对话终止条件:患者确认信息收集完成,或经过10轮未解决的问诊循环后自动结束
- 评估与迭代:由5名专家(2名全科医生、2名专科医生、1名AI伦理研究生)从效率、需求识别、清晰度、全面性、友好度5个维度对模型表现评分,评分<3分则触发模型迭代优化
-
模型开发策略对比研究方法
- 模型变体构建
- 协同设计模型:经过上述双循环优化的PreA基础模型(基于GPT-4.0 mini)
- 本地数据微调模型:在协同设计模型基础上,使用处理后的本地临床对话数据集进行微调,设置微调优先级高于prompt策略,使模型优先学习本地临床对话模式
- 盲法评估:由同一专家团队采用盲法,基于5分Likert量表从完整性、适宜性、临床相关性三个维度评估两类模型生成的转诊报告
【协同设计模型与本地数据微调模型对比实验设计图】
随机对照试验(RCT)研究设计与分析方法
-
研究分组与干预方案
- PreA-only组:患者独立使用PreA完成预问诊,模型生成的转诊报告供接诊医生查阅
- PreA-human组:患者在医疗助理的技术指导下使用PreA,模型生成的转诊报告供接诊医生查阅
- No-PreA组:患者接受常规诊疗流程,接诊医生仅查阅包含患者性别、年龄的基础报告
【多中心RCT研究分组设计图】
-
随机化与盲法设计
- 随机化:采用个体水平计算机生成的随机序列进行1:1:1分组,无分层设置,实施分配隐藏以避免选择偏倚
- 盲法:单盲设计,患者知晓自身分组情况,接诊医生对PreA-only组与PreA-human组的分组不知情,数据采集与分析人员全程保持盲态
-
临床笔记分析方法
- 分类模型构建:采用Med-BERT编码器生成临床笔记的上下文嵌入,结合SimCSE对比学习框架训练二分类器,区分PreA辅助组与对照组的临床笔记,通过F1-score评估组间决策模式差异,计算公式为:
F1=TP2TP+FP+FNF1 = \frac{TP}{2TP + FP + FN}F1=2TP+FP+FNTP
其中TPTPTP为真阳性,FPFPFP为假阳性,FNFNFN为假阴性 - 领域特异性分析:将临床笔记划分为5个核心临床推理领域(病史采集、体格检查、诊断、检查开具、治疗方案),对非结构化文本采用UMAP算法将嵌入向量投影至二维空间分析分布差异,对结构化计数数据采用Mann-Whitney U检验进行组间比较
- 分类模型构建:采用Med-BERT编码器生成临床笔记的上下文嵌入,结合SimCSE对比学习框架训练二分类器,区分PreA辅助组与对照组的临床笔记,通过F1-score评估组间决策模式差异,计算公式为:
-
匹配对分析方法
- 医生工作量匹配:按专科、工作班次、职称、年龄、性别匹配参与研究与未参与研究的医生,采用Wilcoxon符号秩检验比较两组医生每班次接诊患者数量
- 患者等待时间匹配:按专科、工作周、职称、年龄、性别、每班次接诊量匹配参与研究与未参与研究的医生,采用Wilcoxon符号秩检验比较两组患者的就诊等待时间
-
统计检验方法:连续变量符合正态分布时采用两样本t检验,非正态分布时采用Mann-Whitney U检验;分类变量采用卡方检验;采用Benjamini-Hochberg法进行多重比较校正
实验结果分析
PreA对门诊工作流程的影响
【展示PreA-only、PreA-human和No-PreA三组患者的问诊时长分布】
PreA干预显著缩短了医患问诊时间。与未使用PreA的对照组(No-PreA)相比,患者独立使用PreA(PreA-only)的问诊时长平均减少了28.7%(3.14分钟 vs 4.41分钟)。在有工作人员辅助使用PreA的组别(PreA-human)中,问诊时长与PreA-only组无显著差异,证明了PreA的自主运行能力。此外,参与研究的医生在每班次接诊的患者数量显著多于匹配的未参与医生,表明PreA提升了门诊吞吐效率。
- 问诊效率提升:PreA-only组问诊时间显著短于No-PreA组,相对减少28.7%。
- 自主运行验证:PreA-only与PreA-human组的问诊时长无差异,说明无需额外人力支持。
- 系统效率增益:使用PreA的医生接诊量更高,提示其能优化整体工作流。
PreA对患者体验与医护协作的改善
【以雷达图展示患者报告的各项体验指标及医生报告的医护协作评分】
PreA显著改善了患者就诊体验和医生感知的医护协作。在患者报告的指标中,PreA-only组在沟通顺畅度、医生关注度、人际尊重、满意度和未来接受度等所有维度上的评分均显著高于No-PreA组。同时,医生认为PreA生成的转诊报告在促进医护协作方面的价值远高于常规报告(评分3.69 vs 1.73)。大多数医生反馈PreA对其临床决策(64.9%)、促进医患沟通(77.5%)和减轻工作负担(54.1%)有积极帮助。
- 患者体验优化:使用PreA的患者在所有主观体验指标上均有显著提升。
- 医护协作增强:医生高度认可PreA报告对协调专科护理的价值。
- 临床决策支持:多数医生认为PreA在病史采集、初步诊断建议等方面提供了有用支持。
协同设计策略相较于本地数据微调的优势
【比较协同设计模型与基于本地对话微调模型在病史采集、诊断和检查建议三个领域的质量评分分布】
在试验前的一项模拟实验中,比较了协同设计(Co-designed)的PreA模型与基于本地初级诊疗对话微调(Data-tuned)的模型。结果显示,协同设计模型在病史采集、诊断和检查建议三个临床领域的输出质量评分均显著高于数据微调模型。数据微调模型复制了现实初级诊疗中的系统性缺陷,如遗漏关键病史、未能提供必要的诊断或检查建议,以及语气不友好。这证明了与被动收集本地数据相比,与当地利益相关者协同设计是开发更高质量、更公平临床AI工具的有效策略。
- 输出质量更高:协同设计模型在各项临床评估领域的质量评分均显著优于数据微调模型。
- 规避系统缺陷:数据微调模型会模仿并放大现有诊疗流程中的低效和不足。
- 设计策略有效:协同设计能更好地将模型与高质量诊疗目标对齐,而非简单复制现有实践。
优势与局限
优势
• 提升诊疗效率与患者体验:PreA显著缩短专科医生问诊时间(28.7%),同时改善医患沟通体验与护理协调性,在资源有限的高负荷医疗环境中实现了效率与人文关怀的双重提升。
• 协同设计策略有效:与本地利益相关者(患者、社区工作者、医护人员)共同设计LLM聊天机器人,相比单纯微调本地对话数据,能更好地规避系统性偏见,产出更高质量、更符合临床指南的转诊报告。
• 操作自主性强,具备扩展潜力:仅使用聊天机器人的组别与有人员辅助的组别效果相当,证明了其独立运行能力,为在资源有限地区进行规模化、低成本部署提供了可能。
局限
• 研究背景与普适性受限:试验在特定高负荷、资源有限的中国医院环境中进行,其效果在咨询时间更长、工作流程不同的其他医疗体系中的普适性有待验证。
• 存在潜在性能偏差:由于试验设计为单盲(患者知晓分组),可能引入性能偏差,尽管客观指标与主观报告一致,且对照组咨询时长符合当地实际模式,一定程度上缓解了此担忧。
• 数据质量与系统性文档缺陷:协同设计方法虽优于被动收集本地数据,但仍受限于资源有限环境下高质量医疗对话数据的可获得性;同时,研究中存在的医生笔记缺失问题,也反映了现实医疗系统中的文档缺陷。
参考文献
- Goh, E. et al. GPT-4 assistance for improvement of physician performance on patient care tasks: a randomized controlled trial. Nat. Med. 31, 1233–1238 (2025). 该研究通过随机对照试验评估了GPT-4在辅助医生完成患者护理任务中的表现,为大型语言模型(LLM)在临床决策支持中的应用提供了早期证据。本研究借鉴了其试验设计思路,并进一步探索了LLM在初级到专科医疗转诊流程中的直接患者交互作用。
- Tu, T. et al. Towards conversational diagnostic artificial intelligence. Nat. Med. 642, 442–450 (2025). 本文提出了面向对话式诊断的人工智能框架,强调了从原始本地对话数据向标准化医学语料库模拟对话转变的趋势。本研究在此基础上,通过对比协同设计与被动数据微调两种策略,探讨了如何更有效地开发适用于资源有限环境的临床LLM工具。
- Li, S. et al. A community co-designed LLM-powered chatbot for primary care: a randomized controlled trial. Nat. Health https://doi.org/10.1038/s44360-025-00021-w (2025). 该研究报道了一项针对初级保健的社区协同设计LLM聊天机器人随机对照试验,与本研究共同确立了参与式协同设计作为开发情境化医疗聊天机器人的有效方法。两篇研究分别针对初级保健和专科转诊的不同临床需求,展示了协同设计原则的适应性。
- Wan, P. et al. Outpatient reception via collaboration between nurses and a large language model: a randomized controlled trial. Nat. Med. 30, 2878–2885 (2024). 该试验评估了护士与LLM协作在门诊接待中的应用,是LLM整合到实时临床工作流程的早期探索之一。本研究在此基础上,进一步测试了患者直接交互的LLM聊天机器人(PreA)在优化专科诊疗流程中的有效性与自主运行能力。
- Topol, E. J. High-performance medicine: the convergence of human and artificial intelligence. Nat. Med. 25, 44–56 (2019). 这篇前瞻性综述探讨了人工智能与人类智能在医学领域的融合,并指出了在时间紧迫的临床工作流程中建立真实世界证据的重要性。本研究开发并评估PreA聊天机器人,正是为了响应这一号召,为LLM在资源有限的高负荷医院环境中提供临床效用的现实证据。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)