葛培轩 1,2{ }^{1,2}1,2, 苏通坤 Su1\mathrm{Su}^{1}Su1, 吕发勤 Lv3\mathrm{Lv}^{3}Lv3, 赵保亮 1{ }^{1}1, 张鹏 1{ }^{1}1, Wong Chi Hong 1{ }^{1}1, 姚良 1{ }^{1}1, 孙宇 1{ }^{1}1, 王泽楠 1{ }^{1}1, Wong Pak Kin 2{ }^{2}2, 和胡颖 Hu1\mathrm{Hu}^{1}Hu1
1{ }^{1}1 深圳先进技术研究院,
2{ }^{2}2 澳门大学,
3{ }^{3}3 中国人民解放军总医院
px.ge@siat.ac.cn

摘要

由于超声图像的可变性、操作者依赖性和对标准化文本的需求,超声(US)报告生成是一项具有挑战性的任务。与X射线和CT不同,超声成像缺乏一致的数据集,使得自动化变得困难。在本研究中,我们提出了一种统一框架,用于多器官和多语言的超声报告生成,结合基于片段的多语言训练,并利用超声报告的标准化特性。通过将模块化文本片段与多样化的影像数据对齐,并策划一个双语英汉数据集,该方法实现了跨器官部位和语言的一致且临床准确的文本生成。通过选择性解冻视觉变压器(ViT)进行微调,进一步提高了文本-图像对齐。与之前最先进的KMVE方法相比,我们的方法在BLEU得分上相对提高了约 2%2 \%2%,在ROUGE-L上提高了约 3%3 \%3%,在CIDEr上提高了约 15%15 \%15%,同时显著减少了诸如遗漏或错误内容等错误。通过将多器官和多语言报告生成统一到一个可扩展的框架中,这项工作展示了在实际临床工作流程中的强大潜力。

关键词:超声报告生成⋅\cdot 多模态大语言模型⋅\cdot 医学文本生成⋅\cdot 多语言医学AI

1 引言

放射学报告生成需要解释复杂的医学图像并产生标准化的、临床准确的文本。由于其操作者依赖性、高可变性和对噪声的敏感性,超声(US)报告生成尤其具有挑战性。尽管大多数自动报告生成的研究集中在X射线和CT上 [8,11,15, 21, 22],这些领域有现成的标准化数据集,但由于缺乏标准化数据集,US仍未得到充分研究 [6,9]。现有模型难以在US图像间泛化或处理多器官报告任务。

大型语言模型(LLMs)在医学应用中表现出强大的文本生成能力 [11,17],并且在多模态LLMs(MLLMs)中集成视觉编码器
已经实现了联合图像-文本理解 [1, 2,7,18]2,7,18]2,7,18]。通用模型如Intern-VL 2.5 [2] 和Qwen2-VL [18],以及医学专用模型如HuatuoGPT-Vision [1] 和LLaVA-Med 1.5 [7] 在视觉语言任务中表现出色,特别是在需要回答关于医学图像的具体查询的视觉问答任务中。相比之下,报告生成涉及从图像总结发现并生成简洁直接的文本输出,这对MLLMs提出了独特的挑战。由于US图像固有的噪声、图像质量的变化以及现有预训练领域的限制,将MLLMs应用于US报告生成仍然未被充分探索。先前的US报告生成研究主要集中在特定应用如乳腺超声 [6] 或器官特定任务 [9] 上,使用缺乏多样化和标准化需求以实现强大自动化的数据集。

为了解决这些挑战,本研究引入了一种结合视觉变压器(ViT)[4] 优化和基于片段的多语言训练的US报告生成框架。通过在监督微调(SFT)期间解冻ViT,我们能够更好地与语言模型对齐,使其适应US图像的噪声和可变性质。我们的基于片段的多语言训练利用了US报告的标准化和模块化结构,在不增加额外数据集的情况下实现一致的双语报告生成。实验结果表明,这种统一框架在BLEU [13]、ROUGE-L [10] 和CIDEr [16] 指标上优于传统模型和基线MLLMs,在多语言和器官特定任务上取得了显著改进。定性分析进一步证明了该方法生成的报告在语义上准确且具有临床相关性,与专家生成的真实情况紧密对齐。这些贡献突显了我们框架在推进自动US报告生成及其在实际临床工作流程中的适用性方面的潜力。为了鼓励进一步研究,我们将在评审过程后发布我们的代码库和模型权重。

2 方法

2.1 仅解码器多模态LLMs

本研究采用仅解码器MLLMs来生成标准化的、多器官的中英文US报告。如图1所示的架构将来自视觉编码器(ViT)的视觉标记与来自分词器的文本标记集成在一起,共同执行图像-文本理解和生成结构化的文本报告。输入包括系统提示、图像标记和用户提示,在训练过程中使用因果掩码包含目标报告内容以防止信息泄露。在推理过程中,模型自回归地生成报告而不包含目标内容作为输入。

我们评估了几种MLLMs,包括通用模型如InternVL 2.5 [2] 和Qwen2VL [18],以及医学专用模型如HuatuoGPTVision [1] 和LLaVA-Med 1.5 [7]。这些模型在视觉编码器、分词策略和预训练领域上有所不同。为了解决US图像的可变性和
img-0.jpeg

图1. (1) MLLM架构。*仅在训练期间包含目标报告内容以计算掩码因果损失。(2) 按器官部位的片段分布及总出现次数和唯一计数。(3,4,5) 甲状腺部位示例输入超声图像、原始中文报告和翻译后的英文报告,以及片段-翻译查找表,将中文片段映射到英文等效项。(6) 用于联合和跨语言生成的多语言训练提示。(7) 示例输入和输出,包括真实值、提议方法和旧方法。
US图像的噪声问题,我们在SFT期间解冻视觉编码器参数进行微调。这使模型能够联合优化图像和文本特征,解决US图像的可变性和噪声问题,这是冻结编码器无法有效处理的。此外,我们集成了低秩适应(LoRA)[5] 来高效微调文本解码器,仅优化Transformer架构的特定层,包括查询、键、值、注意力输出和MLP投影,以减少计算成本。所有模型均使用Hugging Face Transformers生态系统 [19] 实现,确保兼容性和标准化。

监督微调(SFT)过程最小化因果损失:

LSFT=−∑i=1Tlog⁡pθ(xi∣x<i) \mathcal{L}_{\mathrm{SFT}}=-\sum_{i=1}^{T} \log p_{\theta}\left(x_{i} \mid x_{<i}\right) LSFT=i=1Tlogpθ(xix<i)

其中xix_{i}xi表示序列中的第iii个标记,x<ix_{<i}x<i表示前面的标记,θ\thetaθ指模型参数。采样策略如top-kkk、top-ppp和温度缩放应用于推理阶段以提高输出多样性。通过对视觉编码器和文本解码器进行微调,我们的框架实现了更好的图像和文本模态对齐,相比传统的冻结编码器但解冻投影器的LLaVA [12] 类似方法,显著提高了US报告生成性能。

2.2 数据集和基于片段的多语言训练流水线

数据集源自KMVE [9] 研究,包括三个器官扫描部位:乳腺(3,521名患者)、甲状腺(2,474名患者)和肝脏(1,395名患者)。每个样本包括两张超声图像,配有一份由描述临床发现的模块化片段组成的标准化中文报告,例如扫描质量、疾病严重程度和解剖属性(图1,第2节)。这些片段表现出标准化结构,少数常见片段主导数据集,而较少见的片段增加了多样性。

为了实现双语训练,我们开发了一个基于片段的翻译流水线。每份报告使用逗号、分号和句号作为分隔符分割成片段,然后翻译成英文。正则表达式检查确保保留领域特定术语如"CFDI",所有翻译片段均由放射学专家验证以确保医学准确性。验证后的片段存储在一个查找表中(图1,第5节),该表映射所有样本中的中文片段到其英文等效项。这确保了报告间的一致翻译,维持高质量的双语数据以供训练。

双语数据集使用四种训练提示构建(图1,第6节):从超声图像生成中文报告、从超声图像生成英文报告、从中文查询生成英文报告以及从英文查询生成中文报告。这些提示利用数据集的模块化结构和字节对编码(BPE)和SentencePiece等分词方法以实现多语言表示。基于片段的流水线进一步增强了生成多器官、多语言报告的多模态和多语言特征对齐。

3 实验与结果

所有模型都在NVIDIA 4090 GPU上使用LoRA + ViT解冻(包括投影仪)配置进行训练。对于推理,16GB BF16支持的GPU足以运行7B模型,而训练需要24 GB GPU。超参数是模型特定的,但这里展示了2 B和7 B的最佳两种配置。2B和7B模型共享的超参数包括AdamW优化器,余弦学习率调度器,热身比率为20%20 \%20%,权重衰减为0.05,200.05,200.05,20个训练周期,LoRA秩32,alpha 64,无LoRA偏差。差异包括失效率(2 B2 \mathrm{~B}2 B为0.1,7 B为0.2),学习率(2 B2 \mathrm{~B}2 B为0.0001,7 B为0.00005),以及最大梯度范数(2 B2 \mathrm{~B}2 B为2.0,7 B为1.0)。通过梯度累积使用了有效的批次大小为64。

评估指标包括BLEU [13](B1, B4)用于n-gram重叠,其中BLEU-1关注单词,BLEU-4关注最多4-gram;ROUGE-L [10](RL)通过公共子序列衡量召回率;CIDEr [16](C)通过加权n-gram衡量上下文相关性;BERTScore F1(BE-ZhF用于中文,BE-MF用于多语言)[3]用于语义相似性;以及基于器官特定关键词(如“甲状腺”,源自KMVE [9])的匹配关键词F1(MKF1)衡量临床相关性。由于KMVE没有发布正式的关键词列表,解释文本时存在差异。KMVE报告按器官的指标,但缺乏所有三个器官部位的整体结果,因为它们的模型是器官特定的。为了便于比较,我们重现了他们的结果,获得的数值略高于原论文报告的数值以保持一致性。按器官的指标比较MLLMs与传统模型,而整体指标评估所有部位的改进。

3.1 传统方法与MLLMs的比较

表1. 三种器官部位的方法比较。结果包括传统方法和带有LoRA+ViT解冻SFT的MLLMs。*DeltaNet [20]和R2GenRL [14]的结果来自KMVE [9],这些方法未评估CIDEr。KMVE结果在此研究中被重现以与MLLMs进行比较。

方法 指标(肝脏/乳腺/甲状腺)
B1 B4 RL C
DeltaNet* 0.87/0.72/0.61 0.81/0.61/0.58 0.86/0.76/0.69 −/−-/-/
R2GenRL* 0.85/0.67/0.62 0.77/0.48/0.41 0.84/0.65/0.60 −/−-/-/
KMVE 0.88/0.76/0.74 0.82/0.64/0.57 0.87/0.76/0.73 3.50/3.80/1.91
InternVL-2.5(2B) 0.89/0.76/0.73 0.83/0.66/0.57 0.88/0.80/0.75 3.73/4.48/2.09
InternVL-2.5(4B) 0.89/0.76/0.73 0.82/0.65/0.58 0.88/0.79/0.75 3.64/4.38/2.14
Qwen2-VL(2B) 0.89/0.76/0.73 0.83/0.64/0.57 0.88/0.79/0.74 4.04/4.35/2.12
LLaVA-Med(7B) 0.89/0.78/0.72 0.82/0.67/0.57 0.87/0.80/0.74 3.64/4.50/2.17
HuatuoGPT… (7B) 0.86/0.77/0.71 0.79/0.64/0.55 0.85/0.78/0.72 2.95/4.10/2.15
MLLMs在大多数指标上超越了传统方法如DeltaNet [20] 和R2GenRL [14],以及KMVE [9](表1)。例如,Qwen2-VL(2B)在肝脏上的CIDEr得分为4.04(相对于KMVE提高了+15.4%+15.4 \%+15.4%),而LLaVAMed⁡(7 B)\operatorname{Med}(7 \mathrm{~B})Med(7 B)在乳腺上的CIDEr得分为4.50(+18.4%+18.4 \%+18.4%)。BLEU-4和ROUGE-L的改进较小但一致,通常在2−5%2-5 \%25%范围内。这些收益突显了MLLMs生成多样、语义丰富且具有临床相关性的报告的能力,相比之下,传统方法依赖于更简单、更重复的语言。

在MLLMs中,较大的模型如LLaVA-Med(7B)在某些任务上显示出轻微优势,例如乳腺BLEU-4(0.67 vs. Qwen2-VL(2B)的0.64)和甲状腺CIDEr(2.17 vs. 2.12)。然而,较小的模型如InternVL-2.5(2B)仍然具有竞争力,乳腺CIDEr得分为4.48,超过HuatuoGPT-Vision(7B)(4.10)。值得注意的是,这些MLLMs尚未使用提议的基于片段的多语言训练流水线,显示了进一步改进的潜力。MLLMs较大的词汇量(30k-150k标记)允许更细致的输出,避免了传统模型中出现的重复短语。

3.2 多语言训练和消融研究

表2比较了KMVE [9]、基线和提议的方法。基线包括“Vanilla”,其中应用了ViT解冻+LoRA,以及“LoRA”,仅解冻投影仪和LoRA。提议的“Multi”方法整合了ViT解冻、LoRA和使用跨语言提示的基于片段的多语言训练。其他配置包括“En2Zh”,从英语查询生成中文报告,以及“Direct”,在直接翻译的数据集上进行训练。虽然“En Direct”使用原始翻译,其他“En”配置使用基于片段的翻译作为测试集。

“Multi”配置在所有指标上都取得了最佳结果,展示了其稳健性和多功能性。例如,LLaVA-Med(7B) “Multi”的BLEU-4得分为0.689(+8.2%0.689(+8.2 \%0.689(+8.2%超过LoRA),CIDEr为4.123(+17.7%)4.123(+17.7 \%)4.123(+17.7%),MKF1为0.939(+2.2%)0.939(+2.2 \%)0.939(+2.2%)。与KMVE相比,“Multi”将BLEU-4提高了3.1%3.1 \%3.1%(0.689 vs. 0.668),CIDEr提高了17.8%17.8 \%17.8%(4.123 vs. 3.499),ROUGE-L提高了3.9%3.9 \%3.9%(0.804 vs. 0.774),BERTScore-ZhF1提高了1.3%1.3 \%1.3%(0.934 vs. 0.922),MKF1提高了1.6%1.6 \%1.6%(0.939 vs. 0.924)。同样,Qwen2-VL(2B) “Multi”的BLEU-4为0.681(+6.6%0.681(+6.6 \%0.681(+6.6%超过LoRA),CIDEr为4.059(+24.4%)4.059(+24.4 \%)4.059(+24.4%),MKF1为0.937 (+2.4%)(+2.4 \%)(+2.4%)

对于中文任务,“Direct”训练改善了原始中文预测,但产生了不一致的英文输出,证明使用粗略翻译的数据仍能增强原始语言的表现。相比之下,“En2Zh”和“Multi”配置取得了竞争性结果。例如,Qwen2-VL(2B)在“En2Zh”中的BLEU-4为0.679 ,CIDEr为4.073 ,MKF1为0.936 ,与“Multi”(分别为0.681,4.0590.681,4.0590.681,4.059,和0.937)非常接近。类似地,LLaVA-Med(7B)在“En2Zh”中的BLEU-4为0.686 ,CIDEr为4.108 ,MKF1为0.940 ,几乎与“Multi”相同。
表2. 以前最佳方法KMVE [9]、基线和提议的基于多语言片段的训练(“Multi”)方法的整体性能比较。

实验 B1 B4 RL C BE-ZhF BE-MF MKF1
KMVE [9] 0.786 0.668 0.774 3.499 0.922 0.921 0.924
InternVL-2.5(2B) Vanilla 0.789 0.679 0.797 3.970 0.931 0.930 0.934
InternVL-2.5(2B) Lora 0.759 0.643 0.762 3.445 0.919 0.919 0.915
InternVL-2.5(4B) Vanilla 0.789 0.674 0.793 3.910 0.930 0.930 0.933
InternVL-2.5(4B) Lora 0.752 0.638 0.765 3.494 0.921 0.921 0.918
HuatuoGPT-Vision(7B) Vanilla 0.775 0.652 0.772 3.636 0.924 0.923 0.926
HuatuoGPT-Vision(7B) Lora 0.772 0.646 0.763 3.428 0.920 0.919 0.920
Qwen2-VL(2B) Multi 0.794 0.681 0.799 4.059 0.933 0.932 0.937
Qwen2-VL(2B) Vanilla 0.787 0.673 0.790 3.963 0.929 0.928 0.934
Qwen2-VL(2B) Lora 0.748 0.630 0.752 3.263 0.915 0.915 0.906
Qwen2-VL(2B) En2Zh 0.792 0.679 0.798 4.073 0.932 0.932 0.936
Qwen2-VL(2B) Direct 0.797 0.687 0.802 4.072 0.933 0.933 0.939
LLaVA-Med(7B) Multi 0.798 0.689\mathbf{0 . 6 8 9}0.689 0.804\mathbf{0 . 8 0 4}0.804 4.123\mathbf{4 . 1 2 3}4.123 0.934\mathbf{0 . 9 3 4}0.934 0.933\mathbf{0 . 9 3 3}0.933 0.939
LLaVA-Med(7B) Vanilla 0.791 0.680 0.796 3.980 0.931 0.930 0.936
LLaVA-Med(7B) Lora 0.755 0.637 0.760 3.503 0.919 0.919 0.919
LLaVA-Med(7B) En2Zh 0.797 0.686 0.802 4.108 0.934 0.933 0.940\mathbf{0 . 9 4 0}0.940
LLaVA-Med(7B) Direct 0.801\mathbf{0 . 8 0 1}0.801 0.687 0.802 4.085 0.933 0.933 0.936
Qwen2-VL(2B) En Multi 0.773 0.648 0.753 3.768\mathbf{3 . 7 6 8}3.768 0.908 0.921 -
Qwen2-VL(2B) En Only 0.779\mathbf{0 . 7 7 9}0.779 0.656\mathbf{0 . 6 5 6}0.656 0.752 3.720 0.906 0.919 -
Qwen2-VL(2B) En Direct 0.702 0.484 0.662 3.039 0.880 0.900 -
LLaVA-Med(7B) En Multi 0.777 0.655 0.759\mathbf{0 . 7 5 9}0.759 3.744 0.909\mathbf{0 . 9 0 9}0.909 0.923\mathbf{0 . 9 2 3}0.923 -
LLaVA-Med(7B) En Only 0.762 0.638 0.744 3.677 0.904 0.918 -
LLaVA-Med(7B) En Direct 0.706 0.475 0.653 2.908 0.876 0.896 -

对于英语任务,“En Multi”胜过“En Only”(仅在片段翻译的英语数据上训练)。例如,Qwen2-VL(2B)在“En Multi”中的CIDEr得分为3.768 ,MKF1为0.921,而在“En Only”中的CIDEr为3.720,MKF1为0.919。同样,LLaVA-Med(7B)在“En Multi”中的BLEU-4为0.655,CIDEr为3.744,MKF1为0.923,而在“En Only”中的BLEU-4为0.638,CIDEr为3.677,MKF1为0.918。这些结果突出了基于多语言片段的训练在改善语义指标和临床关键词匹配方面的有效性,相较于仅依赖单一语言信息的方法。

4 讨论与结论

本研究提出了一种新颖框架,利用MLLMs专门针对多语言、多器官超声报告生成,据我们所知,这一应用尚未被充分探索。通过结合基于片段的多语言训练,提议的方法达到了最先进的性能,超越了最近最好的KMVE [9]和基线MLLMs在多个评估指标上的表现。解冻ViT骨干显著增强了文本-图像
对齐,导致CIDEr分数分别提高了15.3%15.3 \%15.3%13.6%13.6 \%13.6%(对于InternVL-2.5(2B)和LLaVA-Med(7B)),相较于仅使用LoRA的设置。基于片段的多语言训练进一步提升了性能,在BLEU-4上提高了大约1.3%1.3 \%1.3%,在CIDEr上提高了3.6%3.6 \%3.6%,在MKF1上提高了0.3%0.3 \%0.3%,相较于Vanilla基线,同时在BLEU-4上相对于KMVE提高了3.1%3.1 \%3.1%,在CIDEr上提高了17.8%17.8 \%17.8%,在匹配临床关键词F1上提高了1.6%1.6 \%1.6%

提议的方法直接生成本地英语报告,避免了事后翻译的需要,同时减少了常见的错误,如多余信息(用红色突出显示)、错误含义(用棕色表示)和遗漏内容(用删除线表示),如图1第7部分所示。与之前的方法不同,如KMVE,它省略了关键发现,或者单独使用ViT解冻+LoRA,往往会引入无关或错误的细节,提议的方法确保了语义准确和上下文一致的输出。为了确保临床相关性,多语言训练中使用的翻译片段由放射科医生进行了初步检查,最大程度地减少了翻译过程中的重大语义错误。

尽管取得了令人鼓舞的结果,本研究仍有一些局限性值得进一步研究。与大规模标准化的X射线或CT数据集相比,超声数据集仍然稀缺且分散。尽管我们使用了可用的最大超声数据集之一,其有限的规模可能影响在更广泛的临床环境和多样化人群中的泛化能力。此外,我们的基于片段的方法依赖于数据集的统计先验,这意味着在报告模式或术语偏好显著不同的环境中部署可能需要额外的微调。多语言训练中使用的翻译片段由放射科医生验证以确保临床正确性,但不同语言或医疗系统之间的报告惯例和风格细微差别的变化可能无法完全捕捉,可能影响实际环境中的语言自然性。此外,本研究专注于三个常见的超声应用(乳腺、甲状腺和肝脏),将这种方法扩展到其他解剖部位,如心脏或产科成像,仍然是一个开放的挑战。最后,尽管我们的双语框架在中文-英语翻译方面表现出色,将其扩展到具有多样化医学术语和报告惯例的其他语言是一个重要的未来研究方向。

总之,这项工作提供了一个可扩展、创新的框架,用于多语言US报告生成,解决了文本-图像对齐、语义一致性和语言适应性等关键挑战。通过无缝集成到现有的机器学习和部署管道中,提议的方法为未来的医学AI发展奠定了基础。尽管数据集规模、对统计先验的依赖、有限的器官和语言覆盖范围等问题仍然存在,这项工作指明了未来研究的关键方向,并为可扩展、临床相关的超声报告生成迈出了重要一步。

参考文献

  1. Chen, J., Ouyang, R., Gao, A., Chen, S., Chen, G.H., Wang, X., Zhang, R., Cai, Z., Ji, K., Yu, G., Wan, X., Wang, B.: Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale (2024), https://arxiv.org/abs/2406.19280
    1. Chen, Z., Wang, W., Cao, Y., Liu, Y., Gao, Z., Cui, E., Zhu, J., Ye, S., Tian, H., Liu, Z., Gu, L., Wang, X., Li, Q., Ren, Y., Chen, Z., Luo, J., Wang, J., Jiang, T., Wang, B., He, C., Shi, B., Zhang, X., Lv, H., Wang, Y., Shao, W., Chu, P., Tu, Z., He, T., Wu, Z., Deng, H., Ge, J., Chen, K., Zhang, K., Wang, L., Dou, M., Lu, L., Zhu, X., Lu, T., Lin, D., Qiao, Y., Dai, J., Wang, W.: Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling (2025), https://arxiv.org/abs/2412.05271
    1. Devlin, J., Chang, M.W., Lee, K., Toutanova, K.: BERT: Pre-training of deep bidirectional transformers for language understanding. In: Burstein, J., Doran, C., Solorio, T. (eds.) Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers). pp. 4171-4186. Association for Computational Linguistics, Minneapolis, Minnesota (Jun 2019). https://doi.org/10.18653/v1/N19-1423, https://aclanthology.org/N19-1423/
    1. Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., Uszkoreit, J., Houlsby, N.: An image is worth 16x16 words: Transformers for image recognition at scale (2021), https://arxiv.org/abs/2010.11929
    1. Hu, E.J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., Chen, W.: Lora: Low-rank adaptation of large language models (2021), https://arxiv.org/abs/2106.09685
    1. Huh, J., Park, H.J., Ye, J.C.: Breast ultrasound report generation using langchain (2023), https://arxiv.org/abs/2312.03013
    1. Li, C., Wong, C., Zhang, S., Usuyama, N., Liu, H., Yang, J., Naumann, T., Poon, H., Gao, J.: Llava-med: Training a large language-and-vision assistant for biomedicine in one day (2023), https://arxiv.org/abs/2306.00890
    1. Li, J., Li, S., Hu, Y., Tao, H.: A self-guided framework for radiology report generation. In: Wang, L., Dou, Q., Fletcher, P.T., Speidel, S., Li, S. (eds.) Medical Image Computing and Computer Assisted Intervention - MICCAI 2022. pp. 588-598. Springer Nature Switzerland, Cham (2022)
    1. Li, J., Su, T., Zhao, B., Lv, F., Wang, Q., Navab, N., Hu, Y., Jiang, Z.: Ultrasound report generation with cross-modality feature alignment via unsupervised guidance. IEEE Transactions on Medical Imaging 44(1), 19-30 (2025). https://doi.org/10.1109/TMI.2024.3424978
      10.10. Lin, C.Y.: ROUGE: A package for automatic evaluation of summaries. In: Text Summarization Branches Out. pp. 74-81. Association for Computational Linguistics, Barcelona, Spain (Jul 2004), https://aclanthology.org/W04-1013/
  2. Liu, C., Tian, Y., Chen, W., Song, Y., Zhang, Y.: Bootstrapping large language models for radiology report generation. Proceedings of the AAAI Conference on Artificial Intelligence 38(17), 18635-18643 (Mar 2024). https://doi.org/10.1609/aaai.v38i17.29826
    1. Liu, H., Li, C., Wu, Q., Lee, Y.J.: Visual instruction tuning (2023), https://arxiv.org/abs/2304.08485
    1. Papineni, K., Roukos, S., Ward, T., Zhu, W.J.: BLEU: a method for automatic evaluation of machine translation. In: Proceedings of the 40th Annual Meeting on Association for Computational Linguistics. p. 311-318. ACL '02, Association for Computational Linguistics, USA (2002). https://doi.org/10.3115/1073083.1073135, https://doi.org/10.3115/1073083.1073135
    1. Qin, H., Song, Y.: Reinforced cross-modal alignment for radiology report generation. In: Muresan, S., Nakov, P., Villavicencio, A. (eds.) Findings of the Association for Computational Linguistics: ACL 2022. pp. 448-458. Association for Computational Linguistics, 爱尔兰(2022年5月)。https://doi.org/10.18653/v1/2022.findings-acl.38, https://aclanthology.org/2022.findings-acl.38/
    1. 斯隆,P., 克拉特沃西,P., 辛普森,E., 米尔梅迪,M.: 自动放射学报告生成:最近进展综述。IEEE 生物医学工程评论 第1-20页(2024)。https://doi.org/10.1109/RBME.2024.3408456
    1. Vedantam, R., Zitnick, C.L., Parikh, D.: CIDEr: 基于共识的图像描述评估。在:2015 IEEE 计算机视觉与模式识别会议 (CVPR)。第4566-4575页(2015)。https://doi.org/10.1109/CVPR.2015.7299087
    1. 王,D., 张,S.: 大型语言模型在医疗和健康领域的应用:应用、进展与挑战。人工智能评论 57(11) (2024年9月)。https://doi.org/10.1007/s10462-024-10921-0, http://dx.doi.org/10.1007/s10462-024-10921-0
    1. 王,P., 白,S., 谭,S., 王,S., 樊,Z., 白,J., 陈,K., 刘,X., 王,J., 葛,W., 樊,Y., 当,K., 杜,M., 任,X., 门,R., 刘,D., 周,C., 周,J., 林,J.: Qwen2-vl: 提升任何分辨率下的视觉语言模型的世界感知能力(2024),https://arxiv.org/abs/2409.12191
    1. Wolf, T., Debut, L., Sanh, V., Chaumond, J., Delangue, C., Moi, A., Cistac, P., Rault, T., Louf, R., Funtowicz, M., Davison, J., Shleifer, S., von Platen, P., Ma, C., Jernite, Y., Plu, J., Xu, C., Scao, T.L., Gugger, S., Drame, M., Lhoest, Q., Rush, A.M.: 变压器:最先进的自然语言处理。在:EMNLP 2020 系统演示程序。第38-45页。计算语言学协会,在线(2020年10月),https://www.aclweb.org/anthology/2020.emnlp-demos.6
    1. 吴,X., 杨,S., 邱,Z., 葛,S., 颜,Y., 吴,X., 郑,Y., 周,S.K., 肖,L.: DeltaNet: COVID-19诊断的条件医学报告生成(2022),https://arxiv.org/abs/2211.13229
    1. 杨,S., 牛,J., 吴,J., 王,Y., 刘,X., 李,Q.: 自适应多模态注意力机制的自动超声图像报告生成。神经计算 427, 40-49 (2021)。https://doi.org/https://doi.org/10.1016/j.neucom.2020.09.084, https://www.sciencedirect.com/science/article/pii/S0925231220316660
    1. 张,J., 程,M., 程,Q., 沈,X., 万,Y., 朱,J., 刘,M.: 带混合判别器的分层医学图像报告对抗生成。人工智能在医学中的应用 151, 102846 (2024)。https://doi.org/https://doi.org/10.1016/j.artmed.2024.102846, https://www.sciencedirect.com/science/article/pii/S0933365724000885
      参考论文:https://arxiv.org/pdf/2505.08838
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐