张大妈

大工&蚂蚁:医疗大模型不该只会看图

源自小红薯:每日ComputerScience

01-25 14:11

现有医疗多模态模型普遍停留在“看图”阶段,难以应对真实世界中复杂的多轮医患对话和多源数据诊断。PulseMind 针对此痛点,提出了数据集、评测基准与强化学习方法三位一体的系统性解决方案,旨在从根本上推动AI从“会看图”向“会看病”迈进,为医疗AI的落地应用提供了全新的思路与技术路径。

大工&蚂蚁:医疗大模型不该只会看图智能速览

  • PulseMind 通过“数据集+评测基准+强化学习”三位一体方案,解决医疗AI“看图不会看病”的痛点。

  • 研究构建了首个真实多轮临床多模态诊断数据集 MediScope,包含近10万条咨询与60万张影像。

  • 提出的 CRPO 强化学习方法,将模型与人类专家偏好一致性从约51%提升至86%。

  • 在自建的 PulseMind Benchmark 上,PulseMind 模型平均胜率达76%,全面领先现有模型。

  • 该方案提供了基于 Qwen2.5-VL 的完整工程级训练流程,具备高可复现性。

大工&蚂蚁:医疗大模型不该只会看图精华内容

当前医疗大模型“只看不说、只看不懂”的瓶颈如何突破?PulseMind 的解决方案不仅是技术堆叠,更是对真实临床诊断流程的深度模拟与重塑,其核心创新在于构建了完整的技术闭环。

构建真实数据基石

现有模型的局限很大程度上源于训练数据的单一性。PulseMind 团队首先构建了名为 MediScope 的数据集,这是首个真实多轮临床多模态诊断数据集。

该数据集包含了 98,000 条真实世界医患多轮咨询记录和 601,500 张医学影像,覆盖超过 10 个临床大科与 200 多个亚专科。数据形态也高度异构,囊括了 CT、MRI、超声、病理、内窥镜影像,以及检验报告、处方和手术记录。

为确保数据的严谨性和隐私性,其构建流程严格遵循“采集 → 去标识 → LLM 扩写 → 医生复核”四阶段,为模型学习真实诊断流程奠定了坚实基础。

设定全新评测标准

没有科学的尺子,就无法衡量进步。为此,团队提出了 PulseMind Benchmark,一个专门面向真实诊断场景的多维评测体系。

该基准首次系统性地评估模型的多轮诊断对话能力,采用双子集结构:MedDiagnose 聚焦于多模态真实病例,而 CMtMedQA-test 则扩展了文本多轮推理能力。

评测维度也更为全面,包含主动性、准确性、有用性和语言质量四个指标,旨在引导模型不仅给出正确答案,还要像一位真正的医生那样进行有效沟通,为行业评测设立了新标杆。

创新训练提升表现

传统的强化学习方法依赖绝对分数打分,稳定性差且难以对齐人类偏好。PulseMind 提出了 CRPO,即比较式强化学习。

该方法用“模型与多个对照模型”的相对偏好判断,来替代不稳定的绝对分数奖励。实验证明,CRPO 显著提升了训练稳定性和与医生偏好的一致性。

具体来看,通过 GPT-4 评测与人类专家打分的一致性从原先的约 51% 大幅提升至约 86%,让模型的优化方向更贴近真实世界的需求。

性能卓越且可复现

综合方案的成效体现在了模型的最终性能上。在 PulseMind Benchmark 上,PulseMind 模型取得了平均 76% 的胜率,对 Lingshu、InternVL3、Qwen2.5-VL 乃至 GPT-4o 等模型均形成了明显优势。

此外,在 11 个标准的医学 QA 数据集上,PulseMind-72B 模型也达到或超越了当前 SOTA(State-of-the-art)开源模型水平,展现了其强大的综合能力。

研究还提供了完整的工程级训练方案,基于 Qwen2.5-VL(32B/72B),采用 LoRA 高效微调和 SFT→CRPO 两阶段训练,使用 128 块 A100 显卡,具备高可复现性,为后续研究者和开发者提供了明确的实践路径。

PulseMind 项目为医疗AI从实验室走向临床诊室铺设了一条坚实的道路。它通过系统性的创新,让大模型真正开始理解诊断的复杂性与互动性。未来,随着这类技术的成熟,我们能否期待一个AI辅助诊断普及、医疗资源更均衡的新时代?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章