百川智能发布的Baichuan-M3模型,标志着AI医疗的重大突破。它不仅在多项权威评测中超越GPT-5.2,更关键的是,首次实现了主动追问、层层深入的原生问诊能力,让AI从“会说话”进化到“能决策”,为解决医疗资源不均等核心问题提供了新的技术路径。
智能速览
Baichuan-M3在权威医疗评测集HealthBench上全球登顶。
模型实现全球最低医疗幻觉率,将安全性内化为自身能力。
首创“端到端严肃问诊”能力,能主动逼近关键病史信息。
在模拟全流程临床的SCAN-bench评测中,问诊能力超真人医生。
通过全动态强化学习等三大技术创新,实现强推理与高可靠统一。
推动AI医疗从健康咨询向临床决策支持的高价值链路演进。
精华内容
当行业还在比拼模型如何“回答”医疗问题时,百川M3已经转向一个更核心的挑战:如何像医生一样“提问”,并真正参与到诊疗决策流程中。
评测标准重塑
长期以来,医疗AI的能力缺乏公认的评判标准。OpenAI推出的HealthBench成为主流坐标系,但它更侧重于模型的知识储备与专业表达能力,无法回答模型是否具备进入真实临床决策流程的资格。
为此,百川联合150多位一线医生,推出了SCAN-bench评测体系。该体系借鉴医学教育的OSCE方法,将诊疗过程拆解为病史采集、辅助检查和精准诊断三大阶段,通过动态多轮考核,完整模拟医生从接诊到确诊的全过程,旨在评估模型在完整临床流程中的综合能力。
问诊能力突破
Baichuan-M3最核心的突破在于其原生的“严肃问诊”能力。它不再只是被动回答,而是能像医生一样主动追问,逐层逼近关键病史和风险信号。评测数据显示,其问诊能力显著高于真人医生的平均水平。
这种能力弥补了AI长期缺失的一环:从高度不完整的信息中精准采集决策依据。过去多数“AI医生”停留在角色扮演层面,对话虽流畅却不足以支撑严肃判断,最终只能给出“建议尽快就医”等安全但无决策价值的结论。
技术架构创新
为实现强推理与高可靠性的统一,百川在底层工程上集中解决了三个关键问题。首先是全动态强化学习系统,让验证规则与模型能力共同进化,突破能力天花板。
其次是SPAR算法,通过分步惩罚机制,将极长的决策链条拆解为可追责的局部过程,让模型学会在有限轮次内问准关键问题。最后是Fact-aware RL,将低幻觉直接作为优化目标,让事实一致性成为模型的内生能力,而非依赖外部工具修正。
定位决策支持
随着能力闭环的形成,百川的产品重心也从模型展示转向了真实医疗场景的承载。其应用正逐步搭建可承接医疗工作流的系统骨架。
这使其与市场中常见的“泛健康”应用形成根本区隔。后者多聚焦于健康科普与情绪陪伴,而百川选择的是一条高风险、高责任的决策支持路径。模型给出的每一次判断和问题,都可能直接影响患者的诊疗选择,是真正进入医疗决策核心环节的尝试。
百川M3的出现,不仅是技术榜单上的一次超越,更是AI医疗从“能说会道”迈向“值得托付”的分水岭。它通过构建会推理、不乱编、会问诊的能力闭环,为解决优质医疗资源稀缺等现实难题提供了新的可能。未来,当AI深度融入诊疗流程,它将如何重塑医患关系与医疗体系的效率?