张大妈

微软发布医疗时序基座模型:基于4540亿数据预训练,解决不规则采样难题

源自知乎:量子位

01-28 15:10

现有的医疗AI擅长解读静态影像和文本,却难以理解生命的连续动态演变。微软的MIRA模型直面这一核心挑战,通过创新架构,能够处理真实医疗场景中不规则、多尺度的时序数据,为AI在重症监护等领域的深度应用开辟了新路径。

微软发布医疗时序基座模型:基于4540亿数据预训练,解决不规则采样难题智能速览

  • MIRA是专为医疗时序数据设计的通用基座模型。

  • 基于4540亿数据点预训练,突破规则采样依赖。

  • 核心技术CT-RoPE和Neural ODE解决不规则采样难题。

  • 无需插值即可原生处理缺失值,鲁棒性强。

  • 零样本迁移能力超越部分全监督模型。

微软发布医疗时序基座模型:基于4540亿数据预训练,解决不规则采样难题精华内容

MIRA如何突破传统桎梏,精准捕捉生命的动态轨迹?其核心在于两项创新技术,分别解决了对历史和未来的建模难题。

医疗时序的挑战

通用深度学习模型通常基于“规则采样”的理想化假设,但真实医疗场景中的生命体征记录却呈现出“时疏时密”的特点。心跳以秒计,血压以小时计,血液指标可能数天才更新一次,这种多时间尺度交织、采样频率不规则的特性,是医疗AI落地应用的核心障碍。

传统方法为了强行对齐数据,常采用插值手段,但这不仅容易引入人为噪声,还可能丢失原始的时间动力学信息,属于典型的“削足适履”。

精准感知历史间隔

为了解决历史记录的时间间隔问题,MIRA提出了连续时间旋转位置编码(CT-RoPE)。它摒弃了传统模型用离散整数标记顺序的做法,直接将真实的连续时间戳代入计算。

这意味着模型能精准感知任意时间间隔的变化,理解两次记录之间是相隔1分钟还是10小时,从而更准确地把握病情发展的真实节奏。

推演未来连续轨迹

人体状态是连续流动的。MIRA引入神经常微分方程(Neural ODE)模块来模拟这种变化。它能基于离散的数据点,推导出符合生理逻辑的连续演化轨迹,仿佛在画出未来的曲线。

这一特性使其不仅能灵活预测任意目标时间点的状态,还能原生处理数据中的缺失值,无需依赖插值这类可能失真的预处理步骤,大大增强了对真实世界“脏数据”的适应能力。

实测表现与能力

在MIMIC-III等多个权威数据集上的评估表明,MIRA的表现超越了现有SOTA模型。其最突出的能力在于迁移性。

在未经特定数据训练的情况下,MIRA直接部署到全新医疗场景(分布外测试)的表现,甚至超越了部分专门训练的全监督模型。即便在数据极度稀疏(仅保留30%观测点)时,其性能依然稳健,证明了其学习到了生理信号变化的通用规律,而非单纯拟合特定数据。

MIRA的问世,是医疗AI迈向通用基座模型时代的关键一步。它不仅能推动ICU预警和慢病管理的发展,也让人不禁思考:一个能真正理解生命动态的AI助手,离我们还有多远?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章