床旁人工智能:心脏、想象言语与CT校准
三项研究显示,医疗人工智能模型在哪些方面已经拿出结果,在哪些方面还需要谨慎权衡:心力衰竭远程监测、从脑电图解码想象言语,以及黑箱放射系统的校准。

心力衰竭给医疗系统出了难题。患者年龄偏大,合并症多,常常住院。远程监测有望更早发现病情恶化,但这类数据稀疏,采样不规律,绝大多数记录里没有发生事件。
从远程监测数据中检测病情恶化
TRACER模型正是为这类数据设计的,全称是带有事件对比表征的Transformer。它把三样东西结合起来:考虑时间因素的生物标志物嵌入、强化异常检测的对比预训练,以及针对各个检测目标的独立二分类器。研究团队用了276名心力衰竭患者的远程测量序列,按时间规则切成相互重叠的时间窗,再根据窗口末端的住院情况打标签。数据集来自真实场景,高度不平衡。模型正确预测了66.7%的导致心力衰竭住院的路径,高估率为7.9%。把训练改成事件检测任务后,结果比直接在预测窗口上训练更好,稀少的事件也因此得到更充分的利用。作者强调,目标是生成警报,为早期干预争取时间,而不是取代临床决策。
想象言语与诚实的评估
从脑电图解码想象言语,被视为重度运动障碍患者的一条沟通途径。问题在于,已报告的结果往往基于某些评估方案,而这些方案并不能反映模型对新个体的泛化能力。丹麦的Frederik Møllskov Trier团队做了一项透明的基线研究,用的是多类别想象言语脑电图数据集,评估方案严格做到跨被试独立。
研究比较了两条处理和特征提取流程:一条用时域统计特征,另一条用频谱各频段的功率。后一条路径在样本层面的平均准确率明显更高,跨被试粗分类中为49.03正负4.18%,前一条为37.97正负3.79%。前向特征选择显示,大部分判别信息集中在有限的几个频段上。作者把这看作进一步开发脑机接口的可靠基础,而不是现成的产品。
当模型是黑箱时如何进行校准
第三项研究涉及放射系统的安全性。分诊、后续检查或治疗计划的决策要安全,模型返回的概率就必须经过校准,也就是反映真实风险。常见的校准改进技术,比如蒙特卡洛dropout或深度集成,需要访问模型参数或重新训练,而商业临床系统是黑箱。
所提出的框架不依赖具体模型。它利用有临床依据的测试集扩充,对三维计算机断层扫描施加几何扰动和受物理启发的扰动,在不访问模型内部、也拿不到训练数据的情况下学习概率聚合策略。在肺栓塞和脑内出血检测任务中,DualTTA变体在测试集扩充方法里校准最好,把期望校准误差降低54%(从0.239降至0.109)和43%(从0.051降至0.029)。在多数指标上,它还超过了需要访问模型内部的技术,比如温度缩放、蒙特卡洛dropout和深度集成。
三项研究共同划出一条实际边界:一边是模型能在真实、稀少且不规律的数据上发挥作用的地方,另一边是价值不来自新模型、而来自诚实评估和校准的地方。
资料来源
3- 01TRACER: AI-based detection of worsening heart failure from telemonitoring dataEN
- 02Decoding Imagined Speech: A Strictly Subject-Independent Approach Using EEGEN
- 03Improving Calibration of Black-Box Radiology AI with Test-Time AugmentationEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。