跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

床旁人工智能:心脏、想象言语与CT校准

三项研究显示,医疗人工智能模型在哪些方面已经拿出结果,在哪些方面还需要谨慎权衡:心力衰竭远程监测、从脑电图解码想象言语,以及黑箱放射系统的校准。

科学分析郑雪莉发布: 2026年9月25日6 分钟阅读资料来源 3
床旁人工智能:心脏、想象言语与CT校准

心力衰竭给医疗系统出了难题。患者年龄偏大,合并症多,常常住院。远程监测有望更早发现病情恶化,但这类数据稀疏,采样不规律,绝大多数记录里没有发生事件。

从远程监测数据中检测病情恶化

TRACER模型正是为这类数据设计的,全称是带有事件对比表征的Transformer。它把三样东西结合起来:考虑时间因素的生物标志物嵌入、强化异常检测的对比预训练,以及针对各个检测目标的独立二分类器。研究团队用了276名心力衰竭患者的远程测量序列,按时间规则切成相互重叠的时间窗,再根据窗口末端的住院情况打标签。数据集来自真实场景,高度不平衡。模型正确预测了66.7%的导致心力衰竭住院的路径,高估率为7.9%。把训练改成事件检测任务后,结果比直接在预测窗口上训练更好,稀少的事件也因此得到更充分的利用。作者强调,目标是生成警报,为早期干预争取时间,而不是取代临床决策。

想象言语与诚实的评估

从脑电图解码想象言语,被视为重度运动障碍患者的一条沟通途径。问题在于,已报告的结果往往基于某些评估方案,而这些方案并不能反映模型对新个体的泛化能力。丹麦的Frederik Møllskov Trier团队做了一项透明的基线研究,用的是多类别想象言语脑电图数据集,评估方案严格做到跨被试独立。

研究比较了两条处理和特征提取流程:一条用时域统计特征,另一条用频谱各频段的功率。后一条路径在样本层面的平均准确率明显更高,跨被试粗分类中为49.03正负4.18%,前一条为37.97正负3.79%。前向特征选择显示,大部分判别信息集中在有限的几个频段上。作者把这看作进一步开发脑机接口的可靠基础,而不是现成的产品。

当模型是黑箱时如何进行校准

第三项研究涉及放射系统的安全性。分诊、后续检查或治疗计划的决策要安全,模型返回的概率就必须经过校准,也就是反映真实风险。常见的校准改进技术,比如蒙特卡洛dropout或深度集成,需要访问模型参数或重新训练,而商业临床系统是黑箱。

所提出的框架不依赖具体模型。它利用有临床依据的测试集扩充,对三维计算机断层扫描施加几何扰动和受物理启发的扰动,在不访问模型内部、也拿不到训练数据的情况下学习概率聚合策略。在肺栓塞和脑内出血检测任务中,DualTTA变体在测试集扩充方法里校准最好,把期望校准误差降低54%(从0.239降至0.109)和43%(从0.051降至0.029)。在多数指标上,它还超过了需要访问模型内部的技术,比如温度缩放、蒙特卡洛dropout和深度集成。

三项研究共同划出一条实际边界:一边是模型能在真实、稀少且不规律的数据上发挥作用的地方,另一边是价值不来自新模型、而来自诚实评估和校准的地方。

评论 0

资料来源

3
  1. 01TRACER: AI-based detection of worsening heart failure from telemonitoring dataEN
  2. 02Decoding Imagined Speech: A Strictly Subject-Independent Approach Using EEGEN
  3. 03Improving Calibration of Black-Box Radiology AI with Test-Time AugmentationEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

郑雪莉

郑雪莉

科学与健康

郑雪莉负责FLASH24科学与健康版块,日常从论文预印本、期刊官网和机构通报中抓取信息,只盯数据来源和实验设计是否站得住。她习惯把每项统计数字与原始数据集交叉比对,遇到百分比先算清分母再决定是否采用。她常联系一线研究人员核实细节,也会在日历上标记大型队列研究的发布节点,提前比对不同团队的结果。私下她学材料物理,还自己架望远镜观测,这让她对测量误差和观测条件格外敏感。她有一条硬规矩:样本量、利益冲突或方法说明缺一项,稿子就不发。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。