跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

三百次实验室测量,就能改善虚拟筛选

用少量活性标签微调 Boltz-2 的亲和力头,早期富集效果更好;重打分只需覆盖排名前百分之十的候选物。

科学新闻郑雪莉发布: 2026年9月22日5 分钟阅读资料来源 2
三百次实验室测量,就能改善虚拟筛选

虚拟筛选要做的事,是从庞大的化合物库里挑出值得送进实验室测试的那些。实验预算有限,真正要紧的不是把整个库分类分得多准,而是有活性的分子多早出现在排序靠前的位置。日本作者的一项工作检验了 Boltz-2 能否借助某个具体测试的几十到几百次测量,为这件事做好准备。

多少数据就够

作者微调了 Boltz-2 的亲和力头,给模型 40 到 300 个二元活性标签,在 MF-PCBA 数据集的八个靶点上做回顾性评估。用 300 次测量时,排名前百分之一里的活性化合物数量相对未微调版本平均几何增长 1.77 倍,平均精度提高 2.14 倍。这个结果取决于靶点,也取决于训练集是怎么挑的。作者把它当作一个信号,而不是一条规律。

第二个实验关心的是算力成本。研究者没有用微调后的头把全部候选物重新打分,而是把重打分限制在 Boltz-2 评分最高的约百分之十的候选物上。这样收窄之后,命中回收率与全量重打分相当。实际结论很简单:如果模型对粗尺度已经有不错的判断,只需要把列表末端再修一修。

作者自己也说明,这项研究是回顾性的:标签来自现成的数据集,而不是新的实验。这些数字描述的是方法在已知数据上的表现,不是它在未知实验室里的效力。不过实际结论仍然有用:不必用几万次测量从零训练模型,只要在一个项目预算能负担的数据集上微调亲和力头,就能在候选物排序上获益。

蛋白质组学里的数据处理

测量这一侧也在推进。另一项工作提出了 ProteoEM,一个 Python 开源库,根据单分子亲和力痕迹估计蛋白质和蛋白变体的丰度。问题在于,探针结合不完美、不特异,一条痕迹可能对应好几种鉴定结果。作者没有把痕迹指派给单一候选物,而是在期望最大化框架里按权重分摊这种不确定性,并使用预先校准的探针响应指标。对于无法区分的蛋白变体,模型把它们报告为分组,而不是强行做出任意的选择。

两种思路有一个共同点:在生物医学研究里,有价值的不是抽象的准确率,而是模型的判断如何影响实验室里接下来那一步昂贵的操作。所以在评估模型时,开始被看重的不是整个数据集上的平均质量,而是在那个真正要紧的狭窄窗口里完成的工作。

评论 0

资料来源

2
  1. 01Adapting Boltz-2 with limited experimental activity data improves early enrichment in virtual screeningEN
  2. 02ProteoEM: probabilistic protein abundance estimation from iterative affinity tracesEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

郑雪莉

郑雪莉

科学与健康

郑雪莉负责FLASH24科学与健康版块,日常从论文预印本、期刊官网和机构通报中抓取信息,只盯数据来源和实验设计是否站得住。她习惯把每项统计数字与原始数据集交叉比对,遇到百分比先算清分母再决定是否采用。她常联系一线研究人员核实细节,也会在日历上标记大型队列研究的发布节点,提前比对不同团队的结果。私下她学材料物理,还自己架望远镜观测,这让她对测量误差和观测条件格外敏感。她有一条硬规矩:样本量、利益冲突或方法说明缺一项,稿子就不发。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。