Dynbench: 蛋白构象动力学研究, 构象集合效果好不等于动力学预测强


Code 蛋白质 动力学模拟 构象动力学 时序分析

参考:https://github.com/kkkniengLiu/dynbench

整个benchmark的亮点在于:模型能复现蛋白构象集合 ≠ 学到了真实的时序动力学

Dynbench 简要解析

定位:蛋白构象动力学的度量校准基准框架,不是生成模型,也不是单一评价指标,而是一套完整评测协议。

  1. 评分逻辑 打分不是单纯看数值高低,要对照两个基准:去掉目标样本得到的基线floor + 指标专属经验参考标尺(不是理论上限):

    • 时间弛豫类指标:用奥恩斯坦-乌伦贝克(Ornstein-Uhlenbeck)过程做参考;
    • 跃迁/首次通过时间类指标:用预留独立分子动力学(MD)轨迹作为参考。 额外增加几何与波动约束校验(guardrails);并且区分任务类型:无序构象集合模型,不会因为缺少时序信息被判时序任务失败。
  2. 核心结论 对平衡态构象做独立同分布重采样(i.i.d. resample):构象集合评测通过率高达0.99,但动力学时序通过率是0。 预留MD副本:构象集合通过率0.95。

    关键点:模型能复现蛋白构象集合 ≠ 学到了真实的时序动力学。

  3. Lockbox-36 测试集(前瞻性盲盒测试) 36个蛋白的独立盲盒数据集,依然保持参考标尺和基线之间的差距;并且两个可评测时序模型在Lockbox上的排名,和它们在ATLAS-82上的排名颠倒。 说明:评测结果本身是稳定可复现的,但不存在放之四海而皆准的全局模型排名。

一句话总结:Dynbench用来区分两件事——模型能不能还原蛋白静态构象集合、能不能还原随时间演化的动力学;证明了构象集合效果好不等于动力学预测强,模型排名会随测试集变化,不能简单排一个固定名次。