要读文献|Nature|谷歌 DeepMind 已经开始给蛋白质打水印了|长篇大论·精解版
发布时间:2026/10/9 11:33:14 锦皓数字建站

现在AI不仅能预测蛋白质结构也能设计新的蛋白质序列啦那一段序列或一个结构文件到了我们手里怎样判断它经过了什么生成流程呢如果把来源标记直接放进蛋白本身会不会又影响它原本要完成的任务呢2026年9月30日Google DeepMind的Pushmeet Kohli团队等在Nature发表“Function-preserving watermarking of AI-generated proteins”提出SynthIDBio探索序列和三维结构两条水印路线分别给AI生成的蛋白质序列和生物分子结构加入可检测水印。这篇研究把两个问题放在一起一边检查水印能不能被认出来一边检查蛋白质在当前测试的任务中是否保留相近表现。那我们就沿着这两条线继续往下看吧原文链接Function-preserving watermarking of AI-generated proteins另想快速了解这篇文章最最最最最核心内容的小伙伴们可以先去看一下要读文献Nature谷歌 DeepMind 已经开始给蛋白质打水印了大道至简·精简版 哟想了解更多细节的话咱们再回来这边哈哈哈哈哈哈本文目录索引如下0 太长不看版1 AI蛋白的来源追踪问题2 ProteinMPNN中的序列水印3 已知结合骨架上的实验验证4 检出率、候选筛选与后续处理5 AF3兼容模型中的结构水印6 结构质量、检出率与局部几何总结与展望如果小伙伴们有需求的话可以加入我们的交流群一定要知道 | 永久免费的环境友好型生信学习交流群又双叒叕来啦| 伴随不定期群友好物分享在这里你可以稍有克制地畅所欲言超级建议大家在入群前或入群后可以看一下这个干货满满 | 给生信小白的入门小建议 | 掏心掏肺版绝对干货满满让你不虚此看如果有需要个性化定制分析服务的小伙伴可以看看这里你要的个性化生信分析服务今天正式开启啦定制你的专属解决方案全程1v1答疑绝对包你满意0 太长不看版想先看重点的小伙伴我们先用两段话把SynthIDBio的两套并行方法捋一下序列路线在ProteinMPNN采样氨基酸时加入水印。研究从三个靶标的已知结合骨架出发重新生成有水印和无水印序列再用表面等离子体共振测量结合。水印组与无水印组的总体亲和力分布没有发现显著差异但一个较宽松亲和力阈值下non-distortionary 0.5组的命中率较低。这个结果更适合概括为“所测结合表现总体相近”而不是“所有指标完全没有代价”。结构路线微调AF3兼容模型使生成坐标带有可检测的几何统计特征。推荐的小噪声设置保留了与基线相近的LDDT和TM-score在0.1%假阳性率下检出率超过99.8%。这一分支验证的是结构预测质量与检测表现没有给每个结构重新做生物功能实验。1 AI蛋白的来源追踪问题大家可能会想到文件名、设计记录和数据库不都能保存来源信息嘛问题是这些信息可能与实际对象分离。文件说明会被删除数据库检索还要面对规模、隐私和知识产权问题。水印换了一个位置它让生成结果本身带有统计特征再由掌握相应检测方式的一方识别。蛋白质的难点在于来源标记不能脱离功能来评价。文本换一个词句子也许仍然通顺蛋白质换一个氨基酸却可能改变折叠、界面或稳定性。水印能被检测出来是一件事蛋白质在当前任务里还能不能用是另一件事。研究因此分成两条线SynthIDBio-sequence处理氨基酸序列并用结合实验检验所测功能SynthIDBio-structure处理三维原子坐标并比较结构预测质量。这两套方法有共同的来源追踪目标但使用不同模型、不同样本和不同验证终点。2 ProteinMPNN中的序列水印我们先从序列这条线看起。研究从已有蛋白质骨架出发让ProteinMPNN为骨架选择氨基酸。水印并不是在生成结束后拼接一段固定标签而是在逐个采样氨基酸时加入带密钥的选择偏向图1a。小小知识要知道骨架和序列分别是什么刚接触蛋白设计的小伙伴我们先把这两个词分清楚氨基酸序列amino acid sequence记录每个位置是什么氨基酸蛋白质骨架protein backbone描述主链的三维形状。ProteinMPNN在骨架等条件下设计序列因此同一个骨架可以产生多条不同序列。后文的序列数、骨架数和技术重复是三个不同的统计单位。SynthIDBio-sequence沿用SynthID-text中的tournament sampling。简单理解模型在候选氨基酸之间做带密钥的“比赛”更偏向选择符合水印评分的候选。检测时再用对应密钥计算整条序列的平均g-value分数越符合水印模式越可能被检测器识别。图1a在ProteinMPNN采样过程中加入序列水印原文 Fig. 1a大家可以沿着图1a从左往右看骨架生成、ProteinMPNN序列采样后面还有AF3指标筛选和水印阈值筛选。水印信号分散在多个位置的选择中检测器综合整条序列的信息不是搜索某个固定片段。研究比较了两种水印思路。non-distortionary设置强调在相应数学条件下保持平均采样分布distortionary设置主动加强偏向提高低温度采样时的水印信号。小小知识要知道non-distortionary描述的是分布non-distortionary可以理解为“分布不扭曲”。它讨论的是对密钥等随机性取平均后的采样分布并没有直接承诺每条序列相同也没有直接回答蛋白质功能。功能是否保留仍要靠相应实验。采样温度控制模型选择的随机程度。低温度时模型更集中于少数高概率氨基酸水印可利用的选择空间也更小。湿实验最终比较无水印0.1、non-distortionary 0.5和distortionary 0.1三种设置。这里的“温度”是模型参数和培养箱温度没有关系哈3 已知结合骨架上的实验验证有了序列我们最关心的问题就来了加入水印后结合蛋白还能不能识别原来的靶标呢实验选择SARS-CoV-2受体结合域SC2RBD、血管内皮生长因子AVEGF-A和程序性死亡配体1PD-L1三个靶标。每个靶标取15个已经有结合证据的AlphaProteo骨架再用ProteinMPNN重新设计序列。每个骨架安排18个设计1条既有亲本序列、5条无水印序列、两种水印设置各6条序列每个靶标另用3条阴性对照替换相应设计。扣除对照后三个靶标合计包含222条无水印序列以及两种水印设置各267条序列。这套设计有一个清楚的取舍。已知结合骨架让实验更容易获得可比较的亲和力数据适合检验“重新设计序列时加入水印”会带来什么变化相应地结论也落在这些已知骨架和结合任务上。图2a–b结合亲和力与不同阈值下的命中比例原文 Fig. 2a–b小小知识要知道K_D越小结合通常越强研究用表面等离子体共振surface plasmon resonanceSPR测量结合并估计解离常数dissociation constantK_D。在可比较的测定条件下K_D越小通常表示结合越强。大家看图2a的纵轴这里用的是对数刻度我们要按数量级读数哟亲和力比较只纳入能获得稳定动力学拟合和可定量K_D的设计各分组n为43–69每个设计的数值来自至少两次技术重复的平均。水印组与无水印组的总体亲和力分布没有发现显著差异比较使用双侧Wilcoxon秩和检验图2a。SC2RBD中两种水印设置之间出现局部差异distortionary 0.1组的中位K_D更低。接着我们换个问法有多少设计达到了给定的亲和力阈值呢在K_D≤10⁻⁷ M时组间没有显著差异阈值放宽到K_D≤10⁻⁶ M时non-distortionary 0.5组的命中率低于无水印组Fisher精确检验显示差异显著图2b。把这两项比较放在一起我们就能更完整地理解结果啦水印组在所测总体亲和力分布上与无水印组相近同时一个命中率阈值显示了设计代价。方法部分还提到部分被归为binder的设计因为信号弱、表达量低或动力学太快无法稳定估计K_D因此“没有K_D”不能简单归为“不结合”。结合表现看过了那水印信号到底散布在序列的哪些位置呢我们再把序列和结构放到一起看看吧图2c多条序列中的局部水印分数原文 Fig. 2c水印信号散布在多个氨基酸位置不是只集中在序列末端或某个固定motif图2c。这里大家对照颜色就能看各位置的局部g-value。图2d–e结构映射与骨架对背景分数的影响原文 Fig. 2d–e把局部分数映射到预测结构后不同二级结构区域都能看到水印信号图2d。右侧按PD-L1结合蛋白的骨架分组即使没有水印不同骨架的g-value背景分布也不完全相同图2e。骨架会限制哪些氨基酸更适合检测阈值因此需要在合适的背景中校准。进入湿实验的水印设计已经通过g-value筛选。在0.1% FPR工作点下这批设计均被检出。大家读到100%时要一起带上“经过筛选的实验样本”这个条件。那如果先不筛选直接检查生成输出效果又会怎样呢下面的大规模计算评估就能帮我们回答这个问题4 检出率、候选筛选与后续处理研究把计算评估扩大到23个靶标每个靶标生成10,000个样本。一项比较不增加g-value筛选检查不同采样设置下的真正例率图3a另一项加入水印阈值观察候选通过率的变化图3b。我们把“检出多少”和“留下多少”放在一起看筛选的代价就更清楚啦图3a–b水印检出率与候选通过率原文 Fig. 3a–b提高non-distortionary采样温度或采用更强的distortionary设置通常可以提高检出率FPR越严格同一设置下的TPR也可能下降图3a。经过g-value筛选以后低分候选会被淘汰。最终保留下来的设计更容易检出但可进入后续结构验证的候选数量也减少图3b。想得到同样数量的成品前面就可能要多生成一些候选呀小小知识要知道TPR和FPR的分母不同真正例率true positive rateTPR回答“有水印的对象中有多少被正确识别”假阳性率false positive rateFPR回答“没有相应水印的对象中有多少被误报”。FPR0.1%不是阳性结果出错概率的直接表达实际解释还与检测背景和水印对象占比有关。研究认为在这套设计流程里可以先做较便宜的水印分数筛选再把通过的候选送入成本更高的AF3结构验证因此新增实际计算开销较小。我们顺着这个顺序想一想就容易理解了昂贵的验证只需要处理留下的候选嘛。正文和图3b对一个通过率下降数字存在不一致原文还把“变为1.715倍”写成了“增加171.5%”。这里我们先抓住筛选与候选需求之间的关系不采用有冲突的单个数值。图3c–d预测指标与后续处理后的表现原文 Fig. 3c–d多数设置下水印与无水印设计的AF3置信度分布接近较强的distortionary设置变化更明显图3c。置信度用于筛查计算设计它和前面的SPR结合实验回答不同问题。用无水印ProteinMPNN重新设计序列后水印可以被有效削弱或移除相应设计的估计命中率也会下降图3d。这里展示的是结合本研究与历史AlphaProteo数据得到的计算估计并非把所有重新设计结果逐一送去做SPR。正文与图中VEGF-A的一项估计值也不一致因此我们只保留稳妥结论序列水印可以被后续处理破坏而去除过程可能伴随设计代价。5 AF3兼容模型中的结构水印序列这条线看完了我们再转到三维结构吧这条路线处理的是原子坐标研究固定AF3的network trunk微调扩散模块的输出部分和置信度模块同时训练一个受PointNet启发的检测器图1b。图1b结构预测模型与水印检测器的联合训练原文 Fig. 1b扩散模块从噪声开始逐步生成原子坐标。检测器读取残基内部的原子距离和连续原子的扭转角再把各残基的信息汇总成整个结构的判断。训练目标同时包含原有扩散损失和水印检测损失水印损失权重为0.1。这套检测器使用内部几何关系因此结构整体平移或旋转时输入特征基本不变。训练还会给坐标加入s0.001、0.01或0.1 Å的均匀噪声帮助水印耐受常见文件格式对坐标小数位的舍入。研究使用256张A100 GPU微调约一天推荐的模型为s0.001设置。文中提到推理阶段没有额外开销因为水印已经进入模型权重不需要每次预测后再运行一个独立嵌入步骤。大家把训练和预测分开看就好前期微调本身仍然需要计算资源。6 结构质量、检出率与局部几何结构水印也有几件事需要我们一起看预测质量保持得怎么样检测器能不能识别如果只剩一个短片段信号还在不在呢图4a结构预测质量、检测性能与长度依赖原文 Fig. 4a推荐的s0.001模型与AF3基线相比LDDT和TM-score没有下降更大的训练噪声则出现小幅质量降低图4a左。大家读这两个指标时可以这样区分LDDT侧重局部距离关系TM-score侧重整体结构相似程度。在FPR0.1%时三个模型的TPR都超过99.8%把FPR收紧到0.01%后s0.001模型的TPR为98.99%图4a中及正文。我们读检出率时也要把对应的假阳性率一起带上哟短片段更难检测小于16个残基或相应链长度时检出率较低长度达到32–48及以上后TPR很快超过99%图4a右。这里分别列出完整结构、蛋白质、RNA和DNA统计单位随链类型而变。小小知识要知道结构相似指标回答什么LDDT和TM-score帮助判断预测结构与参考结构有多相似。它们适合评价结构质量却不会自动告诉我们酶活性、细胞内作用或其他具体功能是否保持。结构路线的“function-preserving”证据主要落在这些结构质量指标上。整体结构指标相近那局部的距离和角度又变了多少呢我们再往细处看看图4b局部原子距离和角度分布原文 Fig. 4b对1,000个结构的分析发现水印模型与AF3、实验结构的局部几何分布并非完全重合图4b。这里展示一个原子距离和两个角度特征都是研究特意挑选的变化较明显案例。文中同时提到大多数原子距离、扭转角和键角仍然得到保留s0.001模型尤其如此。这组结果把“整体结构质量相近”说得更具体全局和局部指标总体保持同时水印在某些几何统计中留下可检测偏移。右侧图注所写残基名称与原子命名存在疑点本文保留原图不继续推断该残基的化学机制。在鲁棒性方面0.01 Å高斯噪声对检测影响较小0.1 Å噪声会破坏较小s模型的水印。受约束的结构弛豫也能够破坏水印。它对平移、旋转和一部分小扰动稳健但并不是永久不会消失的标记。总结与展望读到这里大家应该能看出这项研究很有意思的一个地方它把来源追踪和蛋白质任务放进了同一套评价中。序列分支不只看g-value还测量真实结合结构分支不只看检测率还比较LDDT、TM-score和局部几何。这样我们才能知道水印的识别效果是以什么代价换来的。目前的证据支持一个清楚的可行性结论在三个靶标的已知结合骨架上序列水印总体保留了所测结合表现在AF3兼容模型的评估集上推荐结构模型保留了相近结构质量并实现很高的检出率。命中率阈值、候选筛选、短片段和局部几何结果也说明这种兼顾仍然有适用条件。如果有小伙伴想把这种思路用到自己的任务里我们还得再往前想一步自己最在意的功能有没有被测到呢酶活性、细胞内功能、稳定性、更多结构敏感任务和其他设计平台都需要按实际用途补证据。部署中的背景校准、密钥管理、结果复核和行业标准同样决定水印能不能成为可靠的来源证据。所以我们可以把SynthIDBio看成AI生物设计来源追踪的一种工具。检出相应水印能够支持对象与特定生成流程有关没有检出可能来自自然对象、其他模型也可能是水印在后续处理时减弱。水印解决的是“来自哪里”的一部分问题安全性和功能仍要由各自的证据来回答。文末碎碎念那今天的分享就到这里啦我们下期再见哟最后顺便给自己推荐一下嘿嘿嘿如果我的分享对你有用的话欢迎关注点赞在看转发分享阿巴阿巴阿巴阿巴巴巴这可是我的第一原动力蟹蟹你们的喜欢和支持参考资料Stutz D, Cowen-Rivers AI, Ortiz-Jimenez G, et al. Function-preserving watermarking of AI-generated proteins.Nature(2026). DOI: 10.1038/s41586-026-10965-y
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。