当AI能随手设计出前所未有的蛋白质序列时,传统生物安全防线突然出现了一个大窟窿。过去,DNA合成公司收到陌生序列,可以默认它大概率是自然界里还没被发现的东西;但现在,AI能生成和已知威胁毫无相似度的全新序列,筛查人员再也不敢做这个假设。更棘手的是,不少AI生成的3D结构图被错误标注后上传到公共数据库,正在悄悄污染下游研究的判断。这就是Google DeepMind推出SynthID Bio的动机——把水印技术直接写进生物代码里,让AI生成的蛋白质在物理世界也能被识别出来,而且不破坏它的生物学功能。

SynthID Bio是个水印方法家族,针对不同类型的数据采用不同策略。对蛋白质序列,它会在生成时微妙地影响氨基酸的选择;对预测的3D结构,它会调整原子坐标。这些改动小到几乎不可察觉,却能形成一个可靠的检测信号。关键问题是:这样的改动会不会毁掉蛋白质的功能?实验室测试给了积极答案——针对三个靶蛋白(VEGF-A、SARS-CoV-2的刺突蛋白RBD、PD-L1),加了水印的蛋白结合物和未加印的版本在命中率、结合亲和力、天然序列多样性上完全持平,首次实现了带水印且生物功能正常的蛋白质结合物。这里的"蛋白结合物"指的是专门设计来精准附着到其他蛋白质上的分子,是药物研发里重要的工具。

对于蛋白质折叠预测,SynthID Bio走了另一条路:对AlphaFold 3的扩散网络做微调,把水印能力直接嵌进模型权重。这样无论谁运行这个模型,输出的3D坐标天然携带可检测的签名。实验表明,它几乎无损预测准确率,检测近乎完美,还能抵御数字噪声和轻微的坐标扰动。扩散网络这里可以理解为生成3D结构时逐步去噪的神经网络,是AlphaFold 3的核心组件之一。

为什么这件事重要?因为它给生物安全加了一个关键验证层。生物安全的防御模型常被比作"瑞士奶酪"——多层独立防护互相弥补盲区,但每一层都有透光的洞。模型层面的缓解措施、客户背景审查都是必要的,但都可能被绕过。SynthID Bio直接嵌入生物设计本身,让合成DNA筛查从"人工比对已知威胁库"变成"自动化验证来源"。合成DNA提供商Twist Bioscience的副总裁James Diggans评价,水印能加强筛查、把资源集中在真正需要深查的序列上,让生物安全更高效。同时,对于Protein Data Bank、UniProt、GenBank这些公共数据库,水印也能在提交时标记合成条目,防止AI生成数据污染科研结论。

最让我意外的是,这个思路已经延伸到基因组层面。Google DeepMind和斯坦福Hie实验室、Arc Institute合作,把SynthID Bio集成进了先进的基因组模型Evo 2,给Evo 2设计的噬菌体基因组打上水印,并且在细菌培养中验证了这些水印噬菌体仍然有功能。噬菌体就是专门感染细菌的病毒,在基因治疗和抗菌领域潜力巨大。他们计划很快发布技术论文。

从工程角度看,SynthID Bio现在开源了方法和体外实验数据,也发布了模型权重,这意味着任何研究机构都能复现和继续迭代。未来挑战主要是提高水印对抗蓄意篡改的鲁棒性,以及和类似C2PA(数字媒体溯源标准)那样的元数据方案配合使用。如果你在做AI驱动的生物设计、合成生物学平台,或者维护公共数据提交管道,这个思路可以借鉴——在生成阶段嵌入不可见的身份信息,为下游检测提供自动化信号。一个需要注意的坑是:水印的鲁棒性和功能的平衡很微妙,必须像论文里那样做充分的湿实验验证,光看计算模拟是不够的。

阅读原文 → 返回 AI 技术文档

内容与图片版权归原作者所有 · 原文: https://deepmind.google/blog/introducing-synthid-bio/