AI资讯 / Agent

Agent / 分析

基因组语言模型如何重塑攻防格局

Latent Space

随着 AI 能力边界不断扩张,生物安全正成为继网络安全之后最受关注的风险领域。Radical Numerics 联合创始人兼 CEO Eric Nguyen 曾在斯坦福主导开发基因组语言模型 Evo 与 Evo 2,这些模型后来被用于从头生成可合成为功能性病毒的噬菌体基因组。他与团队现正将链式思维推理、长上下文建模和多模态感知引入基因组语言模型,使模型不仅能读写 DNA,还能理解 RNA、蛋白质乃至表观遗传学信息。核心实验表明,模型在仅见过低分 RNA 适体序列的情况下,能够自主延续优化轨迹并预测出未曾见过的高分序列——这正是 DNA 语言中的链式思维。Eric 坦言,当前防御方正在这场军备竞赛中落后,但他的判断是:唯有加速推进前沿能力,才能让防御跟上攻击的步伐。

生物安全正在成为 AI 时代最紧迫的双刃剑议题之一。Anthropic 的安全过滤系统将网络安全与生物学并列为最值得警惕的两大风险领域。Hugging Face 安全团队近期披露了一起前所未有的攻击事件,并明确指出防御能力必须与前沿模型的攻击能力同步演进。这一背景下,生物领域的攻防失衡问题被推到了聚光灯下。

Eric Nguyen 在斯坦福攻读生物工程与 AI 博士期间,长期无法说服生物学家相信基因组语言模型的价值。研究者们既不相信模型输出可被验证,也看不到超越现有工具的应用场景。但他坚持推进,最终参与主导了 Evo 和 Evo 2 的开发。这两个模型后来被 Arc Institute 与斯坦福的联合团队用于生成完整的噬菌体基因组,并成功合成为具有功能的病毒——这是基因组语言模型能力的里程碑式验证。

DNA 语言与自然语言存在本质差异:字母表极小,仅有 ACGT 四个字符,但序列极长,人类单个基因平均长达 6 万个字符,整个基因组约 30 亿。约三年前,长上下文模型的技术突破使处理如此长度的序列成为可能,这一进展早于主流前沿实验室构建百万级上下文窗口的时间节点。Radical Numerics 正是在这一技术基础上,将模型能力扩展至 RNA、蛋白质结构、表观遗传学及自然语言等多个模态。

团队的核心实验展示了基因组语言模型中的链式思维能力。研究者向模型展示一系列按分数递增排列的 RNA 适体序列,但刻意隐去最高分样本,随后让模型自主延续这一优化轨迹。结果显示,模型能够重现那些从未见过的高分序列——这意味着模型不仅在记忆模式,而是真正理解了序列与功能之间的内在关系,并具备在 DNA 语言中进行推理的能力。

Eric 直言,在当前的生物安全军备竞赛中,防御方正处于下风。相同的基因组语言模型既能被用于设计新型病原体,也能加速疫苗研发、病毒溯源与生物威胁识别。Radical Numerics 的核心论点是:不应因为担忧滥用而放缓前沿能力的开发,恰恰相反,只有持续推进模型边界,防御方才有机会在这场不对称竞赛中保持追赶态势。这一立场与网络安全领域开源防御工具的逻辑高度一致。

Radical Numerics 的创始团队汇聚了多位 AI 与生物交叉领域的顶尖研究者,包括前 Liquid AI 首席科学家 Michael Poli、曾师从 Yoshua Bengio 的 Stefano Massaroli,以及曾与 Chris Ré 合作的 Armin W. Thomas。团队的长期目标不仅是解决生物安全问题,更是通过多模态基因组语言模型,从基因组这一环境在 DNA 上留下的印记中,提取出对生命本身运作规律的深层理解。

要点

  • 基因组语言模型已能从头生成可合成为功能性病毒的完整噬菌体基因组,攻击能力的技术门槛正在快速降低
  • 长上下文建模是基因组语言模型的关键基础设施,DNA 序列的极端长度曾是该领域发展的核心瓶颈
  • 链式思维推理可在 DNA 语言中实现:模型能够在未见过高分样本的情况下,自主推断并生成更优序列
  • Radical Numerics 认为加速推进前沿能力是防御方保持竞争力的唯一路径,而非放缓研发
  • 多模态感知使基因组语言模型能够跨越 DNA、RNA、蛋白质结构与自然语言,形成统一的生物智能理解框架
查看原始来源

原始标题:🔬Bio-security is an AI Arms Race - Eric Nguyen (CEO, Radical Numerics)

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。