当前大语言模型正从“聊天机器”进化为能调用工具、规划任务的“智能体”,这种进化在生物信息学、实验设计等领域展现出巨大潜力,除此之外,需要正视一个关键问题:当AI的能力从信息处理延伸到物理实验操作,生物安全的边界会发生怎样的改变?
近日,智源研究院大模型安全研究团队与北京大学围绕这一核心问题,开展了一项端到端系统性评估。该评估考察大语言模型智能体是否会降低非专业人员绕过DNA合成筛查的知识门槛,评估从智能体生成方案、程序化计算校验延伸到标准分子生物学实验室中的受控湿实验,并以电泳和测序确认模型方案在物理层面的可执行性。
评估结果显示,所有11个参与测试模型均能生成通过计算校验的DNA分片方案,其中GPT-5.5和Claude Opus4.6还能提供详细的逐步实验指导。在物理验证环节,4个良性代理构建体全部成功完成组装。这意味着,大语言模型智能体不仅可能削弱现有DNA合成筛查防线,还可能向不具备专业背景的用户提供原本依赖专业训练才能获得的实验操作知识,存在相关双重用途风险,需要被系统性地评估与提前防范。
基于研究结果,围绕生物安全的协同防线需从四个层面同步构建。
在模型层面,部署前进行能力评估,开发者应将高风险生物安全任务能力纳入部署前的系统评估,针对生物威胁序列与组装查询等建立专门检测与防护机制。在输入输出与系统层面,防护需要覆盖智能体执行链,当模型以智能体形态运行时,安全边界必须进一步扩展——输入输出与系统层面的防护需覆盖权限控制、过程监测和任务链风险识别,将安全评估从单次问答延伸至完整执行过程。在筛查层面,提升合成筛查鲁棒性,现有机制需增强对AI辅助分片策略的识别能力,推动ISO20688等国际标准落地,发展兼顾隐私与安全的筛查方案并加强信息共享。在政策与协同层面,需要形成标准化治理框架,AI生物安全风险具有跨国界特征,需要将政府、模型开发者与生命科学社区的专业经验纳入统一的协同治理框架。
