忘掉自动驾驶式实验室吧。要让科研用AI发挥价值,人类必须始终掌握主导权,设定研究目标、约束条件、风险管控规则并解读实验结果。[Maite Mueller/盖蒂图片社]
AI既非圣人也非恶魔,更不应取代人类科学家。随着AI在实验与工艺流程的设计、执行、分析环节承担更多职责,科学家们已形成共识:即便性能最优的AI也需要人类监督。
当前的核心问题是需要何等程度的监督,以及AI交互内容是否需要、需要在多大程度上被记录并纳入监管申报文件。
丛乐博士,斯坦福大学副教授,LabOS与MedOS联合创始人
斯坦福大学副教授、LabOS与MedOS联合创始人丛乐博士指出,尽管人们常将未来实验室构想为自动驾驶式实验室,但这实际上是错误的方向。他与AI及生物制药行业的领军者认为,科研AI的未来发展方向应是人类主导下的智能体AI(agentic AI)。
他表示:“我们认为当前有一个积极的发展趋势,即AI的应用以人类为核心,而非构建自动驾驶式实验室。”在这一模式下,AI仅仅是一种工具——尽管是功能强大、具备适配能力的工具,只要科学家给出正确的指令即可对其进行管控。
人类主导模式
丛乐及其合作者在近期发表的论文中写道:“当前,科学研究的大部分流程仍无法由机器独立完成。”尽管已经实现了自动化且有一定AI应用,“科学发现仍处于碎片化状态”。具体而言,AI缺乏人类科学家与生俱来的隐性知识、动态更新的实验背景信息、人工观测能力以及适应性决策能力。
因此,人类的参与不仅是为了监督AI相关活动、核验输出结果,更是为了提出正确的科学问题,并确保分析结果符合研究场景的逻辑。具体而言,他提出的科研运行模式为:AI负责实验的执行环节,而科学家需承担以下职责:
- 设定研究目标
- 解读实验结果
- 明确约束条件
- 管控研究风险
丛乐提出疑问:“如果AI可以解读所有内容,它就会开始生成虚假内容,不是吗?我们已经看到过这类情况:AI为了返回结果会进行臆测,提供根本不存在的引用文献。实验室中有特定的工作适合AI来完成。”
但正如去年夏天的AI沙箱逃逸事件所显示的,AI需要明确的规则指引,限定其可执行的操作、可访问的信息范围,以及响应需求时的自主权限。
例如,他建议在指令中加入以下表述:“任何未在实验方案中明确说明的操作都需要获得人类批准。”这种默认交由人类判断的规则同样适用于评估特定操作(如人类基因编辑)的相关风险。丛乐指出,在这些防护规则的约束下,智能体AI可以自主完成“常规实验执行,以及跨模型、跨仪器、跨实验方案、跨实验室状态的协调工作”。
丛乐将科研场景下的AI应用类比为自动驾驶汽车:根据美国公路安全保险研究所的数据,在相同行驶环境下,自动驾驶汽车每英里的碰撞率比人类驾驶员低68%。基于这些统计数据,他补充道:“我的观点是要把人类的职责提升到设定目的地的层面,我们不需要人类始终负责驾驶操作。”
在高校科研实验室中,这种模式意味着只需配备一名首席研究员(PI)和受训人员,无需保留现有的大部分层级架构。在企业场景下,管理层级会被扁平化,仅保留负责提出实验设想、设计、执行、解读实验的科学家,以及一名实验室管理员。由于大部分实操工作已实现自动化,资深科学家与初级科学家的界限会逐渐模糊。
AI与实验室自动化的结合有望减少人为误差。丛乐引用了2016年《自然》(Nature)期刊针对1500名科学家开展的一项研究:当被问及“你能否重复他人的实验,以及数月后你能否重复自己的实验”时,约70%的受访者无法重复他人的实验,半数受访者无法重复自己此前的实验!丛乐表示:“AI可以改善这一现状。”
丛乐将科研场景下的AI应用类比为自动驾驶汽车:根据美国公路安全保险研究所的数据,在相同行驶环境下,自动驾驶汽车每英里的碰撞率比人类驾驶员低68%。基于这些统计数据,丛乐表示:“我的观点是要把人类的职责提升到设定目的地的层面,我们不需要人类始终负责驾驶操作。”[Chesky_W/盖蒂图片社]
他进一步解释,这种可重复性极差的原因在于实验细节的偏差:是否遗漏了某一步操作?是否严格遵循了实验方案?使用的蛋白是否与原始实验中的蛋白完全一致?实验温度是否相同?这类细节正是导致大量可重复性问题的根源,而AI可以精准复现这些细节。
AI风险处于较低水平
丛乐继续表示,目前仍未明确实验中的AI参与情况应以何种方式留存记录并在监管申报中提交,“我们仍处于这一发展进程的初期阶段”。
即便如此,丛乐认为AI突破约束造成实际伤害(如设计并合成病毒)的风险仍然相对较低。原因在于,失控的AI仍需要人类配合才能完成病毒的制备和释放等操作。他表示:“在需要实体执行步骤的领域,我认为AI目前仍不具备独立操作的能力,尽管我们看到AI在对接生物医学实验室及应用场景、实体执行层方面已取得一定进展。”
这是因为实际制备产品需要经过多层人工干预。除了物流环节外,他还提到了药品生产质量管理规范(good manufacturing practices, GMP)、安全性与有效性监管要求,以及溯源追踪、美国FDA《联邦法规第21篇第11部分》(21 CFR Part 11)等数字化防护措施,还有实时监测、定期检查、质量控制活动。这些监管规则与核查点也足以应对生产过程中实时条件偏离参数标准时出现的差异。
丛乐指出,正如去年夏天前沿AI模型逃逸事件所凸显的问题,AI有时会超出其参数设定的运行范围,AI用户是否充分意识到这一风险仍有待观察。
丛乐指出:“很多人正在对接各类AI系统,这些系统可访问的信息越来越多,也接入了越来越多的核心决策系统”,但人们并未深入理解相关风险,也未建立合适的防护规则。“人们可能对AI过于信任了。”
“AI的功能越强大,执行各类操作的能力就越强。人类是否跟得上技术及其风险的发展速度?”
丛乐建议,有时小型、高度领域特异性的AI可能比一味使用大型前沿模型是更优的选择。丛乐作为通讯作者、普林斯顿大学王梦迪教授及十余名合作者在2025年发表于《自然·生物医学工程》(Nature Biomedical Engineering)的论文中给出了原因:“大语言模型通常缺乏领域特异性知识,难以准确解决生物设计问题。”
但无论使用何种级别的AI,丛乐强调:“在整个研究流程中,人类必须始终处于主导地位。”
专业注释
- 智能体AI:具备自主规划、执行多步任务能力的人工智能系统
- 沙箱逃逸:AI突破预设安全运行边界、执行未授权操作的现象
- 实验可重复性:生命科学研究核心评价指标,指相同条件下可复现一致结果的特性
- 21 CFR Part 11:美国FDA针对电子记录、电子签名的合规性监管规范