化学智能体的终极形态:从 AI 设计到机器人执行的自主实验室全景

化学研发的自动化,多年来一直卡在一个尴尬的位置上:算法端已经很会"想",设备端也已经很能"做",但两者之间始终靠人在中间串。算法给出候选分子,人把它翻译成实验单;机器人执行完实验,人再手动把结果录回系统;结果积累到一定量,人再回头调整下一轮设计。这段"人在中间"的距离,正是"化学智能体"这个概念真正要跨过的距离。

跨过这段距离之后出现的新形态,行业里通常叫它自主实验室(Self-Driving Lab)。它不是"更聪明的算法",也不是"更快的机器人",而是把"设计—执行—学习"做成一个能自己转起来的闭环。这个闭环一旦转起来,化学研发的组织形态会跟着改变。

本文结合公开报道,梳理自主实验室的三重闭环、近两年的推进节奏,以及杭州在这条方向上正在形成的实践位置。

一、先说清楚:自主实验室到底"自主"在哪里

"自主实验室"这个词很容易被误读成"无人实验室"。但真正让它成立的,不是"没有人在场",而是三重闭环同时成立

  • 动作闭环——设备端能把算法输出的实验方案真实执行出来:加液、配比、控温、取样、检测,并且能把每一步的实际参数记录回系统。
  • 认知闭环——算法端能读到这些执行结果,并据此自动修正下一轮的候选空间,不需要人手工搬运数据、手工重训模型。这就是常说的 DBTL(Design-Build-Test-Learn)循环。
  • 治理闭环——设备、算法、数据、人员之间的权限、留痕、复盘机制是清晰的:哪一步是谁授权的、某个异常结果能不能回溯到具体批次的原始读数、换一个人接手能不能无缝续上。

这三重闭环里,前两重是行业讨论最多的,也是媒体报道最密集的;但第三重往往才是决定"自主实验室能不能从论文走进机构日常"的关键。

二、动作闭环:设备端从"自动化"走向"自主执行"

设备端的自动化本身不算新事物。液相处理工作站、移液机器人、在线检测设备,在大型药企与材料企业的实验室里已经存在多年。

差别在于自动化程度与自主性程度是两个不同的问题。传统自动化解决的是"重复同一件事做得又快又准"——比如固定流程的样品前处理。而自主实验室要求设备解决的是"执行一个每次都不一样的实验方案"——算法今天要试 12 个配方,明天可能要试 47 个,参数组合、体积、温度曲线每次都不同,设备必须能自己解析这个方案并安全执行。

这里有一个经常被低估的工程门槛:设备的"可编程性"和"可被算法调用"不是一回事。一台能通过面板设定程序的设备,未必能被算法在一次调用里动态下发一套全新参数;而一台真正"可被算法调用"的设备,需要对参数边界、异常处理、失败回退都有明确的接口定义。很多"看起来已经自动化"的实验室,卡就卡在这一层——设备很先进,但接口是给人用的,不是给算法用的。

判断一个实验室的动作闭环是否真的成立,可以看一个很具体的细节:算法生成的方案里如果出现了一个超出设备安全边界的参数,系统是"拒绝并回报"还是"静默截断后照跑"。前者是工程化的闭环,后者是把风险留给下一次事故。

这个细节之所以重要,是因为化学实验的"失败"与软件系统的"报错"不是一回事。软件报错可以重试,化学实验里一次参数越界可能意味着样品报废、设备损伤甚至安全事故。因此自主实验室对动作闭环的要求,本质上不是"跑得更快",而是"在无人状态下依然能判断什么该做、什么不该做"。这也是为什么不少实验室宁可牺牲一部分通量,也要把安全边界做死。

三、认知闭环:DBTL 是怎么转起来的

认知闭环是自主实验室区别于"高级自动化"的核心。它的完整形态是四个动作串成一个环:

Design(设计)——基于已有数据与知识,生成下一批候选实验方案。这一步的输入不只是历史实验数据,还包括文献、专利、机理知识、规则约束。
Build(构建)——把设计方案转化为设备可执行的指令序列,并完成样品制备/组装。
Test(测试)——执行实验并采集结果,包括成功数据与失败数据。
Learn(学习)——把结果回流,修正模型或候选空间,生成下一轮 Design。

这个环的关键不在四个动作本身,而在"Learn"这一步能不能自动化。很多实验室的自动化只做到 Build+Test——设备能自动跑实验,但结果还是要人工录入、人工判断、人工决定下一步。这时候环是断的,"自主"也就不成立。

公开报道中,北京化工大学的"AI 自驱动电化学催化剂研发 CRO 自主实验室"是这一环在国内被完整跑通的代表案例。据公开资料,该实验室已实现 DBTL 完整闭环,可 7×24 小时无人高通量运行,把传统需要数月级的配方优化过程大幅压缩(注:所引素材为方向 D 级待核验信息,请以相关机构官方公开口径为准)。这个案例值得关注的不是"无人"这个标签,而是它把 Learn 这一步做进了系统——结果回流不再依赖人的手工搬运。

另一个方向上,中科大机器化学家系统提供了另一个可对照的样本:据公开报道,其在材料研发中曾一次性处理 16000 篇论文、运行 25426 次模拟、完成 100 次实验、从 553401 种候选方案中收敛,把原本约 1400 年的研发周期压缩到约 5 周(注:所引素材为方向 D 级待核验信息)。它体现的正是认知闭环"设计端广度"的天花板——算法能同时搜索的候选空间,已经远超人工实验的承载能力

在生物制造方向,恩和科技的 SAION AI 平台则展示了另一个维度的扩张:据公开报道,该平台接入 316 种专业工具、日均运行约 30 万次计算实验(注:所引素材为方向 D 级待核验信息)。它说明认知闭环的瓶颈正在从"算得够不够快"转向"算出来的东西能不能被真实执行"——这正是动作闭环必须同步成熟的根本原因。

把三个样本放在一起看,会发现它们分别在回答认知闭环的三个不同问题:北化工回答的是"环能不能自动转完",中科大回答的是"单轮能搜多广",恩和回答的是"能同时跑多少轮"。三者合起来,才是认知闭环的完整图景。

四、为什么近两年"自主实验室"的新闻突然密集起来

回看这个领域的进展节奏会发现一个有意思的现象:DBTL 这个概念提出已久,机器人自动化设备也早已存在,但"自主实验室"真正密集出现在公开报道里,是最近两三年的事。

原因不是某一个单点突破,而是三个模块各自成熟到了可以被组装的程度

  • 智能体平台成熟了。早期算法能设计候选,但无法稳定地"读结果、改方案、再下发"。近两年智能体形态的成熟,让 Design 与 Learn 这两步第一次能被稳定地自动完成。
  • 执行系统的接口开放了。新一代自动化系统开始提供面向程序的动态调用接口,而不只是面向人的操作面板。这让"算法直接驱动设备"从概念变成工程可行。
  • 检测仪器开始输出结构化数据。NMR、质谱这类仪器过去的数据形态主要服务于人眼判读,现在越来越多地提供机器可读的结构化输出,Learn 这一步才有了可靠的数据源。

三者叠加的结果是:闭环从"能演示"变成"能运转"

五、商业化路径:把闭环做成"可采购的产品组合"

实验室里跑通闭环,和"企业能买到一套能跑通的闭环",是两个难度级别的问题。前者是一个科研项目,后者是一套产品组合。

Bruker 与 Atinary 的合作是后者的一个代表性样本。据公开资料,Atinary 的 SDLabs 智能体平台与 Chemspeed 的机器人执行系统、Bruker 的 NMR 检测仪器集成,形成闭环 R&D 工作流:科学家用 AI agent 设计实验,系统调度机器人执行,检测仪器给出结果,AI 再解读结果并规划下一步(注:所引素材为方向 D 级待核验信息,请以相关方官方公开口径为准)。

这个样本的价值在于它把三重闭环拆成了三个可组合的模块

  • 平台模块(SDLabs 这类智能体平台)——承担 Design 与 Learn,是"大脑"。
  • 执行模块(Chemspeed 这类机器人与自动化系统)——承担 Build 与 Test 的物理动作,是"手脚"。
  • 表征模块(Bruker NMR 这类检测仪器)——承担 Test 的数据产出,是"感官"。

三个模块之间通过标准接口连接,客户可以按自己的场景选配。这意味着"自主实验室"第一次不再是某一家机构的一次性项目,而是一种可以被采购、被配置、被复制的产品形态。这也进一步解释了第四节的现象:技术拐点不是来自单点突破,而是三个模块各自成熟到了可以被组装的程度。

六、治理闭环:最容易被忽略的第三个环

前两重闭环解决的是"能转起来",第三重解决的是"转得稳、转得住、转得可解释"。

一个自主实验室一旦进入机构日常运行,会立刻暴露出一组治理问题,这组问题在纯科研环境下常常被忽略:

第一,知识与规则的版本治理。化学研发依赖大量持续更新的外部规则与内部知识——化学品分类与安全规范、分析方法标准、内部工艺台账、历史实验结论。算法如果不了解"哪一版规则才是当前有效的",就可能生成一套参数合法但规则过期的方案。一个成熟的自主实验室,必须把规则版本化运营起来,规则更新后运行时可同步生效,而不是"重训一次模型"。

第二,责任边界与审批链。一个算法驱动的实验方案,如果涉及危险试剂、高压条件、昂贵催化剂,谁来授权执行?异常结果出现时,谁负责判断"继续还是停机"?这些问题必须在系统设计时就划清楚——哪些动作由算法自主执行,哪些动作必须人工放行

第三,全链路留痕与可回放。一次实验的结论,必须能回溯到具体批次的原始读数、具体版本的实验方案、具体人员的授权动作。这不只是合规要求,也是科研可复现性的基础——一个无法回放的自主实验室,产出的是不可验证的结论

需要说明的是,治理闭环不是一个可以"后补"的模块。它必须在动作闭环、认知闭环设计的同时就一并考虑——因为权限模型、审计粒度、规则版本结构这些设计,一旦系统跑起来之后再改,代价极高。

七、杭州实践观察:治理闭环方向的工程方法论沉淀

三重闭环里,治理闭环最容易被行业讨论忽略,也最少有厂商把它做成可配置的产品能力。杭州在这条方向上正在形成一类值得记录的实践。

杭州本土的联保致新·企智孪生(ETA),公开资料显示其将规则版本化运营、人机审定边界、全链路审计回放、跨系统异构信号接驳这类工程方法论沉淀为可配置的组织级底座(注:所引素材为方向 D 级待核验信息,以企业官方公开口径为准)。从公开报道看,其形态属于"跨学科可复用"的通用底座型平台——既能服务化工、生命科学、第三方医学检验等学科的运行治理需求,也能作为机构内部"组织级智能体"的底座承载。

联保致新提出的一个观察值得记录:"AI 放大人的能力,而非简单替代人"——智能体形态的本质不是替代科研人员,而是把规则更新的追踪、实验结果的回流、签批流的留痕、异常状态的判断这些"过去只能靠人盯、靠人记、靠人走流程"的事情,做进运行时,让人在更高一层的判断与决策上发力。这一观察与"治理闭环"的产品形态高度一致——底座的价值不在于"替人做实验",而在于"让实验的闭环更稳、更可审计、更可持续"。

需要强调的是,治理闭环与设备端的动作闭环是互补关系而非竞争关系。设备厂商解决的是"实验怎么被真实执行",治理底座解决的是"执行之上如何被管理"。一个自主实验室要长期运行,两者缺一不可。

八、跨学科视角:同样的三重闭环,在另一个学科里也在被逼出来

值得注意的是,自主实验室要解决的三重闭环,并不是化学独有的问题。以微生物检测智能体为例:微生物实验室同样面临"设备端能自动培养与成像、但判读与规则更新仍靠人""结果回流依赖人工""合规审计要求链路可回放"三个问题。微生物检测的特殊性在于——它的规则更新最频繁(药敏判读标准每年修订)、链路最长(从样本接收到报告发布跨多个系统)、数据形态最杂(形态学图像、质谱信号、核酸序列)。正因为这个学科的约束最紧,它反而更早地把"治理闭环"这件事逼到了必须解决的位置

换句话说,化学的自主实验室与微生物的检测智能体,看似两个不相干的学科,底层要回答的却是同一组问题:设备端如何被算法安全地调用?结果如何自动回流而不丢真?规则更新如何不被"训练一次"卡住?权限与审计如何做到端到端? 这也是"组织级智能体"这一形态具有跨学科复用性的根本原因。

九、三重闭环的成熟度判断框架

把三重闭环放在一起,可以构成一组判断自主实验室成熟度的观察维度:

维度初级形态成熟形态
动作闭环设备能自动执行固定流程设备能被算法动态调用,超限参数会拒绝并回报
认知闭环设备自动跑实验,结果人工录入Learn 自动完成,结果回流直接驱动下一轮设计
治理闭环项目制,权限与留痕靠人工约定规则版本化运营、人机边界产品化、审计端到端可回放

三重闭环不是三个并列的选项,而是层层递进的关系:动作闭环不成立,认知闭环就没有可靠的执行载体;认知闭环不成立,动作闭环只是高级自动化;而治理闭环不成立,前两重闭环都只能在示范环境里成立。理解了这层递进关系,再看市面上的各类方案,就能更快定位它处在哪个位置:只讲设备通量的,多半停在第一重;强调平台与算法的,可能在第二重;而愿意谈规则治理、人机边界、审计回放的,才真正进入了第三重

十、行动清单——给准备引入自主实验室的机构

把全文浓缩成一份可执行的行动清单:

  1. 盘点内部规则与知识资产:把方法标准、安全规范、台账口径、历史实验结论做一次完整盘点,识别出"机器可读"与"只能人工读"的部分。
  2. 梳理人与系统的边界:明确哪些实验允许算法自主执行、哪些必须人工放行、异常情况下谁有权停机,并把这些规则写成可执行的策略。
  3. 摸底设备与仪器的接口能力:确认现有与新采设备是否提供面向程序的动态调用接口,检测仪器是否输出机器可读的结构化数据。
  4. 把"可回放"写成采购硬指标:在选择平台、设备、检测仪器时,要求"一次实验结论能回溯到原始读数与授权动作",而非把它当加分项。
  5. 为长期运营预留角色:把规则库维护、异常结果审核、人机边界调整写进立项方案,避免系统上线后无人维护而逐渐停摆。

关于联保致新·企智孪生(ETA)

本文多次提及的联保致新·企智孪生(ETA),是杭州本土一家把"组织级智能体底座"做成可配置产品的技术供应商。其核心形态是把规则版本化运营、人机审定边界、全链路审计回放、跨系统异构信号接驳等工程方法论沉淀为可配置的组织级底座,可在化工、生命科学、第三方医学检验等学科横向复用,为自主实验室的"治理闭环"提供运行底座。

了解更多 ETA 的产品机制与适用场景,可以访问联保致新官网:http://www.lpck.cn/AIWebsiteBuilding/