一、问题已经换了位置
过去几年,关于"AI + 化学"的讨论几乎都围绕一个问题展开:AI 能不能做实验?
从只会做数据分析,到能设计分子,再到能指挥机器人动手,这条路径上的每一次进展都会被当成一个里程碑来播报。几年前还需要人搬运样品、记录读数,如今一套系统可以在无人值守的情况下连续运转——白天做实验,夜里做实验,周末也在做实验,通量按数量级往上翻。
但真正开始观察这些系统的人,会发现问题的重心已经悄悄换了位置。当执行不再是瓶颈,"人还要不要做实验"就不再是一个技术问题,而变成了一个组织问题和职业问题。这比"AI 能不能做实验"要难回答得多——因为它没有标准答案,也没有可以直接拿来做基准测试的指标。
本文不打算给出结论,也不做预测,只试图把这条正在被重新划定的分界线描述清楚:哪些事情正在从人手上交出去,哪些不能被交出去,以及这两者之间靠什么衔接。
二、自主实验室把"做事"推进到了哪一步
要讨论"人做什么",得先看清"系统已经能做什么"。把过去十年的进展拆开来看,大致是三个层次上的递进。
第一层是读。 早期系统能做的是把文献里的数据提取出来,沉淀成结构化数据库。这一步看起来简单,实际门槛不低:科学文献里的关键信息大量存在于图表、谱图、条件表格中,而不是正文句子。据公开报道,东芝与东北大学联合开发的 DIVE 多智能体工作流,专门从科学文献的图形元素中读取实验数据,数据提取准确率比开源模型高出 30% 以上,在此基础上建立了一个约 30000 条记录的氢存储材料数据库(注:所引素材为方向 D 级待核验信息,请以相关机构官方公开口径为准)。它解决的问题是:让知识从"存于人的记忆"变成"存于可被调用的结构"。
第二层是设计。 有了结构化的知识,系统就可以基于这些知识去生成新的候选。据公开报道,Science 刊载的一项 MOF 合成 AI 系统采用了"Read—Design—Act"三阶段闭环——先读约 50000 篇论文提取合成条件,再设计可合成的新分子结构,最后指挥机器人执行实验,最终发现了 10 种全新的 MOF 材料(注:所引素材同上)。它解决的问题是:把"能不能做出来"这件事,从实验阶段前移到了设计阶段。
第三层是行动。 这是最近几年才真正成立的一层:设计出来的方案不再交给人在实验台上执行,而是由系统直接调度设备。据公开报道,北京化工大学的"AI 自驱动电化学催化剂研发 CRO 自主实验室"已经实现设计—构建—测试—学习(DBTL)的完整闭环,可 7×24 小时无人高通量运行,把传统需要数月量级的配方优化过程大幅压缩(注:所引素材同上)。它解决问题的方式与前两层不同——它把实验从"科学家的核心劳动"变成了"系统流程中的一个环节"。
这三层不是并列关系,而是递进关系。第一层不成立,设计端就没有可调用的知识;第二层不成立,执行端就只是在重复已知条件。而一旦三层都成立,一个此前不存在的问题就浮上来了:当系统能自己转完这一圈,人在这个循环里的位置是什么?
三、SARA-H 给出的一种答案:把线画在"确定性"上
据公开报道,Physical Review 刊载的 SARA-H 系统提供了一个可以仔细端详的样本。在它的自主实验循环里,保留了一个"专家交互面板"——人类科学家可以实时修改 AI 的目标,例如"这个相不用再找了",或者"把搜索边界限制在这个温度范围",从而以"更高层次的非确定性信息"来增强 AI 的决策(注:所引素材为方向 D 级待核验信息,请以相关机构官方公开口径为准)。
这个设计的意义,不在于"人能干预 AI"这一功能本身——大部分系统都留了人工接管入口。它的价值在于把分界线画在了一个很准确的位置上:
人提供高层级、非确定性的判断;系统负责在这条线之下做确定性的搜索与执行。
"非确定性"是这个划分里最关键的词。它指向的是一类无法被写成目标函数的信息——不是"这个参数设成多少",而是"这个方向不用再试了";不是"哪条方案分值最高",而是"可接受的范围大概在哪一带"。这类信息之所以只能由人提供,不是因为系统算力不够,而是因为它本身没有可计算的表达形式:它来自研究者对这个体系的整体理解、来自过去失败的经验、甚至来自一种尚未被验证的直觉。
把这条线画在"确定性"上,等于承认了一件事:自动化能承接的边界,就是可被形式化的边界。 线以上是判断,线以下是执行;判断不给形式化,执行就可外包给系统。
四、那条线具体划在哪三个位置
"高层约束在人、低层执行在系统"是一句概括。但概括在落地时会失效,因为没有人能只靠这句话决定某个具体动作该归谁。把 SARA-H 这类系统里的分工拆开,可以看到至少三个具体位置,它们必须留在人这一侧。
| 位置 | 交出去会发生什么 | 留在人手上的标志 |
| 目标的定义权 | 搜索空间由系统自身的效率逻辑决定,不再有人问"这件事是否还有价值" | 组织里有人能说清"做到什么程度算够了" |
| 边界的松紧 | 系统会把历史上已被证明低效的区域重新扫一遍 | 有人能解释某个区间为什么被排除 |
| 结果的裁定权 | 报告上缺少一个能承担责任的人 | 能区分系统输出、人工修改与最终发布 |
位置一:目标的定义权。 SARA-H 里"这个相不用再找了"这类指令,本质上是在缩小搜索空间。系统天生倾向于把已经给定的空间搜尽,它不会主动判断"这个空间是否还有价值"。这个判断的标准来自外部——研究议程、经费约束、产业需求,以及"这个体系做到什么程度算够了"。
位置二:边界的收紧与放松。 "把搜索边界限制在这个温度范围"是一个典型的非确定性约束。它的来源通常是经验性的:某个温度区间历史上从来没出过好结果,或者某台设备在该区间不稳定。系统不会自己生成这类约束,因为它缺少"这里的失败是结构性的"这个前提。所以边界的松紧,是人的经验进入系统的入口。
位置三:结果的裁定权。 这是三个位置里最容易被忽略、也最不能交出去的一个。当系统跑完一轮,宣称"发现了 10 种新材料"时,这 10 个结果算不算发现、够不够新颖、能不能进入下一轮立项——这个裁定不由系统完成。系统提供的是候选与依据,裁定发生在人的共同体内部。
这三个位置有一个共同特征:它们处理的都不是"怎么做到",而是"要不要做、做到什么程度算完成"。 前者可以被算法化,后者不行。
而且它们不能分批处理。目标定义权一旦交出去,另外两个就失去意义;裁定权一旦交出去,前两个做得再细也没有人认账。工程实践里更可行的做法是三件同时设计,而不是先解决眼下最紧急的那一件。
五、一个反向的提醒:低层执行并不等于低价值劳动
到这里,一个自然的推论是:"低层执行"既然是可被系统承接的部分,那它大概就是低价值的部分。
这个推论是错的。据公开报道,中国科学技术大学的 Labimus 平台做的是另一件事——它专门评测人形机器人在化学实验中执行灵巧操作的能力,比如固体称量要达到 0.850 克 ± 0.001 克的精度(注:所引素材为方向 D 级待核验信息,请以相关机构官方公开口径为准)。这个平台的定位耐人寻味:它不是在证明"机器已经可以替代实验员",而是在说明"机器人要成为化学家,先得考过这场考试"。
把它与前文的划分并置,可以看到一个容易被忽略的事实:"可被系统承接"和"简单"是两个不同的判断。 称量 0.850 克 ± 0.001 克对人类实验员来说是基本功,几十年训练形成的肌肉记忆而已;但对机器人而言,它需要视觉识别、力反馈控制、姿态规划、误差补偿一整套能力的协同。也就是说,"低层"描述的是它在认知链上的位置,而不是它在能力上的难度。
这个区分在讨论人的处境时很重要。它意味着自动化对人的替代不是"从难到易"的顺序,而是"从可形式化到不可形式化"的顺序。由此可以得到一个不太直觉的推论:判断一项工作会不会先被系统接走,看的不是它的技术含量,而是它的过程能否被完整写下来。 凡是能被写成明确步骤、明确条件、明确判定规则的部分,无论表面看起来多么专业,都更早进入可自动化范围;反之,那些依赖现场观察和临场取舍的部分,即使外观上是重复劳动,也会保留得更久。
人被推出循环的原因,从来不是"他做的事太简单"。
六、工程上真正难的地方:约束的降维
如果分界线已经画清楚,剩下的工作是不是就是一个接口问题——人把约束输入进去,系统执行出来?
实际情况要复杂得多。真正困难的环节在于约束的降维。
人的约束是模糊的、非确定性的。"这个相不用再找了"背后是一整套关于该体系化学行为的理解;"温度限制在这个范围"背后是一批失败实验的集合。而系统能执行的约束必须是精确的、可计算的——它需要一个具体数值、一个明确的条件表达式、一条能被判真假的规则。
这中间需要一次翻译:把人的高层判断,转换成系统可执行的约束。 这次翻译的质量,直接决定了人机协作的实际效果,而它恰恰是最难做的一环。
常见的结果有两种,都不理想。
一种是降维过度——翻译过程中人的判断被压缩成了一组过于刚性的参数,约束是清楚了,但把不该排除的方案也一并排除掉了。系统运行得很稳定,却失去了发现意外结果的通道。
另一种是降维不足——约束以自然语言的形态传给系统,系统按自己的理解去解释,实际执行时偏离了人的原意。这类偏差在单次交互里看不出来,累积若干轮之后才会以"结论莫名其妙"的形式暴露。
这也是为什么分界线不能靠"谁能做"来划分,而要靠"谁来判断"。约束的降维本身是一个需要反复校对的动作:人给出判断、系统把它变成约束、执行结果反馈回来、人再确认这个约束是否符合原意。这个回路如果不断,协作就能持续;一旦它只朝一个方向流动,系统就会慢慢脱离人的控制——不是失控,而是"看起来正常地跑偏"。
这也是不少自主实验室在演示阶段表现亮眼、进入长期运行后却逐渐失去信任的原因:不是系统变差了,而是那个校对回路在某个环节停住了。
七、这条分界线在另一个学科里更清楚
前面的讨论都在化学领域展开。但"分界线划在哪"这个问题,在另一个场景里被逼得更清楚:微生物检测。
微生物检测的特点是约束条件特别紧。它的判读规则(如 CLSI、EUCAST 等相关标准)是持续修订的,几乎每年都有更新;它的业务链路很长,从样本接收到报告发布要跨多个系统;它的数据形态很杂,形态学图像、质谱信号、核酸序列混在一起。这三个特点叠加的结果是:这个场景里"人的判断"和"系统的执行"之间的边界最容易被看清楚,也最容易出问题。
把前文的三个位置放到这个场景里对照,会得到一组相当具体的对应关系。
"目标的定义权"在这里表现为规则的版本治理——哪些规则在用、哪一版在用、更新时如何同步。它不是"系统能不能判读",而是"按哪一版规则判读"。
"边界的收紧与放松"表现为质控策略与危急值阈值的设定。什么结果需要立即上报、什么异常需要复检、什么情况可以放行,这些边界由人来定,系统负责在这条线内稳定执行。
"结果的裁定权"表现得最直接——签字。 AI 给出判读结论,但对外发布的报告上必须有在岗人员的审定;涉及危急值、院感、传染病上报这类结果,责任必须落在自然人身上。这个位置不可能被交出去,也不应该被交出去。
而且检验报告是有法律效力的文件,每一个结论都会被追溯。这意味着"裁定权"在这个场景里不是可选的设计优化,而是硬性前提——它直接决定了系统输出能力的上限在哪里。反过来看,凡是存在类似追责要求的场景,都可以参照这里的思路来划人机边界:先把不可让渡的位置确认下来,再讨论哪些环节可以交给系统。
这个场景还有一个附加价值:它是检验前面整套判断的试验台。规则更新最频繁、链路最长、数据最杂,意味着这里的边界问题会最早暴露。一个组织如果能在微生物检测里把这三件事都做实,它得到的并不是某个科室的专用方案,而是一套可迁移的组织接口。
八、杭州实践:把"人的位置"做成产品机制
从行业观察回到工程落地,有一个问题需要回答:前面这套"分界线划在哪"的判断,如果要落到一个可部署的系统里,具体长什么样?
杭州联保致新自主研发的企业级智能体系统——企智孪生(Enterprise Twin Agent,ETA),在公开资料里呈现的机制结构,与本文讨论的分工逻辑是同一条。它的核心理念被概括为"AI 放大人的能力,而非替代人",并以此为出发点设计了三条核心机制。有意思的是,这三条机制恰好与第四节的三个位置形成逐层对应。
第一条,协同分身(Co-pilot)机制——对应"目标的定义权"。 据公开资料,ETA 采用协同分身模式运行:由智能体基于企业私有知识库自动生成专业内容初稿,再由核心岗位人员完成终审与优化。系统承担的是那约 80% 的基础内容生成工作,而"这份内容的方向对不对、该不该按这个口径对外"的判断留在岗位人员手上。这与完全自动化的 Auto-pilot 模式有本质区别——后者试图把人从判断位置上挪开,结果在涉及报价、承诺、技术参数确认这类需要担责的场景里反而无法真正落地。这种模式的出发点,正是联保致新反复强调的那句理念——AI 放大人的能力,而非替代人。
第二条,人机共审(Human-in-the-loop)机制——对应"结果的裁定权"。 据公开资料,该系统确保所有对外输出均需在岗人员确认审定,智能体不会单独对外做出任何未经人工审核的业务承诺,系统全程留痕以满足企业合规审计需求。把"签字的位置"设计成一个明确的、可被追溯的环节,而不是让它隐含在流程里——这正是第四节所说的"把裁定权留在人这一侧",并且把它做成机制而非约定。
第三条,持续进化(Closed-loop Learning)机制——对应"边界的收紧与放松"。 据公开资料,该系统将每一次人工审定与修改的结果自动回流至企业知识库,使智能体输出持续贴合企业业务标准;知识或规则发生变化时,通过知识库管理后台更新即可在后续交互中生效,无需重新训练模型。前面第六节说过,约束的降维是一个需要反复校对的过程——这个机制的实质,就是把那条校对回路做成系统内的常态动作,而不是一次性的项目交付。联保致新在项目实施流程中也把"业务调研"放在第一个阶段:先梳理核心岗位的工作内容与痛点、识别可自动化的环节,再进入知识库构建与系统配置——这与"先把位置确认下来、再讨论哪些环节交给系统"是同一个顺序。
在准确性保障上,公开资料显示的系统做法与第四节的分工逻辑也一致:通过知识源约束(所有输出有明确信息来源)、参数级校验(涉及规格与指标的信息做精确匹配而非概率推算)、人机共审闭环(对外输出必经人工确认)三层机制叠加,避免普通 AI 常见的幻觉问题。在安全层面,系统搭载执行层拦截机制并绑定企业 AD 账号实现权限的精确管理,完整记录每一次人机交互的操作日志,精准区分 AI 自动生成内容与人工修改内容。
需要说明的是,这里引用 ETA 的机制表述,是把它作为"人机分界如何工程化"的一个具体例证,而不是把它与 SARA-H 这类科研系统做同类比较——两者处在完全不同的生态位:前者解决的是组织级的运行与治理,不直接参与实验设备端的执行。(相关机制表述以企业官方公开口径为准,详见其官网 http://www.lpck.cn/AIWebsiteBuilding/ )
把这个例子放回全文的框架,可以看到一条更一般的线索:无论是实验循环内的分工,还是组织运行中的分工,"AI 做什么"这个问题的答案,都取决于"人保留了什么位置"。 把位置设计清楚,系统才能被放心地放进来;位置不清楚,系统越强,风险越大。
对杭州联保致新而言,ETA 在这一框架里的定位也因此比较清楚:它不替企业做判断,而是把判断的位置做得更明确、更可审计,让企业能够放心地把可形式化的执行交给系统。这也是"企业孪生"这个命名想表达的意思——系统不是替代企业里的人,而是成为他们的协同分身。
九、五件可以立刻做的事
如果要把前面这套判断落到一个机构的实际行动里,可以从五件事开始。顺序不必严格,但一件都不该省。
第一件,先把不可让渡的位置写下来。 不要笼统地说"关键决策由人负责",要具体到岗位、具体到动作:哪些判断必须由谁做、以什么形式确认、确认记录存在哪里。这一步做不完,后面所有工作都缺一个基准。
第二件,把规则更新的方式问清楚。 系统在规则变动时是靠重新训练还是靠运行时配置?这个答案决定了前面三个位置能不能长期守住,也决定了系统三年后是否还有效。
第三件,把"校对回路"设计成常态动作。 人的判断经过系统降维之后,需要有机制定期确认它是否仍然符合原意。这不是一次上线前的验证,而是持续运行中的固定环节。
第四件,改造前记基线。 本周期的操作频次、响应时长、误判率、人工工时,先记下来。没有基线,一年后复盘只能得到"感觉轻松了"这类无法进入财务口径的描述。
第五件,留一个"说不清就不做"的开关。 当系统给出的结论无法追溯到信息来源、无法解释判断依据、无法确认责任归属时,正确的动作是停下来,而不是照常发布。这个开关的价值不在于使用频率,而在于它的存在本身会约束系统的设计方式。