OpenAI在9月8日公开了一项与MIT工程量子系统组合作的实验:研究生Beatriz Yankelevich把GPT-5.6 Sol通过Codex接入实验室软件,让模型参与一块六量子比特超导芯片的测量和校准。这个案例真正值得关注的地方,不是模型又回答了一道量子物理题,而是它进入了一个会产生真实物理结果、步骤彼此依赖、错误需要被识别并修正的实验流程。OpenAI给出的范围也很明确:在信号清晰、任务定义充分时,代理能够较少依赖研究人员完成标准测量序列;遇到弱信号或噪声时,它会花更长时间寻找参数,有时仍需要有经验的研究者介入。
超导量子芯片从制造完成到可用于实验,并不是接上电源就能运行。芯片被封装并放进稀释制冷机,冷却到接近绝对零度,研究者再用微波脉冲激发和读取量子比特。正式做新实验以前,团队要先找到跃迁频率、校准控制与读出脉冲、测量量子信息能维持多久。每一项结果都会决定下一项测量如何设置,芯片状态还可能随时间漂移。一个常规芯片的表征需要数天,前置测量往往达到数百甚至数千次,这正是实验室里耗时却又适合标准化的一部分。
模型不是遥控器,而是在执行“测量—判断—再测量”的闭环
Yankelevich没有把一句自然语言指令直接交给未经约束的模型。她为Codex提供了针对不同测量的技能,说明如何运行实验、如何评价结果,再给出芯片设计目标。GPT-5.6 Sol据此选择测量参数、操作硬件、分析返回数据,并决定是继续细化当前测量,还是保存结果并进入下一步。信号足够干净时,它能识别量子比特的跃迁频率,完成控制与读出脉冲校准,并测定量子信息保持时间。也就是说,模型承担的不是单次命令翻译,而是一串带反馈的决策。
这类闭环和“让AI写一段数据处理代码”有本质差别。代码生成结束后,人可以先审查再运行;实验代理的动作会改变设备状态、占用仪器时间,并直接影响后续数据。要让它可用,实验室必须把操作边界、测量接口、结果格式、异常条件和退出机制一并工程化。案例中的成功很大程度上来自任务结构清晰:仪器由软件协调,标准芯片有既定表征流程,判断目标也相对明确。它并不证明模型已经掌握量子物理,更不等于任何实验室都能把仪器权限交给通用聊天机器人。
OpenAI披露的失败边界同样重要。当实验信号弱或噪声大时,代理寻找合适参数更慢,也会需要专家指导。真实实验最困难的部分往往恰好不是重复运行,而是判断异常究竟来自设备、样品、环境漂移还是一个新的物理现象。经验丰富的研究者可能更快识别最佳设置。当前代理的价值因此更像一名能长时间值守的实验助理:它可以在夜间持续完成例行工作,让研究人员把时间转向结果解释、实验设计和下一轮假设。
这也解释了为什么案例里“从手机查看进度并适时引导”比“完全无人实验室”更接近现实。自动化不是取消人,而是重新分配注意力。研究者设定目标和安全边界,代理处理长时间的标准步骤,人负责在不确定性上升时接管。对管理实验平台的团队来说,真正需要统计的指标不会只是模型答题准确率,而是每块芯片节省多少人工监看时间、异常被正确升级的比例、无效测量数量、设备占用效率以及人工接管后的恢复成本。
AI进入物理世界后,权限、追溯和停止条件比提示词更关键
实验室代理的下一道门槛是可审计性。每次参数选择依据什么数据、调用了哪个版本的控制脚本、原始信号如何处理、模型何时改变计划,都需要留下能够复现的记录。否则,一次看似漂亮的自动校准很难成为可信的科研结果。模型输出本身也不能替代仪器校准、实验记录和同行验证。尤其当多个代理同时工作时,资源冲突、错误累积和上下文遗漏都可能放大,实验室需要把权限最小化、动作白名单和硬件联锁放在模型之外。
停止条件尤其容易被忽略。一个代理如果只被奖励“完成任务”,可能会在信号异常时不断尝试,把时间浪费在没有信息增益的参数搜索上。更稳妥的设计要明确最大尝试次数、可接受参数范围、温度和设备状态阈值,以及哪些现象必须交给人判断。日志还应把模型的建议与最终执行动作分开,确保关键操作经过确定性软件检查。这里的安全不是抽象伦理,而是保护昂贵设备、样品和实验时间的工程纪律。
从产业角度看,这个案例展示了一条比“AI发现新定律”更务实的路径。材料科学、半导体测试、生物实验和化学分析都存在大量可软件控制、重复度高、又需要根据结果调整下一步的流程。只要仪器接口足够稳定,领域规则能够写成技能,代理就可能先从夜间值守、批量表征和数据质量检查切入。它带来的生产率提升,首先会表现为设备运行时间被更充分利用,而不是某个模型单独替代一个学科团队。
但这仍是一个具体研究组、具体芯片和具体工作流的案例,不能外推为量子计算已经被AI自动攻克。官方没有声称模型独立完成了新物理发现,也没有说弱信号判断已经解决。更准确的结论是:当物理实验被可靠地软件化,并被拆成可验证的短步骤,当前AI代理已经能接手一部分例行测量;真正复杂、模糊和高风险的判断,依然需要研究者。实验室自动化的竞争,接下来不只看模型能力,还要看谁能把设备、数据、权限和人类监督连接成一套可持续运行的系统。
