随着 AI 智能体开始承担订票、编程和金融分析等多步骤任务,行业关注点正从模型分数转向真实执行能力。Patronus AI 试图解决这一问题,通过搭建模拟业务环境,检验智能体在复杂场景中的稳定性。

完成5000万美元B轮融资

这家旧金山初创公司成立于 2023 年,由前 Meta AI 研究人员 Anand Kannappan 和 Rebecca Qian 创办。公司宣布完成 5000 万美元 B 轮融资,由 Greenfield Partners 领投,Notable Capital、Lightspeed、Datadog 和三星参投。

本轮融资后,Patronus AI 的累计融资额达到 7000 万美元。投资方表示,几乎所有前沿 AI 实验室以及不少新兴创业公司都已成为其客户,相关需求增长迅速。

复制网站和内部系统

Patronus AI 的核心产品是“数字世界模型”。这类系统会复制网站界面和企业内部工具,让 AI 智能体在接近真实业务的环境中执行任务,再据此评估其表现。

公司称,这些测试通常发生在强化学习训练之后,重点不是展示模型在基准测试中的高分,而是检查它能否在变化较多、结果可验证的场景中稳定完成工作。

瞄准智能体走捷径问题

Patronus AI 认为,智能体常见的问题不是完全无法行动,而是在任务中“走捷径”,看似接近目标,实际没有正确完成流程。这类偏差很难仅靠静态基准测试发现。

目前,公司主要服务软件工程和金融场景。创始人表示,未来还会扩展到更多任务类型,并构建可支持智能体连续运行数小时、数天甚至数周的测试环境。

主要对手是内部评测团队

在竞争层面,Patronus AI 认为自己面对的主要不是同类创业公司,而是各家 AI 实验室内部搭建的评测团队。与提供人工数据支持的公司不同,它更强调在没有人工介入的情况下,直接观察智能体在任务环境中的实际行为。