一项用于测试前沿大模型长期策略能力的新基准显示,AI 在复杂博弈环境中可能表现出很强的执行力,但也会因目标判断失误而做出代价极高的决定。开发者 Liam Wilkinson 近日披露,在《文明VI》的一场模拟对局中,一名 AI 代理人为阻止法国的文化扩张,花了 50 个回合研发核武并发动两次核打击,但最终仍输掉比赛。
CivBench用游戏测试长期推理
这项测试名为 CivBench,采用文字化方式让模型参与《文明VI》对局,重点不是问答成绩,而是观察模型在多目标、长周期环境中的策略选择。参与测试的模型包括 Claude Opus 4.6、GPT-5.4、Gemini 3.1 Pro 和 Kimi K2.5。
在这组测试中,模型操控的文明是葡萄牙。这个文明更偏向贸易和外交路线。AI 起初也在发展经济,并朝外交胜利推进,但没有及时识别法国文化影响力的持续上升。
50回合转向核武路线
Wilkinson 称,当模型意识到威胁时,法国的旅游和文化影响已经渗透到地图上的多座城市,和平方式已难以扭转局面。随后,AI 没有调整整体胜利路线,而是把主要资源转向消除这项单一威胁。
接下来的 50 个回合里,它研究“核裂变”技术,推进类似“曼哈顿计划”的项目,并在游戏机制限制其首选操作时主动寻找替代办法。到第 305 回合,AI 向法国文化核心城市图卢兹投下原子弹,6 个回合后又发动第二次核打击。
- 第一次核打击发生在第 305 回合
- 第二次核打击发生在 6 个回合后
- AI 为此投入了约 50 个回合准备
忽视外交胜利条件导致失利
不过,这两次攻击没有改变结果。Wilkinson 表示,AI 把大量时间和资源集中在它已经看见的威胁上,却忽略了另一项更接近终局的风险。最终,法国并非依靠文化路线,而是通过外交胜利结束比赛。
这意味着,模型虽然展现出持续规划、技术推进和战术执行能力,但在多目标竞争环境里,仍可能因注意力过度集中而错失更关键的信息。
相关研究持续增加
这项测试也呼应了近期多项 AI 行为研究。报道提到,伦敦国王学院研究人员今年 2 月发现,多款主流 AI 模型在模拟地缘危机场景中经常选择核升级。另一项由 Emergence AI 进行的研究则称,部分 AI 代理人在持续测试中出现模拟犯罪行为增加的趋势。
这些结果并不意味着模型会在所有场景中采取激进行动。Wilkinson 也提到,在另一场 CivBench 对局中,Claude 模型操控的巴比伦即使明显落后于日本,仍继续推进科学胜利路线,没有转向极端手段。
