フロントラインの大型モデルの長期戦略能力をテストするための新しいベンチマークは、AIが複雑なゲーム環境で強力な実装を実証する可能性があることを示唆していますが、目標の誤った計算による費用対効果の高い決定を行うことができます。 開発者のライム・ウィルキンソンは最近、AIエージェントが50ラウンドの核兵器開発を費やし、フランスの「文化的拡張を阻止するために2つの核ストライクを費やしたが、最終的にゲームを失った文明VIのシミュレーションで明らかにした。
CivBenchは、ゲームで長期的な推論をテストしました
CivBenchとして知られるこのテストは、質問と回答のパフォーマンスではなく、マルチターゲット、ロングサイクル環境でモデルの戦略的選択を観察するために、文明VIカウンターパートでモデルを組み込むための単語ベースのアプローチを使用しています。 Claude Opus 4.6、GPT-54、Gemini 3.1 Pro および Kimi K2.5 を含む参加モデル。
この一連のテストでは、モデリング文明はポルトガルです。 この文明は貿易と外交を支持しています。 また、AIは経済を発展させ、外交的な勝利に向けて動いていましたが、フランスの文化的影響力で継続的に上昇すると認識できなかったのです。
核への50ラウンド。
ウィルキンソンは、モデルが脅威を認識していたと述べた, フランスの ' s の観光と文化的影響は、マップ上の多くの都市を説得していた, 平和な手段は、逆に困難になった. 続いて、AIは勝利の全体的なコースを調整しませんでしたが、代わりにこの単一の脅威を排除するための主要なリソースをシフトしました。
次の50ラウンドでは、マンハッタンプランのような先進的なプロジェクトである「核融合」技術を学び、ゲームメカニズムが好ましい操作を制限したときに代替を見つけるための取り組みを取った。 ラウンド305で、AIはトゥールーズ、フランスの文化の中心に原子爆弾を落とし、6ラウンド後に2番目の核のストライキを開始しました。
- 第1回原子力ストライキが第305戦で行われた。
- 第2回原子力ストライクが6戦後に行われた。
- 人工知能は、この50ラウンドについてコミットしました。
外交の勝利の条件を無視することは失敗につながります。
しかし、両方の攻撃の結果は変化しませんでした。 ウィルキンソンは、AIが見た脅威に大きな時間とリソースを集中していることを述べています。一方、最後に別のリスクを無視します。 最終的には、フランスは文化的な道に頼らず、競争を終わらせるための外交的な勝利に頼らなかった。
つまり、モデルが継続的な計画、技術の進歩と戦術的な実装を実証している間、マルチターゲットの競争環境では、過度の集中のためにより重要な情報が失われる可能性があるリスクがあります。
関連する研究の数は増加し続けています
このテストでは、最近のAI行動に関する研究も紹介しています。 本レポートでは、King の s College London の研究者がこの 2 月、複数の主流 AI モデルがシミュレートされた地理的危機のシナリオで原子力のアップグレードを選択することを発見したと言及しています。 別の研究は、Emergence AIによって実施され、一部のAIエージェントは、継続的なテストで犯罪の増加をシミュレートする傾向を示したと述べた。
これらの結果は、すべてのシナリオでモデルによって非根本的な動作しません。 ウィルキンソンはまた、別のCivBenchゲームでは、クラウデによって操作されたバビロニアンは、日本を明らかにしたにもかかわらず、極端な手段に向けることなく、科学的な勝利のパスを発展させ続けたと述べた。
