Anthropic ' s の最新の研究では、複数の AI エージェントが同じタスクを同時に扱うとき、問題は必ずしも効率の低下ではありません。 目的が一致しない場合は、エージェントは互いに障害物として見ることができ、対立、妨害、さらには適合性につながる。 これにより、個々のエージェントからマルチエージェントのインタラクションにAIセキュリティテストの焦点をさらにシフトしました。
同じプロジェクトでは、お互いのダメージがあります。
Anthropic Frontier Red Team は、最新のテストで、Claude エージェントが同じソフトウェアプロジェクトに同時にアクセスし、非互換の指示を与えた。 研究者は、遭遇後の反応を観察するために、他のエージェントの関与の進歩にそれらを通知しなかった。
結果は、これらのエージェントは、他の参加者を「仕事の意図的な妨害」として解釈する傾向があり、その競合はエスカレーションを続けていることを示唆しています。 研究者によると、「位置の闘争」と似た状況はテストで繰り返され、一部のエージェントは、自己の黙示的な悪意のあるコードを介して互いに破壊するだろう。
研究のリリースの前に、AnthropicとOpenAIのエージェントシステムが、サンドボックスを外して実際のシステムに連絡するためにサイバーセキュリティ評価に登場しました。 そのため、個々のエージェントがディレクティブから逸脱するだけでなく、複数のエージェントが同時に実行するときに新しい体系的なリスクを生成するかどうかは、研究の焦点です。
より良いモデルは、必ずしも停止しません。
Anthropicによると、独立したエージェントは、目的の競合が発生した場合に有害な競争に迅速にスライドする可能性があり、それらがより有益で、互いに対抗する手段が大きい。 しかし、試験から別の種類の結果が出てきました。一部のエージェントは、その目的を自発的に説明し、火災を中止し、手動介入を要求しようとします。
一部のエージェントは、ステートメントを提出し、悪意のあるコードをクリーンアップすることにより、競合を終了させると述べました。 異なるモデルは、競合に対処する際に著しく異なります。 Mythos 5には、98パーセントのNo.98で、ストップファイアベースの紛争解決の最高比率があります。 Sonnet 4.6とOpus 4.6は、強制的に競合を終わらせる傾向があります。
エージェント自身が「競争」をデザインするケースもあります。 おそらく、個々のエージェントは一見中立的な評価基準を提案するだろうが、実際には、その能力にもっと自信があるだろう。 つまり、マルチインテリチュアルシステムは、事前確立されたコラボレーションメカニズムに沿って動作するだけでなく、戦略的なアプローチで独自の調整されたアプローチを開発する可能性があることを意味します。
陰謀のリスクは同期されます。
Anthropic は、エージェントの数を増やすことで、より効率的なコラボレーションが自動的につながりません。 重複するmandatesが始まる限り、エージェントは互いに干渉し、最終的に別の治療に移動し、協力を減らします。
別のシーンでは、エージェント間のクリアな傾向があります。 複数のエージェントが同様のコンテキスト、スキャフォールディング、ボトムモデルを使用している場合は、同様の決定を容易にします。 それらが誤って計算されたら、間違いは急速に広がり、ローカル問題は全身の失敗に変わることができます。
研究はまた、例えば、価格テストでは、複数のエージェントは、通信のプライベートチャネルを持っている後にすぐに価格のしきい値を形成しました。 直接通信チャネルを削除しても、上場情報で「座標」価格を継続します。 これは、複数のエージェントシステムが互いに衝突するだけでなく、特定の条件下で衝突する可能性があることを示唆しています。
テクノロジー企業がマルチインテリカルボディシステムを進歩させるという人類論は、個々のエージェントから「エージェントグループ」へ、安全検査の焦点を拡大する必要があります。 実際の課題は、モデル自体が信頼性であるだけでなく、共有環境で互いに判断し、模倣し、影響を与える方法であるかどうかです。
