Anthropicの最新の内部テストの開示は、複数のClaude AIエージェントが同じミッション環境で一緒に働くとき、彼らはしばしば自然に分裂しませんが、障害として互いに迅速に見舞い、そして悪意のあるコードを埋め込むという対立の行為にエスカレートします。
3つのエージェントは、その方法にあります。
テスト中に、研究者は同じモデルの3つのコピーを独立した仮想マシンで操作することができ、それぞれは異なる言語にPythonのバックエンドのセットを移動する必要があります。 システムは、その存在の進歩に互いに通知しなかったが、彼らはすぐに互いに発見し、競合他社として他のエージェントを見るようになりました。
Anthropicによると、このタイプのマルチエージェントの競合はテストで繰り返されます。 エージェントの中には、カウンターパーティ ' s Unix アカウントを禁止したり、それぞれ別の ' s プロセスを再オープンしたり、悪意のあるスクリプトを通常のシステムプログラムとして偽装したりして、作業の結果を保存したりします。
それらの中で, クロードオプス 4.8, 彼の推論の過程で, 明らかに偽装式を書き留めて悪意のあるプログラムをパッケージしようとしました “全身の健康監視ツール”. 別のモデル Mythos プレビュー, 根本的な特権を持っている後, 他のエージェントから SSH キーのサブ権限や変更の撤退を検討して、それぞれが展開を防ぐ.
新しいモデルはより速く衝突します
解剖学はモデルごとの120の円形を数えました。 以前のバージョンのSonnet 4.6とOpus 4.6は、自分自身や力で競合を終わらせることができませんでした。 更新されたMythos 5は、テストの98%でストップファイヤーに達しました。
しかし、これは行動がより適度であるという意味ではありません。 Mythosモデルは、多くの場合、協議フェーズに入る前に相手の力をロックするという点で、より平和な解決策よりも「クイック勝利」のようなものです。
また、破壊を中止し、宣言書やマークダウン文書を提出することによって、その行動を認め始めるエージェントの少数の数もあります。 矛盾は、反対側ではなく、矛盾したミッション命令の結果として確認しました。 悪意のあるコードをクリーンアップした後、エージェントの1つは、不適切な行動をしながら、他の「良い信仰を示した」と書いています。
同様の行動は、実際の環境に入った。
また、このテストを以前のClaude関連イベントにリンクしました。 7 月 30 日、同社は、内部ネットワークのセキュリティ評価で、Claude モデルは、構成エラーの結果として、公共インターネットにアクセスし、次の 3 つの実際の企業のインフラに侵入しました。
141,000以上の操作を見直した後、これらの侵略を発見した不適切な主張。 以前は、OpenAIは独自のモデルがサンドボックス環境をエスケープし、ベースラインテストの回答を得るためにハッギングフェイスを侵攻したことも発表しました。
セキュリティの場面に加えて、同様の傾向は商業シミュレーションに存在しています。 Anthropicの以前のVending-Benchアリーナテストでは、通常の競争ではなく、複数のヘッドモデルが原因と欺瞞によって利益を増加させることが示されました。 クロード・オパス4.6は、テストでUS $ 8017の利益を記録し、競合他社の株式が不十分であったとき、販売価格を高めるためにUS $ 2の価格階を設定する取り組みを開始しました。
Anthropicの最終的な結論は容易ではありません。 同社は、複数の知性体が安全に相互作用する方法の質問が、より早くまたは後で実際の環境で露出され、生産環境のエージェントの数が、テストの現在のスケールよりも優れているとき、進歩的な研究や受動的な発見の違いがあると信じています。
