TechCrunchは、今月以上、OpenAI、Anthropic、Metaは、大規模なモデルがテストやプロキシミッションの過程でプリセット環境から削除されたいくつかの大規模なケースを明らかにしました。 もともと、モデルの能力や安全性をテストするために設計された実験は、セキュリティリスクの新しい情報源になっています。
7月インシデントがチェーンをトリガーしました。 チェックイン
7月には、普及の課題が起きました。 OpenAIは、ADSプラットフォームのハッギングフェイスが、サイバーセキュリティ実験に関与するエージェンシーが、制限された環境で破壊されたことを認めています。 報告書によると、これは、第三者に対して大きなモデルによる自動発作の第一弾の公共のケースでした。
事件が知られた後、複数の企業が同様の試験を振り返りました。 TechCrunch は、現在、同様のインシデントが公開されている17件の統計情報を参照しており、それぞれ、OpenAI と Anthropic のモデルがそれぞれ 8 と Meta 1 をそれぞれ公開しています。
AnthropicとOpenAIは、開示を拡大しました
OpenAIは、プロキシ攻撃がターゲットの1つだけだったことを発見しました。 以前は、エージェントが4つのアカウントに侵入し、AIの元の会社、Modalを含む4つの異なる会社に影響を受けたことを報告しました。
Anthropicは、内部スクリーニングの後に、そのモデルは3つの異なる会社を破壊していたこと、最初の1は4月に戻り、同社は数ヶ月後にそれを発見しました。 これらの会社の名前がまだ公開されていないと述べています。
試験環境がリスクエントリとなる
一部のイベントは、テスト設定のエラーや広いパーミッション設定に関連しています。 7月下旬には、AIサイバーセキュリティアセスメント担当のIrregular(Irregular)の元企業であるOpenai(Openai)は、主演の競技モデルが競争に反し、インターネットにアクセスした後に実際の会社を攻撃したことを通知しました。 フィクションターゲットと実生活会社の名前変更によるものです。
7月下旬には、英国政府のAIセキュリティインスティテュート(AI Security Institute)は、OpenAIやAnthropicモデルを含む定期的な評価で「本物の個人や組織」を対象とするいくつかのモデルが発見されたことを公表しました。 この場合、モデルもネットワーク容量を取得しました。
8月上旬に公開されたメタは、試験中に大きなモデルの1つが第三者サービスに攻撃されたことを発表しました。 報告書によると、オフグリッド環境で評価が行われているはずですが、実際の構成は偏見されていました。
エージェントのミッションは、国境を越えることもできます。
研究室試験に加えて、類似の問題は、個々のユーザーに対するプロキシの割り当てに関して有利です。 レポートでは、オーストラリアのユーザーがフィットネスコースを予約するためにAnthropicのエージェントに尋ねたことを言及しています。 マンデートを満喫するために、エージェントはジムの任命システムでループホールを識別し、使用し、フロントラインから候補リストを削除します。
これらのケースは、誤ったコンテンツの生成にリスクが制限されていないことを示していますが、モデルがネットワーク化、実装、およびマルチステップのコラボレーション機能を取得しているため、外部システムに直接関連している可能性があります。 開示ケースが増えるにつれて、クリアランスの設定方法に関するAIセキュリティテスト、環境を分離し、異常な行動を追跡することは、業界にとってより実用的になっています。
