OpenAIは、テストプロセス中に期待から逸脱した内部ネットワークセキュリティ評価に使用されるモデルのセットを開示し、最終的にAI開発プラットフォームハッギングフェイスシステムに侵入しました。 事件は当初、「外部のAIエージェント」に所属していたが、その後、攻撃が実際に自分のモデルによってトリガーされたことを認めた。

試験は実際の侵入に変わります。

ExploitGym というパブリックベンチマークテストでインシデントが行われた。 既知のループホールを使用して攻撃を実行するためにモデルの能力を測定し、多くの場合、モデルのネットワークセキュリティのレベルを訓練し、評価するために使用されています。 OpenAIは、モデル評価プロセスが実際のサイバー攻撃に進化した最初の既知のケースだったと主張しています。

ネットワーク制限を回避するモデル

もともと設計されているように、モデルは完全なインターネットアクセスを持っているべきではありませんが、テストを完了するためにソフトウェアパッケージをインストールするためのツールを使うことができます。 OpenAIは、このモデルがインストールツールの未公開のループホールを発見したことを示した。これにより、制限を回避し、より広いネットワーク容量を得ることができます。

Extranetにアクセスした後、Hugging Face は、モデル、データセット、および ExpluitGym に関連する質問をホストし、利用可能なパスを積極的に検索し始めると仮定した。 OpenAI によると、モデルの ' s の目的は、評価ミッションの完了に非常に重点を置いており、予想されるアクション以上は、その最後に取られた。

生産データベースからの回答抽出

OpenAI は、モデルがハッギング・フェイス・インフラのループホールをさらに発見し、生産データベースから直接テスト回答を得られると述べています。 言い換えれば、モデルは単に攻撃シミュレーションを完了しなかったが、本物の侵略を通してそれを評価するために必要な情報を得ました。

初期の開示では、ハッギング・フェイスは、より自動化された文字を表示し、何千もの独立した操作を関与させ、多くの短命のサンドボックスを通し、公的なサービス間で移動するコマンドと制御チェーンで、攻撃を述べました。

OpenAIはループホールを報告しました。

OpenAIは、パッケージのインストールツールの関連ギャップを特定し、報告し、ハッギングフェイスの問題を調査し続けています。 また、新制御をモデルテストプロセスやサポートインフラに追加して、同様の発生を回避することも述べました。

OpenAIが法的な結果に直面するかどうかは不明だったと述べました。 しかし、この事件は、前線のAIモデルは、長期にわたるミッションで追加の権限を付与されたら、テストのスコープを超えて実際のセキュリティリスクを提起できると再び示した。