OpenAI は 7 月に GPT-Red をリリースし、自動レッド チーム アプローチを記述し、自動再生機能強化モデル、アラート、セキュリティ テストを使用します。 モデルとプロキシシステムにおける弱点を識別するためのモデルの使用は、現在のAIセキュリティの作業にとって重要な方向です。システムが複雑であるほど、手持ちのアラート、ツールと長距離のミッション境界の組み合わせによってカバーするのがより困難です。 自動赤いチームは、テストの範囲を拡大することができますが、識別されたギャップは、修理されたギャップと実際の展開のリスクは同じ概念ではありません。

自己再生ゲームの直感的な意味は、攻撃パーティーと防御的なパーティーが変化するミッションで互いにプッシュできるようにすることです。 攻撃モデルは、ルールに違反するターゲットを誘発しようと試みます, 開示または危険な操作を実行すべきでない情報を公開します。; 防御メカニズムは、それに応じて更新され、新しい防御メカニズムは、攻撃者がバイパスの新しい方法を見つけることを可能にする. サイクルは、ソフトウェアセキュリティの継続的な貫通テストに似ていますが、AIS応答はテキスト応答に限定されませんが、ツール特権、外部のWebページ、メモリ、代理店対エージェント通信、識別および人的オペレータの意思決定を含みます。 試験の範囲が広く、どの環境が現実であるか、どのようなデータが触れられるか、そしてそれが停止しなければならない場合を決定する必要性が大きい。

レッドチームインジケータは、実際の世界境界に代わるものではありません。

パスレート、拒否率、または攻撃の成功率は、セキュリティレポートで共通しており、脅威モデルと組み合わせて読み込まれなければなりません。 モデルは、特定のアラートセットで実行されます。これは、攻撃の種類を識別するために学んだことを示すかもしれませんが、未知の攻撃、異なる言語、長期ミッション、または非常に安全である複雑なツールチェーンを表すものではありません。 逆に、Red Teamによる問題の発見は、オープンユーザー製品で同じイベントが既に発生したという意味ではありません。 キーは、テスト、システム特権、データソース、復元の状態の構成を明確にし、絶対的な安全結論として実験室の指標を置くことを避けることです。

オートメーションはまた、新しいガバナンスの問題を提起します。テストシステム自体は、攻撃エージェントがあまりにも多くのツールを持っている場合、リスクのソースになるかもしれません。実際のネットワークにアクセスしたり、コンピテンシーを蓄積することができます。 そのため、Red Corpsの環境は、分離されたアカウント、合成ターゲット、最小限のクリアランス、完全なログおよび緊急の必要なメカニズムを使用する必要があります。 高レベル信号の場合、明確な人間の応答とアップグレードのための時間枠があるはずです。 OpenAIは、以前の機会に、Red Corps自体の機能として重要な厳格な制御と分離を強調しています。 ループホールを識別するモデルは、自動的に自分自身を制限し、制限は、システム境界、日付設計、ビジネスプロセスによって提供されなければなりません。

セキュリティ機能は、リリースではなく、継続的な運用として考慮すべき

開発者にとって、GPT-Redはモデル会社が「安全なバージョン」を配信するのを待ち受けるインスピレーションの源ではありませんが、自社の製品サイクルに対抗テストを組み込むことです。 各新しいツール、データ接続、メモリ機能、自動実装機能により、新しい警告インジェクションパスウェイが作成できます。 チームは、最初に、キーを漏れたり、承認を迂回したり、機密情報を外部システムに送信したり、これらの結果に対する反復的なテストを設計したりするなど、最も望ましい結果を定義することができます。 ライン上では、不規則な呼び出しを監視し、監査記録を維持し、特権の迅速な締付を可能にします。

安全性は、与えられた評価の最後に得られるラベルではありません。 オートレッドチームは、問題の検出を高速化し、システムがより反復的になります。真の成熟は、評価、分離、マニュアルレビュー、事故対応、公共の声明を接続することです。 識別された障害パターンを訓練、製品、輸送に継続的にフィードバックすることにより、リリース材料から、ユーザーが感じることができる物理的保護にセキュリティ研究がシフトされます。 外部の世界では、GPT-Redは、レビュー可能なアプローチ、ボーダーカバレッジ、証拠のその後の修理に焦点を当てて評価されるべきです。

レッドチームシステム自体も評価する必要があります。 攻撃モデルが単にいくつかの既知のヒントを繰り返す場合、防御的なパーティーは、ランキングのトップ上に上昇するかもしれませんが、新しいタイプの攻撃に脆弱です。あまりにも多くの実際のパワーが攻撃の成功を追求するために与えられている場合、テストは、必要な境界線に違反する可能性があります。 よりよい練習は区域の分離ライン、隔離のサンドボックス、制御された灰および実質の生産の監視を、さまざまなアクセス可能な資源および各層のための条件を停止することを示すことです。 深刻な問題は、モデルの次のバージョンが再訪されるのを待つべきではありませんが、ツールの特権の締付け、機能の停止、または追加のマニュアル承認などの明確な断続的な緩和措置のために。

プロキシシステムを使用して企業にとって、最も実用的なセキュリティ資産は「Red Brigadeを通じて」証明書ではなく、最新の状態に保つことができるリスクのリストではありません。 それは最も敏感な用具、注入することができる外的な要素、異常が起こるとき2回識別されなければならない操作を、いかに見つけ、そしてロールバックに入れるべきです。 これらの要素は、プレス会議やコンプライアンス文書にのみ存在するセキュリティメカニズムを回避するために定期的に再解釈されます。 オートメーション攻撃は安くなり、防御側は監視と応答を日々の能力に変える必要があります。

製品、エンジニアリング、セキュリティチームは、インシデント言語の同じセットを共有することもできます。インジェクションの試みは、ログが保持され、クライアントが通知しなければならない実際の電源遮断です。 強固な定義は、事故に対する応答を遅くし、修理が有効であるかどうかを判断する外の世界を防ぐ。 AutoRedチームの最も有用な結果は、多くの場合、目に見えるスコアではなく、システムを本当に変更できる人へのこれらの失敗の早期暴露ではありません。

過度のセキュリティ機能のマーケティングを避けるために、テストの発見と実際の展開境界を開示します。