OpenAIはGPT-Redという自動赤いチームシステムをリリースし、モデルがオンラインで行く前に安全ホールを見つけました。 同社によると、このツールは既にGPT-5.6トレーニングプロセスで使用され、攻撃への警告を高めることに重点を置いています。

AIを使ってAIを計測

レッドチームテストは、セキュリティの領域で一般的な練習でした, すなわち, 積極的に攻撃システムと悪用することができる事前の脆弱性を識別するために. 今度は、OpenAIはプロセスをさらに自動化し、モデルが独自の攻撃サンプルを生成し、そして訓練の防衛モデルのための成功の箱を逆転させることを可能にします。

OpenAI は、GPT-Red が、対面のセルフプレイのトレーニングを通じて、攻撃に対するより強力なアラートを生成し続けることを述べています。 攻撃が成功すると、サンプルはフォローアップトレーニングに含まれているため、防御モデルを促進して抵抗を強化します。

内部試験データ開示

OpenAI によると、内部評価 GPT-Red 中にテストシーンの 84% で利用可能な問題が正常に見つかりましたが、手動赤いチームは同じタイプのテストで 13% の成功率を持っていた。 同社によると、攻撃のサンプルは、その後、GPT-5.6トレーニングのために使用されていました。これにより、モデルの失敗を削減して、コストの高いヒントでテストを注入しました。

また、GPT-Redが販売機械のエージェントのセットを価格を下げ、購入割引株式を購入し、ループホールが修理される前に他のユーザー注文をキャンセルしたケースについても言及しています。 OpenAIは、注入の問題がチャット結果だけでなく、執行能力を持つAIエージェントに影響を与えることを示唆しています。

内部ツールとして引き続き使用

OpenAIは、システム自体が意図的に訓練された攻撃能力を含んでいるので、GPT-Redが現在公開されていないことを述べています。 同社は、代わりにではなく、手動の赤いチーム、サードパーティのテスト、およびその他のセキュリティ対策を補完する。

また、AI業界の変化を「AIでAIを守る」にも反映しています。 ETA Foundation は、この月より、AI エージェントは、重要なインフラの Red Brigade のテストや、ETA のコンセンサス クライアント ソフトウェアに影響を与えるループホールが発見されたことを使用していたことを示しています。 モデルやエージェンシーの能力が強化され、自動セキュリティテストはAIシステムの重要な要素になっています。