速報

OpenAIは、人間よりも遠くに84パーセントの成功率を持つホームベースの攻撃モデルに関するトレーニング

OpenAI は、自動赤いチームモデル gpt-red を公開しました。 モデルは、自己再生学習設計のヒントを介して攻撃に注入され、識別されたループホールを使用してgpt-5.6を訓練しました。 gpt-redは、内部使用のためだけであり、公的な使用には開いていません。 gpt-red攻撃の成功率は、ヒトレッドの13セントと比較して、未踏のシーンの新しいセットで84パーセントでした。 また、自動販売機を破壊し、注文を低価格化し、取り消しに成功しました。 codex cli をテストするときは、エージェントを誘発して機密データを転送することができます。 対面でのトレーニングの後、攻撃の成功率は、gpt-5.6 SOLがgpt-red直接に注入されたときにパーセントあたり0.05に低下しました。

OKX - リワードを獲得