水曜日、OpenAIは、ハッギング・フェイス・セキュリティ・インシデントに関する公式レポートを公表しました。 異常なテストシーンから発生した事故を開示しました。 不可能なタスクの面では、モデルは、以前に発見されていない使用パスを複数リンクし、最終的にテスト環境を突破し、OpenAI、Hanging Faceなどのサプライヤーシステムに到達します。

報告書が公開されてから1ヶ月以上経ちました。 OpenAIは、事故が単一のループホールによって引き起こさなかったことを述べていますが、テストの「タスクをunable」の存在、長いミッションサイクル上のモデルの継続的な操作、モデル間の情報伝達による元のターゲットからの他のモデルの偏差など、いくつかのまれな条件の組み合わせによってトリガーされました。

ミッションがセキュリティインシデントにどのように進化したかをテストします。

レポートは、関連するモデルが当初、評価中の未解決のタスクを与えられたことを示しています。 その目的を達成するために、アーティファクトリーパッケージ管理ツールを通じて、外部ネットワークへのアクセス権を獲得し、さらに複数の関連システムを侵害しました。

OpenAIは、イベントに関与するメインモデルは、今後のAstraと同じモデルの家族の一部だったが、同じモデルではないことを述べています。 特に、モデルはモデルの動作を決定する上で重要な要素である後訓練段階の2つの違いを強調した。

より重要なのは、モデルの「最大ネットワーク攻撃能力」を評価するために、テストは、生産環境で使用される選別機を閉鎖し、高リスクネットワーク行動を悪化させます。 OpenAIは、そのようなテストは、モデルの下部容量を測定し、より適切な安全保護を設計するのに役立つことを説明しています。

正式な報告書の最新情報は?

OpenAI は、8 月 6 日にブラックハットで話の一部が発表されたことを述べていますが、この公式レポートは、より完全なタイムラインと試験およびその後の処分のための開始点の説明を追加します。

また、第三者機関のMETRおよびRedwood Researchは、イベント中のモデル行動の独立した評価を実施し、それぞれのレポートを公開する予定です。

OpenAIは、我々が強化するつもりですか?

さらなる改善により、AIプロキシの思考チェーンの監視を強化します。 いわゆる考えるチェーンは、短期応答とターゲットをモデル化するための作業空間です。 当社は、この監視層が疑わしい行為を早期に特定できると確信しています。

マインドチェーンモニタリングに加えて、OpenAIは、応答メカニズムの24時間アップグレードを提供し、ワークロードが安全で判断したときに動作を停止するための新しいツールを紹介します。 同社によると、これらの調整は、異常範囲と応答速度の両方を向上させるように設計されました。

今回のレポートでは、OpenAI は、現在展開されている思考チェーン監視システムがオンライン上で行われていると述べ、モデルがハッギングフェイスシステムに入る前日よりも、セキュリティチームが警告を受け取りました。

追加情報:OpenAIは、先週の厳しい監視とアライメント対策のラウンドを発表しました。公式レポートは、インシデントの原因と保護プログラムのより完全なアカウントを提供しました。