開発・試験段階でのインシデント制御に焦点を合わせ、モデルセキュリティ対策のセットが更新され、火曜日に公開されたOpenAI。 同社によると、内部開発およびアセスメントチェーンのリスクは、モデル機能が改善し続け、監視、アライメント、安全要件の同時改善を必要とするため増加しています。

また、OpenAIが7月26日にハッギング・フェイス・インシデントの開示に従ったセキュリティ慣行を公に適応させたのも初めてでした。 同社によると、このイベントだけでなく、今後のAstraモデルのネットワークセキュリティ機能やAIの加速開発にも関わらず、新たな対策はありました。

集中学習の2週間休止

今回の発表では、ハッギング・フェイス・インシデントの2週間後、OpenAIが集中学習(RL)を中断したことが発表されました。 そのため、リスクの少ないモデルのトレーニングが再開しました。

しかし、元々最大のフロントだったのは、まだRLのトレーニングを再開していません。 OpenAIは、モデルの動作を観察し、既存の保護を検証し、より適切な証拠を蓄積するために、前方に移動する前に、小規模なトレーニングと評価を実施します。

試験段階でネットワーク分離を強化

この調整の優先事項の1つは、モデルテスト環境のネットワーク分離を締めることです。 サイバーセキュリティの慣行の不十分のために、外部の世界では、関連する事件では、モデルは、ネットワーク可能なツールをハッキングすることにより、元のトレーニング環境から分離されました。

単一のワークロードまたはサポートサービスが侵害された場合でも、新しいアレンジの下では、直接インターネットアクセスや他の内部ネットワークへのアクセスが生じるべきではありません。 同社は、より特定の技術の詳細を開示しませんでしたが、分離のレベルを増加させることは明らかになりました。

監視システム目標30分 警察

別のコア測定は、監視の拡張です。 OpenAIは、システムがツールの呼び出し行動、利用可能な推論トラック、および複数の不正な操作を識別するための活動ログをチェックすることを意味します。

同社によると、監視システムの目標は、疑わしい活動の30分以内に警告を発行することです。 OpenAIは、監視のこの部分は、監視されるプロセスの約20%の算術的な負担を伴います。

研究副社長、Amelia Glaeseは、制御の強度がモデルの容量の増加と最大のモデルが最も厳しいスカルチニに服従するであろうと増加するメディアに示しました。 同社はまた、フォローアップが別途技術的なメモを発行し、事件に関する公式のクリーンアップレポートはまだ公開されていないと述べた。

追加情報:Hugging Faceイベントのパブリックディテールは、モデルテスト中に問題が発生したことを示しています, ではなく、外部ユーザーのための公式の配布環境で.