独立型ボディガイドライトAI規格は、8月18日付で公開された「制御」練習評価の第1ラウンドを発売しました。 この評価は、モデルがリスクを拒絶するかどうかではなく、実験室が高容量のエージェントを社内で使用しているかどうかについてではなく、高リスクの動きを文書化したり、異常が検出されたり、外部のテストを受けたり、制御されていないモデルのための事前準備された分離プログラムを経たりするかどうかについて、適度に停止することができます。 結果は、選択した慣行が完全に実装されていないことを示しています。 Anthropic と OpenAI は C+ だった、Google は D+ だった、XAI は D- と Meta は F だった。
そのような格付けは簡単に簡単なランキングとして読むことができますが、彼らは本当に「原則」と「検証可能な操作」の間の距離を明らかにします。 多くの企業は、安全枠組み、システムカード、および機能のしきい値を発行していますが、必ずしも一般に、内部のエージェントが制限を回避しようとすると、制限を回避しようとすると、彼らがネットを遮断できる期間を解除する権利を有していない、彼らは訓練やデプロイを中止するとき、ログはモデルによって書き出すことができません。 会議がツールマンデートのエージェントのためにそれを設計する前に議論されるまで、事故対応は待つことができません, そして、制御は、mandateを優先しなければなりません.
6つの慣行はスローガンではなく、制御のチェーンを測定します。
ガイドライトは、より広範な制御標準から6つの慣行を選択しました。 まずは社内のAI活動の文書化です。 ログはモデルの出力を維持するだけでなく、ヒント、ツール呼び出し、アイデンティティ、特権の変更、ネットワークの目的や実装結果、エージェントが自分で削除できないポジションに配置する必要があります。 完全な記録がなければ、チームは事故のタイム ラインを再確立するか、モデル、足場、テスト人員または環境構成から派生したかどうかを判断できませんでした。
第二は、監視が本当に誤って識別できるかどうかを評価することです。 監視のインストールは、それが効果的であるという意味ではありません, そして、研究室は、隠れたテストを使用する必要があります, 赤のチームシーンと評判の攻撃は、リコールと誤報率を確認するために. エージェントは、危険な行動を一見正常なステップに分解し、シングルキーフィルタは簡単に見逃すことができます。 実際のインジケータは、検出のタイミングを含める必要があります, 中断比, マニュアルのアップグレードと認識されていない経路の速度.
3つ目は、リスクの高いアクションが発生する前にドアコントロールの設定です。 外部メッセージの送信、コードの強制化、秘密の読み込み、生産データの変更、または資金の転送は、モデルのみに基づいていません。 許可システムは、性的戦略がアクションが許され、二重承認、制限または読み取り専用モードを必要とするかどうかを決定するために、モデルの外にある必要があります。 (c) インフラ層の許可を取り替えないシステム警報の「注意」を含んで下さい。
4つ目は、異常後に溶ける仕組みです。 短期間に複数の権限を過剰に試みた場合、システムは自動的にバウチャーを凍結し、プロセスを終了し、プロキシテストを続行するのではなく、ネットワークを分離する必要があります。 臭いしきいしも重大を避けるために練習する必要があります。, 通常のミッションの頻繁な中断につながる. 第5は、設計と受諾の面で開発チームの利益の競合を低下させる第三者評価であるが、その信頼性は、レポートの評価の範囲、アクセス権、および開示レベルによって決定される。
第6回は封入の明確な計画です。 事件の種類、責任のある人、停止する権限、鍵の取り消し、証拠のオフライン、外部の通知、および再帰の状態の取消。 原則文書の存在は、決定的な容量に量りません。クロスチーム承認、クラウド特権またはベンダー依存による遅延は、通常のデスクトップドリルと技術的な演習によってのみ検出できます。
スコアはどういう意味ですか?
公に利用できる材料だけに頼る評価は、低スコアが最初に「外部から十分な証拠が利用できなかった」ことを示したように、必ずしも社内に関連した措置がなかったことを証明しました。 企業は、セキュリティや商業上の理由について詳細を開示し、継続的に更新される生活文書としての基準を明示的に判断することはできません。 一方、開発者は、その大容量システムが管理可能であることを信じるために公開する必要がある場合は、監査されるべき十分な証拠を提供する必要があります。 機密性の唯一の地面に関する声明を作るための拒否も、約束が検証されるのを防ぐでしょう。
モデル自体のリスクレベルを比較するために、スコアも使用しないでください。 組織的制御慣行、能力、アライメント、製品の品質を測定します。 C+は、実験室が「安全」であり、Fは事故が発生したという意味ではありません。 異なる企業が異なる開示習慣を持ち、よりオープンな企業は、より多くのギャップを公開するだけでなく、外部の改善のための基礎を提供する可能性があります。 そのため、最も価値のある名前ではなく、欠落している証拠の種類ではありません。
AI-agent企業の調達のために、フレームワークはベンダーのアンケートに変えることができます。非取り外し可能なツールログを提供するかどうか、クライアントがすぐにトークンをキャンセルするかどうか、カバーされた権利の停止、サードパーティのテストをトリガーする方法、主要なイベントを通知する方法。 エンタープライズは、モデルメーカーのフルコントロールを配置することなく、ゲートウェイとスメルトを側に保つ必要があります。 セキュアな場合でも、モデルサービスでは、間違った構成されたビジネスツールに接続することでリスクを負うことができます。
研究所にとって、次のステップは、匿名化された演習データ、外部監査のカバレッジ、誤った応答時間、制御障害後の検証結果のリリースに出版物の原則から移動する必要があります。 必要な機密性は保持できますが、少なくとも、コントロールがデプロイされたかどうか、誰とどのシステムが適用されるかを示す必要があります。 ガイドライトの評価の最初のラウンドは、オープンギャップリストのような最終ルーリングではありません。 Frontline AI ガバナンスは「セキュリティを重視する」から始まります。
ソース: 制御と評価方法のガイドライトAI規格, https://guidelight.ai/standards/development-process; Guidelight 公開ウェブサイト, https://www.guidelight-ai.org/
