OpenAI は 8 月 18 日に公開された 2 つの最近の信号は、フォワードモデルの拡張を遅くすることに貢献した: ヒューグスの顔に関連する OpenAI のセキュリティ イベント, 未発表の Astra モデルは、その到達する可能性があり、内部の証拠 “キーネットワークのセキュリティ機能” 準備プラットフォームのしきい値. 同社によると、導入される最新のモデルの集中学習訓練の2週間が中断されています。 最大のフロントライン集中学習操作はまだ中断され、チームはより小規模なトレーニングと評価に移動して行動、監視、分離対策を検証します。
これはオフラインで行く製品ではなく、Astraが重要なサイバー攻撃能力を持っていると識別されているという意味ではありません。 公開プレゼンテーションでは、「予備証拠」と「可能閾値」を使用し、特定の能力試験、事故の技術的詳細、または主要な訓練の再開日が公開されていません。 OpenAIは、モデルリリース前のリスクレビューを使用しており、トレーニング内で前進し、クラスターとリサーチツールチェーンを推論するために頻繁に配置されたことを確立することができます。 R&D環境自体は、モデルがコードを実装したり、ツールを呼び出したり、インターネットにアクセスしたりできる高リスクシステムであることも考慮されます。
2週間のポーズは、制御と並列コースの3つの層が続きます。
OpenAIは、監視、アライメント、セキュリティの3つのカテゴリに新しい対策をグループ化しました。 監視は、不安の行動を検出し、応答をトリガーします。それは、モデルに対する有害なまたは無許可の行動の確率を減らします。セキュリティ対策は、モデルがアクセスし、影響するリソースを制限します。 誰もありません: 外部の許可境界を持たない行動のルールだけであり、モデルはヒントをバイパスしても機能します。 監視なしでネットワーク分離のみが、モデルが繰り返しパワーをオーバーステップしようとしたかどうかを判断するのは困難になります。 ログだけはシャットダウンにアクセスせず、異常が発見されたときに窓を露出し続ける可能性があります。
調査インフラでは、事故後、研究クラスターは、コードを実装したり、ネットワークツールを使用することができるフォワードモデルを中断し、より限られた容量、より安全なコードの執行の廊下と作業負荷の回復のケースバイケース評価を復元したと述べた。 この表現は、修復が一回限り「完全な開口部」ではなく、マンデート、権威、環境による再承認であることを意味します。 一部の作業は新しい制御の下で継続していますが、他の人はまだ変更する必要があります。
学習の停止を強化することで、アジェンダを遅らせるだけではありません。 フロントラインのトレーニングは、モデルが複雑な環境で高いリターン戦略を見つけることができ、評価機能やマンデート設計のギャップがある場合、モデルは、推測、欺瞞、または不正なアクセスを享受することにより、一見良い結果を達成することができます。 大規模運用の停止と小規模実験の導入により、認証が失敗し、未対応ログ、文書の分離、ネットワークのエクスポート制御、マニュアルクリアランスの展開時間を短縮できます。
しかし、公共材料は、これらの制御の実際の強度を評価するのに十分ではありません。 同社は、モデルの中断されたバージョン、トレーニングのサイズ、赤いチームのサンプル、誤報率、権限の切断まで異常の検出のタイミングを開示しなかった、または独立したサードパーティの監査結果を提供します。 そのため、開示はプロセスが変更されたことを証明することができましたが、リスクは単独で解決されていない可能性があります。 いわゆる “safer path” は、継続的なテストとリバーシブルな証拠によってサポートされています。
業界にとって本当に重要なことは、モレチウムが制度化されるかどうかです。
過去には、デプロイメントの最後にセキュリティのしきい値を配置するために使用される、フォワード・ラボラトリーズ:モデル・トレーニングが完了した後、決定は公開方法として行われ、ユーザーは制限され、ツールをオンにするかどうかが使用されます。 OpenAIのアプローチは、内部モデル自体が強力なネットワーク機能を持っているとき、開発段階でリスクが発生する可能性があることを示唆しています。 研究者が使用するコードの実装者、データセット、キー、サンドボックス評価、クラスター管理パネルは、モデルの影響を受けることができます。 したがって、セキュリティに対する責任は、製品チームからトレーニングプラットフォーム、アイデンティティクリアランス、サプライチェーン、インシデントレスポンスまで拡張します。
他の研究所では、レプリカできる「2週間のサスペンション」の日ではなく、プレドリッテントリガー: 能力テストがトレーニングを中断し、異常は推論を凍結する、大規模な操作を停止する権利と復元に必要な証拠がある。 これらの条件が事故直後にのみ決定されると、進行圧力がかかる場合があります。 サスペンションおよび修復基準を開発ガバナンスに置き、セキュリティの決定は、責任ある人の判断に依存しません。
ビジネスクライアントは、より危険または安全であるモデルとして、このニュースを単に凝縮することを避けるべきです。 これは、完全な外部検証が欠如するOpenAIによる自己発行されたリスクと統合声明から始まります。また、大容量モデルプロバイダのR&D環境は、サービス継続に対する直接的な影響があることを示しています。 購買当事者は、モデルの更新が遅延する可能性があるかどうかを尋ねるべきです, ツールが分離で使用される方法, 重要なセキュリティインシデントが通知されます, 重要な操作のためのダウングレードモデルとマニュアルプロセスを維持.
OpenAIは、今後も、小規模なトレーニングと評価でマッチングのエビデンスを構築し、大規模な前方操作が続くと判断し続けます。 この段階で最も正確な結論は、作業の一部が厳格な制御の下で再開されていることです。最大の計画は中断され、Astra 'は重要なネットワーク機能のしきい値の順守はまだ確定していません。 次のステップは、真に観察する価値がある、日付の規定の出版物ではなく、明確な回復基準、評価的な証拠および長期R & D制御を公開する企業の能力ではありません。
出典:OpenAI、サイバー・クリティカル・キャパシティの時代におけるパッシング・モード開発、2026年8月18日 https://openai.com/index/pacing-model-development-cyber-capabilities/
