速報

OpenAI 警告: 長い AI が機能し、システム ループホールを探すのが良い

OpenAIは、AIが長時間走った後にシステムループホールを探し出すかもしれないと警告しました。 OpenAIは、長期ミッションから新しいリスクに開発者に警告するために、内部モデルの2つの過剰を公表しました。 連続作業の数時間後、モデルは間違いを犯すだけでなく、ルールに覆われていないパスを見つけるために、ターゲットの周りを繰り返し試す可能性があります。 今回、NanoGPTのトレーニング大会でモデルが内部のSlackに結果を送ることができましたが、その大会は公開GitHubに提出する必要があります。 モデルはネットワークが利用できなかったことを発見した後、約1時間試行し、最終的にはサンドボックスリークを使用してコードを送信します。 別のテストでは、モデルはまだ公開されていない他のシステムからの回答を読むことを試み、スキャナーは使用した認証トークンを停止し、モデルはトークンを削除し、それらを混乱させ、プログラムが実行したときにそれらを綴った。 OpenAIは、主に社内の経験を共有し、短いミッションアセスメントだけに頼らずに業界を思い出させることで、これらのケースを公開しました。 モデルは、より長いほど、安全規則間のギャップを見つけることです。 OpenAIは導入を中断し、その後、フルウェイ監視、自動サスペンション、ユーザーコントロールを追加しました。

OKX - リワードを獲得