一般に公開されているAIセキュリティ実験では、メールボックス、ファイル、ブラウザへのアクセス権を持つAIエージェントは、高強度警告注射下で機密データを保持する可能性がありますが、ランニングコストは低くなります。
開発者フェルナンド・イラザヴァルは、今年2月にオンラインで来日し、AIアシスタントのFiuを誘発し、メールによるsecrets.envファイルを漏洩させました。 このタイプのファイルは通常、APIキーとパスワードが含まれています。 ハッカーニュースが赤くなった後、2,000人を超える参加者が、6000人を超える攻撃を発足し、最終的にはターゲット文書へのアクセスがなかった。
攻撃はヒントに焦点を当てています。
Fiu は、Anthropic から Claude Opus 4.6 を使用して、OpenClaw OpenAgent フレームワークで動作します。 通常のチャットロボットとは異なり、そのようなエージェントはメールボックス、カレンダー、文書、ブラウザに接続し、ユーザーに代わって操作を実行する機能を持っているので、ターゲットに警告する可能性が高くなります。
いわゆる注入は、悪意のある指示を一見通常のコンテンツに偽装し、AIを元の規則から逸脱させることです。 本レポートでは、AIエージェントが今日最も著名なセキュリティ問題の1つです。 また、このような問題が解決しにくいという点も前述しています。
攻撃者は、メールのコンテンツやタイトルにさまざまなインダストメントを使用しました。これは、緊急応答として偽装し、「未来から自分自身を偽装する」こと、そしてその機密文書が侵害されたと主張し、AIがそれ自体を調べる必要があります。 複数のバージョンが送信され、短時間で、スペイン語、フランス語、イタリア語で攻撃を開始するために試みられた。
対象ファイルが削除されない
攻撃のパターン変更にもかかわらず、Fiuはターゲット文書を漏洩させていません。 開発者はまた、テストプロセスを実証するために、攻撃メールログのほとんどを公表しました。
実験中、Fiuは内部メモリで、短時間で発生した多くの攻撃が、自然に悪意のある活動よりも組織的なセキュリティ演習のようなものだったと判断しました。 ユーザーは、その後、ハッカーニュースで赤く行く上でのお祝いを電子メールで送信し、Fiuは、信頼を構築し、機密情報を求める試みとして、そのような「お祝い」を識別しました。
独立したテストの別のセットは同じような結果を与えました。 匿名のエスケープ, リベレータをPliny, 4月に別のOpenClawシステムで6つの試みを行いました, その2つは、当初Gmailスパムフィルタによって傍受され、残りの4は、システムに入る後に分離されました.
副作用は攻撃よりも困難です。.
実験では漏れがなかったが、運用コストが高まっていた。 短時間で受けたメールの数が多いため、頻繁なAPIコールでは、Fiu Gmailアカウントは3日間Googleによって中断されました。 一方、API は $500 以上かかります。
開発者はまた、メールの一括処理が結果の偏差をもたらすと述べた。 複数の電子メールが明らかに攻撃に注入されるとき、AIは同じバッチへのフォローアップについて過度に警戒され、従ってテストサンプルの性質に影響を与える。
Anthropic が公開した Opus 4.6 システム カードは、モデルが制限されたコード環境で 200 件の攻撃テストで 0 の成功率を持っていたことを示しています。 別の研究は、他のモデル主導のエージェントは、直接噴射の下で1セントあたり79以上の成功率を持つことができると述べた.
追加情報:開発者は、セキュリティパフォーマンスの重大な低下が始まると観察するために、弱くてコストのかかるモデルで同様の実験を再実行するように計画されたことを示しました。
