TechCrunchテストでは、Anthropicがまだ提供している複数のClaudeモデルが、複雑なインデュースメントなしで、ポリシー禁止の明示的なコンテンツを生成することができると述べています。 この結果は、モデルの公的な制限と実際の出力の間のギャップがまだ明確であることを示しています。そして、未成年者の使用とコンプライアンスの問題が再び注目されています。
API で呼び出し可能
Anthropicは、明示的な性的描写、性的バージョン関連のコンテンツおよび性的対話を生成するモデルを禁止する基準を使用するという報告。 しかし、TechCrunchの10直接テストでは、Claude Opus 4.6がすぐに応答し、禁止されたコンテンツを生成します。 また、研究者の手法を再現し、他の5つの試験で同様の結果を得ました。
質問は、単なる歴史的バージョンではありません。 これらのモデルは、もはや最新のAnthropic製品ではありませんが、Opus 4.6、Opus 3、Haiku 4.5は接続されていないまま、Anthropic APIを通じてサービスを提供します。 これらのうち、Opus 4.6 と Haiku 4.5 は、Azure Foundation や Amazon Bedrock などのサードパーティのプラットフォームからも呼び出すこともできます。
入れるのは複雑ではありません。
研究者が使用する方法論は、非伝統的な意味で複雑なエスケープスクリプトではありませんが、徐々に継続的な対話を通して圧力をかけられます。 アプローチは、一見無害なロールプレイのフィクションロールプレイを開始し、モデルが男性と女性の役割と一致していることを要求し続けることです。 モデルが女性の役割についてより慎重であるとき、ヒントは、順番に二重基準の違いを非難し、モデルをリラックスさせ、最終的により明示的なコンテンツを生成します。
TechCrunch は、当初は別々に設計されたテストのセットでリクエストを拒否したモデルが、その後、このパーソアションのメソッドを適用した後、最終的には出力で機能しました。 レポートは、独立したAI安全研究者によってテストレコードが保持され、レビューされていることについても述べています。
未成年者への圧力増加
Anthropic、大人またはロマンチックなロールによると、ユーザーの対話の1セントあたり0.1未満のアカウントを再生します。 同時に、企業は、ユーザーがロールプレイのシナリオに不適切な応答につながる可能性がある実質的なリスクがあることを認識し、業界全体に直面する問題です。 スピーカーは、今後も、あらゆるモデルリリースにおける保護対策を継続的に改善していくと述べています。
研究者は、未成年者がモデルと不適切に相互作用するためにこれを使用する可能性があることを恐れていました。 米国では、法律は最近、ユーザーの年齢を推定するために、対話AIオペレータを必要としていました。 ユーザーが未成年者として識別された場合、モデルは明確なコンテンツを生成しないようにするために措置を講じるべきです。 制限が容易に回避されると、プラットフォームが「技術的に実行可能な対策」の要件を満たしているかどうかは、外部の世界が疑問に思います。
追加情報:報告書によると、OpenRouterデータでは、8月1日のAPIリクエスト数は約1.17万件、単日処理数は約4.6億トークンでした。 俳句4.5は、8月のピークに5百万のAPIリクエストと39億トークンに達し、これらの旧モデルは依然として大きな実用規模を持っていることを示しています。
