2人の元OpenAI社員がウェブサイトを立ち上げました 重量では、実験的な質問に答えようとしています。 ウェブ検索の欠如では、大型モデル自体が「記憶」している人は何人ですか? より多くのユーザーが情報のためのチャットロボットに向けると、そのようなテストは関連性になります。
名前認識をテストする複数のモデル
ウェブサイトの名前の「右」という用語は、モデルパラメーターを指します。 開発者の Thomas Dimson と Joey Flynn は、従来の検索で「自分で調べる」という点は、個々のネットワークの存在を測定する唯一の方法であり、モデルは別の視認性の指標になっていると信じています。
重量では、同様の質問をさまざまなモデルに「someone」としてポーズし、最大10の結果、短い説明と自信を要求します。 その後、同様の説明を分類し、名前のモデルの「記憶」を測定するための強さのスコアを生成します。
リストの変更と幻覚があります。
現在、テスト中のモデルは、Grok、Gemini、GPT、Claude、Llama、およびいくつかの小さなモデルを含む。 結果は、モデルが回答を与え、どの応答を幻覚または混乱させるかを示す。
TechCrunchの著者Anthony Haの場合、ウェブサイトで与えられたスコアは、すべての名前の上の641、6%です。 しかし、引き続き順位が変更されます。 リリース時に、俳優のマカレイ・クルキンが最初に、その後、歌手ルチアーノ・パヴァロッティが続きます。
また、GPT-54 Mini は、特定の人として直接識別されるのではなく、複数の個人のための可能な名前の形式として Anthony Ha を解釈していたと述べました。 そのような場合も、ウェブサイト上の潜在的な幻覚としてマークされます。
開発者は、モデル化度の新しい視覚に賭けます
インタビューでは、ディムソンは、OpenAIを離れた後、彼とフラインは、創造性を再完遂する何かをしたいと述べました。 以前は、デザイン会社グローバル・イルミネーションの買収から始まったOpenAIに入社しました。
2026年(昭和20年)に、大きなモデルに変身する流れが続くと、Googleスタイルのバガリー検索はもはや最も重要な目標ではありませんでした。 Web結果のランキングと比較して、モデルパラメータに情報があるかどうかは、別の新しいネットワークの存在感になります。
開発者は、同じモデルシリーズが異なる結果を与えた理由を引き続き研究し続け、どのような異なるモデルがより簡単に「記憶」することができ、理論的にWikipediaの言葉を持っているが、確立されていないかを調べることを示しています。
