大規模なモデル評価のますます厄介な質問があります。高いマークがモデルの能力を表すか、ベンチマークの主題がオンラインで循環し、トレーニングチームはリストへの参照を繰り返すことができるかどうか? Google DeepMind は、評価ライブラリからモデル開発者を隔離しようとすると、8月27日に「2-blind」評価試験ポイントを発表しました。 治験の逸脱を軽減するという考え方を使用していますが、実装ツールは密閉型封筒ではなく、パスワードで保護されたコンピューティング環境です。

この作品は、ウィリアム・イサック、ソル・メスイング、クリスチャン・ルムによって発表されました。 コアの配置は、評価器がモデル会社にセットされたプライベートテストを渡す必要はありません。また、モデル会社がモデル重量を暴露し、まだ評価者に公開されていないシステムを完了する必要があります。 締約国は管理された環境で計算を完了し、合意された結果だけを得ます。 この設計は、独自のモデル評価における信頼性の最も困難な問題に対処します - •モデルプロバイダの商業機密性の保護、両方の被験者の事前修飾と最適化を防止します。

ランキングの信頼性は「回答を見る」で消費されています。

過去数年間で、大型モデルリストは多くのタスクに取り込まれています。 研究者は、技術の進歩を判断するためにそれを使用します, これにより、企業の調達のための候補者の範囲を削減します, これは、製品の品質への簡単な答えとして、通常のユーザーによって見られます. しかし、一連のテストが業界標準になったら、すぐに「未知の問題」からトレーニングターゲットに変化します。 トピックは、紙、コード倉庫、ディスカッションエリアに表示したり、ポストトレインデータに収まることがあります。 チームが意図的に不正行為をしなかった場合でも、モデルが類似したコンテンツが、データソースが十分に広い限り上昇し続けられる可能性が高い。

別の偏差は、繰り返された試験から来ています。 開発者が評価規則を意識しているとき、彼または彼女はヒント、推論の長さ、サンプリング方法、およびスコアが最高になるまでのツール設定を変更することができます。 このように得られた結果は必ずしも偽物ではなく、真に未知のタスクの面でモデルの ' s のパフォーマンスと等価ではありません。 外部評価者にとって、テストセットの完全な隠蔽は鮮度を維持し、モデル企業にとっては、第三者に重量を与えることは、知的所有権とセキュリティリスクを課す可能性があります。 伝統的な慣行は、多くの場合、それらのいずれかを最初に収穫するように強制します。

二重盲目のパイロットの値は、それが1つであるという事実にあります。 保護環境により、評価コードがモデル上で動作し、相手を見えないものに制限することができます。 結果は、以前に合意した統計方法で生成することができます。元のタイトル、モデルの詳細、および中間データが境界内で残っています。 プロセスが適切に設計されている場合、モデルチームは単一トラックに基づいて最適化することはできません。また、評価者コピーやモデルを探索することができます。 紙ベースの機密保持契約よりも、参加者だけで自己規制に依存するのではなく、技術環境によって制限が実施されるため、より強化可能です。

しかし、「世界で初めてのダブルブリンドAIアセスメント」という表現は、アセスメント・ディレンマを解決したと解釈されるべきではありません。 パスワードの分離は漏出を減らしますが、自動的に主題自体が実質容量を表すことを保証しません。 完全な機密性であっても、テストの狭く、誤認または接続されていないセットは、誤解を招く可能性があります。 また、このシステムは、動作パラメータの設定、故障サンプルが考慮されているかどうか、結果が繰り返され、環境オペレータが過度な管理権限を持っているかどうかにかかわらず、ツールコールを処理する方法も明確にする必要があります。 Biblindは、方法論の完全な品質ではなく、情報の境界を保護します。

1つのパイロットから業界ルールまで、見直し機能を追加

このパイロットは、高値、低周波フロントラインモデル評価に適しています。 たとえば、セキュリティ容量、複雑な推論や専門知識試験のフィールド、再エンジニアリングのコストは、リポジトリ内の漏れが発生した場合に高くなります。 これらのタスクでは、モデルの配置と分離された環境でのテストセットは、パブリックランキングよりも有意義である可能性があります。 購買パーティーは、自社の業務に近いプライベートテストを行なうための独立した代理店を委託し、機密性の高いビジネスデータを直接モデルサプライヤーに渡すことなく実行することができます。

問題は、より多くの評価を閉鎖していることです, それが唯一の最終的なスコアを受け入れるために、外部の世界のために簡単です. 信頼性を構築するには、プロセスは十分な量の非敏感な情報の開示を必要とします: カバーする機能のテスト、サンプルの抽出方法、エラーが測定されたもの、動作設定があったもの、手動レビューがあったかどうか、環境を監査できるかどうか。 結果を再計算するために同じ合意を使用するより独立した機関にとって好ましいでしょう。 それ以外の場合、「テストセットは公開できません」は、合理的な漏れ防止からチャレンジに対するシールドに移行できます。

コストと使いやすさは、現実的なしきい値です。 暗号化、制御された実行と監査レコードは、プロジェクトの複雑さに追加され、フロントラインモデル自体は、大きな努力が必要です。 各モデルの更新はフル プロセスを再実行し、速い緩和される小さいチームのために適さないかもしれません。 したがって、二重盲検は、すべてのオープンベンチマークの即時交換よりも重要な評価のための高水準のオプションである可能性が高いです。 オープンテストは、学術的な回復と迅速な比較を促進し続けています。プライベートブラインドテストは、モデルの「未知のタスクに直面しる能力をテストする責任があります。これは互いに補完することができます。

長期的には、パイロットはモデルが提示された方法を変更しました。 過去には、企業は、多くの場合、リードを示すために独自の選択肢のリストを使用して、新しいモデルを発行しました。将来、重要な機能は、分離された環境と独立した評価者の両方によって支持される必要があるかもしれません。 業界にとって、これは「より良い測定」から「他の方が事前に測定される」という段階的なシフトにつながります。 スコアは現実世界のパフォーマンスと同じではありませんが、少なくとも彼らは最初の読書とその後の検査のためのスペースを減らすでしょう。

AIの評価が本当に欠如しているのは、より多くの決定的なポイントではありませんが、結論がどのように描画されるべきかについて自信があります。 DeepMindパイロットは技術的なパズルを提供しました。コラージュとモデルが相互の露出なしで会うことを可能にします。 以下は、運用ルール、統計方法、監査の責任を組織するための参加者の能力です。 それだけで “blindness” は単なる良いラベルではなく、モデルの機能ステートメントで検証できる証拠の層になります。