Yin Weidaが発表した最近の研究では、連続したマルチステップの意思決定を必要とするAIミッションでは、パフォーマンスギャップを本当に開くボトムモデルではなく、その周りに構築された実装フレームワークを示しています。 メモリ、コンテキスト、フィードバック、ツールへのアクセスを担当するシステムは、回答からマンデートまでのモデルの重要なコンポーネントです。

クラウデオプス 5〜100%

研究では、Young WidaチームはClaude Opus 5用のカスタマイズされた実装フレームワークを設定し、モニターと同様の高レベルのプロキシコンポーネントを追加しました。 結果は、モデルがインタラクティブな推論ベンチマークARC-AGI-3で100パーセント達成したことを示しています。

このフレームワークが使用されていない場合、Claude Opus 5 スコア 30%。 でも、この成果は、テストモデルの中で最高です。 これにより、モデリング能力が重要である一方で、周辺システムの設計は、長いミッションシナリオでより影響力があります。

より長い割り当ては、是正力に依存します。

長いミッションは、単一のリマインダーに応答するのではなく、タスクを確定するために、長い期間にわたって複数の判断のためのAI のsの必要性として定義されます。 そのようなタスクは、AIのプロキシ研究では困難でした。モデルは、実装中に自分の目的から簡単に取り外されるか、途中で不活性に探索されるからです。

エイデル・エル・ハナック、ヤング・ワイダ・プロダクツ副社長は、エージェントは、多くの場合、モデル・インタフェースとして、外部の世界によって理解されたと述べたが、実際のシステムは、モデル自体よりもはるかに多くありました。 また、ツールキット、運用環境、各種コンピテンシーモジュールを装備し、ミッションの推進をサポートします。

この記事では、今年のマイクロソフトでは、長い編集の割り当てのための19大型モデルの処理文書をテストし、フロントラインモデルを含むシステムが、多くのエラーを生成したことを言及しています。 ドキュメントを誤って削除したり、データベースを削除したり、目的を達成するためにクロスボーダーのアクションに従事したりするモデルが優先されました。

過視の代理店はキーの設計になります

Ying Weidarが選んだARC-AGI-3は、言葉のない2次元インタラクティブゲームです。 モデルは自分のルールを見つけて目標を達成する必要があります。 そのようなタスクのシステムの性能が安定した通関のレベルに達したことを意味する100パーセントの平均の賛成。

この記事では、OpenAIモデルがARC-AGI-3で10セント未満のスコアを獲得し、その後、実装フレームワークパラメータを調整することにより、元のレベル約3倍の達成度を増加させたことを言及しました。 しかしながら、英国のウィーダ研究では、まだそのレベルではありません。

Ying Weidaによると、違いへの鍵の1つは「スーパーバイザー剤」の包含です。 このコンポーネントは、メインエージェントのジャム、ダイバート、または古いパスを繰り返すときに介入し、より効果的な方向でシステムをバックアップします。 研究チームは、実装プロセスの修正において、トップレベルのロールと比較しました。

同じモデルの費用は分けられます。

エージェンシー・バリエーション・オペレーションズ(AVO)と呼ばれる。 しかし、これは新しい製品ではなく、既存の技術に基づく実装フレームワークであることを示しています。 ネモブランドを通じて、Weedaは現在、エージェンシーフレームワークの構築のためのさまざまな技術的コンポーネントを提供しています。そのうちのいくつかは、商用化され、他の人が使用するために開かれています。

この研究では、過去の業界における別の観察を強調しています。同じモデルは異なる実装フレームワークを同梱しており、コストと効果の大きな違いがあります。 以前は、フレームワークの選択自体がAI使用のコストを倍増させる可能性があることをDatabricksは示しました。

そうすることで、ワイイダは表現の枠組みが高まっていることを強調した。 ユーザーは、実装フレームワーク、インフラ、運用環境をコントロールすれば、組織のパフォーマンスを細かく調整し、精度を高めながら安全性を向上させることができると確信しています。