速報
Grok、エージェントの耐久性リストの4.5、モデルなしで60%以上
Grok 4.5 は、エージェントの持久力リストのトップをとり、13 個のタスクを実行しましたが、60 パーセント以上はモデルでは実行できませんでした。 テレコミュニケーションの雑種のチームによって発行されるLHTBのベンチマーク テストはソフトウェア工学、実験的な再発、科学計算および複数のモジュラー分析のような仕事区域をカバーする46構成します。 各ミッションは最大90分間実行され、通常は数百歩の連続運転が必要です。 LHTBは、究極の成功や失敗だけでなく、タスクの完了の一部の実際の進捗にも懸念しています。 認証者を隠すと、ファイル、テスト結果、プログラムの出力、およびそれがカウントされないエージェントのクレームが確認されます。 GPT-5.5 が 7 完了し、最初にランク付けされた紙の最初の版で 15 種類のモデルがテストされました。 現在の結果は20モデルに拡張され、Glk 4.5ピークは0.505の平均スコアです。 46のミッションのうち、29はまだ完了基準を満たしたモデルを持っていません。 ほとんどのエージェントは、いくつかの手順を完了することができてきました, しかし、多くの場合、90分を費やすか、タスクを完了していないと、実際に複雑なタスクを完了することはできません。
