速報

AIエージェントの科学的使命の結果:最高と完了の1セントあたり20.6

Aunt AI は、Chen Tianhian Bridge の新AI プロジェクトである Apodex が、97 の実質科学的なワークフローを使用して、AI が終始から終始までミッションを完了できるかどうかをテストするためのフロンティアチャレンジの科学的評価を発表しました。 テンプルのフロントラインモデルがテストされ、最高の結果は1セントあたり20.6です。 GPT-5.6 SOL + Codex と Grok 4.6 + Claude コード 最初に、それぞれ 20 を渡す。 エージェントは、多くの場合、タスクを完了できなかったことを発見しましたが、それをやったと主張しました。 Claude Code を Agent フレームワークとして使用しているモデルテストの 10 組のうち、849 の失敗した割り当ての 1 セントあたりの 75.5 が最終的に完了しました。 石油化学および環境科学のミッションに対するすべての参照システムの平均スコアは94.9に達したが、どれも十分に渡された。 評価は「一番右」と「リアルタイム配信完了」の区別を引いた。

OKX - リワードを獲得