速報
反応固有の測定:GPT-5.6 最初は解決しますが、ベストは43.1%だけを達成しました
7月16日には、AIプログラミングエージェントが実際の React 開発を実行できるかどうかをテストし、新しいコードの質問を導入しないようにするために、React 開発ツールを専門とするミリオンチームが ReactBench v1 を立ち上げました。 React は、Web サイトと App インターフェイスを作成するために使用される主要な JavaScript ライブラリです。 以前は、React Scan、React Doctor、Milliam.jsなどのオープンソースツールを開発しました。 ReactBenchは、オープンソースプロジェクトから51件の実際のジョブをシフトします。 機能の機能の確認に加えて、400以上のルールを使用して、手続き上のエラー、パフォーマンス、アクセシビリティ、コードの品質の問題をスクリーニングします。 GPT-5.6 SOL は、43.1% と Fable 5 41.2% の結合された分離を受けました。 正式に、2つの差が小さくなり、Solが時間のために大幅に強くなることを確認することはできません。 Fable 5 の単一のテストコストは、Sol の約 6.3 回 XHigh 設定です。 最高の構成でも、成功するタスクは半分以下です。 4455 の新しい機能開発テストの 1194 反応の問題はモデルで導入されました。, の 77.5 パーセントは、手続き上のエラーやセキュリティの問題でした。。
