速報

Kimiのオープンソースの認識ベンチマーク、GPT-5.6-Solは60%のモデルブレークスルーなしトップ

Kimiチームは、オープンソースの大型モデル視覚感覚評価ベンチマーク認識ベンチマークの認識ベンチマークを宣言しました。これにより、視覚的な感覚能力を10アトミックグレードに分解し、視覚的な関係、カウント、特性、深さ、および3D、位置決め、微分粒子認識、コンテキスト統合、OCRおよび幻覚認識などの次元をカバーしています。 ベンチマークは、既存の集中型モデルの故障42基づいて、合計3,000個の手動で検証された質問で、それぞれが推論や外部の知識を必要としない単一の視覚機能を見ています。 アセスメントの結果は、16のフロントラインの大型マルチモジュラーモデルのどれも全体の精度が60パーセント以上であったことを示しています。 GPT-5.6-Sol は、Kimi K3 (セントあたり 58.5)、Claude-Fable-5 (セントあたり 57.2)、Gemini-3.1-Pro (セントあたり 56.2)、GPT-5.5 (セントあたり 55.8) で最初にランク付けしました。 視覚的な幻覚は、モデルの最も弱い性能であり続け、全体的な感覚能力を向上させるための重要な部屋があることを報告します。

OKX - リワードを獲得