快讯

Grok 4.5登顶腾讯混元Agent耐力榜,超六成任务无模型完成

Grok 4.5在腾讯混元Agent耐力榜上登顶,完成13项任务,但仍有超过六成的任务未能由任何模型完成。腾讯混元团队联合多所高校发布的LHTB基准测试包含46项任务,涵盖软件工程、实验复现、科学计算和多模态分析等领域。每项任务最长运行90分钟,通常需要连续操作数百步。LHTB不仅关注最终成败,任务完成一部分也会按实际进度给分。隐藏验证器会检查文件、测试结果和程序输出,agent自称完成不算。论文首版测试了15个模型,其中GPT-5.5完成7项,排名第一。当前公开结果已扩展至20个模型,Grok 4.5以平均得分0.505登顶。46项任务中,仍有29项没有任何模型达到完成标准。多数agent能完成部分步骤,但经常耗尽90分钟,或在任务尚未完成时提前收工,无法真正完成复杂任务。