OpenDesign Arena 本周对 13 款 AI 模型进行了同一组设计任务测试。结果显示,DeepSeek V4.1 Flash 在真实设计场景中的表现,已经接近 OpenAI 的 GPT-6 Astra,但运行成本远低于后者。
测试结果接近头部模型
OpenDesign Arena 主要评估网页应用、仪表盘、移动端界面和落地页等日常设计任务。它给出的总分中,30 分看任务是否真正完成,70 分看版式、层级、配色和风格匹配度。
在这次测试里,GPT-6 Astra 以 82.7 分排在第一。DeepSeek V4.1 Flash 得到 81.2 分,达到前者成绩的 98%。两者分差只有 1.5 分。
成本差距明显
OpenDesign 给出的数据还显示,GPT-6 Astra 完成一项设计平均要 11.1 分钟,费用为 1.61 美元。DeepSeek V4.1 Flash 平均用时 5.3 分钟,单次成本只有 0.023 美元。
在 13 个模型中,除 GPT-6 Astra 外,其余 11 个模型的得分都低于 DeepSeek V4.1 Flash,且运行成本更高。参与测试的模型还包括 Claude Fable 5.1、Grok 4.6、Qwen 3.8-Max、Kimi K3、GLM-5.3 Flash 和 Gemini 3.8 Flash。
低价来自参数激活方式
DeepSeek 的技术报告称,V4.1 Flash 总参数量为 5520 亿,但在读取提示词时只激活 80 亿参数,生成回复时激活 160 亿参数。公司将这一设计称为 Causal Encoder-Decoder。
OpenDesign 也提醒,这类测试更偏向衡量稳定输出网页的能力,而不是通用推理或编程水平。GPT-6 Astra 则是 OpenAI 于 9 月 3 日发布的新模型,在这项设计榜单上仍然保持领先。
