DeepReinforce 上周发布开源编码模型系列 Ornith-1.0,并以 MIT 许可开放在 Hugging Face。该系列并不主打通用对话,而是面向能够在代码仓库和终端环境中独立执行任务的 AI 编码智能体。

提供 9B 到 397B 版本

这次发布的模型共四个规格,分别为 9B、31B、35B MoE 和 397B MoE。DeepReinforce 将其定义为面向智能体编码任务的模型家族,重点是让模型在真实开发流程中完成多步操作,而不是只生成一段代码。

所谓智能体编码,指的是模型接收任务后,可以自行读取文件、运行测试、定位报错、修改代码,再继续循环执行,直到任务完成。与常见聊天式 AI 不同,这类模型更强调在较少人工干预下完成完整开发流程。

训练方式覆盖执行策略

DeepReinforce 介绍,许多编码智能体通常依赖人工预设的执行框架,例如何时调用工具、如何拆解任务、遇到错误后怎样处理。Ornith 的做法是把这套执行框架也纳入训练,让模型在完成任务的同时,逐步优化自己的执行策略。

公司同时提到,为避免模型通过钻规则空子拿到高分,训练中加入了三层限制:测试环境和验证脚本不可修改;监控系统会识别访问受限路径或改动验证流程的行为;另有一个冻结的裁决模型用于否决异常结果。

397B 与 9B 都给出高分

按照 DeepReinforce 披露的数据,397B 旗舰版在 SWE-bench Verified 上得分 82.4。这个测试会给模型一个真实开源仓库中的漏洞或缺陷,让其在看不到测试集的情况下完成修复,并按成功解决问题的比例计分。

  • 397B 版本在 SWE-bench Verified 上得分 82.4
  • 397B 版本在 Terminal Bench 2.1 上得分 77.5
  • 9B 版本在 SWE-bench Verified 上得分 69.4

报道提到,397B 版本在 SWE-bench Verified 上高于 Claude Opus 4.7 的 80.8,也高于 DeepSeek-V4-Pro 的 80.6;在 Terminal Bench 2.1 上,Ornith 为 77.5,Claude Opus 4.7 为 70.3。

不过,围绕 SWE-bench 的训练污染争议一直存在,即模型可能记住训练时见过的题目答案。为此,Ornith 也公布了在更难的 SWE-bench Pro 上的成绩,397B 版本得分为 62.2,低于其在 Verified 上的表现,但仍保持竞争力。

更受关注的可能是小模型表现。9B 版本在 SWE-bench Verified 上达到 69.4,高于 Gemma 4-31B 的 52.0,也接近 Qwen 3.5-35B 的 70 分区间。以参数规模看,这意味着 Ornith 的小模型在编码任务上展现出较高效率。

明确不做通用聊天模型

DeepReinforce 在模型文档中也提醒,Ornith-1.0 可能不适合非编码任务。如果用户希望它总结文档、写邮件或处理一般性文本工作,这套模型未必是合适选择。

文章显示,Ornith 的定位很明确:它服务的是已经在搭建自托管编码流水线、智能体基础设施或自动化开发工具的团队,而不是面向普通消费者的通用 AI 助手。

从对比口径看,Ornith 超过部分闭源模型的成绩主要体现在特定编码基准上,且更适合放在同类开源模型与智能体编码任务这一范围内理解。对开发者而言,真正的价值在于较小和中等规模模型能否在边缘硬件或自建环境中稳定运行。