DeepReinforce は、先週の Open Source Model Series Ornith-1.0 をリリースし、Hugging Face で MIT の許可を受け付けています。 本シリーズは、一般的な対話に焦点を合わせませんが、コード倉庫やターミナル環境で独自にタスクを実行できるAIコード型のインテリジェンスボディに向き合っています。

9Bを397Bバージョンに提供

モデルは、9B、31B、35B MoEと397B MoEの4つの仕様でリリースされました。 DeepReinforceは、単一のコードを生成するのではなく、モデルが実際の開発プロセスで複数のステップを実行することに焦点を合わせ、スマートボディコーディングミッション用のモデルファミリーとして定義します。

インテリジェントなコーディングは、タスクが完了するまで、ファイルを読み、テストを実行し、エラーの位置、コードを変更し、再サイクルし続ける能力を指します。 一般的なチャットAIとは異なり、これらのモデルは、手動介入が少ないフル開発プロセスを完了することに重点を置いています。

実装戦略をカバーするトレーニング方法

DeepReinforce は、通常、ツールを呼び出すときに、タスクを分解する方法、エラーに対処する方法など、人工的に定義された実装フレームワークに依存する多くのコーディングのスマートについて説明しています。 Orith ' s のアプローチは、この実装フレームワークをトレーニングに組み込むことです。これにより、モデルは徐々にその実装戦略を最適化し、その mandate を満たします。

同時に、同社は、ドリルルールを介して高いマークを得るモデルを避けるために、トレーニングに制限の3層が追加されました。 テスト環境とバリデーションスクリプトは非修飾です。制御システムは、制限されたパスや認証プロセスの変更へのアクセスを識別します。また、異常な結果を拒否するためにフリーズフリーのアワードモデルが使用されます。

397Bおよび9Bは両方高い印を与えます。

DeepReinforceによると、397BのフラッグシップスコアはSWE-bench Verifiedの82.4でした。 このテストは、モデルを実際のオープンソースの倉庫にループホールまたは欠陥を与え、テストセットを見て、ソリューションの成功に比例してそれを評価することなく修理を完了することができます。

  • SWE-bench検証82.4の397Bスコア
  • ターミナルベンチの397Bスコア 2.1 77.5
  • 9B スコア に SWE-bench 検証 69.4

報告書によると、SWE-benchの397Bバージョンは、Claude Opus 4.7とDeepSeek-V4-Proよりも80.8より高いです。 ターミナルベンチ2.1では、Ornithは77.5であり、Claude Opus 4.7は70.3です。

しかし、SWE-benchの周りの汚染の紛争を訓練してきました。つまり、トレーニングで見てきた質問に対する答えを覚えているかもしれません。 この目的のために, Ornithはまた、より困難なSWE-bench Pro上の結果を発表しました, 397Bバージョンは62.2に分割されています, これは、検証上の性能よりも低いが、競争力を維持します.

より興味深いのは、おそらく小さなモデルのパフォーマンスです。 9Bバージョンは、SWE-bench Verifiedで69.4に達し、Gemma 4-31Bの52.0以降、Qwen 3.5-35Bの70パーティションに近い。 パラメータの大きさでは、Orith の小さなモデルは、コーディングタスクの効率性を高めることを意味します。

Unequivocal一般的なチャットモデル

DeepReinforce は、Ornith-1.0 がノンコーディングのタスクに適さないモデルのドキュメントにも思い出させます。 ユーザーが文書をまとめたり、メールを送ったり、一般的なテキストを処理したりしたい場合、モデルは適切な選択肢ではないかもしれません。

記事によると、Ornithはよく配置されています: 一般的なAIアシスタントではなく、コーディング水ライン、スマートインフラ、自動開発ツールをホストするチームを支援します。

対照的に、Ornithのパフォーマンスは、部分的なクローズドソースモデルよりも主に特定のコーディングベンチマークに反映され、同じオープンソースモデルとインテリジェントなコードミッションの文脈でより適切に理解されています。 開発者にとって、現実的な価値は、小規模なモデルがマージンハードウェアや自己構築環境で着実に動作できるかどうかにあります。