速報

AMDリリースフルオープンソースMoE大型モデルInstella-MoE、16Bパラメータサイズチャレンジメインストリームオープンソースモデル

7 月 25 日、AMD は、フル オープンソース ミックス エキスパート モデル (MoE) Instella-MoE の発売を発表しました。合計パラメーターが 16 億、各トークンは 2.8 億のパラメーターをアクティブにし、同じサイズのオープンソースの言語モデルで主要なパフォーマンスとして記述されています。 AMDは、Instella-MoEが独自のAMDインスティテュートMI300XとMI325X GPUに基づいており、ROCmリポジトリがゼロトレーニングから完了し、Gated Multi-head Late ActionやFarSkip-Collectiveなどの構造的革新を導入することで、トレーニングと推論の効率を改善しました。 パフォーマンステストでは、Instella-MoE-16B-A3Bベースモデルが平均76.7ポイントを獲得し、SmolLM3-3B、OLMo-3-7Bモデルにランクされ、2.8億のパラメータが有効化されたときにより大きなモデルと競合していることを示しています。 また、64K対応のモデルです。 トークンコンテクスト処理とプリトトレーニング、中期トレーニング、長期的コンテクスト拡張、過視微調整(SFT)、直接設定最適化(DPO)、強化学習(RL)などの完全なトレーニングプロセスを完了します。 今回、AMDは、Instella-MoEモデルの全ての重量、トレーニング構成、データマッチング、中間チェックポイントと推論コードのリリースを合成し、オープンAIモデルの研究とレプリケーションを推進します。 AMD は、AMD ハードウェアとオープン ソフトウェアエコロジーに基づく大規模な MoE モデルのトレーニングを実施する Instella-MoE を実証し、今後、より大きく、より合理的かつ効率的なオープンソース言語モデルの開発を進めていきます。

OKX - リワードを獲得