研究チームは、「モデルを小さくし、その性能を弱める」という共通のトレードオフを破ろうとする新しいAIモデルの圧縮方法を提案しました。 8月25日にHugging Faceブログにて、OpenAI Open GPT-OSS 120Bを60億個のパラメーターに圧縮し、4ビット式にさらに押し込み、複数のテストで対応する60Bフルバージョンよりも優れているモデル。
9件のテストが7件見つかりました
Quantification-Aware Health という名前のリサーチチーム。 開示によると、圧縮された60Bモデルは、通常、より高い品質と見なされた対応するモデルである60Bの「unquantified」バージョンを超えた9ベースラインテストの7が含まれています。
圧縮されたバージョンが元の120Bの大きなモデルを完全に超えているわけではありません。 この記事では、120Bの元のバージョンはまだほとんどの比較で強力であることを言及していますが、圧縮されたバージョンは、以前の異常なしきい値を渡します。 ローカルテスト結果がさらに低いRAMと少ないパラメータで達成できます。
- オリジナルモデル: GPT-OSS 120B
- 圧縮されたサイズ:60B変数
- 記憶は4ビットを示します
その点は、被写体が変更された点です。
大規模なモデルを縮小し、より小さいモデルがこの「メディア版」を模倣できるようにするための一般的な練習です。 問題は、この中間バージョン自体が圧縮プロセス中にその容量の一部を失ったことです。 訓練された小さなモデルは、通常、この「失敗した答え」に近いです。
トレーニングの目的を変更しました。 研究チームは、小さなモデルが結露された中間バージョンを続行することができませんでしたが、直接、元の、非圧縮の大きなモデルから結果を学ぶことができました。 つまり、コンプレッションのステップはパフォーマンスの損失だけではありませんが、追加のスーパーバイザーのトレーニング機会として使用されます。
ローカル展開のためのより魅力的な
この結果がより多くのモデルで再現できるのであれば、主に展開終了です。 パラメータとビット幅の小さいサイズは、モデルを実行するために必要な可視性と電力の両方が低下することを意味します。 記事によると、この「リハビリテーション」バージョンは、元のモデルのメモリの約4分の1だけを要求します。
これは、データセンターからデスクトップデバイスに移動し、さらにはモバイルエンドにモデルの能力に直接影響を与えます。 限られた予算、独立した開発者、およびローカル展開されたユーザーを持つ研究所では、推論コストの低下は、それ自体が重要な変化です。
オープンソースの重みを公開
Multiverse Companyは、オープンウェイトでHugging Faceに圧縮されたHypernova-60Bが公開され、ユーザーがダウンロードできることを示します。 しかし、このモデルを生成するために使用される圧縮ツールは、まだ独占的であり、完全なプロセスは現時点では開いていません。
追加情報:現在、GPT-OSSのみをカバーしているテストでは、Llama、Qwen、Mistralなどの他の主流モデルファミリーに拡張されず、方法論の相互運用性が続いています。
