PrismMLは、AIモデル盆栽27Bの圧縮版をリリースし、27億個のパラメトリックモデルを3.9GBに削減し、スマートフォン上でローカルで動作することを可能にします。 Decrypt を使用して、会社の情報を引用します。, モデルに達することができます。 11 iPhoneで秒あたりのトークン 17 Pro Max 携帯電話のためのメモリのしきい値を渡すために最初の 27B グレード モデルの 1 つになる.
そのようなモデルは、通常、メモリの高いレベルを必要とします。 テキストによると、通常、半減期で動作する27億億のパラメータモデルは、約54 GBのメモリを必要とします。 PrismMLは、クラウド展開の代わりに、エンドサイドの推論機能を使用して、操作できる携帯電話のサイズにモデルを圧縮します。
圧縮の後で性能のほとんどを保ちます
PrismMLは、Caltech関連の知的財産からプログラムを使用しています。 コアのアプローチは、16ビットの浮動小数点の精度から非常に低いビットの式にモデルの重みを圧縮することです。 バイナリバージョンは、+1と-1のみを保持し、3つの値バージョンは、この状態に0を追加し、16ビットのスケーリング係数を各128重量で共有することができます。
同社が保有するデータでは、2つの値バージョンは、元のフル精度モデルの約1fourthのボリュームで、重量1.125ビット程度に対応しています。 3つの値バージョンは約1.71ビットです。 PrismML は、Bonsai 27B が 15 ベースラインテストと 76.11 のフル精度モデルの 94.6 の平均スコアを達成した 3 つの値が述べています。
- セルラーバージョン 約3.9 GB
- iPhone 17のプロ マックスは、約11のトークン/秒の速度を加速します
- M5のプロ装置およそ26のトークン/秒
携帯電話や低品質機器の焦点
一般的な低ビット定量モデルとは異なり、盆栽27Bは、いくつかの敏感な層のためのより高い「例外」を保持しません。 埋め込まれた層、焦点の層および言語モデルの出力のエンドツーエンドの圧縮があります。 一般的に、高精度層の保持はより安定した効果を交換するだろうが、モデルのサイズを後押しする。
PrismMLはまた、注意構造のミックスを使用し、レイヤーの約75%は、完全な二次的注意の代わりに線形注意を使用します。 記事によると、これは262,000トークンコンテキストウィンドウをエンドサイドデバイスでより有効にします。そうしないと、携帯電話のハードウェアの計算コストは過度になります。
今年3月に盆栽8Bを発売したプリズムMLは、モデルが1.15 GBであった。 8Bから27Bまでのアップグレードは、圧縮されたルートの大容量モデルへのステップとして見られます。 記事によると、このサイズは、継続的な推論、ツールコール、マルチステッププロキシミッションの安定したゾーンに近いです。
アップルは、関連する圧縮技術にさらされています。
モデルそのものに加えて、商品化の進行も注目されています。 PrismML、Babak Hassibiのチーフ・エグゼクティブ・オフィサーは、同社がアップルとの初期接触にあったCNBCに指示し、エンド・サイド・ユースのためのこの圧縮技術の適合性を評価しました。
PrismMLは、次のステップは、圧縮されたGemmaモデルを起動し、より大きなスケールモデルを前進させると示しました。 この記事はまた、同社はまた、GPUシーンでの受動効率を高めるために使用されるDSparkと呼ばれるデコード層を提供するという言及しています。 NVIDIA H100 では、このオプションは、約 1.37 回増加し、出力結果の分布を変更することはできません。
こうした超低ビット圧縮プログラムが安定化できる場合、携帯電話や低エンドコンピュータの閾値で中型モデルの動作を継続し、エンド・サイド・AIの展開スペースが拡大する可能性があります。
