PrismML 发布了压缩版 AI 模型 Bonsai 27B,将 270 亿参数模型缩小到 3.9 GB,使其能够在智能手机上本地运行。按 Decrypt 援引公司信息,这款模型可在 iPhone 17 Pro Max 上达到每秒 11 个 token,成为首批跨过手机内存门槛的 27B 级模型之一。

这类模型通常对内存要求很高。按文中说法,270 亿参数模型若以半精度运行,通常需要约 54 GB 内存,许多笔记本都难以承载。PrismML 这次将模型压缩到手机可运行的体积,主打的是端侧推理能力,而不是云端部署。

压缩后仍保留大部分性能

PrismML 采用的方案来自加州理工学院相关知识产权。其核心做法是把模型权重从 16 位浮点精度压缩到极低比特表示。二值版本只保留 +1 和 -1,三值版本则增加 0 这一状态,并让每 128 个权重共享一个 16 位缩放因子。

按公司披露的数据,二值版本相当于每个权重约 1.125 bit,体积约为原始全精度模型的十四分之一;三值版本约为 1.71 bit。PrismML 称,三值 Bonsai 27B 在 15 项基准测试中的平均得分达到全精度模型的 94.6%,一位版本则达到 76.11。

  • 手机版体积约 3.9 GB
  • iPhone 17 Pro Max 速度约 11 token/秒
  • M5 Pro 设备上约 26 token/秒

重点瞄准手机和低配设备

与常见低比特量化模型不同,Bonsai 27B 并未给部分敏感层保留更高精度“例外”。其嵌入层、注意力层和语言模型输出头都进行了端到端压缩。通常这类保留高精度层的做法能换取更稳定的效果,但也会推高模型体积。

PrismML 还在模型中使用了混合注意力结构,约 75% 的层采用线性注意力,而非完整的二次注意力。文章称,这使得 26.2 万 token 上下文窗口在端侧设备上变得更可行,否则在手机硬件上的计算成本会过高。

PrismML 今年 3 月已推出 Bonsai 8B,当时模型体积为 1.15 GB。这次从 8B 升级到 27B,被视为其压缩路线向更高能力模型推进的一步。文章称,27B 这一规模更接近持续推理、工具调用和多步代理任务稳定出现的区间。

苹果已接触相关压缩技术

除模型本身外,商业化进展也受到关注。PrismML 首席执行官 Babak Hassibi 向 CNBC 表示,公司正与苹果进行初步接触,苹果在评估这项压缩技术是否适合端侧使用。

PrismML 还表示,下一步计划是推出压缩版 Gemma 模型,之后再推进更大规模模型。文章同时提到,公司还提供名为 DSpark 的推测解码层,用于提升 GPU 场景下的吞吐效率。在 NVIDIA H100 上,这一方案可带来约 1.37 倍速度提升,且不改变输出结果分布。

如果这类超低比特压缩方案能够稳定落地,手机和低配电脑运行中等规模模型的门槛将继续下降,端侧 AI 的部署空间也可能随之扩大。