
今天,我们发布 Bonsai Image 4B,这是一系列紧凑型图像生成模型,旨在本地硬件(从笔记本电脑到手机)上运行高质量的扩散模型推理。
Bonsai Image 4B 提供两种变体:
- 1-bit Bonsai Image 4B 使用二值 {−1, +1} Transformer 权重,并带有 FP16 分组缩放因子,每个权重有效比特数为 1.125。它面向最大程度的压缩,当内存压力、带宽和部署规模是主要限制条件时,它是合适的选择。
- 三元 Bonsai Image 4B 使用 {−1, 0, +1} Transformer 权重,并带有 FP16 分组缩放因子,每个权重有效比特数为 1.71。额外的零状态为模型提供了更强的表示灵活性,在保持极致紧凑的同时,提升了视觉质量和提示词忠实度。
这为图像生成开辟了一种新的部署模式:具备能力的输出、开放的权重,以及在以往此类模型无法触及的设备上实现实用的本地推理。据我们所知,Bonsai Image 4B 是首个在其参数量级别中能直接在 iPhone 上运行的图像模型。
为本地生成而构建

本地图像生成始于一个硬性约束:模型必须适配设备的可用内存。
对于一个 4B 级别的图像模型,扩散 Transformer 是模型中最大的部分,也是在生成过程中反复运行的部分。每个去噪步骤都会再次调用 Transformer,因此 Transformer 的大小直接影响内存压力、带宽需求和本地推理速度。
Bonsai Image 4B 基于 FLUX.2 Klein 4B 构建。它保持了架构不变,但改变了 Transformer 权重的表示方式。通过将这些权重转换为二值和三元形式,Bonsai 缩减了图像流程中对本地部署最关键的部分。
| 模型 | 扩散 Transformer | 相较于 FP16 的缩减比例 |
|---|---|---|
| FLUX.2 Klein 4B | 7.75 GB | 1.0x |
| 1-bit Bonsai Image 4B | 0.93 GB | 8.3x |
| 三元 Bonsai Image 4B | 1.21 GB | 6.4x |
表 I:各模型的扩散 Transformer 占用空间
二值化层相比全精度 Transformer 权重实现了约 14 倍的缩减。一小部分对精度敏感的支撑张量(约 5%),称为投影层,仍保留在 FP16 精度,因此最终的 1 位 Bonsai Image 4B Transformer 大小为 0.93 GB:相比全精度的 FLUX.2 Klein 4B 的 7.75 GB,缩减了 8.3 倍。
三值化变体遵循相同的结构。其三值化层实现了约 10 倍的缩减,最终的三值化 Bonsai Image 4B Transformer 大小为 1.21 GB,相比全精度 Transformer 缩减了 6.4 倍。它比 1 位模型稍大,但额外的零状态提升了视觉质量和提示词忠实度。
包括压缩后的文本编码器和 FP16 VAE,1 位 Bonsai Image 4B 在 Apple Silicon 上的部署负载为 3.42 GB,三值化 Bonsai Image 4B 为 3.88 GB。作为对比,全精度的 FLUX.2 Klein 4B 需要 15.97 GB 的部署负载。由于在运行时,文本编码器在提示词编码完成后会被卸载,因此平均内存使用量小于总负载。在生成 512x512 图像时,二值化和三值化模型的平均活跃内存分别为 1.5 GB 和 1.96 GB,而原始 FLUX.2 Klein 4B 为 11.74 GB(分别缩减了 7.8 倍和 6.0 倍)。对于 1024x1024 图像,二值化和三值化模型的平均活跃内存分别为 1.95 GB 和 2.38 GB,而原始 FLUX.2 Klein 4B 为 14.39 GB(分别缩减了 7.4 倍和 6.0 倍)。
内存占用的减少改变了模型可运行的设备范围。我们的部署栈支持 Apple Silicon 的 iPhone、iPad 和 Mac,以及 CUDA GPU,在 Apple 硬件上使用 MLX 低位路径,在 CUDA 上使用 Gemlite 低位 GEMM 内核。在 iPhone 17 Pro Max 上,全精度的 FLUX.2 Klein 4B 流水线无法适配设备内存预算,而两种 Bonsai Image 变体均可在设备端运行。
视频 I:Bonsai Studio 上的图像生成
在实际应用中,Bonsai Image 4B 在 iPhone 17 Pro Max 上生成一张 512x512 图像需要 9.4 秒,在 Mac M4 Pro 上约需 6 秒。在 Mac M4 Pro 上,Bonsai Image 4B 比原版全精度的 MFLUX 流水线快最多 5.6 倍。
性能基准测试
压缩只有在模型保持有用时才重要。我们在三个互补的基准上评估了 Bonsai Image 4B:用于物体组合和属性绑定的 GenEval;用于人类偏好和美学质量的 HPSv3;以及用于密集提示词遵循和语义忠实度的 DPG-Bench。

| 模型 | 扩散Transformer占用空间 (GB) | GenEval | HPSv3 | DPG-Bench | 相对于FLUX.2 Klein 4B的尺寸缩减 | 相对于FLUX.2 Klein 4B的性能 |
|---|---|---|---|---|---|---|
| 1-bit Bonsai Image 4B | 0.93 | 0.671 | 11.15 | 0.822 | 8.3x | 88% |
| 三值 Bonsai Image 4B | 1.21 | 0.723 | 12.22 | 0.851 | 6.4x | 95% |
| FLUX.2 Klein 4B | 7.75 | 0.819 | 12.84 | 0.853 | 1x | 100% |
| SDXL | 5.14 | 0.3 | 10.05 | 0.74 | 1.5x | 67% |
| BK-SDM-Small | 0.98 | 0.297 | 3.05 | 0.559 | 7.9x | 42% |
| Stable Diffusion 1.5 | 1.72 | 0.396 | 4.2 | 0.601 | 4.5x | 51% |
| PixArt-Σ XL 2 | 1.2 | 0.541 | 11.93 | 0.769 | 6.4x | 83% |
表 II:三值 Bonsai Image 4B 与其他模型的图像质量基准比较。
三值 Bonsai Image 4B 是面向质量的变体。在 1.21 GB 的尺寸下,它在 GenEval、HPSv3 和 DPG-Bench 上保留了 FLUX.2 Klein 4B 95% 的准确率,同时将扩散Transformer的占用空间减少了 6.4 倍。
1-bit Bonsai Image 4B 是面向占用空间的变体。它将扩散Transformer的尺寸降至 1 GB 以下,缩减了 8.3 倍,同时在这三项评估中仍然取得了强劲的基准分数(保留了 FLUX.2 Klein 4B 88% 的准确率)。
这两个变体共同推动了质量与占用空间的前沿。Bonsai Image 在与现代 4B 级图像模型竞争时,仅使用了其扩散Transformer占用空间的一小部分。同时,它在性能上大幅超越了具有相似内存占用空间的更小模型。这与我们在之前的 Bonsai 语言模型中看到的帕累托迁移相同。Bonsai Image 将现代扩散Transformer的行为带入了以前属于更小、能力更弱模型的内存范围。
为何重要
图像生成不仅是一个模型质量问题,也是一个部署问题。
对于许多产品而言,云 API 仍将是正确的选择。但纯云生成模式会带来特定的产品限制:每个提示词都是一次远程请求,每次迭代都产生边际服务成本,每次交互都会增加往返延迟。
这一点之所以重要,是因为图像生成本质上是迭代式的。用户很少只生成一张图就停下。他们会修改提示词、比较输出结果、生成变体、丢弃失败作品,然后重新尝试。当每次尝试都是服务器端的任务时,创作循环就变成了用户需要计量和等待的事情。本地推理改变了这一点。一旦模型能装进设备,生成过程就可以直接嵌入产品体验中。运行成本更低,迭代速度更快,在那些提示词和生成资产需要保持私密的环境中也更容易使用。
Bonsai Image 4B 正是朝着这种部署模式迈出的一步:在用户已有的硬件上,让具备能力的图像生成更贴近用户运行。

可用性
1-bit 和 Ternary Bonsai Image 4B 都将以 Apache 2.0 许可证开放权重和代码发布。伴随此次发布,我们还推出了 Bonsai Studio,这是一款 iOS 应用,可直接在 iPhone 上试用 Bonsai Image 4B。
加入我们
PrismML 由加州理工学院的研究团队创立,并获得了 Khosla Ventures、Cerberus 和 Google 的支持。我们花了数年时间攻克该领域最棘手的问题之一:在不牺牲推理能力的前提下压缩神经网络。
如果你想帮助构建下一代最先进的 AI,我们期待你的来信。请查看我们的招聘页面。
资源
- 白皮书
- Hugging Face
- WebGPU 演示
- iPhone 版 Bonsai Studio
- GitHub