Hacker News 热门(buzzing.cc 中文翻译)
精选
72AI 编辑部评分,满分 100

本地设备 AI 图像生成模型 1-Bit Bonsai Image 4B 发布

2026-06-01 01:47· 77天前· modinfo
AI 导读

1-Bit Bonsai Image 4B 是一款新的 AI 图像生成模型,其主要特点是面向本地设备进行优化,可以在用户的本地硬件上运行。这是一款专注于端侧部署的图像生成解决方案。

推荐理由

端侧图像生成终于进入可用阶段,把 4B 模型压到 iPhone 能跑而且性能保留 95%,做本地 AI 应用的产品人应该认真看一眼。

正文 · AI 翻译
来自三元 Bonsai 4B 生成的图像

今天,我们发布 Bonsai Image 4B,这是一系列紧凑型图像生成模型,旨在本地硬件(从笔记本电脑到手机)上运行高质量的扩散模型推理。

Bonsai Image 4B 提供两种变体:

  • 1-bit Bonsai Image 4B 使用二值 {−1, +1} Transformer 权重,并带有 FP16 分组缩放因子,每个权重有效比特数为 1.125。它面向最大程度的压缩,当内存压力、带宽和部署规模是主要限制条件时,它是合适的选择。
  • 三元 Bonsai Image 4B 使用 {−1, 0, +1} Transformer 权重,并带有 FP16 分组缩放因子,每个权重有效比特数为 1.71。额外的零状态为模型提供了更强的表示灵活性,在保持极致紧凑的同时,提升了视觉质量和提示词忠实度。

这为图像生成开辟了一种新的部署模式:具备能力的输出、开放的权重,以及在以往此类模型无法触及的设备上实现实用的本地推理。据我们所知,Bonsai Image 4B 是首个在其参数量级别中能直接在 iPhone 上运行的图像模型。

为本地生成而构建

来自 1-bit Bonsai Image 4B 生成的图像

本地图像生成始于一个硬性约束:模型必须适配设备的可用内存。

对于一个 4B 级别的图像模型,扩散 Transformer 是模型中最大的部分,也是在生成过程中反复运行的部分。每个去噪步骤都会再次调用 Transformer,因此 Transformer 的大小直接影响内存压力、带宽需求和本地推理速度。

Bonsai Image 4B 基于 FLUX.2 Klein 4B 构建。它保持了架构不变,但改变了 Transformer 权重的表示方式。通过将这些权重转换为二值和三元形式,Bonsai 缩减了图像流程中对本地部署最关键的部分。

模型 扩散 Transformer 相较于 FP16 的缩减比例
FLUX.2 Klein 4B 7.75 GB 1.0x
1-bit Bonsai Image 4B 0.93 GB 8.3x
三元 Bonsai Image 4B 1.21 GB 6.4x
表 I:各模型的扩散 Transformer 占用空间

二值化层相比全精度 Transformer 权重实现了约 14 倍的缩减。一小部分对精度敏感的支撑张量(约 5%),称为投影层,仍保留在 FP16 精度,因此最终的 1 位 Bonsai Image 4B Transformer 大小为 0.93 GB:相比全精度的 FLUX.2 Klein 4B 的 7.75 GB,缩减了 8.3 倍。

三值化变体遵循相同的结构。其三值化层实现了约 10 倍的缩减,最终的三值化 Bonsai Image 4B Transformer 大小为 1.21 GB,相比全精度 Transformer 缩减了 6.4 倍。它比 1 位模型稍大,但额外的零状态提升了视觉质量和提示词忠实度。

包括压缩后的文本编码器和 FP16 VAE,1 位 Bonsai Image 4B 在 Apple Silicon 上的部署负载为 3.42 GB,三值化 Bonsai Image 4B 为 3.88 GB。作为对比,全精度的 FLUX.2 Klein 4B 需要 15.97 GB 的部署负载。由于在运行时,文本编码器在提示词编码完成后会被卸载,因此平均内存使用量小于总负载。在生成 512x512 图像时,二值化和三值化模型的平均活跃内存分别为 1.5 GB 和 1.96 GB,而原始 FLUX.2 Klein 4B 为 11.74 GB(分别缩减了 7.8 倍和 6.0 倍)。对于 1024x1024 图像,二值化和三值化模型的平均活跃内存分别为 1.95 GB 和 2.38 GB,而原始 FLUX.2 Klein 4B 为 14.39 GB(分别缩减了 7.4 倍和 6.0 倍)。

内存占用的减少改变了模型可运行的设备范围。我们的部署栈支持 Apple Silicon 的 iPhone、iPad 和 Mac,以及 CUDA GPU,在 Apple 硬件上使用 MLX 低位路径,在 CUDA 上使用 Gemlite 低位 GEMM 内核。在 iPhone 17 Pro Max 上,全精度的 FLUX.2 Klein 4B 流水线无法适配设备内存预算,而两种 Bonsai Image 变体均可在设备端运行。

视频 I:Bonsai Studio 上的图像生成

在实际应用中,Bonsai Image 4B 在 iPhone 17 Pro Max 上生成一张 512x512 图像需要 9.4 秒,在 Mac M4 Pro 上约需 6 秒。在 Mac M4 Pro 上,Bonsai Image 4B 比原版全精度的 MFLUX 流水线快最多 5.6 倍。

性能基准测试

压缩只有在模型保持有用时才重要。我们在三个互补的基准上评估了 Bonsai Image 4B:用于物体组合和属性绑定的 GenEval;用于人类偏好和美学质量的 HPSv3;以及用于密集提示词遵循和语义忠实度的 DPG-Bench。

Bonsai Image 与 FLUX.2 Klein 4B 模型的定性比较。
模型 扩散Transformer占用空间 (GB) GenEval HPSv3 DPG-Bench 相对于FLUX.2 Klein 4B的尺寸缩减 相对于FLUX.2 Klein 4B的性能
1-bit Bonsai Image 4B 0.93 0.671 11.15 0.822 8.3x 88%
三值 Bonsai Image 4B 1.21 0.723 12.22 0.851 6.4x 95%
FLUX.2 Klein 4B 7.75 0.819 12.84 0.853 1x 100%
SDXL 5.14 0.3 10.05 0.74 1.5x 67%
BK-SDM-Small 0.98 0.297 3.05 0.559 7.9x 42%
Stable Diffusion 1.5 1.72 0.396 4.2 0.601 4.5x 51%
PixArt-Σ XL 2 1.2 0.541 11.93 0.769 6.4x 83%
表 II:三值 Bonsai Image 4B 与其他模型的图像质量基准比较。

三值 Bonsai Image 4B 是面向质量的变体。在 1.21 GB 的尺寸下,它在 GenEval、HPSv3 和 DPG-Bench 上保留了 FLUX.2 Klein 4B 95% 的准确率,同时将扩散Transformer的占用空间减少了 6.4 倍。

1-bit Bonsai Image 4B 是面向占用空间的变体。它将扩散Transformer的尺寸降至 1 GB 以下,缩减了 8.3 倍,同时在这三项评估中仍然取得了强劲的基准分数(保留了 FLUX.2 Klein 4B 88% 的准确率)。

这两个变体共同推动了质量与占用空间的前沿。Bonsai Image 在与现代 4B 级图像模型竞争时,仅使用了其扩散Transformer占用空间的一小部分。同时,它在性能上大幅超越了具有相似内存占用空间的更小模型。这与我们在之前的 Bonsai 语言模型中看到的帕累托迁移相同。Bonsai Image 将现代扩散Transformer的行为带入了以前属于更小、能力更弱模型的内存范围。

为何重要

图像生成不仅是一个模型质量问题,也是一个部署问题。

对于许多产品而言,云 API 仍将是正确的选择。但纯云生成模式会带来特定的产品限制:每个提示词都是一次远程请求,每次迭代都产生边际服务成本,每次交互都会增加往返延迟。

这一点之所以重要,是因为图像生成本质上是迭代式的。用户很少只生成一张图就停下。他们会修改提示词、比较输出结果、生成变体、丢弃失败作品,然后重新尝试。当每次尝试都是服务器端的任务时,创作循环就变成了用户需要计量和等待的事情。本地推理改变了这一点。一旦模型能装进设备,生成过程就可以直接嵌入产品体验中。运行成本更低,迭代速度更快,在那些提示词和生成资产需要保持私密的环境中也更容易使用。

Bonsai Image 4B 正是朝着这种部署模式迈出的一步:在用户已有的硬件上,让具备能力的图像生成更贴近用户运行。

由 Ternary Bonsai Image 4B 生成的图像

可用性

1-bit 和 Ternary Bonsai Image 4B 都将以 Apache 2.0 许可证开放权重和代码发布。伴随此次发布,我们还推出了 Bonsai Studio,这是一款 iOS 应用,可直接在 iPhone 上试用 Bonsai Image 4B。

加入我们

PrismML 由加州理工学院的研究团队创立,并获得了 Khosla Ventures、Cerberus 和 Google 的支持。我们花了数年时间攻克该领域最棘手的问题之一:在不牺牲推理能力的前提下压缩神经网络。

如果你想帮助构建下一代最先进的 AI,我们期待你的来信。请查看我们的招聘页面。

资源

  • 白皮书
  • Hugging Face
  • WebGPU 演示
  • iPhone 版 Bonsai Studio
  • GitHub

来源:Hacker News 热门(buzzing.cc 中文翻译) · prismml.com

本地设备 AI 图像生成模型 1-Bit Bonsai Image 4B 发布

Hacker News 热门(buzzing.cc 中文翻译)·2026-06-01 01:47·77天前·modinfo
AI 导读

1-Bit Bonsai Image 4B 是一款新的 AI 图像生成模型,其主要特点是面向本地设备进行优化,可以在用户的本地硬件上运行。这是一款专注于端侧部署的图像生成解决方案。

正文 · AI 翻译
来自三元 Bonsai 4B 生成的图像

今天,我们发布 Bonsai Image 4B,这是一系列紧凑型图像生成模型,旨在本地硬件(从笔记本电脑到手机)上运行高质量的扩散模型推理。

Bonsai Image 4B 提供两种变体:

  • 1-bit Bonsai Image 4B 使用二值 {−1, +1} Transformer 权重,并带有 FP16 分组缩放因子,每个权重有效比特数为 1.125。它面向最大程度的压缩,当内存压力、带宽和部署规模是主要限制条件时,它是合适的选择。
  • 三元 Bonsai Image 4B 使用 {−1, 0, +1} Transformer 权重,并带有 FP16 分组缩放因子,每个权重有效比特数为 1.71。额外的零状态为模型提供了更强的表示灵活性,在保持极致紧凑的同时,提升了视觉质量和提示词忠实度。

这为图像生成开辟了一种新的部署模式:具备能力的输出、开放的权重,以及在以往此类模型无法触及的设备上实现实用的本地推理。据我们所知,Bonsai Image 4B 是首个在其参数量级别中能直接在 iPhone 上运行的图像模型。

为本地生成而构建

来自 1-bit Bonsai Image 4B 生成的图像

本地图像生成始于一个硬性约束:模型必须适配设备的可用内存。

对于一个 4B 级别的图像模型,扩散 Transformer 是模型中最大的部分,也是在生成过程中反复运行的部分。每个去噪步骤都会再次调用 Transformer,因此 Transformer 的大小直接影响内存压力、带宽需求和本地推理速度。

Bonsai Image 4B 基于 FLUX.2 Klein 4B 构建。它保持了架构不变,但改变了 Transformer 权重的表示方式。通过将这些权重转换为二值和三元形式,Bonsai 缩减了图像流程中对本地部署最关键的部分。

模型 扩散 Transformer 相较于 FP16 的缩减比例
FLUX.2 Klein 4B 7.75 GB 1.0x
1-bit Bonsai Image 4B 0.93 GB 8.3x
三元 Bonsai Image 4B 1.21 GB 6.4x
表 I:各模型的扩散 Transformer 占用空间

二值化层相比全精度 Transformer 权重实现了约 14 倍的缩减。一小部分对精度敏感的支撑张量(约 5%),称为投影层,仍保留在 FP16 精度,因此最终的 1 位 Bonsai Image 4B Transformer 大小为 0.93 GB:相比全精度的 FLUX.2 Klein 4B 的 7.75 GB,缩减了 8.3 倍。

三值化变体遵循相同的结构。其三值化层实现了约 10 倍的缩减,最终的三值化 Bonsai Image 4B Transformer 大小为 1.21 GB,相比全精度 Transformer 缩减了 6.4 倍。它比 1 位模型稍大,但额外的零状态提升了视觉质量和提示词忠实度。

包括压缩后的文本编码器和 FP16 VAE,1 位 Bonsai Image 4B 在 Apple Silicon 上的部署负载为 3.42 GB,三值化 Bonsai Image 4B 为 3.88 GB。作为对比,全精度的 FLUX.2 Klein 4B 需要 15.97 GB 的部署负载。由于在运行时,文本编码器在提示词编码完成后会被卸载,因此平均内存使用量小于总负载。在生成 512x512 图像时,二值化和三值化模型的平均活跃内存分别为 1.5 GB 和 1.96 GB,而原始 FLUX.2 Klein 4B 为 11.74 GB(分别缩减了 7.8 倍和 6.0 倍)。对于 1024x1024 图像,二值化和三值化模型的平均活跃内存分别为 1.95 GB 和 2.38 GB,而原始 FLUX.2 Klein 4B 为 14.39 GB(分别缩减了 7.4 倍和 6.0 倍)。

内存占用的减少改变了模型可运行的设备范围。我们的部署栈支持 Apple Silicon 的 iPhone、iPad 和 Mac,以及 CUDA GPU,在 Apple 硬件上使用 MLX 低位路径,在 CUDA 上使用 Gemlite 低位 GEMM 内核。在 iPhone 17 Pro Max 上,全精度的 FLUX.2 Klein 4B 流水线无法适配设备内存预算,而两种 Bonsai Image 变体均可在设备端运行。

视频 I:Bonsai Studio 上的图像生成

在实际应用中,Bonsai Image 4B 在 iPhone 17 Pro Max 上生成一张 512x512 图像需要 9.4 秒,在 Mac M4 Pro 上约需 6 秒。在 Mac M4 Pro 上,Bonsai Image 4B 比原版全精度的 MFLUX 流水线快最多 5.6 倍。

性能基准测试

压缩只有在模型保持有用时才重要。我们在三个互补的基准上评估了 Bonsai Image 4B:用于物体组合和属性绑定的 GenEval;用于人类偏好和美学质量的 HPSv3;以及用于密集提示词遵循和语义忠实度的 DPG-Bench。

Bonsai Image 与 FLUX.2 Klein 4B 模型的定性比较。
模型 扩散Transformer占用空间 (GB) GenEval HPSv3 DPG-Bench 相对于FLUX.2 Klein 4B的尺寸缩减 相对于FLUX.2 Klein 4B的性能
1-bit Bonsai Image 4B 0.93 0.671 11.15 0.822 8.3x 88%
三值 Bonsai Image 4B 1.21 0.723 12.22 0.851 6.4x 95%
FLUX.2 Klein 4B 7.75 0.819 12.84 0.853 1x 100%
SDXL 5.14 0.3 10.05 0.74 1.5x 67%
BK-SDM-Small 0.98 0.297 3.05 0.559 7.9x 42%
Stable Diffusion 1.5 1.72 0.396 4.2 0.601 4.5x 51%
PixArt-Σ XL 2 1.2 0.541 11.93 0.769 6.4x 83%
表 II:三值 Bonsai Image 4B 与其他模型的图像质量基准比较。

三值 Bonsai Image 4B 是面向质量的变体。在 1.21 GB 的尺寸下,它在 GenEval、HPSv3 和 DPG-Bench 上保留了 FLUX.2 Klein 4B 95% 的准确率,同时将扩散Transformer的占用空间减少了 6.4 倍。

1-bit Bonsai Image 4B 是面向占用空间的变体。它将扩散Transformer的尺寸降至 1 GB 以下,缩减了 8.3 倍,同时在这三项评估中仍然取得了强劲的基准分数(保留了 FLUX.2 Klein 4B 88% 的准确率)。

这两个变体共同推动了质量与占用空间的前沿。Bonsai Image 在与现代 4B 级图像模型竞争时,仅使用了其扩散Transformer占用空间的一小部分。同时,它在性能上大幅超越了具有相似内存占用空间的更小模型。这与我们在之前的 Bonsai 语言模型中看到的帕累托迁移相同。Bonsai Image 将现代扩散Transformer的行为带入了以前属于更小、能力更弱模型的内存范围。

为何重要

图像生成不仅是一个模型质量问题,也是一个部署问题。

对于许多产品而言,云 API 仍将是正确的选择。但纯云生成模式会带来特定的产品限制:每个提示词都是一次远程请求,每次迭代都产生边际服务成本,每次交互都会增加往返延迟。

这一点之所以重要,是因为图像生成本质上是迭代式的。用户很少只生成一张图就停下。他们会修改提示词、比较输出结果、生成变体、丢弃失败作品,然后重新尝试。当每次尝试都是服务器端的任务时,创作循环就变成了用户需要计量和等待的事情。本地推理改变了这一点。一旦模型能装进设备,生成过程就可以直接嵌入产品体验中。运行成本更低,迭代速度更快,在那些提示词和生成资产需要保持私密的环境中也更容易使用。

Bonsai Image 4B 正是朝着这种部署模式迈出的一步:在用户已有的硬件上,让具备能力的图像生成更贴近用户运行。

由 Ternary Bonsai Image 4B 生成的图像

可用性

1-bit 和 Ternary Bonsai Image 4B 都将以 Apache 2.0 许可证开放权重和代码发布。伴随此次发布,我们还推出了 Bonsai Studio,这是一款 iOS 应用,可直接在 iPhone 上试用 Bonsai Image 4B。

加入我们

PrismML 由加州理工学院的研究团队创立,并获得了 Khosla Ventures、Cerberus 和 Google 的支持。我们花了数年时间攻克该领域最棘手的问题之一:在不牺牲推理能力的前提下压缩神经网络。

如果你想帮助构建下一代最先进的 AI,我们期待你的来信。请查看我们的招聘页面。

资源

  • 白皮书
  • Hugging Face
  • WebGPU 演示
  • iPhone 版 Bonsai Studio
  • GitHub

来源:Hacker News 热门(buzzing.cc 中文翻译)· prismml.com