新的 @GoogleGemma 4 QAT(量化感知训练)检查点来了,你可以在消费级 GPU 和移动设备上本地运行模型,且质量损失极小。
新变化:
🔹 GGUF(Q4_0):检查点:所有尺寸和推测模型的最大本地性能 🔹 定制移动端模式:我们通过使用专为边缘硬件设计的定制混合精度模式(包含针对性 2 位解码层、优化后的 KV 缓存和静态激活),将 Gemma 4 压缩到移动设备上不足 1GB
通过在训练期间而非训练后(训练后量化)模拟压缩,我们大幅减少了内存占用,同时加速了解码速度,并且保持了推理质量。https://blog.google/innovation-and-ai/technology/developers-tools/quantization-aware-training-gemma-4/