atomic【.】chat 刚刚让 Gemma 4 26B 在 LLaMA.cpp 中运行得更快。
在其 MacBook Pro M5 Max 测试中,模型 token 生成速度提升了约 40%。
这对本地大语言模型来说是个好消息,因为 LLaMA.cpp 和 GGUF 与本地 AI 用户群体关系紧密,而这一生态的支持往往延伸至桌面应用、编程智能体,以及私有的设备端助手。
MTP(maltai token prediction)就像一个更小型的辅助模型,负责草拟接下来几个词,而主模型再检查这些词是否可接受。
如果草稿正确,系统就会快速接受多个模型 token。
如果草稿错误,系统会拒绝错误部分,并回退到正常的生成模式。