STORY · 事件已收束

Tencent Hunyuan releases Hy3 4-bit quantized model

1 个精选信源 · 1 篇报道持续 1最新动态 20天前
最新进展

腾讯混元将Hy3旗舰模型量化至1bit与4bit,单卡即可部署

TIMELINE

报道时间线

1 条公开报道 · 官方一手 1 条 · 最新在前
  1. 腾讯混元将Hy3旗舰模型量化至1bit与4bit,单卡即可部署
    公众号:腾讯混元官方一手精选

    腾讯混元将295B参数的Hy3旗舰模型权重量化至1bit与4bit并打包成GGUF,配合llama.cpp生态,使原本需多卡集群部署的模型最少一张96GB推理显卡即可运行。1bit版将权重从598GB压缩至85.5GiB,4bit版体积169.9GiB,两张显卡可承载;量化版在长文理解、Agent与代码任务上贴近满血效果,开启MTP后解码速度提升约50%-60%。