公众号:腾讯混元
精选
78AI 编辑部评分,满分 100

腾讯混元将Hy3旗舰模型量化至1bit与4bit,单卡即可部署

2026-07-14 16:56· 20天前· 腾讯混元
精选理由

将 295B 旗舰模型量化至单卡部署,1bit 版本在长文理解上仍接近满血,且提供 MTP 加速,改变了本地运行大模型的门槛与成本考量。

AI 摘要

腾讯混元将295B参数的Hy3旗舰模型权重量化至1bit与4bit并打包成GGUF,配合llama.cpp生态,使原本需多卡集群部署的模型最少一张96GB推理显卡即可运行。1bit版将权重从598GB压缩至85.5GiB,4bit版体积169.9GiB,两张显卡可承载;量化版在长文理解、Agent与代码任务上贴近满血效果,开启MTP后解码速度提升约50%-60%。

公众号正文需在微信内阅读,站内仅提供摘要。

腾讯混元将Hy3旗舰模型量化至1bit与4bit,单卡即可部署

公众号:腾讯混元·2026-07-14 16:56·20天前·腾讯混元
精选理由

将 295B 旗舰模型量化至单卡部署,1bit 版本在长文理解上仍接近满血,且提供 MTP 加速,改变了本地运行大模型的门槛与成本考量。

AI 摘要

腾讯混元将295B参数的Hy3旗舰模型权重量化至1bit与4bit并打包成GGUF,配合llama.cpp生态,使原本需多卡集群部署的模型最少一张96GB推理显卡即可运行。1bit版将权重从598GB压缩至85.5GiB,4bit版体积169.9GiB,两张显卡可承载;量化版在长文理解、Agent与代码任务上贴近满血效果,开启MTP后解码速度提升约50%-60%。

公众号正文需在微信内阅读,站内仅提供摘要。

在微信中打开原文mp.weixin.qq.com(在新标签页打开)