# 腾讯混元将Hy3旗舰模型量化至1bit与4bit，单卡即可部署

- 来源：公众号：腾讯混元
- 作者：腾讯混元
- 发布时间：2026-07-14 16:56
- AIHOT 分数：78
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmsdu2uhb013orofz5u7hfmv2
- 原文链接：https://mp.weixin.qq.com/s?__biz=MzkwODU2OTQyNQ%3D%3D&mid=2247498028&idx=1&sn=9b6f4f0d9eff9d2a6925f3860eb63665

## 精选理由

将 295B 旗舰模型量化至单卡部署，1bit 版本在长文理解上仍接近满血，且提供 MTP 加速，改变了本地运行大模型的门槛与成本考量。

## AI 摘要

腾讯混元将295B参数的Hy3旗舰模型权重量化至1bit与4bit并打包成GGUF，配合llama.cpp生态，使原本需多卡集群部署的模型最少一张96GB推理显卡即可运行。1bit版将权重从598GB压缩至85.5GiB，4bit版体积169.9GiB，两张显卡可承载；量化版在长文理解、Agent与代码任务上贴近满血效果，开启MTP后解码速度提升约50%-60%。

## 正文

公众号正文需在微信内阅读，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
