MLog
返回文章列表
Tech#AI开发工具#开源项目#模型量化#LLM

不到600GB压到85GB:腾讯混元Hy3量化版让295B模型跑进单卡时代

发布于: 2026年7月18日阅读时长: 7 min

腾讯混元团队回应社区呼声,仅用8天便将295B参数的Hy3旗舰模型量化至1bit和4bit,体积从598GB压缩至85.5GiB,单张96GB显卡即可部署。本文从量化方案、性能保持和部署实践三个维度详解这次技术落地。

八天,一个社区呼声变成了一份可跑代码

7月6日,腾讯混元发布 Hy3——295B 参数的 MoE 旗舰模型,单次推理只激活 21B 参数,256K 上下文,Apache 2.0 协议开源。发布当天就炸了,但社区的焦点很快集中到了一个核心诉求上:"给个单卡能跑的版本吧。"

BF16 权重文件接近 600GB。要完整跑起来,8 卡起步。这对个人开发者和中小团队来说,等同于"看看就好"。

8 天后——7 月 14 日——腾讯交出了答案。1bit 和 4bit 量化版本,GGUF 格式,直接适配 llama.cpp 生态。没有定制框架,没有花活,下载就能跑。

这个响应速度在行业里相当少见。通常大模型厂商从发布到推出官方量化版,几周到几个月都算正常。295B 这个量级的量化本身就有技术难度,何况还要适配通用生态。

不是什么魔法,是选对了压缩路线

Hy3 量化版提供了三条不同定位的路线:

版本 格式 体积 硬件需求 定位
1bit IQ1_M GGUF 85.5 GiB 单张 96GB 显卡 极限压缩,消费级尝鲜
4bit Q4_K_M GGUF 169.9 GiB 双卡(或 128GB 统一内存) 接近满血,有限成本最优解
GPTQ Int4 safetensors ~174 GB vLLM 服务端 高并发线上 API

1bit 版本把 598GB 压到 85.5GiB,缩小了 6.7 倍。这是什么概念?一张 NVIDIA H100 80GB 不够,但一张 96GB 的卡刚好能塞下。128GB 统一内存的 Mac Studio 或 DGX Spark 就更从容了。

4bit 版本 169.9GiB,两张推理卡或一台高配 Mac 可以稳定运行。GPTQ Int4 则走服务端路线,直接对接 vLLM,面向需要高并发低延迟的线上部署场景。

压得狠,能力塌了没?

量化最让人担心的永远是精度损失。Hy3 这次的答卷比预期好不少。

4bit 版本:在 Agent 能力、多语言代码生成、工具调用、长文理解等关键任务上,成绩都贴近原始 BF16 模型。判断量化好不好,最直接的方式是对比输出分布——4bit 版本在绝大多数位置上的首选答案和 Top-K 概率分布都与 BF16 保持一致。GPTQ Int4 在评测集上的掉点幅度也非常有限。

1bit 版本才是真正的惊喜。按直觉,压到 1bit 附近模型多少会"变笨"。但 Hy3 1bit 版在长文理解上几乎和原始模型持平,Agent 与代码方向也保持得相当好,只有小幅回落。日常编码辅助、文档处理、常规问答完全够用。腾讯团队自己也表示"没料到它撑得住"。

这个结果的意义可能比 4bit 的量产更大——它把旗舰级模型的智能门槛打到了单卡消费级硬件的水平。

MTP 投机解码:让量化版真正"能用"

量化只解决了"能不能装下"的问题。要让它"用起来不卡",还需要推理加速。

腾讯团队专门为 llama.cpp 开发了补丁,补齐了对 Hy3 模型结构的 MTP(Multi-Token Prediction)投机解码支持。实测 token 接受率稳定在约 60%:

  • 1bit 版本:解码速度提升约 50%
  • 4bit 版本:解码速度提升近 60%

补丁和构建指引已经在 HuggingFace 上公开。用 explainx.ai 社区的一句话说——"你现在可以在 DGX Spark 或 128GB Mac 上以可交互的速度跑一个 295B 的旗舰模型了。"

大模型瘦身不是孤例,是一股趋势

把视野拉宽,7 月 14 日同一天还有两件事指向同一个方向:

面壁智能 CTO 曾国洋在采访中提出"面壁定律"——知识密度每 3.5 个月翻一番。2B 参数的 MiniCPM 可以打败同期 8B 竞品,靠的不是堆参数,而是架构和数据质量。

德国 AI 协会发布开源模型 Soofi S——30B 总参数量,MoE 架构每个 token 只激活约 3.2B,生成吞吐量是同规模稠密模型的 8 倍。HumanEval 73.8%,MBPP 70.2%,权重完全开源。

三家走了不同的路——腾讯是"先胖后瘦",面壁是"生而瘦",Soofi S 是"参数量大但每次只用一点"——但都指向同一个结论:效率正在取代规模成为新的竞争力。

对开发者来说,这意味着什么?

如果你在做模型选型,现在不用死盯着千亿参数了。一个量化后的 295B 模型,在单卡上跑出来的实际任务能力,可能比一个未经优化的小模型强一个量级。

选型逻辑正在变成三层:

  1. 本地开发和实验:1bit GGUF,一张 96GB 卡或 128GB 统一内存机器搞定
  2. 小团队服务部署:4bit GGUF 或 GPTQ Int4,有限预算下拿到接近满血的效果
  3. 大规模线上服务:BF16/FP8 配合 vLLM/SGLang,8 卡集群跑满性能

腾讯这次用 8 天时间把一个社区呼声变成了可部署的代码,速度本身就是一个信号——大模型厂商之间的竞争,已经从"谁先发模型"变成了"谁先让模型被真正用起来"。量化不是妥协,是通往实用化的必经之路。