9月1日,腾讯混元发布Hy4 preview的量化轻量版本,将模型权重从接近1.5TB压缩到约214GB,大幅降低了运行这一旗舰开源模型的硬件门槛。官方介绍称,此次压缩依托自研的Sherry稀疏三值量化方案,四个权重一组编码为5比特、平均每权重仅1.25比特,并按各层敏感度分配混合精度。在主流评测中,量化版与BF16原版的差距控制在一两分以内,检索类任务几乎不掉点,4090笔记本加四卡A4000的异构联合推理即可跑到1.02 token/s。
Hy4 preview是腾讯混元8月31日开源的新一代大语言模型,总参数770B、激活49B、原生上下文突破1M token。其BF16格式的完整权重接近1.5TB,即便是配备多张高端显卡的推理服务器,加载与部署也颇为吃力,普通开发者很难在本地环境运行。量化轻量版的核心目标,就是让这个"庞然大物"进入个人工作站和中小企业机房。
腾讯混元团队采用的Sherry方案属于稀疏三值量化路线。传统三值量化把每个权重约束为-1、0、1三种取值,配合稀疏性进一步压缩存储;Sherry的进阶之处在于引入分组编码,每四个权重组合成一个5比特单元,平均每个权重仅占1.25比特,相比BF16的16比特实现了约12.8倍的存储压缩。叠加模型本身的MoE稀疏结构,最终把完整权重压到214GB,约等于原版的七分之一。
纯粹追求压缩并不难,难的是压缩后不掉点。混元团队为此引入MIX-STQ1_0策略,先对模型各层做敏感度分析,找出对精度影响最大的关键层,再按层分配不同的量化精度,敏感层保留更多比特、冗余层则大胆压缩。这种逐层混合精度的思路,让压缩损失被控制在可接受范围:官方数据显示,量化版在主流评测集上与BF16原版的差距仅一两分,检索类任务基本持平,多轮对话与指令遵循表现稳定。
量化带来的最直接变化是硬件门槛的下降。以官方演示配置为例,一台搭载RTX 4090的笔记本配合外接四块A4000显卡,即可通过异构联合推理运行量化版Hy4,实测推理速度约1.02 token/s。虽然这一速度与云端大规模集群相比仍有差距,但对于本地开发调试、私有化部署验证、小规模生产环境而言,已经具备实用价值。
推理框架的适配也在同步推进。混元团队已为量化版提供与vLLM、SGLang等主流推理框架的对接方案,开发者拿到权重后可以直接加载运行,无需为特殊格式编写额外代码。对于数据敏感的政企客户,214GB的体量意味着单台高配服务器就能承载完整模型,无需依赖外部算力,为金融、政务、医疗等场景的私有化部署打开了空间。
从产业视角看,大模型量化正在成为开源生态的标配动作。此前多个国产大模型团队已推出INT4、INT8量化版本,而Hy4量化版把单比特级压缩推到1.25比特量级,同时保住与BF16的精度差距,展示了更激进的压缩路径。可以预见,随着权重体积进一步缩小,个人开发者与中小团队将重新获得"跑旗舰开源模型"的能力,应用层的创新也会随之加速。
压缩七倍之后还能不能打,是开发者最关心的问题。混元官方公布的评测覆盖了通用语言理解、数学推理、代码生成、知识问答与检索增强等主要维度,量化版与BF16原版的分差集中在一两分以内,其中检索类任务几乎持平。对于以RAG应用、知识库问答为主的企业场景而言,这种精度表现意味着量化版可以直接承担生产环境的工作负载,而不仅仅是一个"能跑的玩具"。
检索任务不掉点的原因,与MoE架构和稀疏量化的契合度有关。Hy4的专家路由天然带有稀疏特征,Sherry的稀疏三值编码恰好放大了这一结构优势,让模型在"知识定位"类任务上损失极小。长上下文方面,量化版完整保留原生1M token的窗口能力,长文档理解、海量资料问答等场景不受压缩影响,这为法律、金融、学术研究等超长文本应用保留了关键能力。
从"分数"到"体验",社区实测给出的反馈也印证了量化版的可用性。早期开发者测试显示,量化版在多轮对话、指令遵循与工具调用上的表现稳定,与BF16版本的差异在日常使用中几乎不可感知;部分检索密集场景甚至因为显存压力降低、批处理吞吐提升,获得了更流畅的体验。1.25比特的压缩密度由此被证明落在"质量与体积"的甜点区,为更大模型的端侧化留下了想象空间。
Hy4量化版的发布,是混元团队在推理优化路线上的重要一步,但远非终点。MIX-STQ1_0的逐层敏感度分配机制本身具有通用性,可以迁移到其他模型家族,未来混元系列的其他尺寸模型也有望沿用同一套压缩管线。更值得注意的是,1.25比特量级的压缩密度意味着,更大规模的模型有望被压进单卡显存,端侧与边缘部署的边界将被进一步推远。
对开发者社区而言,量化版的意义在于"可负担的旗舰能力"。过去,想要体验770B级别模型的完整能力,动辄需要数十万元的服务器投入;现在,一套4090笔记本加显卡坞的组合就能完成本地验证。混元团队表示,后续将持续优化量化版在长上下文场景下的表现,并开放更多精度的预置选项,让开发者按需选择体积与速度的平衡点。
从行业竞争看,开源模型"能跑多大"与"跑得起多大"正在被重新定义。当旗舰模型的权重压缩到消费级硬件可承载的范围,开源与闭源之间的体验差距将进一步收窄,算力资源的分配逻辑也会随之改变。腾讯混元以量化轻量版回应"大模型落地难"的行业痛点,其实际部署效果与社区反馈,将是检验这条技术路线成色的试金石。