中关村在线

热点资讯

腾讯发布混元Hy3极致量化版:2950亿参数MoE模型单卡高效运行

腾讯混元团队于2026年7月14日正式发布混元Hy3极致量化版本,实现超大规模MoE模型在单张高端显卡上的本地高效运行。

Hy3是腾讯自主研发的混合专家架构旗舰模型,总参数量达2950亿,推理时仅需激活其中210亿参数,原生支持256K超长上下文。该模型在代码生成、智能体调度、长文档理解等核心任务上,性能表现与当前国际主流超大规模旗舰模型相当。但其原始BF16权重文件体积高达598GB,对硬件部署构成显著挑战。

为提升模型可用性与落地效率,研发团队完成深度梯度量化压缩,推出三类面向不同应用场景的量化方案:

第一类为极限轻量化的IQ1_M(1比特)版本,权重体积压缩至85.5GiB,相较原版缩减约6.7倍,可在单张96GB显存的高端显卡上完整部署,适用于资源受限的本地离线环境;

第二类为Q4_K_M(4比特)量化版本,包体大小为169.9GiB,双卡配置即可稳定运行,输出精度高度接近原始BF16满血状态;

第三类为GPTQ Int4格式版本,深度适配vLLM推理框架,充分发挥其高并发、低延迟优势,专为企业级线上API服务场景优化。

实测结果表明,各量化版本在显著降低显存占用的同时,核心能力保持高度稳定。其中4比特版本在输出概率分布、Top-K采样等关键指标上与BF16原版基本一致;在多语言代码生成、工具调用、长文本解析及智能体任务等多项评测中,性能衰减微乎其微。即便在压缩程度最高的1比特版本中,长文本理解能力几乎无损,代码生成与智能体任务仅出现轻微波动,完全可胜任日常问答、文档处理、编程辅助等通用需求,有效突破业内长期存在的“低比特即低性能”认知瓶颈。

为进一步提升本地交互体验,团队专门开发llama.cpp专属补丁,全面支持Hy3原生MTP多令牌投机解码机制。启用该机制后,令牌接受率稳定维持在60%左右;1比特版本解码速度提升约50%,4比特版本提速近60%,显著缓解大模型本地生成过程中的响应延迟与卡顿问题。

展开全文
人赞过该文
内容纠错

相关电商优惠

评论

更多评论
还没有人评论~ 快来抢沙发吧~

读过此文的还读过

点击加载更多

内容相关产品

说点什么吧~ 0

发评论,赚金豆

收藏 0 分享
首页查报价问答论坛下载手机笔记本游戏硬件数码影音家用电器办公打印 更多

更多频道

频道导航
辅助工具