
一、发布事件8/28 开源9/1 极量化轻量版事件时间线截至 2026-09-01腾讯混元官方公告日期事件2026-08-28腾讯混元正式发布并开源 Hy4 preview770B 总参 / 49B 激活 / 1M 上下文同步上线 Hugging Face 与 GitHub2026-08-29腾讯混元内部公开与 prima.cpp 合作的异构推理原理2026-09-01Hy4 preview 极量化轻量版214GB发布并开源权重同步上线 Hugging Face 和 GitHub简单回顾一下 Hy4 preview 这个底座本身总参数量770B7700 亿激活参数49B490 亿上下文长度1M100 万 token架构78 层 Transformer第 1 层为稠密 FFN第 2-78 层为 MoE 块每层 256 个路由专家 1 个共享专家每个 token 选 top-8 路由专家 共享专家所以激活参数稳定在 49B额外组件约 10B 参数的 MTPMulti-Token Prediction模块用于推测解码——这部分不参与主推理前向传播许可证Apache 2.0——没有 MAU 用户数门槛没有社区条款约束定价Tencent Cloud TokenHub$0.834 / $2.501 每百万输入输出 token缓存输入 $0.042 每百万官方部署配方16 张 B200 或 8 张 B300需要数据中心级硬件Hy4 preview 的关键数据由 MarketBrief 等独立媒体复核——值得注意的一点是49B 激活 ≠ 49B 模型。每次推理实际只激活 49B 参数但全部 770B 权重必须常驻并可寻址因此激活参数少不会带来更小的下载体积只会带来加载之后的吞吐——这正是这次轻量版的发力点。Hy4 preview 在 9 月 1 日同一天又发生另一件事——OpenRouter、AngelSlim 同步上线开源生态的中国阵营又多了一张原生 Apache 2.0 的旗舰牌。二、压缩目标1.5TB → 214GB 是怎么压下去的2.1 压缩前后的对照项目原版BF16轻量版QQ MIX-STQ1_0权重体积接近 1.5TB约 214GB压缩比1×约 7×每权重的平均比特数bpw16 bit1.25 bit推荐部署硬件16×B200 / 8×B300单张 4090 4×A4000 异构联合显然不是简单地把整张权重都量化到 1.25 bit——这会让模型变成随机噪声。真正的工程做法是稀疏三值 混合精度两件套。2.2 第一件套Sherry 稀疏三值量化核心论文与代码https://github.com/Tencent/AngelSlim原理把四个权重一组编码为 5 比特平均下来每个权重 1.25 bit。四个权重一组为什么能用 5 比特编码三值量化意味着每个权重的可能取值为 {-a, 0, a} 三个数。三值对应 2 bit 信息。但四个权重一组、共有 3⁴ 81 种组合远小于 2⁸ 256 种 8-bit 可能性——这就是冗余度。通过码本压缩 行程编码run-length四个三值权重能用 5 bit 表达而不是 2×48 bit。这套方案的难点在三件事码本设计怎么把81 种组合的概率分布映射到实际比特位宽激活误差补偿低位宽必然放大量化误差需要在激活侧做校准稀疏性保护稀疏模型里被路由到的专家才是有效权重被压坏一个专家就影响一类 token腾讯的方案是把这三件事一起放进统一优化目标给定目标平均 bpw 1.25逐层搜索码本与分配策略。2.3 第二件套MIX-STQ1_0 混合精度光有稀疏三值还不够因为 MoE 不同层的敏感度差异巨大前几层 Transformer决定通用表征对量化敏感需要保留较高精度中间 MoE 层决定专业能力对量化相对耐受可以更激进最后几层决定输出解码敏感度又上升所以 MIX-STQ1_0 实际是一个逐层比特分配策略层类型平均位宽bpw量化方法敏感层如 Embedding、Attention QKV2.06 bitIQ2_XXS标准 IQ 量化不敏感层如 MoE 中间专家1.31 bitSTQ1_0稀疏三值全局平均1.25 bitMIX-STQ1_0 调度校准数据来自一份真实业务数据集——腾讯工程师公开的口径是用一份标准化的校准集跑逐层敏感度分析。三、精度损失小数 6%长上下文检索几乎不掉3.1 跑分对照BF16 原版 vs 214GB 轻量版基准BF16 原版1.25 bit 轻量版损失MCP Atlas83.783.2-0.5SWE-Bench multi82.981.3-1.6长上下文检索100%99%几乎不掉数学GSM8K MATH假设 100%小幅回落约 2-3 分区间轻微需要注意几点0.5 / 1.6 这种小数点级损失对编程 Agent、长文档摘要、检索问答场景下的体验几乎无感数学能力虽然小幅回落但用了几乎不掉以外更谨慎的口径——数学任务通常对量化噪声更敏感回落 2-3 分其实已经说明 MIX-STQ1_0 的逐层策略起了作用长上下文检索几乎不掉这点至关重要——Hy4 preview 最大的卖点就是 1M 上下文量化如果把百万级检索能力压垮整个轻量版就没有意义3.2 为什么 MoE 模型比稠密模型更适合极量化这件事 1.31 bpw 的稀疏专家层能撑得住背后有 MoE 的天然优势专家权重更新频率低256 个专家里每个 token 只激活其中 8 个意味着大量专家的更新信号稀疏每个专家的数值稳定性远高于稠密模型参数。容错性来自冗余专家之间存在隐式冗余——某个专家被量化压坏了路由会把它对应的 token 转到其他专家。激活侧独立只有激活的专家需要在推理时反量化未激活的专家常驻在量化状态IO 与显存压力都更小。反过来说稠密模型 1.25 bit 量化几乎一定崩在某个层。MoE 模型把模型参数拆成小而稳定的子集是天然的极量化友好架构。四、prima.cpp 异构推理1.02 token/s 是怎么算出来的4.1 硬件拓扑节点GPU显存内存网络Node A笔记本1× NVIDIA RTX 409024GB64GB局域网 ANode B工作站4× NVIDIA RTX A400064GB每张 16GB64GB局域网 B合计80GB GPU 显存 128GB 内存分属两个局域网。Tencent 混元与 prima.cpp 团队合作的方案叫prima.cpp 异构调度把 MoE 层按专家拆分分别落到不同的节点上。4.2 拆分逻辑MoE 层有 256 个路由专家 1 个共享专家。prima.cpp 做的是Embeddings Attention 层每个 token 必须经过的部分放在 Node B 的 A4000 上这些层计算密集、显存需求高。MoE 专家权重按路由命中概率分散存储——热门专家放 Node A 的 4090 显存里吞吐高、容量小冷门专家放 Node B 的 A4000 显存 CPU 内存里容量大、速度稍慢。共享专家放在 Node A 的 4090因为每个 token 都要用。每个 token 的推理变成embedding → Node B (attention) ↓ for each token: router → node A (hot experts) Node B (cold experts) ↓ shared expert → Node A ↓ output → Node B (head)跨节点通信走RDMA over RoCE如果有或者普通 TCP实测场景prima.cpp 内部做异步预取。4.3 性能数据配置速度4090 笔记本 4×A4000 异构联合推理1.02 token/s4090 笔记本单机 offload全部权重放 CPU 内存约0.17 token/s提速比约 6×对比下如果给一张 RTX 4090 直接跑 214GB 权重——这其实做不到因为 24GB 显存装不下模型必须 CPU offload。异构拆分真正解决的不是显存不够而是异构带宽下把 MoE 的专家分工映射到对的位置。4.4 实操建议prima.cpp 一键启动伪代码# 安装 prima.cppHy4 preview 适配版pipinstallprima.cpp[hy4-quant]# 启动异构推理服务prima serve\--modelTencent/Hy4-preview-GGUF\--quantizationQ2_K_S\--nodes192.168.1.10:4090,192.168.1.20:a4000x4\--moe-strategy hot-cold-split\--rdma\--port8080# 调用curlhttp://localhost:8080/v1/chat/completions\-d{model: Hy4-preview-q2ks, messages: [{role:user,content:...}]}⚠️ 上述命令与参数为编者按 prima.cpp 公开 README 与 Tencent AngelSlim 文档整理的简化示例生产部署建议参考官方仓库https://github.com/Tencent/AngelSlim最新参数。五、为什么这件事对行业很重要5.1 把本地部署的门槛从数据中心降到消费级显卡在 Hy4 preview 极量化出现之前770B 总参 Apache 2.0 模型听起来必须跑在 8 张 B300 上。214GB 量化版加上异构推理把它降到了预算 4-5 万 RMB 的主机单张 4090 4 张二手 A4000就能跑 1.02 token/s预算 2 万 RMB 左右的笔记本单张 4090 CPU offload0.17 token/s够体验不够生产预算 20 万 RMB 的工作站4-8 张 4090 直接把量化版全部装进显存能跑到 5-8 token/s这把本地部署大模型的预算门槛从数据中心起步拉到了小型创业公司可承受。5.2 数据合规与模型自主权中国大模型在金融、医疗、法律、政府等高度敏感场景下面临的最大问题是**“用云端 API 等于让数据出国/出域”**。214GB 极量化版让企业可以在一台独立工作站里完成推理数据不出企业机房推理过程完全在本机 GPU CPU 内完成模型权重可二次微调不必依赖厂商 APIHy4 preview Apache 2.0 极量化轻量版三者叠在一起意味着这个选项第一次成为国产大模型主导的方案。5.3 MoE 模型的极量化范式的确立回顾 2026 年下半年的开源 MoE 大潮——DeepSeek V4-Flash284B 总参 / 13B 激活4.6% 激活率Kimi K32.8T 总参 / 50B 激活GLM-5.3753B 总参Qwen 3.8 Max2.4T 总参Hy4 preview770B 总参 / 49B 激活6.4% 激活率这些 MoE 架构都有共同特点“总参巨大、激活很小”。这一组合天然适合做极量化——214GB 版 Hy4 preview 跑出来的精度持平就是证据。可以预见 2026 Q4 会有一波类似的国产 MoE 极量化潮。六、与同生态其他工具的对比项目Hy4 preview 轻量版Llama.cpp 通用 1.5-3 bitAutoGPTQ INT4AWQ INT4量化目标MoE 模型通用稠密模型通用通用平均位宽1.25 bit1.5-3 bit4 bit4 bit是否为逐层自适应✅ MIX-STQ1_0❌ 固定❌ 固定⚠️ 部分自适应异构推理✅ prima.cpp⚠️ llama.cpp rpc需手动配❌❌MoE 友好度✅ 原生 MoE 设计⚠️ 通用 MoE 支持⚠️ 需手工拆分⚠️ 需手工拆分许可Apache 2.0MITApache 2.0MIT数据来源各项目 GitHub README 与论文2026-09-01 编者整理。核心差异Sherry 稀疏三值是为 MoE 路由专家量身定制的——它把路由专家的稀疏性和三值量化的稀疏性叠在一起平均位宽能压到 1.25 bit通用方案在稠密模型上能到 3 bit 已经很极限撑不住 1.25 bit 而不出错。七、容易踩的坑7.1 “1.02 token/s 听起来快吗”——不这是研究的可用速度1.02 token/s 的意思是一个字一个字地生成。对一个 200 字的回答来说从第一个字到最后一个字大约需要200 秒3 分 20 秒。这种速度适合✅ 内部测试、效果评估✅ 短问答场景10 个 token 以内❌ 任何交互式体验❌ 任何实时编码助手场景要交互体验至少需要5-10 token/s——这要求 8 张以上 4090 级别的卡把钱烧透。7.2 “1.25 bit 量化≠所有硬件都能跑”1.25 bit 量化要求推理框架原生支持反量化路径。当前可用的✅ llama.cpp部分支持 1.5-2 bit✅ vLLMINT4 友好1.25 bit 需打补丁✅ SGLang通过 AngelSlim 集成⚠️ TensorRT-LLM不支持需要做 kernel 重写❌ TGI、DeepSpeed-MII不支持如果你的团队在用 TensorRT-LLM 或者基于 Triton Inference Server请先确认流程再决定是否用轻量版。7.3 跨节点推理的网络瓶颈prima.cpp 异构推理的瓶颈在跨节点网络万兆以太网1.02 token/s 是已经压到的瓶颈RoCE / InfiniBand理论上能再快 2-3 倍Wi-Fi基本不可用工程经验两节点之间最好走有线以太网不要经过路由器。八、对开发者的实操建议8.1 我应该现在就迁过去吗场景建议我在做研究 / 内部测试立刻试。这是 2026 年 Q3 最便宜的 Apache 2.0 大模型入门体验。我在做 RAG / 长文档问答试但跑一遍你自己的长上下文基准。1.25 bit 在百万级检索场景下的精度是 Tencent 官方称的几乎不掉但你的数据可能不一样。我在做交互式对话产品不要。等 4-bit / 8-bit 的标准量化版本。我在做编程 Agent 或实时助手不要。1.02 token/s 不可用。我在用别的国产 MoEDeepSeek、Kimi、Qwen观望。Hy4 preview 给了范式下一波开源 MoE 应该会跟进同等水平的极量化轻量版。8.2 部署检查清单□ GPU 显存 ≥ 80GB或者分布式 80GB □ 跨节点网络 RDMA 或 万兆以太网 □ llama.cpp ≥ 0.2.150 或 vLLM ≥ 0.6.0 □ 下载 Tencent/Hy4-preview-GGUF 的 Q2_K_S 变体 □ 准备一份 ≥100 条的内部基准不能只用公开榜 □ 校准拿你的长文档 / 代码库做一份真实业务压力测试 □ 部署形态单机 vs 分布式 vs 异构选定后跑 7 天的稳定性测试九、今日其他相关资讯Claude Fable 5.1 发布同日 9/1——缓存读降价 75%、Terminal-Bench 4.0 拿到 55.8%、EFS 数据主权。详见本专栏第一篇。DeepSeek-V4-Flash-Vision-Exp 开源同日 9/1——305B 多模态、MIT 协议、4.6% 激活率逼近 Opus 4.8 的 Agent 视觉。详见本专栏第三篇。Harvey 发布 Tenet同日 9/1——以中国开源模型 Kimi K3 为基座的法律专用模型标志着美国法律 AI 公司用中国底座的范式翻转。常见问题FAQQ11.25 bit 量化为什么不是低质量的代名词A因为 Sherry 是稀疏三值量化把权重已经是稀疏的这一事实利用起来把码本行程编码压到极低再加上 MIX-STQ1_0 对敏感层做位宽补足。MCP Atlas 83.7→83.2 这种小数级损失在生产 Agent 与长文档场景下接近不可感。Q2214GB 轻量版能跑在单张 RTX 4090 上吗A单张 4090 有 24GB 显存214GB 远大于显存。必须 CPU offload。prima.cpp 异构推理是面向多机多卡的方案不是单卡方案。Q3MOE 模型量化后激活率会变吗A不会。量化改的是权重的存储方式不影响路由逻辑。49B 激活参数还是 49B。量化后推理时把 1.25 bit 的专家反量化到 BF16 再做计算。Q4MIX-STQ1_0 与 AutoGPTQ INT4 在效果上怎么选AINT4 体积是 1.25 bit 的 3.2 倍精度大致相同但常小幅更优。如果硬件允许INT4 是更稳的选择如果硬件预算紧且能容忍 1-2 分精度损失1.25 bit 是 2026 年 Q3 的工程最优。Q5Apache 2.0 意味着什么商用可以吗A意味着你可以 fork、微调、卖访问、不用 call Tencent 法务。MAU 不设上限也没有商业用途另行许可的灰色地带。这是 2026 年国产大模型里少有的标准开源协议。Q6极量化轻量版什么时候能到 5-10 token/sA取决于硬件代际。如果 RTX 5090 把显存容量推到 48GB单卡即可把 214GB 量化版完全装进显存理论上能跑到 5-8 token/s。同时prima.cpp 团队正在做 tensor parallelism 异构融合进一步压榨速度。Q7我之前用的是 Hy3 / DeepSeek V3 / Qwen 2.5要迁过来吗A先用一天做小流量 A/B。Hy4 preview 在长上下文与代码任务上比上述三者都有提升但你的业务数据可能反过来——比如你做的是短对话Hy4 preview 的 1M 上下文优势就无法发挥。参考资料腾讯云开发者社区《770B 参数、1M 上下文混元 Hy4 preview 为生产力而生》发布时间2026-08-29。IT 之家《1.5TB 压到 214GB腾讯混元 Hy4 preview 轻量版发布开源》发布时间2026-09-01。Tencent/Hy4-preview Hugging Face 模型卡发布时间2026-08-28。AngelSlim 量化工具 GitHub 仓库发布时间持续更新。MarketBrief《Tencent Open Sources 770B Parameter Hy4 AI Model》发布时间2026-09-01。Fello AI《Tencent Hy4 Preview: 770B Open Weights, Specs and Price》发布时间2026-09-01。ArturMarkus《Tencent Open-Sources Hy4 Preview — 770B MoE, 49B Active, 1M-Token Context, Apache 2.0》发布时间2026-09-01。qq 财经《vibe coding 日报》收录 Hy4 preview 轻量版消息发布时间2026-08-29。