Hy4 preview config.json 终极深度解读:从 MLA 到 MTP,读懂每个参数背后的含义

发布时间:2026/9/2 13:58:47
Hy4 preview config.json 终极深度解读:从 MLA 到 MTP,读懂每个参数背后的含义 Hy4 preview config.json 终极深度解读从 MLA 到 MTP读懂每个参数背后的含义【免费下载链接】Hy4-previewHy4 preview 是由腾讯混元团队研发的新一代混合专家MoE旗舰模型。模型总参数量 770B每个 token 激活 49B主干共包含78层第一层采用标准 FFN其余 77 层均为 MoE 结构每层包含 256 个路由专家与 1 个共享专家每个 token 激活 top-8 路由专家及共享专家。主干之外原生内置 1 层 MTP总参数量 10B激活 0.7B以支持投机解码。项目地址: https://ai.gitcode.com/tencent_hunyuan/Hy4-previewHy4 preview是腾讯混元Tencent Hy团队开源的新一代混合专家MoE旗舰模型总参数 770B、每 token 激活 49B。想真正读懂它入口就是仓库根目录的 config.json。这份文件里没有一个多余字段——从MLA 注意力、门控稀疏注意力DSA到MTP 投机解码每个参数都在回答同一个问题这台 770B 的机器是如何高效运转起来的。本文带你逐段拆解 config.json让你即使不写一行代码也能看懂 Hy4 的架构设计精髓。一分钟速览Hy4 核心规格一览表先把最重要的参数摆出来后面再逐项展开项目值对应参数模型类型MoE 旗舰model_type: hy_v4主干层数78 层num_hidden_layers隐藏维度6144hidden_size注意力门控 DSA MLAuse_dsa/use_mla路由专家256 选 8 1 共享n_routed_experts/num_experts_per_tok上下文长度100 万 tokenmax_position_embeddings词表大小120832vocab_size精度bfloat16dtype/torch_dtype投机解码原生 1 层 MTPnum_nextn_predict_layers 完整参数文件见 config.json生成采样配置见 generation_config.json。架构总览78 层里藏着什么层结构第一层稠密其余 77 层 MoEHy4 的主干共 78 层但并不是每层都一样。两个数组精确描述了这种差异mlp_layer_types第一个值是dense后面 77 个全是sparse。这意味着只有第 1 层用标准稠密 FFN其余 77 层全部换成 MoE 结构。layer_types78 个值全是deepseek_sparse_attention说明所有层都采用 DeepSeek 风格的稀疏注意力。这两个数组像一张施工图纸让加载模型时精确知道每一层该搭哪种前馈网络和注意力。MoE 路由专家256 选 8 是什么意思MoE 是 Hy4 770B 总参、49B 激活的秘诀。核心字段参数值含义n_routed_experts256每层有 256 个可路由专家num_experts_per_tok8每个 token 只激活 top-8 个专家n_shared_experts1外加 1 个永远激活的共享专家moe_intermediate_size2048每个专家的中间层维度intermediate_size18432第 1 层稠密 FFN 的中间维度norm_topk_probtrue对 top-k 门控概率做归一化可以这样理解256 个专家像 256 位专科医生每个 token 只挑最相关的 8 位会诊再让 1 位全科医生共享专家兜底。这样参数总量很大知识丰富但单次计算只动一小部分推理便宜。门控策略上gating_type: elementwise表示门控信号逐元素生效routed_scaling_factor: 2.827则对路由专家的加权输出做了整体缩放配合swiglu_limit: 10.0对 SwiGLU 激活值截断到 ±10来保证训练稳定。注意力机制从 MLA 到门控稀疏注意力这是 config.json 里最硬核的部分也是 Hy4 长上下文能力的来源。use_mla多查询隐注意力MLAHy4 用use_mla: true启用 MLA并用一组*_rank/*_head_dim参数定义了压缩维度参数值作用q_lora_rank2048查询 Q 的压缩潜变量维度kv_lora_rank512键值 KV 的压缩维度qk_nope_head_dim192不旋转部分每头维度qk_rope_head_dim64RoPE 旋转部分每头维度qk_head_dim256 192 64Q/K 完整头维度v_head_dim256值 V 每头维度num_attention_heads64注意力头数MLA 的核心思想是把庞大的 KV 缓存先压缩成低秩向量再存储。kv_lora_rank只有 512意味着 KV 被折进一个很小的小瓶子里极大降低了长上下文的显存占用——这正是 100 万 token 上下文能跑得动的关键之一。use_dsa门控稀疏注意力 IndexCache 索引复用Hy4 在 MLA 之上又叠了一层稀疏注意力Gated DSA相关字段参数值含义use_dsatrue开启 DeepSeek 稀疏注意力gated_mlatrue对 MLA 输出做门控index_n_heads32索引器indexer头数index_head_dim128索引器每头维度index_topk2048每个位置只关注 top-2048 个 tokenindex_topk: 2048是最直观的一个面对百万级上下文模型不再让每个 token 看全部历史而是用索引器挑出最重要的 2048 个 token 做注意力。计算量从 O(n²) 降到接近 O(n)这是长文本又准又快的第二把钥匙。更妙的是indexer_types这个 78 长度的数组full与shared交替。它配合IndexCache实现跨层稀疏索引复用标为full的层自己计算稀疏索引标为shared的层直接复用前一full层的索引省去重复计算。从数组规律看大约每 4 层里就有 1 层是全量计算、3 层共享复用进一步压榨效率。MTP 投机解码让生成再快一档MTPMulti-Token Prediction多 token 预测是 Hy4 原生内置的加速器。参数值含义num_nextn_predict_layers1内置 1 层 MTP 预测层mtp_loss_factor0.1训练时 MTP 损失权重较小的辅助目标原理主干每生成 1 个 tokenMTP 层会顺手猜出后续的几个 token。部署时把这 1 层当作草稿模型做投机解码speculative decoding——草稿模型快速出稿主干模型一次性校验命中率高的话就一次产出多个 token。README 中给出的部署参数如speculative-num-steps 3正是利用这一层来加速推理。据官方介绍这层 MTP总参约 10B、激活 0.7B性价比很高不占太多显存却能明显提升出字速度。iHC 超连接打通层与层之间的信息高速路残差通路也是 Hy4 的亮点。相关字段参数值含义enable_ihctrue开启 identity Hyper-ConnectionsiHChc_mult4残差流通道数为 4hc_eps1e-06归一化数值稳定项hc_magnitude2.0超连接幅度系数普通 Transformer 只有一条残差流信息在深层间流动受限。iHC 把它扩成 4 条并行的信息通道hc_mult: 4与规格表里的 Residual Streams 4 一致让深层网络能更充分地复用浅层特征改善信息在 78 层间的传递。长度、词表与训练细节剩下这些参数决定了模型能读多长、认多少字、用什么精度参数值说明max_position_embeddings1048576支持100 万token 上下文rope_parameters.rope_theta10000000RoPE 位置编码基频越大越利于长文本外推vocab_size120832词表规模hidden_actsilu激活函数配合 SwiGLUrms_norm_eps1e-05RMSNorm 数值稳定项initializer_range0.006权重初始化的标准差dtype/torch_dtypebfloat16存储与计算精度enable_lm_head_fp32true词表投影头用 fp32提升数值稳定use_cachetrue推理时开启 KV 缓存其中rope_theta取到千万级、max_position_embeddings直接给到 100 万两者配合就是 Hy4 百万上下文能力的地基。生成配置temperature 与 top_p 怎么设generation_config.json 单独管如何采样输出和 config.json 的架构参数分工明确参数值建议temperature0.9官方默认采样温度top_p1.0不截断配合温度使用top_k-1关闭 top-kdo_sampletrue开启随机采样对新手的小建议做代码/工具调用等确定性任务时可把temperature调低如 0.2–0.6减少跑偏做创作/头脑风暴时保留 0.9 的默认值让输出更丰富。快速上手从 config.json 到部署与微调读懂参数后落到操作其实很直接部署推理Hy4 兼容 vLLM、SGLang 等主流框架开启 MTP 投机解码可获得更高吞吐具体参数见 README.md 的 Deployment 一节。微调模型仓库自带 DeepSpeed / LLaMA-Factory / ms-Swift 三套微调模板参数与 config.json 保持一致例如 finetune/llama_factory_support/hy_v4_full_sft.yaml 与 finetune/deepspeed_support/ds_zero2_offload.json。入门教程见 finetune/README_CN.md。写在最后一句话看懂 Hy4 的聪明之处把整份 config.json 串起来看Hy4 的设计哲学其实就三条MoE 专家路由——用 256 选 8 把大知识和低计算解耦MLA 门控 DSA IndexCache——用压缩和稀疏把百万上下文的显存与算力打下来MTP 投机解码——用 1 层 10B 小模型给整台机器提速。看懂了这些参数你就看懂了 Hy4 preview 为什么既是旗舰、又跑得动。下一步不妨打开 config.json 对照本文亲手过一遍每个字段——你会发现这份不足三百行的 JSON就是一台 770B 大模型的解剖图。【免费下载链接】Hy4-previewHy4 preview 是由腾讯混元团队研发的新一代混合专家MoE旗舰模型。模型总参数量 770B每个 token 激活 49B主干共包含78层第一层采用标准 FFN其余 77 层均为 MoE 结构每层包含 256 个路由专家与 1 个共享专家每个 token 激活 top-8 路由专家及共享专家。主干之外原生内置 1 层 MTP总参数量 10B激活 0.7B以支持投机解码。项目地址: https://ai.gitcode.com/tencent_hunyuan/Hy4-preview创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考