
1. MobileLLM 或 SmolLM 这类小模型,为了在手机端运行,在架构上做了哪些特殊优化?(如 SwiGLU 替换、深窄结构、Embedding 共享)端侧小模型的核心矛盾是:参数量小,但能力不能塌方。MobileLLM、SmolLM 等模型在架构上做了大量针对性优化,常见手段如下:优化手段做法收益深窄结构(Deep Narrow)减少隐藏层宽度,增加层数同等参数量下表达能力更强,推理延迟更低Embedding 共享(Weight Tying)输入 Embedding 与输出 LM Head 共享权重大幅减少参数量,尤其对词表大的模型收益明显SwiGLU 替换用 SwiGLU 激活替代传统 FFN 中的 ReLU/GELU提升小模型容量效率,但需注意参数量微增分组查询注意力(GQA)多个 Query 头共享 Key/Value 头显著降低 KV Cache 内存占用共享注意力层部分层复用同一套注意力参数