
专栏:大模型应用开发:从原理到生产篇号:44建议权限:付费建议标签:Transformer、大模型面试、Attention、KV Cache、MoE上一篇,我们先解决了一个比知识点更重要的问题:大模型面试到底应该怎么答。答案不是把背过的内容尽量多地说出来。而是先给判断,再讲机制,最后用边界和证据证明自己真的理解。从这一篇开始,我们正式进入高频追问链。第一条链,绕不开 Transformer。面试官可能先问 Attention,也可能从 RoPE、KV Cache、GQA 或 MoE 切入。题目看起来不同,背后却是同一件事:输入 Token 进入模型以后,信息怎样被表示、混合、变换,并在推理阶段复用?如果只背一组公式,追问到推理过程就会断。如果只会说 KV Cache 节省计算,又讲不清缓存了什么、为什么占显存,也会暴露理解停留在名词层。这一篇不重新复述 Transformer 的全部历史。我们把最常见的问题放回一次真实生成过程里。一、先给出一条完整主线一个 Decoder-only 大语言模型生成文本,可以压缩成下面这条