文本生成工作流程)
自回归推理总体流程总结将原始文本拆成Token ID将 ID 转为含位置信息的向量通过 Transformer 解码器计算上下文表示用最后一个 Token 的输出来预测下一个 Token将预测的 Token ID 转回文本追加到输入后再重复整个过程每一步详解第1步文本分词Text Tokenization项目内容输入原始字符串“ACP is a very”处理用词表Vocabulary将字符串拆分为子词并映射为整数ID输出Token ID序列 [61295,374,264,1062]作用将人类语言转化为模型可处理的离散符号整数索引第2步Token向量化Token Embedding项目内容输入Token ID序列 [61295,374,264,1062]处理查Embedding表得到词向量V加上位置编码P以保留顺序信息输出带位置信息的向量序列 [T1,T2,T3,T4] (每个TVP)作用将离散ID转为连续向量并注入位置信息供神经网络计算第3步大模型推理Model Inference项目内容输入向量序列 [T1,T2,T3,T4]处理经过多层Transformer解码器含Self-Attention、Feed-Forward、AddNorm,建模Token间的依赖关系输出更新后的上下文向量隐藏状态向量Hidden State序列 [H1,H2,H3,H4]同样长度但包含了Token在整个上下文语境中的语义信息作用通过注意力机制理解上下文语义生成每个位置的高阶表示第4步解码与自回归Decoding Autoregresstion项目内容输入模型输出的完整向量序列处理1、提示最后一个Token的向量H4【因果注意力的机制H4 已经压缩了前文 ACP is a very 的全部语义信息】2、经Linear线性层词表映射给出Logits分数向量(所有可能的候选词及打分)3、Softmax转为概率4、按策略如贪心/采样选出下一个Token ID输出下一个Token ID(例如 38219对应 ‘informative’) 及其概率作用本于当前已生成的全部内容预测最可能的下一个词并控制生成多样性通过策略选择第5步输出文本Output Text项目内容输入选中的Token ID(38219)处理通过Detokenizer(逆分词)将ID转回字符输出新生成的文本片段‘informative’,并追加到已有输出后-Acp is a very informactive作用将模型输出的数字结果还原为可读文本并以流式方式实时展示第6步生成下一个词将新生成的 Token如 informative追加到原始输入序列末尾带着更长的序列5个 Token可通过KV Cache加速重复第25步不断生成下一个词直到遇到结束符EOS或达到最大长度“自回归”Autoregressive的含义每次用已生成的词作为下一步的输入一步一步“续写”下去