HCIA - Al Solution 华为认证—— 3、大模型基础

发布时间:2026/8/15 9:03:18
HCIA - Al Solution 华为认证—— 3、大模型基础 目录一、人工智能发展势与概1. BERT概述及架构1)BERT概述2)BERT的结构3)输入部分的处理4)输出部分的处理5)Fine-tuning阶段6)模型效果2. GPT概述及架构1)模型效果及产生背景2)GPT的发展历程3)GPT系列的共同特性4)GPT系列的模型参数对比5)GPT-1架构6)GPT-1的特定任务输入转换7)BERT的诞生3. GPT-24. GPT-31)GPT-3相较于之前版本的变化点2)强化学习模型:行为、环境与模型的关系3)强化学习模型:以训狗为例4)强化学习模型:以小车为例5)GPT-3.5的改进:奖励模型与强化学习训练5. GPT-3.51)InstructGPT的诞生与技术方案2)强化学习:寻找最佳行动3)强化学习的工作机制4)ChatGPT的发布6. ChatGPT1)核心能力与突破2)大模型与一般模型的区别3)技术路线:RLHF7. GPT-41)核心升级2)上下文长度对比8. Vision Transformer1)ViT诞生背景2)ViT算法介绍3)ViT的变体4)ViT实验效果9. Diffusion模型10. Diffusion模型的问题1)Diffusion模型介绍2)“一次到位”存在的问题3)ViT算法介绍4)Stable Diffusion相关文件与操作11. Diffusion模型工作原理1)核心思想:从噪声中逐步生成图像2)去噪模块(Denoise)的作用3)逆向过程(Reverse Process)4)为什么需要“N次到位”而非“一次到位”?12. Denoise模块实际做的事情1)核心任务:预测噪声,而非直接预测图像2)训练过程:前向扩散与反向去噪3)无条件生成:模型能生成好图像,但用户无法控制内容4)实际演示:从噪声到图像的生成过程5)总结:去噪过程的理解13. 训练Noise Predictor1)扩散模型工作原理2)GAN与Diffusion对比3)从无条件到有条件生成4)例题:猫的图像生成示例5)例题:一只猫示例14. Stable Diffusion模型架构1)模型核心架构2)潜空间与速度优势3)两大核心功能4)WebUI界面功能模块15. Stable Diffusion模型外挂1)Stable Diffusion模型架构2)迭代步数(Steps)与采样方法(Sampler)3)图像生成过程与解码器(Decoder)4)文本编码器:一个Transformer语言模型5)文本编码器在文生图中的重要性16. Contrastive Language-Image Pre-Training (CLIP)17. 图像解码器:Auto-encoder1)图像压缩、解压与绘制过程2)潜空间与解码器重构18. 图像信息创建器:Diffusion U-net19. Stable Diffusion总览20. 多模态大模型1)多模态大模型的定义与示例2)多模态的重要性3)多模态模型特点(1)4)多模态模型特点(2)5)多模态模型发展6)多模态模型发展-Sora模型21. 稠密模型和稀疏模型1)模型规模与计算成本22. 混合专家模型1)MoE的核心架构23. DeepSeek-V31)DeepSeek-V3模型概述与MoE结构基础2)NLA机制与路由器功能解析3)专家选择与全局特性捕捉机制4)模型结构创新-MTP24. DeepSeek-R125. DeepSeek模型蒸馏26. DeepSeek-R1训练流程二、考试考点总结1. 考试重点与学习方法2. 大模型基础与架构3. 例题:Transformer采用的技术4. Diffusion模型5. Stable Diffusion模型架构6. GPT-2模型7. MindSpore AI计算框架三、知识小结一、人工智能发展势与概00:061. BERT概述及架构00:201)BERT概述核心目标: 与GPT类似,旨在学习一个通用的预训练模型,以便在大量不同任务上通过微调快速适配。与GPT的对比: BERT的效果在实验数据上优于GPT-1。模型特点: 采用双向的Transformer编码器结构,能够实现不同位置信息之间的互通,这与GPT的单向结构不同。2)BERT的结构01:24结构本质: BERT的模型结构是一个双向的Transformer编码器。双向性: 与单向的Transformer不同,BERT的编码器之间可以互相传递信息,实现多向的信息流通。3)输入部分的处理02:14输入构成: BERT的输入由三种向量相加组合而成,最终形成模型可处理的数据。Token Embeddings: 词向量。第一个单词是特殊的[CLS]标志,用于后续的分类任务。Segment Embeddings: 分句向量。用于区分两个不同的句子,因为预训练任务不仅包括语言模型,还包括以两个句子为输入的分类任务。Position Embeddings: 位置向量。对每个单词在输入序列中的位置进行编码。输入示例: 输入句子“my cat is cute”和“he likes playing”,通过上述三种向量组合后输入模型。4)输出部分的处理03:28核心任务: 获取被掩码(Mask)单词的位置信息,并预测这些单词。处理流程:获取掩码位置: 通过gather indexes操作,从输入张量中取出被掩码单词的位置。非线性变换: 在输出层之前,先通过一个全连接层和层归一化(LayerNorm)进行非线性变换。计算概率: 将变换后的结果与词典中所有单词的权重矩阵相乘,再通过Softmax函数,预测最可能的单词。计算损失: 累加所有被掩码单词的预测损失(Loss),用于模型训练。掩码机制的作用: 防止模型在预测时“抄答案”,强制模型学习上下文语义。5)Fine-tuning阶段04:22两个核心阶段: BERT最重要的两个阶段是预训练和微调。预训练任务:完形填空(Masked LM): 随机掩盖句子中的部分单词,让模型根据上下文预测被掩盖的词。下一句预测(Next Sentence Prediction): 给出上文句子,要求模型预测下文句子。例如,给出“How are you”,模型应预测输出“I’m fine, thank you”。微调阶段: 在预训练好的模型基础上,针对具体的下游任务(如文本分类、问答系统)进行结构改造和参数微调。6)模型效果05:34历史影响: BERT出现时,在NLP领域引起了轰动,刷新了许多数据集榜单。技术发展: 后续出现了GPT-2、GPT-3、GPT-3.5和ChatGPT等模型,参数量越来越大。涌现能力: 随着参数量的增加,大模型涌现出“思维链”等能力,表现出超越以往模型的智能。2. GPT概述及架构06:371)模型效果及产生背景模型效果: BERT出现时在NLP领域引起轰动,刷新多项榜单。后续GPT-2、GPT-3、GPT-3.5及ChatGPT参数量持续增大,大模型涌现出思维链能力,表现出超越以往的智能。GPT产生背景: NLP领域仅有少量标注数据,却有大量未标注的原始文本。为充分利用这些数据,GPT采用无监督学习从文本中提取特征。词嵌入技术的局限: 词嵌入只能处理word level(单词级别)的任务(如king→queen ≈ man→woman),无法处理句子、语法等更高层次的任务。GPT框架正是为解决这一局限而提出。GPT的定位: 与BERT一样,是一种通用大模型,先进行预训练,再通过微调适应不同任务。2)GPT的发展历程08:08发展时间线:2018年: GPT-12019年: GPT-2(参数达15亿)2020年: GPT-3(参数达1750亿)2022年1月: InstructGPT(GPT-3.5),将人类反馈纳入训练过程,使模型输出与用户意图保持一致,减少有害、不真实和有偏差的输出2022年11月: ChatGPT,第一个真正进入大众生活的大语言模型2023年3月: GPT-4,GPT的升级版本3)GPT系列的共同特性08:54共同特性(重点记忆,常考):预训练方式: 在大规模未标注语料上进行无监督学习预训练监督学习: 预训练后,在有标注数据上进行监督学习参数规模: 均在1亿以上基础架构: 均基于Transformer的Decoder架构(Transformer是一切大语言模型的基础)任务能力: 能处理多种NLP任务(如文本识别、文本生成等)4)GPT系列的模型参数对比10:00参数对比表:模型总参数量网络层数上下文长度训练数据隐藏层维度GPT-11.17亿12512十亿768GPT-215亿481024百亿1600GPT-31750亿962048千亿12288GPT-41.76万亿120800013万亿20k网络层数: 指Transformer中Decoder的堆叠数量(解码器堆叠数量)参数增长趋势: GPT-1→GPT-2约翻10倍,GPT-2→GPT-3约翻100倍,GPT-3→GPT-4约翻10倍上下文长度增长: 从512→1024→2048→8000,持续提升训练数据增长: 从十亿→百亿→千亿→13万亿5)GPT-1架构11:44架构特点: GPT-1架构与原始Transformer架构相似,但有以下区别:Decoder堆叠数量: 原始Transformer的Decoder堆叠6层,GPT-1堆叠12层结构简化: 原始Transformer的Decoder包含三层Add操作(多头注意力、交叉注意力、前馈神经网络各一层),GPT-1的Decoder仅包含两层Add操作(仅有多头掩码注意力和前馈神经网络)注意力机制: GPT-1仅使用Masked Multi-Self Attention(掩码多头自注意力),没有交叉注意力(Encoder-Decoder Attention)输入处理流程: 训练数据从左侧输入,经过编码器处理;测试/使用时的数据从右侧输入,经过解码器处理,最终输出预测概率,选择概率最高的句子作为输出关键组件: 包含残差计算(Add)和层归一化(Layer Norm),缓解深层网络梯度消失问题6)GPT-1的特定任务输入转换15:05核心思想: 将所有结构化输入转换为Token序列,使用预训练模型(Transformer)处理,最后通过线性层(Linear)和Softmax层完成特定监督学习任务(输出预测概率)不同任务的输入格式:分类任务: Start + Text + Extract → Linear蕴含关系任务: Start + Premise + Delimiter + Hypothesis + Extract → Linear相似度任务: Start + Text1 + Delimiter + Text2 + Extract → Linear(可交换顺序)问答任务: Start + Context + Delimiter + Answer + Extract → Linear(多个答案选项分别处理)7)BERT的诞生15:54BERT简介: 2019年Google团队论文《BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding》目标: 与GPT类似,学习一个通用模型,能在大量任务上应用,针对不同任务只需略作修改效果对比: 从实验结果看,BERT的效果比GPT-1更好3. GPT-217:09核心定位: 主推Zero-shot(零样本学习),模型参数大幅提升至15亿。架构变化(2点):数据集更大: 使用WebText数据集(40GB),远大于GPT-1的5GB。层数更多: 堆叠了48层Decoder(GPT-2 extra large版本),而GPT-1只有12层。Normalization前置: 将层归一化(Layer Norm)的位置从自注意力和全连接层之后,分别移到了它们之前。训练参数变化:batch_size从64增加到512。上下文窗口从512增加到1024。4. GPT-319:071)GPT-3相较于之前版本的变化点训练数据: 混合了不同质量的多个数据集,并赋予不同权值。包括低质量的Common Crawl,以及高质量的WebText2、Books1、Books2和Wikipedia。权值策略: 对数据先进行预判断,根据质量赋予不同权重,分出更多注意力给重要部分。模型结构: 延续GPT结构,但引入了Sparse Transformer中的sparse attention(稀疏注意力)模块。作用: 自动减小对无用信息的注意力,将更多神经元资源分配给重要区域。下游任务: 从Zero-shot转向采用Few-shot(少样本学习)。2)强化学习模型:行为、环境与模型的关系20:29核心三要素: 行为、环境、模型。运作机制: 模型根据当前环境和做出的行为,判断该行为的好坏,并给出相应的奖励或惩罚。学习目标: 通过反复的奖惩反馈,让模型学会在特定环境下做出正确行为。3)强化学习模型:以训狗为例21:25类比过程: 类似于训练小狗形成条件反射。行为: 小狗“坐下”或“趴下”。奖励: 完成正确动作后,给予零食作为奖励。结果: 通过反复训练,小狗学会将特定指令与正确行为关联起来。4)强化学习模型:以小车为例22:17场景: 一辆小车需要沿着直线从起点走到终点。奖惩机制:偏离直线(歪了): 奖励模型给予惩罚,告知行为错误。过度纠正(歪过头): 环境模型也给予惩罚,告知行为超出范围。回到正确路径: 环境模型给予肯定,但奖励模型可能因“纠正太晚”仍给予惩罚。最终成功: 当小车持续走直线到达终点时,两个模型都给予正向反馈。总结: 强化学习通过神经网络,根据行为和环境反馈的奖惩机制,不断调整策略,直到达成目标。5)GPT-3.5的改进:奖励模型与强化学习训练24:01核心问题: GPT-3虽然强大,但对人类指令的理解不够好。改进方向: GPT-3.5主要新增了奖励模型和强化学习训练。作用: 通过强化学习中的奖惩机制,让模型更好地理解并遵循人类指令。5. GPT-3.524:371)InstructGPT的诞生与技术方案24:42诞生背景: GPT-3虽然强大,但对人类指令的理解不够好,因此催生了GPT-3.5(即InstructGPT)。核心目标: 让模型更好地理解人类的命令和指令含义,例如生成小作文、回答知识问题、进行头脑风暴等。技术方案: InstructGPT采用基于人类反馈的强化学习来微调预训练语言模型,原文分为三个步骤:基于GPT-3有监督微调:先让模型学习人类标注的指令数据。奖励模型训练:训练一个模型来评估输出质量,模拟人类偏好。强化学习训练:利用奖励模型作为反馈,进一步优化模型行为。2)强化学习:寻找最佳行动25:20核心概念: 强化学习总是在寻找什么样的行动才是最佳的。经典案例:自动驾驶汽车: 黄灯开始闪了,是刹车还是加速通过?理想情况:黄灯闪,应该减速。错误情况:加速冲过去导致闯红灯,奖惩机制会告诉模型“你错了,不能再犯”。吸尘机器人: 电量剩余10%,还剩一小块区域未打扫,是继续吸尘还是回去充电?错误情况:继续吸尘导致电量不够回不去,模型会自我修正,下次会老老实实去充电。3)强化学习的工作机制工作流程: 模型感知环境,做出行动,根据状态与奖惩做出调整和选择。核心要素:状态 (State): 当前环境的情况。行动 (Action): 模型做出的决策。奖惩 (Reward): 环境对行动的反馈,用于指导模型学习。学习目标: 通过一系列的行动,最大化“奖函数”,从而学习到最优策略。4)ChatGPT的发布29:57关键时间点: 2022年10月30日,ChatGPT正式发布。技术基础: ChatGPT基于InstructGPT(GPT-3.5)的技术方案,进一步优化了人类指令理解和对话能力。6. ChatGPT30:141)核心能力与突破核心突破: ChatGPT具备初步理解人类意图的能力,不再是单纯的问答。单纯问答: 仅根据训练数据,找到类似问题并给出对应答案。ChatGPT的能力: 能回答后续问题、承认错误、挑战不正确的前提、拒绝不合适的请求。发布时间与影响: 2022年11月30日发布,2个月内用户数突破1亿,效果震撼。2)大模型与一般模型的区别规模: 大模型层数、隐藏单元、参数更多,能捕捉更复杂的模式和关系。参数量: 大模型通常有数十亿甚至数千亿参数,能存储更多信息。训练成本: 大模型需要更长的训练时间和更多的计算资源。性能表现: 大模型在各类任务上表现更好,表示学习能力更强。泛化能力: 大模型可能在小数据集上过拟合,一般模型结构简单,泛化能力有时更强。注意: ChatGPT本身不是大模型,而是基于GPT-3.5架构的较小模型。3)技术路线:RLHF整体路线: 在GPT-3.5大规模语言模型基础上,引入“人工标注数据+强化学习”(RLHF)进行微调。训练三阶段:有监督微调: 利用GPT-3.5模型进行有监督微调。奖励模型训练: 训练一个奖励模型。强化学习训练: 使用强化学习进一步优化模型。说明: 该训练过程与GPT-3.5(InstructGPT)类似。7. GPT-431:421)核心升级发布时间: 2023年3月14日,参数规模达万亿级。性能提升: 比GPT-3.5(含ChatGPT)回复更可靠、更有创意,能处理更细微的指令。多模态能力: 能同时接收图像和文本输入。应用场景: 描述特殊图像含义、从屏幕截图总结文本、回答包含图表的问题。2)上下文长度对比GPT-3: 上下文长度为2048 Tokens。GPT-3.5: 上下文长度为4096 Tokens。GPT-4: 上下文长度为32768 Tokens(另有8192版本)。学习重点: 需要掌握GPT-1、GPT-2、GPT-3、GPT-3.5、GPT-4这五个版本之间的核心区别。8. Vision Transformer34:001)ViT诞生背景34:12CV领域的格局: 2020-2021年间,卷积神经网络(CNN)主导计算机视觉(CV)领域,而Transformer已成为自然语言处理(NLP)的标准配置。早期的融合尝试: 研究人员尝试将NLP思路引入CV,主要分为两类:将注意力机制与CNN结合。在整体结构中,用注意力机制替换CNN的某些部分(如Non-local、DANet、CCNet等语义分割模型)。核心局限: 上述方法底层仍依赖CNN来提取图像特征。ViT的突破性思考: 研究人员开始探索完全不依赖CNN,直接使用Transformer作为编码器来提取图像特征。2)ViT算法介绍35:45