AI 八股文 之 【人工智能、LLM概述、Prompt 工程、Token、会话记忆、上下文窗口、多模态、RAG、 Tool Calling 、MCP、Agent、Workflow、Skill】

发布时间:2026/9/30 2:30:02
AI 八股文 之 【人工智能、LLM概述、Prompt 工程、Token、会话记忆、上下文窗口、多模态、RAG、 Tool Calling 、MCP、Agent、Workflow、Skill】 目录1. 人工智能概述2. 大语言模型LLM3. Prompt 工程CO-STAR 结构化框架实用模板提示词工程技巧4. Token5. 会话记忆与上下文窗口6. 多模态文本、图像、音频、视频的融合7. RAG检索增强生成8. Tool Calling 与 MCPTool Calling工具调用MCPModel Context ProtocolMCP 核心组件MCP 工作流程4 步Tool Calling vs MCP9. Agent 与工作流Workflow10. Tool Calling 与 Skill11. Vibe Coding 与 Copilot/Agent 模式1. 人工智能概述人工智能AI目标是用计算机系统模拟人类智能实现学习、推理、决策等认知活动本质是算法 数据让机器具备类人能力你每天刷短视频平台知道你喜欢什么 —— 这是 AI 在“学习”和“预测”你跟 Siri 说句话它能听懂 —— 这是 AI 在“听”和“说”拍照自动美颜、翻译文字 —— 这是 AI 在“看”和“理解”输入文字生成一段视频 —— 这是 AI 在“理解并创作”汽车自己开 —— 这是 AI 在“思考”和“决策”三者的关系人工智能AI目标让机器有类似人类的智能机器学习MLAI 的核心实现方式通过数据训练模型自动学习规律线性回归、决策树、SVM 等深度学习DLML 的重要分支基于多层神经网络自动从海量数据中提取特征一句话DL ⊂ ML ⊂ AI2. 大语言模型LLMLLMLarge Language Model基于海量文本训练能理解和生成人类语言的模型模型系列开发方特点GPT 系列OpenAI顶级多模态超强推理原生音视频处理Claude 系列Anthropic擅长编程辅助、长文档处理、拟人化对话Gemini 系列Google多模态搜索引擎与对话系统融合GLM智谱 AI高效上下文理解本土化语言优势通义千问阿里全栈 AI与阿里云生态深度绑定混元腾讯企业级安全微信/腾讯云生态打通云雀/豆包字节驱动豆包 AI与抖音/头条生态集成DeepSeek深度求索国产“推理之王”推理强成本效益高3. Prompt 工程提示词Prompt 是用户或系统给 LLM 的指令/文本用于引导模型生成特定输出类型定义核心功能示例用户提示词终端用户直接输入传达即时需求提问、指令“查询订单”系统提示词开发者预设嵌入后端定义角色、行为规范、知识边界、安全过滤“你是一名客服用友好语气解答问题”系统提示词像“操作系统”持续影响所有交互用户提示词像“操作指令”驱动单次任务CO-STAR 结构化框架实用模板缩写含义说明CContext背景提供足够背景帮助 AI 理解任务上下文和环境OObjective目标明确希望 AI 完成的具体目标SStyle风格指定生成内容的风格正式、幽默、小红书风等TTone语气确定语调礼貌、说服性、激励性等AAudience受众描述目标受众年龄、兴趣、职业等RResponse响应格式指定输出格式表格、段落、列表等及具体约束示例美食短文 Prompt角色资深美食专栏作家背景微信公众号读者 20-35 岁晚 9 点饿西安肉夹馍任务写 300 字短文突出“馍酥脆、肉软烂”输出格式标题≤15字正文分3段风格市井烟火气口语化短句禁用陈词滥调提示词工程技巧基础技巧角色提示设定身份“你是一位 Python 架构师”约束语气和专业深度结构化指令用分隔符“”、【】、XML 标签、列表、Markdown 清晰界定各部分少样本提示提供 1~3 个正确示例让模型快速学习格式进阶推理技巧链式思考CoT让模型分步推理先思考再输出提升复杂问题准确率示例请一步步推理以下问题展示完整思考过程最后得出结论……自我一致性多次独立推理投票得出最终答案避免“一次思考定生死”优化策略迭代式精炼Iterative Refinement从简单指令开始逐步添加约束条件观察输出并优化4. TokenToken 是 LLM 处理文本时的最小语义单位由分词器将文本拆分而成不同模型分词器不同同一个词可能被拆成不同的 TokenPrompt Token / Input Token发给模型的内容问题、历史对话、上传文档、系统提示词Completion Token / Output Token模型生成的回答Token 的三大作用计费单位几乎所有商用大模型按 输入 Token 输出 Token 收费上下文长度限制模型有最大上下文窗口如 8k、32k、128k、1M超限会截断或报错决定理解能力与成本Token 切分合理性直接影响语义理解数量影响推理速度、显存占用5. 会话记忆与上下文窗口会话记忆Chat Memory模型对历史对话内容的存储与利用机制让对话连贯、减少重复输入、实现个性化体验和多轮任务完成上下文窗口Context Window大语言模型在单次前向传播一次推理或训练步骤中能够处理的输入 TokenPrompt 输出 TokenCompletion的总和上限上下文窗口 背包容量当前输入 会话记忆 系统提示词 你要装进去的东西如果三者总 Token 数 输出 Token 超过窗口就必须截断或触发遗忘6. 多模态文本、图像、音频、视频的融合多模态指融合多种类型信息让模型能理解、生成不同模态数据。单模态只能处理一种常见模态典型应用文本Text智能问答、文档分析图像Image医疗影像分析、AI 绘画、商品描述生成音频Audio语音助手语音→文本→LLM→语音视频Video视频摘要、行为识别、安防监控7. RAG检索增强生成RAG 解决三大问题知识过时训练数据有截止日期RAG 可接入最新文档、实时数据幻觉模型容易“编答案”RAG 基于真实文档回答可溯源私有知识模型不知道企业内数据、业务规则RAG 接入知识库实现“专属 AI”此外还能节省 Token只检索相关片段并提升可解释性返回引用来源RAG 核心工作流程阶段步骤具体操作离线准备1. 数据采集文档PDF/Word/Markdown、数据库、API、网页2. 文档切分Chunking拆成小块提高检索精度适配上下文窗口3. 向量化Embedding将每个 chunk 转换为向量4. 存入向量数据库存储向量 原文 metadata常用 Milvus、Pinecone在线查询1. 问题向量化 检索用户问题转向量在向量库中相似度搜索余弦相似度、向量距离2. 重排序可选用更强模型对检索结果重新排序筛选最相关内容3. Prompt 构建 生成将检索结果 用户问题组合成完整 Prompt调用 LLM 生成答案8. Tool Calling 与 MCPTool Calling工具调用指 LLM 能根据用户请求智能选择并调用外部工具函数、API、服务等扩展自身能力Function Calling 是 Tool Calling 的早期叫法特指调用代码中的函数Tool Calling 是更广泛的概念涵盖 API、数据库、浏览器等任意外部操作MCPModel Context ProtocolMCP 是LLM 与外部系统交互的标准化协议类比 AI 领域的“USB-C”核心价值解决 “N 个模型 × M 个工具” 的集成复杂度问题以前每个模型对接每个工具都要单独开发适配逻辑现在只要遵循 MCP 标准即插即用MCP 核心组件MCP 采用的是“客户端-宿主-服务器”Client-Host-Server三层架构MCP Host 就是运行 AI 能力的应用程序本身。比如 Claude Desktop、Claude Code、Visual Studio Code或者你自己搭建的 AI Agent 应用Host 的职责是创建和管理多个 MCP Client 实例控制 Client 的连接权限和生命周期执行安全策略和用户授权协调 AI/LLM 的集成跨多个 Client 聚合上下文MCP Server 是一个独立的程序向 MCP Client 提供特定的上下文和能力MCP Server 的核心职责职责具体说明暴露 MCP 原语通过 Tools工具、Resources资源、Prompts提示模板三种原语提供能力独立运行每个 Server 聚焦于明确、单一的能力边界可独立部署请求采样Sampling可通过 Client 接口请求 Host 侧的 LLM 进行采样遵守安全约束只能访问被授权的内容不能读取完整对话历史本地或远程部署可以是本地进程stdio 传输或远程服务HTTP 传输Server 暴露的三种原语原语控制方说明示例Tools工具模型控制暴露给 LLM 执行操作的函数API POST 请求、文件写入、数据库查询Resources资源应用控制通过 URI 访问的上下文数据文件内容、Git 历史、数据库记录Prompts提示模板应用控制预定义的提示消息模板带参数的问题模板、角色设定模板MCP Client 是运行在 Host 内部的组件由 Host 创建负责与一个 MCP Server 建立和维护一对一的连接关键特征一个 Client 只连接一个 Server一对一关系MCP Client 的核心职责职责具体说明建立有状态会话与每个 Server 建立一个有状态的会话stateful session协议协商与能力交换在初始化阶段与 Server 协商协议版本和双方支持的能力双向路由协议消息在 Host 和 Server 之间双向传递 JSON-RPC 消息管理订阅和通知处理 Server 的订阅请求和实时通知维护安全边界隔离不同 Server 之间的连接防止互相“窥探”MCP Server 获取渠道官方 Registryhttps://registry.modelcontextprotocol.io国内云厂商阿里云百炼 MCP 广场、腾讯云 MCP 广场社区平台mcp.so、ForAgents.devMCP 工作流程4 步初始化连接MCP 主机启动Client 与 Server 建立通信能力发现Client 向 Server 查询工具列表名称、描述、参数、权限同步给 LLM执行决策与调用LLM 判断是否调用工具若需调用Client 将结构化请求转发至 ServerServer 执行并返回结果结果回传与输出Client 将执行结果回传 LLM模型融合后生成自然语言回答Tool Calling vs MCP维度Tool CallingMCP本质LLM 调用外部工具的能力LLM 与工具交互的标准化协议范围偏向单一操作查天气、查数据库覆盖工具发现、调用、结果返回的全流程集成方式每个模型 每个工具需单独适配统一接口Client 与 Server 分层解耦标准化程度各厂商实现不同缺乏统一规范开源标准跨模型、跨工具互通9. Agent 与工作流Workflow对比维度Workflow工作流Agent流程控制人预先定义步骤固定顺序LLM 根据目标动态控制走向灵活性可预期适合确定性任务自适应适合开放性任务决策主体人设计规则固定流程LLM 自主决策多 Agent 模式将复杂任务拆给多个职责不同的 Agent 协作完成何时需要多 Agent 而非单 Agent任务复杂到单 Agent 无法稳定完成时上下文限制单 Agent 塞入所有信息会超窗口、成本剧增、速度下降角色冲突同时扮演多角色导致提示词冲突行为混乱单点故障某一步出错整个任务链崩溃10. Tool Calling 与 Skill维度Tool CallingSkill粒度单一操作查天气 API完整任务能力规划旅行查天气查机票查酒店生成行程特点原子化可被组合封装好的可复用能力包含多个工具调用逻辑常用 Skill 平台ClawHubOpenClaw 官方llmskills.orgClaude 用户友好SkillsMP12 万 GitHub 开源 Skill腾讯 SkillHub、阿里云官方 Skill 平台11. Vibe Coding 与 Copilot/Agent 模式Vibe Coding用自然语言驱动开发开发者描述意图LLM 自动生成/修改代码开发者验收、反馈、迭代。代表工具Cursor、Windsurf、Trae以及 CLI 工具Claude Code、Aider、ClineCopilot 模式AI 作为“副驾驶”提供建议最终决策权在人如普通 ChatGPT 问答Agent 模式AI 自主规划并调用工具完成执行如智能客服帮你订机票层级核心问题关键概念概念层是什么AI、ML、DL、LLM、多模态交互层怎么问Prompt、Token、会话记忆、上下文窗口增强层怎么让回答更准RAG、向量数据库、Embedding行动层怎么让 LLM 做事Tool Calling、MCP、Skill系统层怎么构建智能体Agent、Workflow、多 Agent、OpenClaw、Hermes