云计算与大数据技术应用习题核心考点与实战指南

发布时间:2026/9/18 11:48:31
云计算与大数据技术应用习题核心考点与实战指南 简介云计算与大数据技术应用是物联网、计算机类课程的重要方向这份习题集适合在校学生、考研复习者及自学者用于课后自测与考前巩固。包内为1个docx文档体积仅209KB以简答与填空题型为主围绕课程核心考点展开目前已获246人次学习浏览。文档覆盖云计算定义与五大特点、IaaS/PaaS/SaaS三种服务模式、分布式文件系统与MapReduce基础设施并梳理了非结构化/半结构化数据、大数据4V特征及云计算与大数据的关系。虚拟化部分整理了虚拟化概念、使用原因与常见技术类别数据中心部分涉及发展四阶段、选址因素、主要组成及PUE/DCIE能耗指标等考点并行计算习题还交代了并行计算发展历程、集群系统分类、Flynn分类法与四类设计模型。习题均配有参考答案便于即时对照检验既能帮助快速建立知识框架也能针对薄弱环节查漏补缺是一份适合系统备考与课程巩固的实用资料。1. 云计算与大数据技术应用习题到底在考什么一门课的习题往往比课程本身更早暴露行业的真实需求。云计算与大数据技术应用在许多院校数据专业培养方案里位于分布式系统与工程实践的交界处习题风格也“两头重”前半部分考云服务分层、虚拟化调度、对象存储等基础设施概念后半部分围绕 Hadoop 与 Spark 生态要求手推 HDFS 读写流程、解释 YARN 资源调度。这不像背多分课程更像是岗位笔试的压缩版。把题吃透收益会延伸到云计算运维、大数据开发、数据可视化大屏等实际岗位中。来搜这份习题的通常有三类人准备期末考的大数据专业学生、备战云计算运维笔试的转行者、做毕设需要自建集群的准毕业生。下面按习题高频知识点分块展开每个模块先讲原理、再过题、最后收在丢分点上让你刷题之外还能攒出一点能写进简历的实操能力。2. 云计算核心机制概念题与选型题的双线复习法习题开篇几乎都是概念题但概念题不等于送分题。常见考法既有“简述 IaaS、PaaS、SaaS 的区别并给出适用场景”也有“从隔离方式、启动速度、资源密度三个维度对比虚拟化与容器”。这类题表面考定义实际考一条纵深认知同一条服务链路上到底哪一层由用户管理、哪一层交给云厂商。抓住“托管边界”这个主轴概念题和场景选型题就能共用一套答题逻辑。2.1 用一张表先钉死 IaaS / PaaS / SaaS 的托管边界习题里最常见的是“以下哪个服务属于 PaaS”这类判断但每年都有人把云数据库和容器服务归类弄混。复习时把下面这张对比表背熟只能解决一半问题另一半要靠“写清楚边界”来拿分层级用户管理范围云厂商管理范围典型产品习题常配考点IaaS虚拟机、操作系统、中间件、应用与数据物理服务器、虚拟化层、机房网络与存储华为云 ECS、阿里云 ECS、AWS EC2快照与镜像的区别、按量计费与包年包月PaaS应用代码与业务数据运行时、数据库中间件、自动伸缩与高可用华为云 CloudIDE、阿里云 RDS自动扩容触发条件、多租户隔离方式SaaS应用内的配置与业务数据所有底层与运行环境钉钉、企业微信、腾讯会议开放平台 API、订阅制计费、数据归属考试中的高频陷阱有两个值得单独拎出来。第一个是“云数据库属于哪一层”标准答案是 PaaS因为数据库实例的可用性、备份、主从切换都由平台托管使用者只关心连接串和表结构如果你在 IaaS 的虚拟机里自行安装 MySQL它才算 IaaS。第二个是“对象存储属于 IaaS 还是 PaaS”主流分类把它归入 IaaS 的存储服务因为它提供的是存储能力 API不带计算框架。答题时把“托管边界”四个字写出来再补一句“由谁负责高可用”比单纯给结论更容易拿满过程分。2.2 虚拟化与容器对比高频题的三个维度与最小验证命令虚拟化与容器的对比题几乎年年出现阅卷时看得最清的就是“隔离级别”这个词有没有被点到。虚拟化依赖 Hypervisor 模拟完整硬件虚拟机自带内核隔离发生在硬件层安全边界硬容器与宿主机共享内核通过网络命名空间与 cgroup 实现进程级隔离资源密度高但隔离完备性弱。习题一般还要求补上启动速度差异虚拟机以分钟计容器以毫秒到百毫秒计。下面两条命令可以在本机快速验证容器这部分特征写实验报告时也能引用# 测量容器本机启动开销通常远小于 1 秒 time docker run --rm alpine echo container boot ok # 查看 cgroup 的 CPU 配额文件理解 --cpus0.5 的真实含义 docker run --rm --cpus0.5 alpine cat /sys/fs/cgroup/cpu.max第一条命令的输出重点不在 echo 本身而在time给出的 elapsed 时间它佐证容器无需引导完整内核属于进程级拉起。第二条命令中/sys/fs/cgroup/cpu.max文件里形如50000 100000的两个数字表示该容器在每 100000 微秒周期内最多使用 50000 微秒 CPU这正是 Kubernetes 中 requests 与 limits 在底层 cgroup 的映射。习题如果继续追问“容器逃逸和虚拟机逃逸哪个更严重”记得答虚拟机逃逸一旦攻破 Hypervisor 就等于接管宿主机控制面而容器逃逸后触及的范围仍受内核安全模块限制。这个结论是题眼也是后面章节说 HDFS 部署优先选物理机的间接理由。2.3 云基础设施机制场景组合题要把“构件”当积木近几年练习里“云基础设施机制”成了高频词它指的不是某一台服务器而是云环境的基本构件块虚拟服务器、块存储、对象存储、负载均衡器、弹性 IP、自动伸缩组等。习题的考法通常是一个场景题例如“网站平时流量平稳促销时段流量突增 5 倍要求成本最优”答案由三块构件拼成自动伸缩组承载弹性扩缩容、负载均衡器分发流量、按量计费实例应对峰值而包年包月的固定实例只保证基线。做题时先在题干圈出“波动、成本、可用性”三个词再决定每个词对应哪类构件波动对应伸缩组成本对应计费模式可用性对应多可用区部署。把构件当积木而不是孤立定义来理解选择说明题基本不会写偏。3. 大数据技术原理与应用HDFS 与 MapReduce 的习题怎么答练习中段进入大数据章节这一部分与云计算知识点形成明显的递进关系前一章讨论怎么把计算资源池化这一章讨论怎么把数据拆开存放并并行处理。习题考核重心集中在 HDFS、MapReduce、YARN 三个组件Spark 多以对比题身份出现。答这章题不能只写结论必须能把读写流程的每一步说清楚因为阅卷要点按过程分步给分。3.1 HDFS 读写流程过程描述题的画法与必带细节HDFS 相关题目里出现率最高的是“描述客户端向 HDFS 写一个文件的全过程”和“某个 DataNode 宕机后数据会丢吗”。前者答题框架固定为五步客户端向 NameNode 发起写请求NameNode 校验权限和配额后返回可用 DataNode 列表客户端将文件切分为默认 128MB 的 Block按返回列表顺序写入第一个 DataNodeDataNode 之间建立流水线复制完成副本冗余。画流程时一定标出两个易扣分细节写入先落本地磁盘再向上游返回 ack副本放置策略是同机架一个副本、另外两个副本分到不同机架。宕机题的标准答题点落在副本数上默认副本数为 3只要存活副本数不降到 0NameNode 就会重新调度复制使副本数恢复因此宕机不丢数据只有全部副本都损坏才丢。做题者容易忽略读流程与写流程的字数分配读请求先访问 NameNode 获取 Block 到 DataNode 的映射然后客户端就近选择网络距离最近的副本读取“就近读取”常演变为机架感知概念题。复习时把四个易混点放一起记块大小 128MB、副本数默认 3、NameNode 管元数据、DataNode 管数据块这四个数字是填空题的稳定来源。3.2 MapReduce Shuffle分值最高的分析题要按顺序答MapReduce 是分析题的核心其中 Shuffle 是考察频率最高的子过程。标准答题顺序按阶段推进Map 端写出时先进入环形缓冲区缓冲区默认 100MB达到阈值后 Spill 到磁盘并在落盘前完成分区、排序与可选 CombinerReduce 端启动后从每个 Map 输出中拉取属于自分区的数据在内存与磁盘上做归并排序最后进入 Reduce 函数。习题常追加一个追问Combiner 能否滥用正确答案是必须保证合并前后的结果语义一致例如求平均值的任务就不能用 Combiner因为局部平均值合并后得不到全局平均值。注意Combiner 的使用前提是合并操作保持语义一致求和、求最大最小值可以求平均值这类任务不要套用。# 用 Python 生成器模拟 WordCount 的 Map 与 Reduce 两个阶段 def mapper(line): for word in line.lower().split(): yield (word, 1) # Map 端输出键值对等待框架分区 def reducer(word, counts): # counts 是相同 key 的全部 value 组成的迭代器 yield (word, sum(1 for _ in counts))这段代码重点不在性能在于体现两个习题考点一是 Map 端的输出是键值对而不是单词列表二是 Reduce 端函数的第一个参数是 key、第二个参数是该 key 的值集合。代码注释里“等待框架分区”六个字值得在答题时展开分区发生在 Map 端 Spill 前按键的哈希值与 Reduce 任务数取模决定每条记录进入哪个 Reducer。不少人在图上把分区画到 Reduce 端这是典型扣分点。3.3 Spark 对比题的四个得分点DAG、内存迭代与依赖模型习题里经常出现“同样是计算框架为什么 Spark 比 MapReduce 快”这类对比题作答应围绕四个得分点组织。第一中间结果是否落盘MapReduce 的 Shuffle 必须写磁盘Spark 优先在内存中维护 RDD 的转换关系。第二调度模型Spark 通过 DAG 调度器把作业拆成多个 StageStage 内部流水线执行MapReduce 则是一个作业串行跑完。第三迭代计算机器学习算法反复扫描数据时Spark 可通过缓存避免重复读盘MapReduce 只能反复读 HDFS。第四依赖类型窄依赖不产生 Shuffle宽依赖必然产生 Shuffle这直接决定 Stage 划分。四个点写全对比题基本不丢分。对比维度MapReduceSpark中间结果落盘到 HDFS优先驻留内存作业调度一个作业一个 JobDAG 拆分为多个 Stage迭代计算每次重新读盘支持 RDD 缓存Shuffle 时机每次宽依赖仅宽依赖发生时4. 大数据集群部署策略从习题选型到真实环境搭建讲完框架原理练习文档会过渡到部署与运维方向。这类题目考核的不只是知道框架怎么用还要知道在真实多节点环境里怎么装、怎么调、怎么修。集群部署策略与云计算运维这两个方向近年正逐渐合并成一道综合题要求做题者同时给出硬件选型、组件分配与参数配置三部分答案这也是复习时最值得动手的一章。4.1 部署形态选型虚拟机、物理机还是容器习题经常给一个场景要你判断部署形态。我归纳的通用结论是节点数不超过 5 的教学或开发环境用虚拟机方便快照与回滚节点数超过 20 的生产集群用物理机避免虚拟化层的 I/O 损耗容器化部署在当前课程体系里只作为加分项因为 HDFS 的 DataNode 需要本地磁盘承载 Block容器环境下本地磁盘与 Kubernetes 的调度解耦是个大麻烦。做题时盯住题干里的三个信号词出现“教学实验”选虚拟机出现“生产环境”选物理机出现“云原生或弹性伸缩”才考虑容器。选型题在考卷上通常占 6 到 8 分先写结论再补一句“考虑 I/O 与故障域隔离”分数就能拿全。4.2 最小三节点集群的初始化与五个必调参数无论习题考得多么抽象最终都要落在一个可运行环境上。以 Hadoop 3.x 为例最小集是三台机器一个 NameNode 节点、两个 DataNode 节点兼作 YARN 的 NodeManager。每台机器建议至少 2 核 CPU、8GB 内存、50GB 磁盘并配置机器间 SSH 免密。下面这段初始化脚本在 Ubuntu 服务器上完成 JDK 与 Hadoop 环境变量设置可作为实验报告的第一段# 在 NameNode 节点执行追加环境变量到用户配置 cat ~/.bashrc EOF export JAVA_HOME/usr/lib/jvm/java-11-openjdk-amd64 export HADOOP_HOME/opt/hadoop export HADOOP_CONF_DIR$HADOOP_HOME/etc/hadoop export PATH$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin EOF source ~/.bashrc # 覆盖后的关键参数按配置文件分组说明 # etc/hadoop/core-site.xml 设置默认文件系统地址 # etc/hadoop/hdfs-site.xml 设置副本数与块大小 # etc/hadoop/yarn-site.xml 设置资源调度器地址与内存上限初始化脚本最常见的报错出在两处一是JAVA_HOME路径与系统实际 JDK 路径不一致导致后续所有命令找不到 Java二是HADOOP_CONF_DIR没有指向正确配置目录NameNode 格式化后启动读不到配置。习题里针对参数的记忆题通常只考五个字段建议按“配置文件 参数名 默认值 生产建议值”整理成表配置文件参数名默认值生产建议core-site.xmlfs.defaultFSfile:///hdfs://namenode:9820hdfs-site.xmldfs.replication33测试环境可临时设为 1hdfs-site.xmldfs.blocksize134217728128MB128MB 或 256MByarn-site.xmlyarn.nodemanager.resource.memory-mb8192按节点内存的 70% 至 80% 设置yarn-site.xmlyarn.scheduler.maximum-allocation-mb8192不超过 NodeManager 总内存做题时按表调用参数值比死记硬背省力很多。考卷若问“为什么块大小默认不设成 1MB”答题方向是降低 NameNode 元数据压力与减少任务启动开销块越大则元数据条目越少但过大会导致 Map 端并行度不足。4.3 运维场景题节点掉线、数据倾斜与磁盘写满的答法运维方向的情景题对碰过集群的人是送分题没碰过集群的人容易整空。节点掉线题的标准答法是先描述现象再给排查命令用hdfs dfsadmin -report查看 DataNode 是否存活用jps查看进程是否在用tail -f /opt/hadoop/logs/hadoop-hdfs-datanode.log定位异常。节点宕机等待重启期间NameNode 会自动把该节点上的 Block 复制到其他节点不会造成数据丢失。数据倾斜题要先判断倾斜发生在 Map 端还是 Reduce 端常见缓解手段是增加 Reduce 数量或采用 Salting 方式打散 key。磁盘写满题要回答在线扩容路径为新磁盘分配挂载点、修改dfs.datanode.data.dir并滚动重启 DataNode。这类题的共同点是以“先看日志、再动配置、最后重启”的顺序作答顺序写颠倒会被扣步骤分。实践中的操作顺序也很重要先用hdfs fsck /做健康检查再用hdfs dfs -count -q -h /看配额最后用hdfs balancer -threshold 5做数据均衡把这三个命令写进实验报告能直观体现你确实处理过真实集群。5. 数据可视化大屏与毕设题目把习题数据接成可交互面板练习文档最后通常会布置一道综合大作业常见形态就是数据可视化大屏。这类题目把前面章节的数据接入与统计分析能力汇总到一个前端面板上也和大数据毕设选题的自然延伸方向重合。大屏看起来偏前端但考核的其实是数据链路从数据库或接口读数据、做清洗聚合、再交给图表渲染。下面用一个最小案例说明从数据到图表的一整条链路。5.1 大屏项目的三要素数据源、聚合接口、渲染框架可视化大屏的评分点一般分三块。第一块是数据源近年的大作业普遍要求接入真实数据最少可以用一个 CSV 文件更好的是从 MySQL 或 Hive 查询结果生成 JSON。第二块是聚合接口前端不直接连数据库常见做法是后端写一个 REST 接口返回按时间或地区聚合好的 JSON前端只负责渲染。第三块是渲染框架主流选择是 ECharts配置简单且社区样例多。把这三块分清楚大屏项目的架构也就顺了也避免出现“前端直连数据库”这种被答辩老师一眼看穿的设计。5.2 一个最小示例用 ECharts 渲染云服务访问趋势以下代码片段演示前端如何请求接口并渲染一张折线图覆盖大屏中最常见的一个图表类型// 请求后端聚合接口返回近 24 小时访问量数据 fetch(/api/traffic?window24h) .then(res res.json()) .then(data { document.title 云平台访问趋势大屏; const chart echarts.init(document.getElementById(main)); chart.setOption({ xAxis: { type: category, data: data.hours }, yAxis: { type: value, name: 请求数 }, tooltip: { trigger: axis }, series: [{ type: line, smooth: true, data: data.requests, areaStyle: { opacity: 0.2 } }] }); });接口返回的 JSON 结构需要与后端同步约定为{ hours: [...], requests: [...] }前端的data.hours和data.requests正好对应横轴与纵轴。丢分点集中在两处一是时间字段没有按小时切分导致折线图横轴稀疏二是没有处理接口失败的情况。至少给fetch加一个.catch分支提示后端服务不可用就能在演示环节避开运行报错。需要地图类图表时可以在 series 里换用type: map并注册 GeoJSON逻辑与折线图一致。5.3 从课程大屏到毕设选题的迁移路径很多准备做大数据毕业设计的学生会问选题怎么定我的建议是别另起炉灶把课程的大屏作业横向扩展。课程大屏输出的是统计结果毕设需要的则是预测或分类能力两者之间的增量不大给同一份数据接上一个训练好的分类或回归模型把模型输出作为第二张大屏的数据源再补上数据采集与模型评估章节就能从“可视化大屏”升级为“数据驱动的决策分析系统”。这条路的好处是数据、接口、前端三类工作都在课程里踩过坑毕设阶段只需新增算法模块风险可控。6. 考前两周的错题转写与两轮自测法练习的价值在最后两周才会完全释放但前提是用对方法。我常用的做法是把刷题过程中的所有错题改写成考点卡片每张卡片只写三行考点名称、错误原因、正确结论。例如“NameNode 与 DataNode 职责混淆”可以写成一行卡片原因是把元数据管理错记成数据存储正确结论是 NameNode 只存元数据不存数据块。把三五十张卡片按云计算、大数据、集群部署、可视化四类归档考前只翻卡片不翻原卷效率比二刷整本练习高得多。第一轮自测用闭卷方式规定 90 分钟完成一套练习期间不查资料、不翻书。第二轮自测专门针对错题时间压缩到 60 分钟只做上一轮出错和拿不准的题做完后对照卡片修订。如果某个考点在第二轮仍然出错直接回到前面章节的环境里动手操作一遍用命令验证结论。经过两轮自测常见失分点基本能清掉八成。还有一个容易被忽视的技巧把练习里出现的所有参数值统一列成一张速查表包括块大小、副本数、环形缓冲区阈值、YARN 内存上限等考前 10 分钟只扫那张表。考试时如果遇到拿不准的参数优先写默认值并补一句“生产环境中需要结合节点规格调整”阅卷老师看到这句通常会保留过程分。这张速查表同时就是你面试前的复习底稿从期末考到大数据面试题都可以复用同一份材料。本文还有配套的精品资源点击获取