
简介这是一份面向VMware vSAN管理员及5V0-22.23认证备考者的题库资料整体以单个PDF文档形式提供压缩包大小296KB。内容围绕vSAN 8.0的新特性展开覆盖集群磁盘布局选择、OSA与ESA架构对比、同步延迟监控、FTT容错规则调整、RAID-5与RAID-6策略使用、vLCM离线升级、站点容灾、vSphere HA故障重启以及边缘三节点全闪存集群部署等高频考点。全部题目均附答案与要点解析能够帮助读者在考前快速完成自测与错题复盘也可作为实际环境中的排障参考避免在vSAN存储策略、性能服务、关机流程等关键环节出现配置偏差。文件总数1个虽体量不大但考点集中目前已有72人学习下载适合正在备考VMware vSAN认证或需要巩固vSAN 8.0运维知识的技术人员。每道题后还配有场景化解析遇到类似生产环境问题时可直接参考决策依据节省翻阅文档与反复验证的时间。1. 5V0-22.23 到底考什么先搞清楚它值不值上周一个客户现场对方的存储工程师拿着 vSAN 的健康告警截图问我这个橙色的vSAN object health到底要不要处理 我顺手在管理端敲了两条命令定位到一台磁盘控制器队列深度异常的宿主机。他感慨了一句早知道应该把这个认证考了。 他说的就是 5V0-22.23——VMware vSAN Specialist 专项认证。这个考试不是泛泛的虚拟化认证它围绕 vSAN 一个产品线考你的架构选型、部署、运维和故障排查能力适合正在做或打算做超融合基础设施的工程师、运维和架构师。先说结论如果你日常就是和 vSAN、vSphere 打交道这个认证的备考过程比证书本身值钱。因为它不是背题就能过的考试题目大量以给你一段运维场景选下一步操作的形式出现考的是你在真实环境里怎么判断问题边界、怎么选命令、怎么排错。下面我把这个考试的框架、备考路径和高频参数拆开讲最后给出我踩过的坑。2. 拆掉 vSAN 的黑匣子考试四大知识域和选型逻辑2.1 从混合架构到全闪OSA 与 ESA 的选型逻辑vSAN 走到 8.0 之后官方把架构分成了两条线传统架构 OSAOriginal Storage Architecture和新一代架构 ESAExpress Storage Architecture。5V0-22.23 考试对这两套架构的区分考得很细不是简单问你支持不支持全闪而是要求你在具体场景里选择用哪套架构。OSA 沿用的是 vSAN 6.x 起的那套机制每个宿主机至少一个磁盘组Disk Group磁盘组里有缓存盘Cache Tier和容量盘Capacity Tier缓存盘承担读写加速容量盘负责持久化数据。它的价值在于兼容性——机械盘、混合配置、旧型号服务器都能跑而且容量盘的利用率计算比较直接。ESA 则是 vSAN 8 推出的新玩法直接把缓存盘和容量盘合并成单一闪存层主机只需要插 NVMe 盘不再需要单独的缓存盘。考试里常见的坑是OSA 能不能做全闪这种问题。答案是能只是 ESA 是设计上更纯粹的全闪架构。选型时我的经验是项目预算允许上 NVMe 且集群规模预期会扩张优先 ESA因为它在数据路径上的开销更小如果服务器还是旧的 SAS/SATA 盘、或者有兼容性清单卡着老老实实走 OSA。考试题目里如果出现最小磁盘数缓存盘比例这种数值题大概率是在考 OSA 的参数因为 ESA 把这些参数简化掉了一大半。2.2 存储策略和故障域理解 Failures to Tolerate 才算入门如果说架构选择题考的是你见没见过产品那存储策略考的就是你懂不懂数据怎么落地。vSAN 的存储策略里有几个核心参数Failures to TolerateFTT、Number of Stripes条带数、Capacity Reserved、IOPS Limit。FTT 决定了数据能容忍几个宿主机或磁盘同时故障条带数决定一条数据被拆成几份条带化分布。考试里经常给一个场景集群有 6 台主机每台主机一个磁盘组问 FTT1 时一台主机宕掉数据还能不能访问。答案多数是能但重建时间取决于剩余容量和网络带宽。另一个常见坑是FTT 和伸延集群Stretched Cluster的配合伸延集群本质上把 FTT 从物理机维度扩展到站点维度。这里必须说清楚常规 FTT 是允许几个主机坏而站点故障容错是允许一个站点整体坏考试里这两类容错常常混在一个场景里考察。实操层面存储策略不是创建完就一劳永逸的。我一般会建议新集群先用默认策略跑一周观察容量和性能曲线后再调整条带数。条带数调大能提升并发读性能但也意味着同一份数据拆得更碎故障重建时涉及更多盘重建流量更分散。考试题目不会直接告诉你这个权衡它会给一个访问延迟偏高、CPU 和存储都空闲的现场让你判断要不要调高条带数——这种题我见到的频率很高。2.3 容量与性能规划一块盘该放哪里由哪些参数决定容量规划是另一个反复出现的考点。vSAN 的容量计算和传统 RAID 不太一样它要同时考虑副本、Fault Domain、主机故障后的重建余量。官方给过一个核心公式实际可用容量 原始容量 × 冗余因子 × 预留因子。冗余因子就是 FTT 对应的副本倍数FTT1 时差不多是 2预留因子建议至少预留 20% 的容量给重建和快照。考试里典型的计算题样式是50 TB 原始容量FTT1磁盘使用率已经 70%还能不能把一台主机设为维护模式。这类题表面上在考容量其实在考对象健康和剩余空间的联动。关键点在于vSAN 不要求有完全空闲的主机也能进入维护模式它只需要在数据迁移后有足够的健康对象数量并且剩余容量能支撑重建。判断标准应该是集群剩余容量是否大于即将迁移的数据量 20% 余量而不是有没有主机完全空闲。性能规划上考试会涉及IOPS 瓶颈判断。我经常看到有人一遇到性能问题就怪磁盘慢但 vSAN 环境里网络队列、CPU、内存回收和存储策略都可能导致延迟拉高。考试场景题一般会给你一个监控页面的截图上面有宿主机 CPU、网络吞吐、磁盘延迟三个指标让你选排查方向——多数情况下瓶颈在网络因为 vSAN 的数据 IO 都是走网络的万兆网卡跑到 70% 以上时延迟就开始抬头了。2.4 考试题型与官方参考大纲、蓝本和软硬件清单5V0-22.23 的考试形式是 70 道左右的选择题和场景题限时约 100 分钟分数线官方没有对外公布具体百分比但行业内共识是场景题不能连错错误率控制在 20% 以内才稳。重点不是背多少条命令而是对架构决策的敏感度。备考素材上官方 Release Notes 和 Configuration Guide 是最可靠的依据。vSAN 8 的几个大版本更新点要留意ESA 引入、vLCM 对 vSAN 生命周期管理的集成、vSAN Express 数据路径加密的支持范围。软硬件兼容性不是把整个 HCL兼容性列表背下来而是记住常见厂商服务器型号在 HCL 里都能找到考试不考具体型号但会考加盘之前要不要查 HCL这种合规性判断。这里给一个我的备考习惯每学一个功能点就把它映射到一个现场场景里。比如看到vSAN File Service就问自己客户要求把 NFS 共享放到 vSAN 上我要在集群里启几个文件服务节点、实例数怎么设。考试里的题目不会直接说vSAN File Service 的默认端口是多少但会问文件服务实例需要 IP 和存储资源部署前要预留什么。提前做过这种转换答题速度会快很多。3. 备考落地路径从 HOL 免费实验环境到可复现命令3.1 用 VMware Hands On Labs 搭出最小 vSAN 集群学 vSAN 最大的障碍是没环境。你不能在虚拟机里嵌套装一个 vSAN 集群——它能装但性能和网络模拟都不真实排错经验完全套不上。我推荐的路径是先用 VMware Hands On LabsHOL的 vSAN 类实验它提供浏览器可访问的预配置环境里面有 3 节点 vSAN 集群、vCenter Server 和一套监控工具你在里面敲命令、改配置、破坏数据再恢复都不会影响生产环境。进入 HOL 后的操作关键是不要只做 guided scenario要切到 Manual 模式。引导式场景会把每一步告之目的但练习排错时需要自己折腾把一台主机的磁盘组删掉再重建观察 vSAN health 从黄变绿的过程把存储策略的 FTT 从 1 改成 2看容量消耗如何翻倍模拟一次主机隔离确认对象重新保护的时间。这些操作在引导模式里不会给你机会做但考试后半部分的场景题恰恰就是这种状态变化后的判断。实验环境的网络是数据中心的虚拟网络延迟很低所以延迟类实验效果不太真实但 vSAN health 检查、告警、对象同步这些行为和生产环境完全一致。我的建议是每个功能都做两遍第一遍按文档走第二遍故意把某个参数配错观察现象和报错日志再把正确的配置找回来。这样理解深度完全不一样。3.2 在实验里反复验证的命令从 vSAN health 到事前检查考试不考手敲命令输出但会考哪条命令能解决当前问题。下面这套命令是我在 HOL 里反复敲过的场景题也经常出现。用esxcli vsan health cluster list查看集群整体健康状态是最快找到问题入口的地方。esxcli vsan health cluster list输出里会有HOST_OF、DISK_FAILING、MISC等几类状态分别对应主机离线、磁盘预测性故障、其他杂项问题。优先看UNHEALTHY的条目再逐层深入。比如看到DISK_FAILING说明有盘正在报预测性故障需要进一步定位到具体宿主机的具体盘。esxcli vsan debug disk list这条命令会列出每块磁盘的状态和所属磁盘组配合esxcli vsan cluster get看集群 UUID 和本地节点状态。实际排错时我喜欢先跑三条命令定位vsan health cluster list看问题域、vsan health cluster check network看网络问题、vsan debug disk list看底层盘状态。考试场景题里只要出现vSAN 健康状态显示异常排查顺序基本就是网络 → 磁盘 → 策略。参数说明esxcli vsan health cluster list可以加--full参数显示更详细的子项比如磁盘组信息、网络适配器的虚拟化检查esxcli vsan debug disk list的输出里VSAN UUID和Disk Group UUID两项对定位存储策略归属很有用。实验环境里一定把这些命令都敲一遍记住输出格式考试时遇到对应的故障描述才能回忆起链路。3.3 反复刷题之外事件报告类题型的答题思路5V0-22.23 的考试被很多人说答案看起来每个都对根本原因是它考的是决策顺序而不是单个知识点。给你一段描述——集群健康报警有两台主机显示网络隔离三块盘高延迟用户报告访问变慢——问你先处理哪个这类题不是考你会不会修是考你能不能判断优先级。我的分诊顺序是先看数据是否还能访问损失数据的风险优先再看是否影响所有对象还是部分对象然后看是单点问题还是多点问题。考试选项里经常会有一个重启所有涉及主机的选项千万不要选vSAN 不是那种重启能解决问题的架构重启主机只会触发更多对象迁移。另一种高频题是给你一个存储策略的 JSON 或表格问某个对象当前是什么状态。这类题考的是策略和对象的映射。见多了发现它们都是绕一个核心对象的健康状态取决于它当前的组件Components是否可用而不是策略本身怎么定义。策略只是期望状态真实健康状态要看组件分布和可访问性。所以平时我提醒自己看对象状态时先展开组件列表看到组件缺失再回头看策略别被策略带偏。4. 高频考点里的硬参数FTT、Witness 和性能天花板4.1 可用性参数FTT、条带化、容错方法怎么组合这个投票是最容易出计算题的地方。FTT 和容错方法的组合要考虑一个容易被忽略的约束数据副本需要放在不同的故障域里否则 FTT2 也是白设。比如在 3 节点集群里设 FTT2数据有三个副本每个副本各放一台主机表面看没问题但如果有两个副本放在同一台主机的不同盘上其实并没有达到真正的容错级别。条带化参数和 FTT 是独立的两条轴但考试常把它们放在同一个场景里考察。我的经验是条带化不要轻易从默认的 1 往上调。很多工程师为了追求性能把条带数改成 2 甚至 4结果容量消耗涨上去重建时间也变长但性能收益很有限。考试里出现IOPS 无法提升的判断题优先考虑网络是瓶颈或者存储策略没有应用成功而不是先怀疑条带数。容错方法Failure Tolerance Method在 vSAN 里有两个选择RAID-1镜像和 RAID-5/6纠删码。RAID-5 在 FTT1 时只吃 1.33 倍容量冗余比镜像省不少空间但重建时 CPU 开销大、性能受影响更明显。考试里客户想省容量又要容忍一台主机故障这种题选 RAID-5 而不是 RAID-1但性能优先且容量压力不大的场景就选 RAID-1。这个决策要在 30 秒内做出来平时多做几遍对比表。4.2 延伸集群从 Witness 到站点故障优先级的配置取舍Stretched Cluster 是考试的一大块也是实际项目里最容易被低估的部分。它是把两台或更多主机放到两个站点数据在两个站点各留一份站点之间的网络要求 RTT 延迟不超过 5 ms官方标准实测 3 ms 以上就要慎重。Witness 节点是整个延伸集群的大脑。它不存数据副本只存仲裁信息但它的可用性直接决定站点故障时谁能继续提供服务。考试里最常见的延伸集群题是主站点全部故障业务还能不能写——答案是能只要 Witness 还在反过来Witness 故障主站点还正常——业务仍然正常但集群进入无仲裁状态不能再容许任何一台主机故障。配置延伸集群时有两个参数一定要记牢Preferred Site优先站点和Secondary Site。优先站点在故障恢复后会优先接管业务考试里问两个站点同时恢复谁会接管答案总是优先站点。还有一个细节延伸集群不支持 vSAN File Service这是官方约束考试里出现过延伸集群上启用文件服务的错误选项。4.3 vSAN 文件服务和快照两个容易被翻车的功能点vSAN File Service 是小块知识点但几乎每次考试都会露脸。它本质是在 vSAN 数据存储上提供 NFS 服务配置时要开启文件服务、定义网络、分配文件服务器实例File Server Instances。一个常考的数字是默认配置下每个 vSAN 集群至少要有一对文件服务器实例来做高可用。考试会问要启用文件服务集群需要满足什么条件选项里出现至少 4 台主机是错的因为文件服务器实例是一对但不是每台主机一个。快照问题是运维场景题的高频主题。vSAN 快照不是传统存储的克隆它在删除时做的是合并Consolidate合并过程需要空间来承载新的写入。不少人考试前没有意识到快照删除后原来快照占用的空间不会立刻释放它会随实际数据的写入逐渐回收。考试题给删除快照后容量没恢复正确方向是检查快照合并是否完成、预留重建余量是否足够而不是立刻重新同步数据。快照还有个连锁影响对象上有快照时它的组件读写路径会变长性能下降是正常的。所以考试场景里如果出现某虚拟机开了快照后延迟高没错就是这么直接的原因。4.4 性能验证方法IOPS 不达标先看这张表这里给一张我在项目里常用的性能首查表表现优先排查方向次要排查方向读延迟高存储策略RAID/镜像网络队列深度写延迟高缓存盘剩余空间VMDK 的 IOPS 限额IOPS 上不去宿主机网卡多队列配置条带数过低重建慢网络带宽争抢磁盘组内盘数量个别 VM 慢快照影响存储策略未更新这张表帮我解决了考试里八成以上的性能判断题。考试题目描述所有 VM 都慢先看网络描述只有一台 VM 慢先看那台 VM 的策略和快照。这是最朴素的分诊逻辑但比背性能参数可靠得多。参数层面记住几个关键值vSAN ESA 推荐跑在 25 GbE 以上网络OSA 至少 10 GbEvSAN 8 上同站点默认对象空间使用率达到 80% 就建议扩容这些数值在容量规划题里很好用。5. 避坑指南考试和现场最常见的五个坑5.1 现象vSAN 集群容量报警但明明还有空间有次项目上 vCenter 弹容量告警集群可用空间只剩 6%我打开容量规划页一看原始容量还剩 30%。这就是 vSAN 容量好看但不够用的经典现象。原因vSAN 容量规划页的可消耗容量已经扣除了 FTT 副本、20% 重建余量但没扣掉快照和对象开销的波动。报警的是当前可用性低位线不是原始剩余。解决进入 vSAN 的容量监控看构建可用容量Usable Capacity和消耗容量两个数字的差值。如果差值超过 15%且快照数量多给关键 VM 清快照如果纯容量不足加主机或加盘才是正解。考试里对应的选项也是检查重建余量和对象健康不是直接买盘。5.2 现象延伸集群 Witness 坏了主站点也变只读有个客户打电话说业务变只读了检查发现延伸集群的两个站点都在线但 Witness 挂了。他们一开始也奇怪主站点数据还在为什么不让写。原因延伸集群的写入要求两个站点中的副本都确认写入witness 参与仲裁当 Witness 不可用整个集群失去仲裁能力vSAN 为确保数据一致性强制所有对象进入只读状态。解决恢复 Witness 是唯一路径。这里有个经验Witness 的证书有效期和状态检查在实际项目中每季度看一次考试里遇到类似描述第一反应别选从主站点重建要选恢复 Witness 节点。可以在 vCenter 里先把 Witness 重新加入集群观察 vSAN health 从只读回到正常。5.3 现象快照删除后空间没有释放这是一个非常容易被误判的现场。删了虚拟机快照容量告警还在于是开始怀疑 vSAN 出 bug。原因快照删除只是把快照链的元数据移除真正的数据合并是在后台逐步完成的。如果这段时间里有新数据一直在写入合并动作会和新写入抢 IO释放速度看起来极慢。解决关闭相关 VM 的 IO 压力大的应用或者直接做一次 Storage vMotion 把这台 VM 迁到别处合并会立刻完成。考试题里给出已经删除快照两小时容量没变正确选项是检查合并进度不是强制重启主机。5.4 现象性能测试 IOPS 和延迟都不达标我自己踩过一次全闪 NVMe 的 vSAN ESA 集群用 HCIBench 跑 4K 随机写IOPS 只有预期的 60%。查了三天最后发现是客户端网卡没有开启多队列。原因vSAN 的数据路径是网络 IO单队列网卡在小包高并发场景下会成为硬瓶颈CPU 大量消耗在中断处理上而不是真正的存储逻辑。解决在 ESXi 里为 vSAN 使用的 VMkernel 适配器启用多队列esxcli network nic queue相关命令并检查网络 MTU 是否设置为 9000巨型帧。考试里如果出现全闪还是延迟高的题答案往网络上找考虑巨型帧和网卡队列配置而不是怀疑存储。5.5 现象考试题目里的最合适选项和正确答案不同这是 5V0-22.23 考试特有的坑。它不像微软题库那样只有一个绝对正确答案很多题是最佳选择其他选项不是错而是不够好。原因VMware 的认证考试考的是决策能力同一场景下可能有多个操作都能恢复业务但只有一个是最低风险、最快、不引入新问题的。解决筛选选项时按三个维度打分是否影响数据完整性、是否影响业务连续性、是否引入新的配置迁移。优先排除影响数据完整性的选项然后排除需要长时间维护操作的选项剩下的就是答案。平时刷题时别只看对错要把每个选项差在哪里标出来考试临场才能快速排除。6. 用 esxcli 和 PowerCLI 验证你学会的每一寸知识点证书考完不代表会做项目我习惯用一套命令来验证自己是不是真的懂。比如在 HOL 环境里执行esxcli vsan cluster get看集群状态再配合esxcli vsan health cluster list确认健康检查项最后用vsan capacity分析容量趋势。这套命令在生产环境也能安全跑只读不改不产生额外负载。一个更进阶的验证是 PowerCLI 脚本把 vSAN 状态拉到 CSV 里做长期趋势判断。我常用的一小段是列出所有主机的磁盘组信息Get-VMHost | Get-VsanDiskGroup | Select-Object -Property VMHost, Disks, CacheDisks | Export-Csv vsan_diskgroup.csv这段命令会导出每台主机的磁盘组结构我在项目周报里用它快速确认集群拓扑没有漂移。逻辑说明Get-VMHost获取所有 ESXi 主机Get-VsanDiskGroup拿到磁盘组对象Select-Object只保留主机名、容量盘和缓存盘字段。考试其实不直接考 PowerCLI但会考你用什么方式确认配置是否合规记住这些命令能帮你答对运维场景题。我对 5V0-22.23 最深的个人教训是别只刷题。我当初备考时刷了 300 道题正确率 90%考试还是差点翻车因为场景题和题库里的题目表述不同真正救了我的是在 HOL 里手动破坏过一次集群、看过一次真实的警报流。所以如果你打算考建议在考前至少完整做一遍断掉一台主机的网络 → 观察 vSAN health → 恢复网络 → 再看对象重新同步这个循环。这个动作能同时覆盖架构、运维、排错三方面的复习。希望帮到你。本文还有配套的精品资源点击获取