华为FusionStorage安装实战:从角色规划到故障排查的关键指南

发布时间:2026/10/6 20:30:20
华为FusionStorage安装实战:从角色规划到故障排查的关键指南 简介FusionStorage V100R003C30 软件安装指南 PDF 文档面向存储运维、云计算实施与解决方案架构人员系统讲解分布式存储软件从安装准备、系统要求到 FSM 组件与 FSA 组件部署的完整流程。资源为单个 PDF 文件压缩包大小 2.98MB包含安装简介、安装过程FusionSphere 服务器虚拟化场景、部署 FSM 组件、部署 FSA 组件、存储资源接入虚拟化环境等章节目录按步骤分层便于按需查阅。内容不仅对系统要求、安装准备、流程简介等前置信息交代清楚还详细说明 FSM 管理组件的安装与配置、FSA 代理组件的部署、可选 IB 网络配置以及存储资源接入虚拟化环境的具体步骤每部分均给出操作要点整个指南可作为部署前的核对清单和排错参考。该资源已有 381 人学习下载适合需要规范化部署 FusionStorage 或系统梳理其安装路径的技术人员使用。1. FusionStorage 装到一半最容易翻车问题多半出在安装前的那个晚上FusionStorage 这个名字做华为私有云和混合云交付的人都不陌生它不是一台存储盒子而是一套把多台 x86 服务器的本地磁盘聚合成统一存储池向上提供块存储服务的分布式软件。我第一次认真读《华为FusionStorage软件安装指南.pdf》是给一个客户的虚拟化平台做底层存储当时天真地以为装软件不就是解压、点下一步结果被三张网、两种磁盘模式和一个叫 MDC 的角色折腾得够呛。这篇笔记不打算复述 PDF 的目录而是按我实际执行时的顺序讲清楚装这套软件之前要懂什么、安装命令怎么落、装完怎么证明它敢上线、哪些地方最容易踩坑。适合正在做 FusionStorage 交付或维护的存储、虚拟化和云平台工程师也适合准备接手类似分布式存储项目的新手。2. FusionStorage 安装前必懂的节点角色与网络规划2.1 MDC、OSD、MGR三种角色装错了位置后面全是返工翻开安装指南 PDF第一张架构图里一定有 MDC、OSD、MGR 三个角色。搞懂它们的分工比急着找“安装向导”更有价值。MDC 是元数据控制器管文件系统的元数据和分布式锁类似 Ceph 里 Monitor 加 MDS 的一个组合但它对内存和主频敏感单节点的元数据性能不足会直接拉高所有 IO 的响应延迟。OSD 是数据落盘的角色每块直通给 FusionStorage 的物理盘对应一个对象存储实例负责把数据按副本或纠删码策略写到本地盘上。MGR 偏管理面负责存储池管理、卷的创建与映射同时承担把块服务通过 iSCSI 或 FC 呈现给客户端的协议网关工作。中小规模的部署里三合一形态最普遍一台服务器同时跑 MDC、MGR、OSD 三个角色三节点起步就能搭出一个可用集群也是预算有限的项目里最常见的做法。但节点规模超过十个、或者业务对 IO 延迟很敏感时指南和现场经验都指向把角色拆开两个节点专职 MDC两个节点专职 MGR其余节点全部做 OSD。拆开以后的好处是元数据抖动和协议网关重启不会波及数据面坏处是机器利用率下降很多项目在成本压力下会犹豫。我一般建议先看业务容忍度能接受短暂 IO 抖动就三合一先上不能接受就分。有一点无论哪种形态都不能妥协MDC 必须至少两节点做为主备只装一个 MDC 的集群一旦它宕了就是全局故障这不是省钱的地方。2.2 网络规划表里的硬指标三张网还是两张网VLAN 怎么切FusionStorage 安装指南的网络规划章节名义上给了一张推荐表实际上是在定死架构边界。标准做法是拆成三张网管理网负责 SSH、部署、平台面访问业务网负责客户端和存储之间的块服务流量存储网专门承载节点间的数据复制和 OSD 心跳。管理网和业务网在小型项目里可以合并为一张省交换机口但代价是管理面和业务流量互相抢带宽你在大规模数据重建的时候登录管理界面会明显感到卡顿和超时。存储网则尽量不要跟任何一张网共用它要承载三副本场景下最高三倍的数据写放大带宽一旦被其他流量挤占首先表现出的不是速度变慢而是 OSD 心跳超时和节点被误判离线。三个硬指标值得在规划时写进交付文档。第一存储网必须万兆起步千兆只能跑通功能测试性能测试那一关基本过不去。第二存储网建议做成纯二层不要配网关更不要让它成为默认路由出口。我曾接手一个项目客户把存储网 VLAN 配了 IP 网关结果某个节点因为 routing table 问题把存储报文绕去防火墙延迟高了几个数量级查了两天才定位到日志里的 TCP retransmit 触目惊心。第三MTU 要统一设 9000服务器网卡、交换机接入端口、上行链路三处都得一致有一处漏改就等着性能断崖。如果核心交换机是华为三层交换机记得把存储网的接入端口设成 edge-port 并关闭 STP 协商否则链路收敛时存储报文会被堵在交换机上那种“平时正常、一重建就丢 OSD”的玄学故障多半就是这么来的。2.3 硬件与 OS 兼容性指南里的清单不是参考是硬约束FusionStorage 对硬件兼容性的要求比一般应用苛刻得多。安装指南 PDF 里的兼容性表会列明服务器型号、RAID 卡型号和固件版本、网卡型号、OS 版本与内核版本。第一次装的人最容易犯的错是拿一台“配置看起来更高”的机器去替代推荐型号结果 BIOS 里缺了 FusionStorage 依赖的虚拟化指令集或者 RAID 卡是直通模式不支持的型号后面怎么折腾都装不上。我把自查动作拆成五类CPU 是否支持 VT-x 或 AMD-V、内存容量是否达到对应角色要求、系统盘是否做 RAID1、数据盘是否支持直通、网卡型号与队列数是否在兼容列表内。操作系统这块安装指南通常把 SUSE Linux Enterprise Server 和 RHEL 系内核列在前排部分国产化项目会用到麒麟 OS此时要格外注意内核参数和 FusionStorage 所带内核模块的版本匹配。不要凭感觉去升内核更不要在生产前临时换 OS 小版本。一个节点装不上可以先单点排查一批节点因为 OS 版本被批量卡住就属于规划失误。我的习惯是开工前先在兼容性表里勾出本次用的 OS 和内核版本做成一张表格跟着交付文档走后续扩容也按同一张表准备环境这样能省掉很多半夜扩容时发现版本不匹配的血泪经验。3. 照着 FusionStorage 安装指南把裸机跑成可用存储池3.1 安装前把 BIOS、RAID 和磁盘清理一次做完拿到一批裸机或重装过的服务器先别急着把安装包传上去。我一般把安装前动作固定成一个顺序改 BIOS、配 RAID、清磁盘、核 IP。这四步哪个没做部署工具的预检查都会把它挖出来但等工具报错再回头一台台处理的时间成本非常高。BIOS 方面常见要求是打开超线程、VT-x 或 AMD-V、NUMA关掉 C-state 节能。节点在低负载时反复重启十有八九是 C-state 设置导致主频抖动这属于“安装时没感觉、跑起来才发作”的典型问题不如一开始就关掉。RAID 配置按角色区分。系统盘建议做 RAID1保证操作系统挂了能快速恢复数据盘是将来 OSD 的数据载体必须直通给 FusionStorage不能在 RAID 卡里先组 RAID0。如果阵列卡支持把系统盘控制器和数据盘控制器分开系统盘控制器保持 RAID1数据盘控制器整体设成直通或 JBOD 模式。这样后续扩容时新插的硬盘会自动出现在部署工具的候选列表里不用每次去改 RAID 配置。磁盘清理是最容易被跳过的细节老机器上残留的分区表和 LVM 签名会让部署工具误判为非法磁盘。清理时先确认盘符再逐块处理# 列出所有磁盘确认哪些是数据盘 fdisk -l # 对每块数据盘执行清盘/dev/sdb 替换为实际盘符 sgdisk -Z /dev/sdb dd if/dev/zero of/dev/sdb bs1M count100 statusprogresssgdisk -Z会把 GPT 头、分区表和后备 GPT 全部清零dd再往起始区写 100MB 零数据足以抹掉残留的文件系统签名和 LVM 元数据。这一步做完建议顺手记录每块盘对应的机柜槽位。后面建池时如果遇到副本分布不均衡你能借助这份记录快速判断是拓扑问题还是磁盘域配置问题。3.2 用部署工具拉起集群拓扑清单、预检查、批量安装FusionStorage 安装包自带部署工具核心工作模式是“在一台安装执行机上编辑拓扑文件再向所有目标节点批量下发软件”。拓扑文件相当于整个集群的蓝图里面写着每个节点的 IP、SSH 登录方式、角色归属、存储网 IP 和磁盘范围。这份文件建议放进版本管理而不是放在安装执行机的临时目录里因为你迟早要扩容半年后翻出这份文件重新读一遍能少走很多弯路。以下是一个简化的拓扑清单结构和部署命令实际使用时以你拿到的安装包内模板为准# 每个节点定义角色 mdc/osd/mgr管理 IP 与存储网 IP 分开 [node] mdc01 rolemdc ip10.10.1.11 storage_ip10.20.1.11 mdc02 rolemdc ip10.10.1.12 storage_ip10.20.1.12 osd01 roleosd ip10.10.1.13 storage_ip10.20.1.13 osd02 roleosd ip10.10.1.14 storage_ip10.20.1.14 mgr01 rolemgr ip10.10.1.15 storage_ip10.20.1.15 # 环境预检查检查 SSH 免密、内核版本、磁盘状态等 ./fsp_deploy --check --config /opt/fsp/install/cluster.cfg # 预检查通过后执行安装 ./fsp_deploy --install --config /opt/fsp/install/cluster.cfg--check和--install是两个阶段。--check的输出要分清 WARNING 和 ERRORWARNING 常见于磁盘未清零、节点时间偏差略大一般不阻断ERROR 会直接中断常见是 SSH 连接失败、内核版本不满足、磁盘数量不一致。SSH 失败时先看执行机能否通过管理 IP 免密登录所有节点多网卡环境下 SSH 会话可能走了非预期的接口需要在~/.ssh/config里显式指定来源地址。批量安装耗时与节点数、磁盘数强相关通常几十分钟到两小时。日志默认写在安装目录下的 deploy 日志文件里排障时先搜err或fail关键字然后只关注最后一条错误。不要看到几个 ERR 就慌很多是重试过程里的残留。安装完成后用管理面命令查看集群状态所有节点应该都是 normal 状态角色列清晰显示 mdc、osd、mgr。3.3 建池与建卷磁盘域、副本数与第一个可用卷集群拉起后进入管理界面第一件事不是接业务而是建存储池、建卷、挂载验证一条龙走完。建池时的第一个选择题是副本策略三副本是默认且最稳妥的选择写放大三倍换简单可靠的恢复逻辑纠删码对空间更友好但随机小 IO 延迟偏高坏盘重建时对存储网压力更大没有足够经验不建议首次直接上 EC。建池界面里的“磁盘域”是一个容易被当成高级功能忽略的选项但它直接决定数据安全性。可以把磁盘域理解成故障隔离域通常按机柜划分机柜 A 的盘进 domain1机柜 B 的盘进 domain2机柜 C 的盘进 domain3。三副本策略下三个副本会分别落到三个不同域任意一个机柜掉电都不影响数据可用性。如果不建域或只建一个域三个副本可能落在同一机柜里那这个机柜断电就等同于整个集群数据丢失。建池和建卷在命令行下的操作因版本而异我习惯用这样的命令结构# 创建三副本存储池指定副本落到三个磁盘域 fsp pool add -n pool_data -t replica -r 3 --domain domain1:domain2:domain3 # 在存储池上创建 500GB 卷 fsp volume add -n vol_docker_01 -p pool_data -s 500G这里-r 3是副本数--domain显式声明副本落点-s 500G是卷容量。命令返回后务必用列表命令复核池剩余容量和卷状态卷状态应从 creating 转为 available。如果卡在 creating多半是某个 OSD 未进入 normal回到上一节的节点状态命令里找原因。建卷成功不代表挂载顺利下一章讲的验证才是决定能否上线的关键。4. 装完 FusionStorage 先别上线三层验证把“能用”推到“敢用”4.1 MTU 与网络连通性验证9000 字节大包是最低门槛FusionStorage 装得再顺利如果网络没验证就接业务属于给自己埋雷。第一层验证是存储网的 MTU 一致性。存储网要求 MTU 9000但服务器网卡、交换机端口、交换机上行端口这三处只要有一处是默认 1500数据报文就会被分片或丢弃表现出来就是性能断崖和间歇性 IO 错误。在 Linux 节点上用 ping 验证是最快的手段# 从 osd01 到 osd02验证存储网 9000 字节大包 ping -M do -s 8972 -c 10 10.20.1.12 # 验证业务网链路负载小一档更贴近跨三层路径 ping -M do -s 1400 -c 10 10.10.1.15-M do表示禁止分片-s 8972是 9000 MTU 对应的 ICMP 负载大小因为 ICMP 头 8 字节加 IP 头 20 字节要预留。返回 Frag needed 说明链路上存在 MTU 较小的端口顺着路径去交换机逐个端口排查。业务网用 1400 字节是因为业务网通常跨三层网关报头开销和路径 MTU 更接近真实情况。命令通了不算完还要看丢包率10 个包丢哪怕 1 个都要继续查不能带着间歇性丢包上线。4.2 卷映射到客户端多路径与 LUN 识别双确认第二层验证是把卷真正挂到计算节点上确认从客户端视角能看到一个健康的块设备。FusionStorage 的映射逻辑分两步存储侧把客户端的 initiator 加入主机组再把卷映射给这个主机组客户端侧扫描总线识别新盘并配置多路径。主机组的划分建议按业务域走属于同一个集群的多台计算节点放在一组共用共享卷普通独立卷则一台机器一个组避免把卷误挂到多个节点上造成文件系统互相踩踏。客户端识别到盘后必须确认多路径配置。FusionStorage 同一个卷通常会以多条路径呈现给客户端多路径软件不装或者没配对主路径一切换 IO 就中断。配置多路径时把user_friendly_names打开否则重启后盘符名变化会让依赖固定盘符启动的应用直接翻车。正常状态下multipath -ll能看到同一个设备的两条路径都是 active如果显示有一条 standby 也正常但如果全是 failed就要回到映射关系里查 initiator 是否被正确加入主机组。4.3 故障注入拔一根线、停一个进程验证自动恢复第三层验证是最容易被跳过也最值得做的故障注入。趁着业务还没接入主动在集群里制造一次小故障确认恢复机制真的在工作。我常用的低风险做法是挑一台 OSD 节点停掉它的存储网口或 OSD 服务进程然后盯三样东西节点状态是否在几十秒内被标记为 offline数据是否自动在其他节点上重建管理面是否产生告警并自动恢复。以网口故障为例在 OSD 节点上执行# 停掉存储网口注意确认网卡名称 ip link set down ens3f1 # 观察重建状态之后恢复网口 ip link set up ens3f1操作后不要立刻恢复给管理面足够的反应时间。三副本池下一个副本失联后集群应该自动把数据重建到健康节点。你要记录的是从故障发生到开始重建的时间以及重建完成的大致耗时。如果等了很久状态还停留在 degraded优先检查存储网是否拥塞、磁盘域是否还有可容纳副本的位置。故障注入做一次就够了但这一轮的结论要写进交付记录它是你后面答“这个存储到底行不行”这个问题时最硬气的证据。5. FusionStorage 安装避坑五个高频故障从现象到根因5.1 现象安装后节点反复重启登录后负载却不高有同事遇到过这样的场景集群安装完白天看着一切正常一到夜里或低负载时段某个存储节点就自动重启重启后检查负载和温度都正常。这类问题的根因不在 FusionStorage 本身而在服务器 BIOS 的节能策略。x86 服务器默认开启 C-state C6/C7 时CPU 在低负载下会频繁进入深度睡眠一旦 IO 到来唤醒延迟叠加中断响应延迟导致节点间心跳超时管理面误判节点失联后执行了自动重启。解决方法是进入 BIOS 的 CPU Configuration把 C-state 改为 C0/C1 或直接关闭电源策略设为 Performance。改完不能立刻下结论要观察至少一个完整的业务低峰窗口期确认夜间不再重启才算是真解决。5.2 现象部署工具报“磁盘不可用”磁盘却明明没坏预检查阶段报候选磁盘不足是安装现场最常见的拦路虎。第一次遇到时大家的第一反应都是怀疑盘坏了但拔下来插到 PC 上读写都正常。真正原因在 RAID 卡模式数据盘必须处于直通或 HBA 模式FusionStorage 才认为它是物理盘。如果数据盘在阵列卡里被设成了 RAID0工具会把它识别为带控制器逻辑盘出于一致性和数据安全考虑直接拒绝接纳。解决方法是进阵列卡 BIOS把数据盘对应控制器整体切成直通或 IT Mode然后清一次磁盘签名重新扫描。系统盘控制器和数据盘控制器尽量分开系统盘保持 RAID1数据盘控制器单独设直通后续扩容和更换坏盘都会省事很多。5.3 现象客户端挂载后性能断崖式下跌写带宽不到预期一半挂载验证时性能数据很难看首先怀疑 MTU而不是存储本身。FusionStorage 的存储网跑 9000 字节大包服务器网卡改了 MTU交换机端口没改或者交换机端口改了但上行口没改都会导致报文在路径上被分片重组吞吐直接腰斩。验证方法就是第 4.1 节里的大包 ping命令一跑就能确认是哪一段路径出了问题。另一个隐蔽因素在 Bond 模式服务器网口做了 Bond但交换机侧没配 link aggregation或者 Bond 模式选成了 active-backup流量全挤在一条物理链路上。FusionStorage 场景下存储网和业务网都建议用 LACP 或 balance-rr并保证交换机侧联动改配置前先确认链路聚合组已经协商成功否则下发瞬间会直接断网。5.4 现象MDC 心跳失败主备角色频繁倒换MDC 主备节点之间靠心跳维系心跳异常是最影响集群稳定性的一类故障。表现是管理面频繁报警 MDC 主备切换客户端 IO 间歇性阻塞。根因之一是管理网与业务网共用了一张网大流量场景下心跳报文被挤丢另一个更隐蔽的原因在交换机端口 VLAN 配置不一致某个接入端口被人从静态 access 改成了 trunkVLAN 集两边对不上心跳报文时通时不通。解决方法是把 MDC 主备节点放到一个独立的管理 VLAN 里交换机端口写死静态 access不要用 trunk。验证手段是连续 ping 加时间戳跑 24 小时丢包率必须为 0。只要还有 0.1% 的丢包都说明链路没有真正干净上线后早晚还会倒换。5.5 现象扩容节点加入集群失败提示软件版本不匹配扩容是每个集群的必经之路也最容易翻车。现象是新的 OSD 节点做完环境准备后加入集群被拒绝报软件版本不匹配。原因几乎都是老节点安装时间和新节点安装时间隔了太久安装包小版本已经更新。同一个集群内所有节点的 FusionStorage 软件必须保持同一版本元数据同步协议在小版本之间可能有差异集群出于一致性保护会拒绝混跑。解决方法是扩容前先查集群当前版本用相同版本的安装包准备新节点环境。如果确实希望升级到新版本先做整个集群的滚动升级全部节点到新版本后再执行扩容顺序不要反。版本号看着差一个小版本实际带来的问题可能是一整夜的扩容失败和回滚操作。6. 把安装指南变成一张可复查的验收单安装指南 PDF 是静态的而机房是动态的。我现在的习惯是做完一次 FusionStorage 安装后把最关键的环境项固化成一张核查表打印出来贴在机柜门内侧或放进交付文档首页。这张表比任何安装日志都直观也方便接手的人快速了解集群当初是怎么落地的。阶段检查项通过标准失败时先看环境准备数据盘直通模式部署工具识别为物理盘RAID 卡直通设置环境准备BIOS 节能策略C-state 关闭或 C0/C1电源策略设置网络存储网 9000 字节 ping0% 丢包交换机端口 MTU网络管理网 24 小时心跳0 丢包VLAN 配置一致性集群所有角色状态normal安装日志功能卷创建与映射状态 availableOSD 节点状态客户端多路径状态至少两条 active主机组映射可靠性故障注入自动恢复完成存储网拥塞情况除了这张表还有一个小技巧值得养成安装日志和集群配置文件不要只留在安装执行机里要拷贝一份交给运维存档文件名带日期和版本号。重装系统或更换执行机之前先把这些文件备份出来否则集群出问题时连当初装的什么版本、用了什么拓扑都查不到只能靠猜。我见过太多项目把安装执行机当成临时环境一年后要扩容时找不到原拓扑文件只好反向推导浪费了整整一个变更窗口。我现在每次做完 FusionStorage 部署都会把装好后的第一张卷、第一条 ping 记录和故障注入的时间点写进交付记录。听起来繁琐但这些细节会在某次深夜救你一次别人还在翻安装指南找思路时你已经能指着验收单说出问题出在哪一环。希望帮到你。本文还有配套的精品资源点击获取