资讯详情

资讯详情

HP MSA 2050磁盘阵列配置实战:从拆箱到主机映射全指南

一台HP MSA 2050磁盘阵列从纸箱里拆出来到两台主机都能正常读写正常情况半天就能搞定。但如果没搞清它的管理口逻辑、盘位规则和主机映射关系卡上两三天也是常事。我去年给客户部署过一台MSA 2050当时固件版本比较老光第一个管理IP就折腾了一个多小时。这篇文章把我完整梳理出来的配置步骤和踩坑点写出来按这个顺序走基本能一次过。如果你正准备上手HP MSA 2050或者听到“服务器磁盘阵列怎么做”这类问题时想去自己试一遍这篇内容应该能帮你节省大量时间。1. 拿到一台MSA 2050先别急着上架1.1 认识控制器的接口和指示灯MSA 2050有两种常见形态2U12盘位的大盘LFF和2U24盘位的小盘SFF。无论哪种后背板核心就是两个可插拔控制器通常左边是控制器A右边是控制器B电源模块在外侧。我见过不少人把控制器后面的管理口和业务口搞混其实只要认准“MGMT”标识基本不会错。每个控制器上至少有一个RJ45管理口、一个串口一般是Mini-USB或Micro-USB形态包装里会附带转接线、若干个FC或iSCSI业务口以及一个用于扩展柜的SAS口。指示灯方面绿色表示正常琥珀色闪烁一般是有故障或正在同步。开机时先留意控制器上的“Health”和“Power”灯别急着进配置界面。如果某一侧控制器报错后续固件升级和卷映射都可能受影响。我曾经遇到一台设备控制器B的“Health”灯慢闪琥珀色进SMU一查是缓存模块未同步重新插拔后才恢复。硬件层面确认正常再做软件配置才稳妥。1.2 规划管理IP和业务网络这一步特别重要。MSA 2050有两个控制器每个控制器都要有独立的管理IP而且管理网络尽量与业务网段分开。管理口默认情况下可能处于DHCP自动获取状态也可能有一个固件版本相关的默认地址所以上架前先想好两个管理IP、子网掩码和网关。业务网络根据你用的连接方式规划FC环境要记好交换机ZoneiSCSI环境要预留专门的VLAN和网关不要让存储管理流量和业务流量混在一起。我的习惯是管理网单独用一个VLANPC直连交换机管理口再通过管理PC访问SMU。这样排查问题的时候不会被业务流量干扰。另外管理PC的IP地址建议手动设置成与存储管理IP同网段的静态地址不要依赖DHCP。很多“连不上管理口”的问题本质上就是管理PC的IP没对应上而不是设备坏了。1.3 确认固件版本和功能许可MSA 2050的许可证相对开放但不同固件版本对功能和界面布局影响很大。见过一台出厂很老的固件登录后连界面模块都不完整。建议在浏览器进入SMU后先到“系统状态”或“About”里记录当前固件版本再到官网对照是否需要升级。配置之前升级固件比配置完成后再升级要省事得多因为升级过程可能会重启控制器卷映射等配置虽然一般保留但生产环境下尽量避免临场升级。除固件外还要确认快照、卷复制等功能是否已经包含在许可内。MSA 2050通常出厂已经带基础许可但有些渠道设备可能会被限制最好在SMU的“License”页面核实一下。如果功能缺失后续业务要开快照时再补齐许可会很被动。2. 硬件部署与控制器初始化2.1 硬盘盘位安装顺序和注意事项磁盘阵列的盘位安装不完全是随便插的。MSA 2050正面盘位有编号建议从最小编号开始安装同时尽量保证同一磁盘组内的硬盘型号、容量和转速一致。混合不同容量时磁盘组会以最小容量计算可用空间后面换盘也可能出现容量不匹配的问题。另外所有硬盘在通电前装好比开机后再热插拔要稳妥。硬盘托架上的锁扣要扣到位按压完全进入后再锁闭别图省事只按半边运行中振动会导致硬盘被识别为“缺失”。对于24个小盘位的机型盘位分布对散热影响不小有条件的话尽量均匀分布避免局部过热。我见过客户为了整理线缆把后排几个盘位空着所有业务数据都集中在前排结果连续报警硬盘温度过高。2.2 首次登录串口CLI还是Web初始化向导MSA 2050首次配置有两种路径串口CLI和Web初始化向导。我推荐用串口CLI做第一次管理IP配置原因是管理口默认IP不稳定而串口从启动阶段就能看到完整日志。用配置线连接控制器的串口到笔记本使用终端软件连接波特率一般是115200数据位8停止位1无校验。接通电源后终端上会出现启动信息进入CLI菜单后选择网络配置相关项设置控制器A和控制器B的管理IP、掩码和网关。设置完成后用网线把PC的网口调到同一网段浏览器访问管理IP就能进入SMU。如果你没有串口线也可以尝试把管理口接入DHCP环境从DHCP服务器租约记录里查地址但这种方法在复杂网络里明显没有串口高效。串口线还是建议常备一根存储设备维护时作用非常大。2.3 为控制器设置静态管理地址配置管理地址时两个控制器最好分别设置不要只配置一个。SMU里也能修改但首次用CLI更直接。CLI菜单层级需要对照固件提示操作通常会有“Network Configuration”或“Management Port”选项。单一控制器配置完成后另一个控制器会自动处于未配置状态如果你想让两个控制器都走管理网络务必在配置完A后切到B控制器的串口再执行一遍相同设置。很多人在这一步漏了另一个控制器结果一台存储有一半管理功能不可用。设置完成后可以做一次ping测试确认管理PC与两个管理IP都通。从这之后我习惯把两个管理IP直接写入机柜标签和运维文档省得下次回访时满世界找IP。2.4 初始化SMU后台的基本选项第一次进入SMU界面会启动一个初始化向导要求设置管理员密码、系统名称、日期时间和NTP服务器。日期时间如果不对日志排序会让人崩溃快照策略和复制任务的调度也会受影响。所以别跳过去。系统名称建议用能体现机房位置或业务用途的比如“SAN-ROOM-A-01”后面卷命名也能更规范。NTP建议直接配置公司内部NTP服务器若没有也可以用公开的NTP服务器但注意存储管理网是否能出外网。初始化向导结束后SMU首页会显示两个控制器状态应该都是“Optimal”。如果显示其他状态先别继续回到硬件和日志页面排查完再走下一步。3. 磁盘组与卷的创建核心步骤3.1 RAID级别选择与容量计算MSA 2050支持RAID 0/1/5/6/10也支持动态存储池根据固件版本不同有差异。选择RAID级别时我通常会问自己一个问题这块存储上放的数据丢了能不能承受不能承受就至少RAID 1或RAID 10追求容量利用率就RAID 5盘多且故障容忍要求高就RAID 6。容量计算方法很简单RAID 1可用容量等于单盘容量也可以理解为总容量的一半RAID 5可用容量等于盘数减一块盘的容量RAID 6是减两块RAID 10是总容量的一半。下面这个表可以直接用来做选型参考RAID级别最少盘数可用容量容错能力典型场景RAID 12总容量的一半最多坏1块系统盘、重要小容量数据RAID 53(N-1)×单盘容量最多坏1块常规业务数据RAID 64(N-2)×单盘容量最多坏2块大容量、高可靠场景RAID 104总容量的一半每个镜像组坏1块数据库、高随机IO举个例子8块1.2TB硬盘做RAID 5可用容量大约是8.4TB按1.2TB计算实际格式化后会有差异RAID 10则只有4.8TB。如果还要额外设置热备盘可用容量再减一块。热备盘的价值在于自动顶替故障盘减少人工等待时间建议至少配一块。3.2 创建磁盘组/存储池时如何选盘在SMU的“Storage”菜单下创建磁盘组部分固件叫存储池界面会列出所有未分配硬盘。这时候要小心不是把所有硬盘一股脑加进去就行。如果一个磁盘组混了10K和7.2K转速的盘性能会以慢盘为基准如果混了不同容量大容量盘的空间会被浪费。所以创建前在磁盘列表里检查每块盘的容量、转速和固件版本必要时分成两组或三组。另外MSA 2050界面里通常会有“动态池”和“传统磁盘组”两个方向。动态池的优势是扩容灵活、重建时间短传统磁盘组的兼容性和管理习惯更成熟。我个人的建议是如果是虚拟化环境动态池体验更好如果是传统数据库裸设备映射用RAID 10磁盘组更直观。磁盘组创建后系统会执行初始化这期间硬盘灯会频繁闪烁属于正常现象。初始化时间与硬盘数量和容量有关大容量盘动辄几小时不要在初始化期间反复开关机。3.3 创建卷与逻辑单元号分配磁盘组创建好后接下来是创建卷Volume。卷建在磁盘组之上对应主机看到的LUN。卷名建议使用“用途-主机-序号”的方式比如“DB-SQL01-01”这样在映射多个主机时不会乱。创建卷时要设置容量和逻辑单元属性容量可以小于磁盘组剩余容量后面还可以扩展。块大小默认即可除非有特殊应用要求。一个常见误区是以为每个卷都要用满磁盘组所有空间其实按需分配更灵活。MSA 2050支持精简配置Thin Provisioning但我个人在生产库上倾向用厚配置空间规划透明后续监控也简单。精简配置更适合虚拟化场景因为多台虚机共享存储池写多少占多少容量规划得当的话可以提升资源利用率但一定要开启告警防止前端无感知写满空间导致整池只读。3.4 主机与卷的映射关系设置卷创建完不会自动出现在主机上必须做映射。映射的本质是定义一个主机Host把主机的HBA卡WWN或iSCSI发起程序的IQN加进去然后把卷LUN授权给这个主机。在SMU里进入“Hosts”或“Mapping”页面先创建主机项填上主机别名和操作系统类型再添加WWN/IQN。添加WWN时不要把空格或冒号弄错iSCSI的IQN要完整复制少一个字符都识别不了。映射时同样选择目标主机和要分配的卷注意同一卷不能同时映射给多个非集群主机否则文件系统会出问题。如果你确实需要让多台主机共享一个LUN应该走集群文件系统或专用共享存储软件而不是直接把裸LUN分配给多台非集群主机。完成后SMU里能看到映射关系主机端重启扫描才能看到LUN。第一次做的人容易在主机端反复找不到盘这时不要急着重复扫描先回SMU确认映射关系是不是真的生效了。4. 主机端连接让系统认出LUN4.1 FC交换机Zone配置与WWN核对如果你是FC环境存储端和主机端都通过光纤交换机连接。配置Zone时我习惯用WWN别名Alias来配置而不是直接用端口号因为端口可能被拔插但WWN是固定的。先分别记录存储控制器FC端口WWN和主机HBA卡的WWN然后进交换机配置Zone把每个主机的HBA和它要访问的存储控制器FC端口放到同一个Zone里。这里有一个特别容易踩的坑MSA 2050双控制器下主机最好同时连到两个控制器的FC端口这样才具备故障切换基础。如果只映射到控制器A而不映射控制器B控制器A故障后你还要手动改配置达不到高可用。Zone配置完成后在主机上通过HBA卡管理工具或系统命令可以看到存储端WWN但LUN还要等存储映射和主机扫描之后出现。4.2 使用iSCSI连接MSA 2050iSCSI连接相对简单。在MSA 2050上提前为控制器配置好iSCSI端口的IP地址创建主机时用的是主机的IQN而不是WWN。Windows下控制面板打开“iSCSI发起程序”会看到本机IQN复制到一个记事本Linux下一般在“/etc/iscsi/initiatorname.iscsi”文件里。存储端把IQN加入主机后再到主机发起程序“目标”页面上输入MSA 2050的iSCSI端口IP点击连接就能发现已映射的卷。如果目标显示不活跃检查双方端口是否在同一网段、防火墙是否放行3260端口。iSCSI的MTU建议在交换机和网卡上同时开启巨型帧Jumbo Frame否则网络性能上不去但要注意所有转发路径都要支持一条链路不支持就会产生分片。还有一个细节iSCSI的CHAP认证虽然好但如果两边配置了不同的用户名或密钥连接会报“登录失败”这类问题按日志排查比在界面上反复试要快得多。4.3 Windows主机启用MPIO多路径Windows服务器第一次发现存储时往往会看到同一个卷在磁盘管理里出现两次这是因为两条路径分别被识别成了两个设备必须先启用MPIO。在“服务器管理器”里添加“多路径I/O”功能然后打开MPIO控制台在“发现多路径”页签勾选“添加对iSCSI设备的支持”或“添加对SAS设备的支持”。如果是FC设备就勾选“添加其他设备支持”并填写MSA 2050对应的设备硬件ID。有些情况下需要重启多次。配置完成后磁盘管理里会只出现一个盘在MPIO控制台可以看到两条或四条路径建议把负载均衡策略设置为“循环”或“最少队列深度”。存储端务必确认所有路径映射到同一个LUN否则MBR/GPT会出错。我遇到过一次重启后MPIO策略自动变回“故障转移”导致某条路径上IO全部阻塞后来改成“循环”策略并在注册表里固定下来才稳定。4.4 Linux主机multipath配置Linux下配置多路径用默认的device-mapper-multipath也能识别但建议写一个干净的multipath.conf。配置文件里重点是alias命名、path_grouping_policy和failback设置。以下是我常用的一个基础配置示例defaults { user_friendly_names yes path_grouping_policy multibus failback immediate } blacklist { devnode ^(ram|raw|loop|fd|sr|scd|st)[0-9]* } multipaths { multipath { wwid 3600c0ff000xxxxxxxxxxxxxxxxxxxx alias data01 } }wwid可以在系统里通过“multipath -ll”或“scsi_id”查到alias最好手动固定不然重开机后设备名容易漂移。配置好后多路径设备通常出现在“/dev/mapper/”下像“mpatha”或你自定义的“data01”。注意分区时用“parted”或“fdisk”对“/dev/mapper/xxx”操作而不是对单个sdX操作。每次重启后路径重新探测如果发现设备名变了说明没有固定alias要在配置里绑定wwid。5. 配置中常见的坑与排查实录5.1 管理口连不上、SMU页面打不开这问题排第一。最常见的原因一是管理PC和存储管理IP不在同一网段二是浏览器访问了错误IP三是管理口接了但网线或交换机端口没启用。排查顺序建议这样先用串口登录CLI确认两个控制器的管理IP配置再用“ping管理IP”测试三层连通如果通了但页面打不开检查浏览器是否用了代理SMU建议用Chrome或Edge禁用代理后刷新。如果ping不通在CLI里看看管理口是否down可能你插的是业务口。另外部分固件默认启用了“管理端口自动协商”但如果PC网口是千兆交换机端口被强制百兆同样会出问题。我个人踩过的坑是串口线没插紧终端软件界面全黑差点以为控制器挂了。这里也放一张速查表方便后面直接对照现象常见原因处理建议管理口ping不通网段不对、管理口插错、IP未生效串口登录CLI查IP换网口或直连SMU页面打不开浏览器代理、页面缓存、固件兼容禁用代理换浏览器清理缓存串口无输出线材没插紧、波特率不对、终端软件配置错重新插拔核对115200/8N1控制器状态异常缓存未同步、电源异常、固件不匹配查看事件日志重新插拔缓存或电源5.2 硬盘状态一直不是Optimal新装阵列或更换硬盘后SMU里硬盘状态偶尔会停在“Unassigned”或“Predictive Failure”。“Unassigned”表示这块盘还没被加入任何磁盘组或热备池属于正常只要在创建磁盘组时选中即可。“Predictive Failure”说明硬盘预测到故障强烈建议尽快更换。还有一种情况是硬盘固件版本不一致MSA 2050会自动尝试做固件同步但如果盘型号跨系列可能一直显示不匹配这时只能选同一型号的盘替换。磁盘组重建时千万不要人为重启控制器或拔盘RAID5/6重建期间对硬盘访问压力大速度慢是正常的多留意事件日志即可。另外热备盘触发后SMU主页会持续显示“Rebuilding”这个过程也是正常状态不要以为存储坏了。5.3 主机已映射却看不到盘这类问题多见于FC或iSCSI映射后主机侧无反应。先别急着反复扫描按顺序检查存储端映射是否生效SMU能看到“Mapped”状态、主机HBA是否在线、交换机Zone是否包含两端WWN、主机端的WWN/IQN是否和存储端录入的一致。Windows下在“设备管理器”里扫描硬件更改Linux下执行命令重新扫描“/sys/class/scsi_host/”下的每个host。如果扫描后还是没有盘最常见的是Zone把主机和存储控制器B配在一起但映射时只映射到了控制器A路径不对称导致所有IO走到一个控制器。正确做法是让每个控制器至少有一条可达路径。你可以在SMU里修改映射也可以把Zone补全总之路径对称是后面所有高可用操作的基础。5.4 控制器故障切换验证的方法配置完双控制器并且主机多路径生效后我建议做一次故障切换验证不要等到真出问题再反映。具体做法可以选在生产低峰期拔掉一台控制器的电源或强制控制器B重启然后观察主机端多路径路径是否下降、应用是否中断。SMU里事件日志会记录控制器重启过几分钟后控制器重新上线多路径恢复。如果此时应用卡顿重点检查多路径策略、LUN所有权设置和FC/iSCSI连接是否均衡。我就是在这个环节发现过某个LUN的所有权一直固定在控制器A控制器A重启后IO全部需要跨到控制器B延迟变高后来通过设置LUN所有权偏向和负载均衡解决了。故障切换验证做完存储配置才算真正可以交到业务手上。6. 使用与维护中的几点建议6.1 定期配置备份与固件升级MSA 2050的SMU界面里有配置备份功能会把当前所有磁盘组、卷、映射、用户等信息导出成一个文件。我习惯在每次改动配置前备份一次固件升级前也必做。配置文件放本地还不行最好同步到公司IT文档库里。文件不大但恢复一个复杂映射关系时能省很多事。固件升级时先下载对应版本的升级包在SMU的“Maintenance”里上传过程会重启控制器。升级顺序上建议在官方文档里查看是否要先升级到中间版本不要从很老的版本直接跳最新版本。切记现场没有备件、没有变更窗口时就别动固件存储设备稳定压倒一切。升级完成后记得再备份一次配置因为新固件可能对配置文件格式做了升级。6.2 日志监控和硬盘预测性故障处理SMU首页的事件日志能看七天内的事件建议每隔几天翻一次重点关注“Predictive Failure”和“Battery Failure”这类关键词。MSA控制器的缓存电池如果出问题系统会警告长时间不处理可能切换为直写模式性能下降明显。硬盘一旦出现预测性故障SMU会提示建议更换不要抱有侥幸心理。更换硬盘时热备盘会自动顶替并开始重建热备盘本身也可以定期更换。如果条件允许在存储端开启邮件告警SMU里配置SMTP服务器事件能直接发到运维邮箱这是最省心的一条。配置SMTP时注意填写正确的发件人地址和认证信息不然告警邮件发不出去比没配置还误导人。6.3 后续还可以扩展什么MSA 2050不只是做RAID和LUN映射它还内置快照、卷复制和远程复制。快照功能在做备份测试和误删除恢复时非常有用我通常给重要卷每小时拍一次快照。卷复制适合把生产卷克隆到另一台机器做验证。远程复制则需要两台MSA设备通过网络做异步复制。这些功能在SMU里都有对应入口配置思路和卷映射类似。如果你前面已经把磁盘组、卷、主机映射这三个环节跑通后面的扩展其实没有太多新东西。最后再提一个我自己的习惯交付时一定在机柜上贴一张标签写上管理IP、控制器A/B的WWN和iSCSI IP再把SMU备份导出一份。这套配置步骤看似基础但基础打牢了后面做快照、复制、容灾都不会抓瞎。
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →