华为交换机堆叠实战:从原理到排障全解析
发布时间:2026/10/3 8:50:02 锦皓数字建站

从去年下半年开始我陆续在几个机房的网络改造里碰上了华为交换机堆叠的活儿有S5700的老款也有CE系列的数据中心交换机。这期间踩了不少坑也把华为官方的文档翻了个遍还拿ensp做了好几轮模拟验证。折腾到现在总算把堆叠从原理到排障的整个链路理清楚了。这篇东西就当成一份实战笔记来写把我碰到的、听到的、查到的关于华为交换机堆叠的问题一次性说透希望能帮到正在搞堆叠改造或者准备上堆叠的朋友少走弯路。先说明白堆叠这玩意儿到底是什么。简单说就是把两台或者多台物理交换机通过专用的堆叠线缆连起来虚拟成一台逻辑交换机。对上层网络来说这是一台设备对下层设备来说这还是一台设备。你在这台逻辑交换机上做的配置会自动同步到所有成员交换机上。最直观的好处就是带宽翻倍、可靠性提升、管理简化。比如原来两台接入交换机各跑各的上联各一条千兆做了堆叠之后两台设备变成一台上联可以跨成员做链路聚合带宽翻了一番原来每台设备都要单独登录管理、单独配VLAN堆叠之后只需要在一台设备上配置其余成员自动同步。但堆叠不是万能的配错了比不配还难受。下面我从原理、配置、排障三个维度来拆解最后附上一份常见问题速查表全是实操里验证过的内容。1. 堆叠的本质与组网设计先搞清楚它到底在干什么1.1 华为交换机堆叠的核心概念拆解华为的堆叠技术在不同产品系列上有不同的叫法S系列盒式交换机上叫iStackCE系列框式交换机上叫Cluster但核心思想是一致的。我们日常接触最多的还是iStack它依赖专用的堆叠线缆和堆叠口来完成成员设备之间的数据转发和控制面同步。在堆叠系统里有几个关键参数必须先搞明白成员IDMember ID每台成员交换机在堆叠系统里的编号从0开始范围一般是0到8视具体型号而定。这个ID决定了设备的角色优先级也直接影响堆叠口的物理编号映射所以每台设备都必须设置不同的ID。堆叠优先级Priority数值越大成为主交换机的几率越高。默认值是100两个成员都默认100时MAC地址小的一方会胜出成为主设备。堆叠域编号Domain ID同一物理网络里可能存在多组堆叠系统为了隔离管理报文需要给每组堆叠分配不同的Domain ID。如果两台设备配置了相同的Domain ID且互相能收到堆叠报文它们会尝试合并成一组这在配电房和实验室场景下很容易搞出幺蛾子。堆叠口Stack Port华为盒式交换机一般用后部的专用堆叠口也有用业务口比如10GE光口或25GE光口复用成堆叠口的型号配置逻辑完全不一样后面实操部分会分开讲。堆叠系统里的角色分为三种主交换机Master、备交换机Standby、从交换机Slave。主交换机负责整个堆叠系统的管理运行与外界交互的控制协议比如STP、OSPF、VRRP等备交换机是主交换机热备主挂了之后顶上去从交换机也就是普通的成员负责数据转发。这个主备倒换机制是堆叠高可用的核心但也经常是故障的源头后面会详细讲。1.2 堆叠解决了什么问题又引入了什么风险很多刚接触堆叠的朋友会问我直接用两台独立交换机跑冗余不行吗非要用堆叠这个问题的答案要从“管理平面”和“数据转发平面”两个角度去看。两台独立交换机的方案在数据平面确实做到了冗余——一台挂了流量走另一台。但在管理平面上你面对的是两台设备每个接入位置的VLAN、ACL、QoS策略都要配两遍漏配一条就是隐患。而且如果接入层用了链路聚合跨设备做双上联早期方案还得靠STP或M-LAG来做跨设备链路聚合复杂度一下就上去了。堆叠最核心的吸引力在于把多台设备的“管理平面”合并成一个配置从N份变1份同时跨设备的链路聚合成为出厂自带的能力不需要额外协议支持。但堆叠引入的风险也必须要清楚我见过不少翻车现场归纳下来主要是这几类主备倒换瞬间存在丢包窗口虽然现代堆叠已经做到了控制面的无缝切换但数据面在倒换瞬间还是会出现短暂的流量震荡。如果对丢包零容忍的业务比如视频会议或者存储同步要提前做链路冗余设计。堆叠链路是全系统的短板所有成员之间的通信都要走堆叠链路。一旦堆叠链路抖动或者误码率高可能导致系统频繁分裂、合并比单台设备故障的破坏力大得多。升级和变更的范围扩大对堆叠系统做软件升级涉及所有成员一个节点升级失败可能影响整个堆叠系统。华为虽支持平滑升级但操作顺序和版本要求非常严格。1.3 组网规划时的三个关键决策在动手配置之前有些决策必须做在前面不然堆叠上线之后有的是罪受。第一个决策是堆叠成员的连接拓扑。华为iStack支持链形和环形两种拓扑。链形就是A的堆叠口1接B的堆叠口1B的堆叠口2再接C的堆叠口1首尾不相连环形就是链形的最后一个成员再回到第一个成员。我的建议是能环形坚决不链形因为链形拓扑里任何一条堆叠链路断开整个堆叠就分裂成两个独立的堆叠系统直接导致业务中断环形拓扑在一条链路断开时还能维持成一个堆叠系统只是成员间的转发路径变长但业务不中断。第二个决策是堆叠带宽的选型。如果堆叠成员之间需要承担大流量的跨设备互访堆叠链路的速率之和必须大于可能出现的跨设备流量峰值。比如堆叠口用的是两个10GE光口跨设备带宽只有20Gbps如果成员之间有超过20Gbps的流量转发需求这些流量就只能走堆叠链路溢出的部分会造成拥塞丢包。这个计算很多人忽略等流量模型跑起来之后才发现堆叠链路被打满。第三个决策是业务口和堆叠口的复用边界。部分华为交换机型号支持把业务口配置成堆叠口这就有个问题一旦业务口被挪去当堆叠口这个口的业务接入能力就没了。规划时必须算清楚每个成员的接入端口数量和堆叠端口数量别出现把唯一的高速上联口拿去当堆叠口、导致接入带宽瘸腿的乌龙。2. 华为交换机堆叠配置全流程从理清逻辑到命令行落盘2.1 配置前的准备工作和版本检查很多堆叠配置失败都是因为准备工作没做足。华为官方对堆叠有明确的软硬件要求我归纳成一张自查清单所有成员交换机的软件版本必须一致至少主版本号要相同建议连补丁版本也统一。堆叠线缆要使用华为原装或兼容的堆叠线缆S系列盒式设备常用SFP堆叠电缆CE系列常用40G/100G的堆叠专用线缆。每台设备需要提前规划好成员ID和优先级最好贴在设备面板上防止现场接错。如果交换机是通过堆叠口后部的专用堆叠口连接配置相对简单如果使用业务口复用为堆叠口需要先检查该型号是否支持这个功能并在系统视图下开启堆叠口功能。版本检查可以通过display version查看堆叠能力检查可以用display stack configuration部分老型号是display stack来确认设备是否支持堆叠。有个细节值得专门提一下新交换机出厂默认情况下堆叠功能是没有“激活”的。你需要先进入堆叠配置视图把堆叠使能再配置成员ID和优先级。如果你在配置过程中发现设备提示Error: The stack function is not enabled那就说明堆叠功能还没开。2.2 经典配置流程S5700系列双成员iStack我以最常见的S5700系列两台成员做iStack为例说一遍标准配置流程。先澄清一个认知华为盒式交换机的堆叠口默认是独立于业务口的比如S5720-28X-SI的后面板通常预留了两个堆叠口用专门的堆叠线缆插上即可这类端口只能在堆叠模式下使用不能转发普通业务流量。配置步骤如下先规划成员ID和优先级。比如两台设备规划A为主ID为0优先级200B为备ID为1优先级100。在设备A上执行命令切换到堆叠视图并配置system-view stack stack member 1 priority 200 stack member 1 domain 10注意华为的成员ID默认顺序设备启动后默认自己是member 1另一台是member 2你要按物理设备重新规划ID并分别配置。在设备B上配置system-view stack stack member 2 priority 100 stack member 2 domain 10这里有一个容易翻车的细节stack member N命令里的N是本设备的当前成员ID。如果设备B默认查出来是member 2而你希望它在堆叠系统里是member 1需要先修改本设备的成员ID。你会看到提示需要保存配置并重启之后才能生效。我强烈建议先在单台设备上完成member ID和priority的配置并重启生效再连接堆叠线缆做堆叠否则两台设备同时改ID、同时重启极容易导致堆叠系统混乱。成员ID生效后再进入堆叠口视图完成堆叠口的物理接口绑定华为的堆叠口是一个逻辑口比如stack-port 1/1表示member 1的第一个堆叠口。你要用port interface命令把物理口绑定到这个逻辑堆叠口上。S5720后部的堆叠口通常是固定的物理槽位比如XGE0/0/27、XGE0/0/28映射到stack-port 1/1和stack-port 1/2。system-view interface stack-port 1/1 port interface xgigabitethernet 0/0/27连接堆叠线缆前确保所有设备都处于关机状态插线顺序无所谓但插完再上电。华为堆叠线缆一头插A的堆叠口1另一头插B的堆叠口1B的堆叠口2再接回A的堆叠口2形成环形。注意线缆不要缠绕避免光纤或铜缆受力弯曲。全部就绪后先给其中一台设备上电等它启动完成后再给第二台上电。此时第二台会通过堆叠链路自动发现已有堆叠系统并加入你会在第二台的Console口日志里看到Stack topology has changed之类的提示。登录主交换机执行display stack查看堆叠成员信息和拓扑信息。看到两台设备都在且角色分别是Master和Standby就说明堆叠建立成功了。2.3 业务口复用为堆叠口的配置差异部分华为设备型号并不提供专门的后面板堆叠口而是需要把业务口复用为堆叠口。比如某些款型的S5735就没有专门的堆叠口你需要把两个万兆光口配置成堆叠口。命令逻辑跟专用堆叠口略有差异例如system-view interface stack-port 1/1 port interface 10ge 0/0/27这个配置会把10GE 0/0/27从普通业务口切换为堆叠物理口该口将不能再配置IP地址或VLAN业务。配置完成后这条线缆也能承载堆叠协议报文和控制面同步数据。此时要注意线缆必须使用堆叠专用的线缆或合适的光模块光纤速度必须匹配否则堆叠无法正常建立。功能验证命令都是一样的display stack display stack configuration display stack port对于老手我更推荐关注display stack port的输出它会告诉你物理口和堆叠口的映射关系以及堆叠链路的速率和状态是排查“堆叠口Link up了但堆叠没起来”的第一利器。2.4 堆叠系统里的业务配置VLAN、接口和镜像堆叠建立成功后业务配置的写法和单台设备很相似但有几个新玩法。先说VLAN在堆叠系统里创建VLAN、划分VLAN的语法没有任何变化但因为所有成员变成了一个逻辑设备你可以在成员2的下联口上也划分同一个VLAN只要接口的编号带上成员ID前缀就能精确指定system-view vlan 100 port gigabitethernet 1/0/1 to 1/0/10 port gigabitethernet 2/0/1 to 2/0/10这串配置的意思是把member 1的GE0/0/1到GE0/0/10和member 2的GE0/0/1到GE0/0/10都加入VLAN 100。在普通交换机上接口编号是GigabitEthernet0/0/1在堆叠系统里接口编号变成了GigabitEthernet1/0/1前缀的1就是成员ID。很多人第一次看到这种接口编号会以为设备出问题了其实那是堆叠生效后的正常形态。再说镜像。在堆叠系统里做端口镜像既可以只镜像某一个成员上的端口也可以把多个成员上的端口镜像到另一个成员的端口写法需要带上成员IDobserve-port 1 interface gigabitethernet 2/0/20 interface gigabitethernet 1/0/5 port-mirroring to observe-port 1 both这个场景常用于堆叠接入网络的抓包排障比如跨成员的流量需要被另外一台PC抓取分析。堆叠下做镜像比多台设备下做镜像方便太多不需要考虑时间同步所有流量通过堆叠系统内交换即可被镜像出来。3. 堆叠常用验证命令与排障思路出问题的时候别慌3.1 堆叠状态检查的命令解读先列5个我实际工作中最常用的堆叠检查命令以及它们分别告诉我什么信息。命令输出核心信息适用场景display stack成员ID、角色、优先级、状态、系统MAC堆叠是否建立、主备角色是否正常display stack configuration各成员的堆叠配置参数、Domain ID、堆叠口绑定关系配置是否一致、有没有配置残留display stack port堆叠口物理状态、速率、光电模块类型堆叠链路是否有物理问题display device各成员设备状态、是否离线成员设备是否掉电或异常重启display logbuffer堆叠相关日志拓扑变化、主备倒换排障时定位事件序列对于很多人关心的华为交换机查看DHCP配置的场景在堆叠环境下也同样适用。比如你要排查某台终端的IP地址是否由堆叠系统分配可以在主交换机上执行display dhcp server ip-in-use查看租约信息要查看VLANIF接口的DHCP中继或地址池配置用display current-configuration | include dhcp就可以快速定位。堆叠的管理面统一在这台逻辑设备上所以查DHCP不需要分别登多台设备这是个优势。3.2 主备倒换为什么会发生怎么定位堆叠系统的核心高可用机制是主备倒换。主交换机宕机或堆叠链路异常触发重新选举就会发生主备倒换。倒换期间整个堆叠系统的控制面会短暂中断已建立的业务表项比如MAC表、ARP表可能在备机上不完整需要重新学习所以倒换瞬间会出现短暂丢包。排查主备倒换的思路我总结为三步查看display logbuffer里的堆叠事件日志确认倒换发生的确切时间和触发原因。常见关键词包括MEMBER_OFFLINE、MASTER_OFFLINE、STACK_MERGE。确认倒换之前是否有外部事件比如供电线路闪断、设备重启、堆叠线缆松动。很多机房事故是同一路PDU给两台堆叠成员同时供电一个PDU故障导致整个堆叠系统全挂这才是高可用失效的经典原因。堆叠设备最好分别接两路不同的供电。如果排除了外部因素就要检查堆叠链路本身的质量光功率、误码率。华为设备查看光模块光衰的命令是display interface transceiver verbose能看到当前光模块的收发光功率、温度、电压信息。我遇到过堆叠链路因为光纤弯曲过大导致误码率升高主备之间频繁倒换用这条命令一查收光功率已经低于灵敏度阈值换了一根跳线就好了。3.3 堆叠分裂最危险的故障场景没有之一堆叠分裂是堆叠组网里最严重的事故它指的是原本一个堆叠系统因为堆叠链路全部断开、或部分成员失联导致逻辑上分裂成两个或更多独立堆叠系统。每个分裂出来的系统还会自选举出新的主交换机两个系统同时拥有相同的IP地址、相同的VLAN配置、相同的网关配置在网络上形成冲突直接导致业务大范围中断。华为设备对堆叠分裂有比较成熟的检测机制建议所有生产环境的堆叠系统都要开启堆叠分裂检测。华为S系列主要支持两种方式堆叠域内检测通过堆叠协议报文和增强检测通过直连检测线。在框式CE交换机上还有多主检测MAD机制。配置增强检测需要把堆叠系统内特定端口直连如果配置了管理网口互连还能基于管理口发送心跳。举一个我实际配置过的增强检测例子。两台S5720通过管理口MEth互相连接配置如下system-view stack stack member 1 domain 10 stack-member 1 detect eth-trunk 1这里的eth-trunk 1需要先创建并且把两台设备的管理口加入。配置完成之后堆叠系统会周期性地通过这个直连检测链路发送心跳报文。一旦发生分裂两条链路上的两个堆叠系统都会收到心跳丢失的消息其中一个系统会自动关闭自身的业务物理口即进入Recovery模式从而消除IP冲突和双主对网络的影响。这个机制非常关键一定要配上。要注意的是不同型号的命令存在差异有些款型只能在系统视图下配置stack detect相关参数老一些的S5700甚至要用stack-member配置专用MAD检测口。开配之前先查清楚自己设备的版本支持哪种检测。3.4 堆叠合并如何安全地把两个堆叠系统合并成一个堆叠合并的场景也不少见。比如两栋楼各自跑着一组堆叠中间新增了一条万兆链路想让它们合并成一个堆叠系统又或者堆叠分裂后两半都活着需要重新合并。合并的核心矛盾在于两套堆叠系统的主交换机之间需要重新选举落选一方会被重置并重启它上面的业务中断不可避免。所以合并操作的前置条件有三个缺一个都不要动两台堆叠系统的配置最好是同构的如果事后要做配置融合必须提前把差异配置清单拿出来。双方所有成员交换机的软件版本必须一致。落选一方的业务侧要做好割接窗口明确通知合并过程中该侧业务中断。实际执行前先分别登录两套堆叠系统把各自的display stack执行一遍确认各自的Domain ID、成员ID、优先级。然后按规划把连接堆叠线缆的链路准备好最后给落选方调整优先级并做保存配置重启让它以低优先级加入主方堆叠系统。合并过程中落选主交换机上的配置会被覆盖为当选主交换机的配置注意提前备份。有很多次合并失败都是因为Domain ID不一致两套堆叠系统之间即使物理连接了也不会自动合并日志会提示The domain ID does not match。这就是前面我在规划里强调Domain ID的原因。3.5 光口光衰排查堆叠链路物理层问题堆叠链路物理层故障是排查堆叠问题的底层基本功。华为交换机的光口光衰排查命令我放在这里因为对堆叠链路同样适用。执行display interface transceiver verbose输出中重点关注Rx Power和Tx Power两个数值单位是dBm。正常收光在-3到-15dBm之间是健康的如果Rx Power低于厂家标称的灵敏度通常在-20dBm以下光模块虽然Link up但误码率会上升堆叠协议报文可能丢包导致堆叠系统频繁震荡。如果收光功率正常但堆叠口状态异常就要检查光模块和光纤的兼容性了。华为设备对非原装光模块会有告警但有些第三方模块仍然能正常工作只是设备的特定功能可能受限。堆叠链路对时延和误码极其敏感尽量不要在堆叠链路上用劣质光模块省下的钱远不够填一次故障的坑。我还发现一个容易忽略的点堆叠线缆或者光模块的松动在设备日志里往往只会表现为Stack port link down或者Stack port link up的反复跳变这个现象恰恰说明物理链路中断过。不要只盯着软件配置去机房把堆叠线缆重新插拔一次、换一根线试试往往问题就没了。4. 常见问题与排查技巧实录排障速查表与经验积累4.1 堆叠建立失败、配置丢失等高频问题的排查清单下面整理一份华为交换机堆叠的常见问题速查表供日常运维随查随用。现象可能的坑快速定位方法解决方案堆叠建立不起来Console口日志报Domain ID不一致两台的Domain ID配成了不同的值display stack configuration对比Domain ID重新配置Domain ID为一致值堆叠建立不起来堆叠口状态Down堆叠线缆松动、光模块故障、线缆插错口display stack port查看物理口状态重新插拔线缆或更换线缆/光模块两台设备配置完全一致但堆叠起来后角色不对优先级和MAC地址决定主备你规划的Master没赢display stack查看角色和优先级提高期望Master的优先级保存重启堆叠成功后部分成员反复重启堆叠链路误码率过高导致协议不稳定display logbuffer看历史告警查光衰换线缆/光模块检查光纤弯曲半径堆叠成员掉线后重新上线配置丢失掉线期间该成员自己分裂成了新堆叠系统并形成垃圾配置display stack查看是否有多主通过主交换机重新合并成员必要时清零重配业务口划分VLAN提示接口不存在未区分成员ID前缀查看接口编号前缀与成员ID是否对应把接口编号GigabitEthernet0/0/1改成GigabitEthernet1/0/1配置stack命令时提示命令不存在该型号软件版本不支持iStack或堆叠功能未激活确认型号和版本检查License升级到支持堆叠的版本激活堆叠功能4.2 断开堆叠链路后的“脑裂”处理实录说一个真实案例。某中型办公网的接入层用了两台S5720做堆叠某天施工队整理机柜的时候不小心踢掉了一条堆叠线堆叠链路从环形变成了链形其实环形拓扑中断一条线仍然维持一个堆叠系统但大家掉线了大概两分钟还是有一堆终端掉线了后来发现是因为另外一条堆叠线也松动导致整个堆叠彻底分裂成了两套系统。看一下当时的处理流程先登录其中一台设备执行display stack看到只有member 1孤零零地在线master角色由自己担任。再登录另一台发现它也是master角色两台都是master可以确认发生了堆叠分裂。这个时候不要直接重新连接堆叠线缆因为两套系统都活着两边都在转发业务直接合并会引起业务中断。正确的做法是先保住主要业务侧把次要一侧的某些业务口shutdown或者在物理上隔离掉故障侧消除环路和IP冲突风险。检查两份配置的差异确认无冲突。调整优先级让次要侧以低优先级进入主系统。执行前把次要侧设备关机重新插好堆叠线缆再让次要侧上电让它作为从成员重新加入主堆叠系统。全部恢复后执行display stack verify或display stack确认堆叠成员数量、角色和拓扑都正常。这个案例的教训就是用脚踢到堆叠线缆这种低级事故恰恰是堆叠运维里最常见的事故。所以双份的堆叠线缆要固定好最好用理线架或者扎带把线缆绑扎固定。4.3 多厂商对比华为、H3C、锐捷的堆叠排障经验实际工作中不会只遇到华为的设备机房里H3C和锐捷也很常见。我简单说一下多厂商环境下的排障思路方便上手。H3C的堆叠IRF智能弹性架构跟华为iStack很像但命令体系不同。H3C查看堆叠状态主要用display irf查看堆叠口配置用display irf topology配置成员编号是irf member 1 renumber 2。H3C设备指定接口执行ping测试的命令跟华为不一样华为是直接在接口视图下执行ping -a 源地址加参数或者用ping -i指定源接口H3C则常用ping -a指定源IP。还有H3C查光口光衰的命令是display transceiver diagnosis interface可以直接看到当前光模块的工作状态和光功率参数比华为的display interface transceiver verbose更直接华为没有这个诊断命令需要自己看verbose输出。锐捷交换机查看接口状态的常用命令是show interface status和show interface transceiver它的堆叠叫VSU调试命令风格介于华为和思科之间但排障逻辑是一致的先看物理层光功率、线缆再看协议层堆叠报文、心跳最后看业务层VLAN、链路聚合、STP。不管是哪个厂商的设备堆叠排障的最底层原则始终不变先物理后逻辑先单机后堆叠。如果你连单台设备的光模块光衰都没查就去翻堆叠协议报文那是在正确的方向上浪费力气。4.4 恢复模式与底层自救技巧华为堆叠系统在使能了分裂检测之后分裂时备选一侧会进入Recovery模式。Recovery模式下该设备的业务口会被强制关闭只保留堆叠口和管理口继续工作目的是防止双主引发的广播风暴和IP冲突。此时设备前面板的ALM指示灯会频繁闪动很多第一次遇到的人会误以为是硬件故障。恢复方法是把恢复侧的堆叠链路重新接好它会自动重新合并并退出Recovery模式。如果合并失败可能需要手动重启该设备。如果这台设备已经因为优先级问题在重新选举中落选并且配置被清空不要慌只需要保证它重新加入堆叠系统即可系统会自动把主设备的配置同步过来。另一个底层自救技巧是如果你需要强制把某台设备从堆叠系统中摘出来单独维护比如升级或者故障隔离可以在设备上执行stack stop视版本而定或者直接拔掉所有堆叠线缆并关闭该成员的业务端口。但这个操作会导致该成员独立成一台新设备IP地址会跟原堆叠冲突所以摘除之前务必先在该成员的配置里改掉管理IP或者直接断开其上联等维护完成后再重新合并回去避免全网IP冲突。4.5 混合组网中的接入场景堆叠下联口和上联口的使用心得最后聊一下堆叠在接入网落地时的一些使用心得。堆叠最成功的应用场景是接入层和汇聚层因为接入层设备数量大、配置一致性强、管理分散堆叠正好把这些痛点全部命中。接入层堆叠的下联口用来接PC和终端上联口通常会做跨成员链路聚合接到汇聚交换机上。这里有几点实操心得下联口的VLAN划分在堆叠配置完成后再批量添加优先用port group批量配置别一个个口敲效率低还容易漏。上联口的链路聚合在堆叠系统里可以直接跨成员做。比如member 1的10GE0/0/1和member 2的10GE0/0/2做成一个Eth-Trunk连到汇聚交换机这时候汇聚交换机那侧也需要做相同的聚合配置或者启用LACP。如果汇聚交换机不支持堆叠聚合就只能分别接两个物理口并依赖STP阻塞其中一个带宽翻倍的效果就没了。要提前确认汇聚交换机的支持能力。如果汇聚侧是S5700或S6730这类华为设备可以做跨设备链路聚合的业务叫M-LAG或类似技术与堆叠解耦但那是另一个大的技术话题不在本文展开。另外在做故障恢复演练时我建议至少每半年主动做一次主备倒换测试。方法是把主交换机远程重启观察备交换机是否能在预期时间内接管业务。这个测试能提前暴露很多堆叠配置和硬件的问题成本很低收益很大。演练时务必挑业务低峰期并让值班同事在场。5. 收尾一点心里话堆叠这个技术初看起来就是几根线连一连、几条命令敲一敲的事但真正上了生产环境才知道细节里全是魔鬼。Domain ID、成员ID、优先级、堆叠链路质量、分裂检测、供电冗余每个环节都可能是故障的起点。我在实际排查中踩过不少坑印象最深的一次是整组堆叠设备因为两路PDU接在同一个空气开关下空开跳闸导致两台设备同时断电业务全断。从那以后每套堆叠系统的供电冗余我都会亲自确认。还有一次是堆叠配置因为成员ID规划错误导致主备角色跟预期完全相反备机上的配置覆盖了主机的业务配置现场花了大半夜才恢复。后来我养成了一个习惯任何涉及堆叠变更之前先看清当前堆叠系统的成员ID、角色和配置备份再动手。这个习惯救了我很多次。最后再分享一个小技巧华为ensp企业网络仿真平台完全支持iStack的模拟新版本也支持其功能搭建几台模拟设备练习堆叠配置和环形拓扑成本几乎为零。我建议每个准备上堆叠的工程师先在ensp里把堆叠配置、倒换、分裂检测这些场景全部演练一遍再上真机。这么做不仅稳妥而且能帮你把堆叠的原理彻底吃透。等你真机调试的时候很多坑你已经提前趟过了。
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。