AI集群网络面试核心:从IB与RoCE到拥塞控制的实战指南
发布时间:2026/10/9 14:49:18 锦皓数字建站

1. 为什么AI集群网络能单独成为一个面试板块说实话两三年前大家面AI Infra岗位问的还是“用过什么框架、怎么调参、CUDA优化熟不熟”。但这两年风向明显变了AI集群网络被提到了一个几乎必考的位置。我自己面过不少候选人也被人面过这个转变背后的逻辑其实很直接预训练模型动辄千卡万卡并行跨节点的通信开销已经从“辅助因素”升级成了“决定训练能效的上限因素”。打个比方你把一万张卡用网线连成一个大水池单卡算力是水泵的功率但最终出水效率取决于水管有多粗、水闸怎么开、堵不堵塞。如果网络设计不合理哪怕水泵功率再大整体流量也会被压下来。放到大模型训练里就是MFU模型算力利用率在30%和55%之间的差距这个数字直接决定一个训练集群的盈亏。所以面试官问“AI集群网络基础”真正想考察的不是你会不会配交换机而是三个层次第一层知不知道训练场景下网络的核心作用是什么比如集合通信、数据并行、张量并行是怎么依赖网络的。第二层懂不懂关键协议和拓扑的取舍比如IB和RoCE怎么选胖树和Torus各自适合什么场景。第三层有没有在真实集群上踩过坑。比如拥塞导致训练抖动、ACK超时引发连锁反压这些现象你怎么分析定位。这篇文章就把这三层拆开揉碎讲清楚不是背概念而是按我实际面试和被面的经验来梳理。阅读对象是准备AI Infra岗位面试的工程师也可以是刚接触集群训练的研发希望能帮你们把网络这块的认知补完整。2. 集群网络在AI训练中的真实地位与流量模型2.1 从单机到集群通信不再是配角先明确一个基本认知AI集群网络不是普通的“上网用的网络”它是为了完成分布式训练而专门设计的一套高性能通信系统。在单卡或单机训练里数据都在本地内存和显存之间流动不涉及跨节点通信。但到了大规模并行训练模型参数被切到多张卡上前向计算和反向传播过程中必须不断同步梯度、传递张量跨节点通信变成每次迭代的必经环节。我在面试时候经常用一个数据来说明问题一个千亿参数的模型如果用纯数据并行训练每个step光同步梯度就需要交换数百GB的数据。这个吞吐如果跑不满GPU就在空转等数据。你可以想象每辆车都在高速上排队等收费站GPU利用率自然上不去。集群网络的任务本质上是两条在尽可能短的时间内完成跨节点的数据交换在大量并发流量下保持稳定、低抖动、不丢包。这个“稳定”和“低抖动”非常关键。训练不是跑一次就结束而是几万步迭代连续跑。偶尔一次网络延迟尖峰会让某些GPU等待导致其他节点也跟着等最终整个集群的训练效率被拉低。所以面试官特别喜欢问“为什么AI集群网络需要无损特性”答案的核心就是训练任务对网络的要求不只是带宽大更是要可预测的延迟表现。2.2 集**合通信产生的流量模型理解了流量从哪来才能真正理解为什么网络拓扑和设备选型如此重要。分布式训练中的通信主要依赖MPI消息传递接口风格的集合通信其中最核心的几种操作包括AllReduce全规约所有节点先进行本地梯度计算再全局求和/求平均最终每个节点都得到完整的聚合梯度。这是数据并行训练中频率最高的操作。AllGather全收集每个节点把自己的数据分发给所有其他节点最终所有节点汇聚到完整数据常用于张量并行和MoE模型的部分场景。AlltoAll全交换每个节点把自己的数据按目标节点切分再发给对应节点同时从其他节点接收数据。专家并行Expert Parallelism的Token分发就是典型的AlltoAll场景。不同集合通信模式对网络的压力完全不同。AllReduce通常表现为多对多的广播流量AlltoAll则是细粒度的多点交叉流量容易在交换机端口形成拥塞。面试中如果有人能把这几种通信模式的流量特征讲清楚基本上就能证明他真正做过大规模训练而不是只在书上读过概念。我用一个大家容易理解的类比来解释这几种流量AllReduce像是全班同学各自算出自己那份题目答案然后互相交换核对最终每个人都得到全班的完整结果AllGather像每个人手里有一个拼图块最后每人手里都拿到整套拼图AlltoAll则像是每个班级出一部分人去其他班级同时接收来自其他班级的同学。三种模式对教室过道也就是网络的占用方式完全不同。大模型训练还有一个普遍趋势是混合并行数据并行、张量并行、流水线并行、专家并行结合在一起。张量并行通常发生在节点内走NVLink等高速总线数据并行和专家并行跨节点需要走集群网络。所以集群网络设计需要适配多种流量混合的情形而不仅仅是应付单一的AllReduce模式。这也是为什么面试时还经常追问“为什么有了NVLink还要设计跨节点网络”本质是不同并行模式的通信域不同。2.3 网络性能指标带宽、时延和抖动AI集群网络面试中最重要的性能指标主要有三个聚合带宽Aggregated Bandwidth所有节点并发通信时的总吞吐量。集群网络设计的首要目标之一就是让聚合带宽能随节点数线性扩展这就是所谓的“无阻塞”或“低阻塞”网络设计。时延Latency单次小包通信的往返时间。对同步训练来说时延决定了每一步迭代的通信开销下限。小消息通信如控制信号、同步标识非常依赖低时延。抖动Jitter时延的波动程度。训练迭代一旦出现抖动就可能出现某个节点等待时间不可预测进而造成整个集群的效率损失。我面试时经常用一个很务实的提问方式“给你一个千卡集群怎么评估网络是否达标”答案通常分几步先看聚合带宽能不能达到理论峰值的80%以上再测AllReduce的耗时是否接近理论最优值最后看长时间的稳定性是否有周期性抖动或突发性延迟尖峰。这些测试在真实集群上都用得上推荐大家动手试试特别是用nccl-tests跑一遍数据非常直观。3. 两大技术路线InfiniBand与RoCE的取舍3.1 InfiniBand为什么成了大模型集群的主流选择目前全球头部的大规模GPU集群绝大多数选择了InfiniBandIB作为跨节点网络的物理层方案。原因很直接IB从设计之初就是为HPC高性能计算场景服务的它的协议栈天然支持RDMA远程直接内存访问数据传输可以绕过CPU和操作系统内核直接从GPU显存到网卡再到对端显存延迟低、CPU占用量少。IB生态里最让工程师省心的一个特性是Credit-Based流控机制。网络设备只有在确认对端有足够缓冲区接收数据时才会发送这种端到端的信用机制能从根本上避免丢包。大模型训练的通信流量通常是burst式的一瞬间可能并发大量数据如果网络出现丢包TCP重传的代价极高训练效率会断崖式下跌。IB的无损特性正好匹配这个需求。另外IB交换机的端口速度升级迭代非常快。目前主流的400G HDR已经普及800G NDR也在逐渐落地。大集群要支撑十万卡规模对端口数和交换架构都有超高要求IB在这块的产品成熟度和生态完整性目前确实领先于其他方案。不过IB的劣势也很突出贵。无论是网卡、交换机还是光模块价格都远高于以太网方案。而且IB的生态相对封闭很多传统网络工程师对它不熟悉运维技能门槛高。所以不是所有团队都适合无脑选IB要看预算、团队能力和集群规模。3.2 RoCE在以太网之上实现RDMARoCERDMA over Converged Ethernet是把RDMA能力移植到以太网的一种方案。它有两种主要版本RoCEv1是二层协议无法跨三层路由RoCEv2引入了IP和UDP封装可以走三层网络灵活性大大增强目前实际部署基本都是RoCEv2。RoCE的优势在于能复用已有的以太网基础设施和运维体系成本显著低于IB。特别是一些中型训练集群或者混合云场景RoCE的兼容性和灵活性更有吸引力。加上近年来无损以太网技术逐步成熟RoCE在高带宽场景下的表现越来越接近IB。但RoCE有一个绕不开的痛点它依赖底层网络提供无损传输能力否则一旦丢包性能就会雪崩。传统以太网本身会丢包所以RoCE部署必须配合DCQCN、PFC、ECN、ETS等一系列机制来保证无损调试难度相当大。我在面试中通常用一个连环问题来考候选人RoCE场景下拥塞产生了网卡侧会收到什么信号交换机侧怎么调度如果出现PFC风暴怎么定位能完整答上来的人确实不多。3.3 两种方案的实际选型对比选IB还是RoCE不是简单看性能跑分而是要结合实际训练负载、运维能力和预算综合判断。下面这份对比表是我自己整理多年项目的经验维度InfiniBandRoCEv2协议设计面向HPC原生设计天然支持RDMA以太网上的RDMA扩展协议拥塞控制基于信用机制的端到端流控依赖PFC、ECN、DCQCN等机制部署维护独立组网生态封闭技能门槛高可复用现网以太网设备生态开放成本高网卡/交换机/光模块均贵相对可控以太网设备价格更低典型规模千卡级以上超大GPU集群中小规模集群或混合云场景成熟度在HPC和大型训练集群中验证充分在AI集群中也大量使用但调试复杂选型时我的经验判断标准是如果集群规模超过一千卡且预算允许直接上IB省心、稳定、性能上限高。如果是百卡规模或者预算受限RoCEv2完全足够关键在于提前设计好QoS和无损策略并且预留运维调试时间。还有一个容易被忽视的点新入局者在选RoCE时务必提前测试不同厂商交换机的PFC和ECN兼容性。很多项目死不是死在理论性能上而是死在多厂商设备策略不一致导致的隐性丢包上。4. 集群拓扑设计从胖树到Torus再到3D Torus4.1 胖树Fat-Tree大集群的基本盘大模型训练集群里最常见的拓扑就是胖树结构。胖树的核心思想是每一层链路的带宽总和等于或大于下一层的总带宽需求从而保证任意节点对之间的通信都能获得接近线速的性能。以经典的三层Clos架构为例自下而上分别是边缘层接入层、聚合层汇聚层和核心层脊层每个下层交换机向上层多台交换机同时连接。这样任何节点之间的通信路径有多条可选可以通过ECMP等价多路径进行负载均衡不容易出现单点瓶颈。千卡级GPU集群实际布线时我们通常会按“计算节点-边缘交换机-聚合交换机-核心交换机”的顺序逐层汇聚。单个计算节点通常放4到8张GPU节点的网卡通过高速线缆接入边缘交换机。聚合层和核心层的数量按带宽收敛比来算一般要求无收敛也就是每一层总带宽大于等于上一层需求。胖树的另一个好处是容错性好某条链路故障或某台交换机故障时流量可以快速切换到其他等价路径对训练任务的影响相对有限。从运维角度看故障域更小更好排查。所以面试时如果问到“为什么大多数集群选胖树”核心答两点一是可水平扩展二是路径冗余天然支持故障恢复。4.2 Torus与3D-Torus高密度低成本的选择胖树虽然性能好但它需要大量的核心交换机和高带宽线缆投资非常重。在某些场景下特别是节点间通信局部性较强的任务中可以用更低成本的Torus拓扑。Torus可以理解成一个环形网格。每个节点只与相邻的节点连接组成一个二维或三维的格状结构并且在边缘处回环相连相当于把整个拓扑的头尾接起来。它最大的优点是线缆总量大幅减少构建成本远低于胖树。但缺点是任意两个节点之间的通信可能需要多跳转发时延随着跳数增加而上升对通信的局部性要求较高。3D-Torus是在二维基础上再加一个维度例如每台机器有6个网络端口分别连接X、Y、Z三个轴上的前后两个邻居。这种设计主要被用于一些超算系统以及节点间通信以邻居通信为主的场景。对大模型训练来说由于集合通信中有大量跨随机节点的流量纯Torus拓扑并不理想所以它更多出现在超算场景或者配合胖树做混合组网。4.3 大模型集群的主流趋势RDMA over Fabric近几年在万卡集群设计中一个明显的趋势是走向RDMA over Fabric的架构本质上就是把高性能RDMA网络与可编程交换机结合起来实现路径动态调度。最典型的例子是英伟达的NVLink InfiniBand融合架构以及Google的TPU Pod采用的OCSOptical Circuit Switch光路交换架构。OCS可以根据训练任务的需求动态调整拓扑连接让通信频繁的节点组物理上更靠近。这种做法比固定拓扑更灵活但代价是控制逻辑很复杂而且光路切换本身有时间开销。从面试角度看你不需要真的去设计一个万卡网络但至少要掌握这些拓扑解决的关键问题胖树解决的是无阻塞高带宽Torus解决的是结构成本约束OCS解决的是动态流量适配。能讲清楚每种方案的适用边界面试官就会觉得你有架构视野而不只是会照着文档配机器。5. 集合通信中的网络瓶颈分析5.1 为什么AllReduce会成为训练性能的关键在大模型数据并行训练中AllReduce是出现频率最高的集合通信操作。每个训练step所有GPU需要先把各自的梯度算完然后通过AllReduce把梯度聚合成全局梯度。通信完成前任何一张卡都不能进入下一轮参数更新所以AllReduce的耗时直接叠加在每次迭代的关键路径上。我习惯用一个直观的公式来解释迭代总耗时 ≈ 计算耗时 通信耗时 - 计算通信重叠部分也就是说如果计算耗时从100毫秒优化到90毫秒但通信耗时50毫秒没变最终收益远远不如把通信从50毫秒压缩到20毫秒来得明显。这就是为什么在大规模训练里网络优化带来的收益往往比微调算子更显著。那AllReduce底层到底是怎么在集群网络上实现的通常做法是用Ring-AllReduce算法。把N张卡组织成一个虚拟环每个节点只和前后两个邻居通信。梯度数据被切成N份每个节点先把自己的第i份数据发送给下一个节点同时从上一个节点接收数据经历N次数据转发后所有节点都聚合出完整的梯度。Ring算法最大的优点是把通信负载均匀分摊到所有节点不依赖中心节点不会出现单点瓶颈。因为没有中心节点Ring-AllReduce的通信时间理论上随节点数增长但扩展效率远优于Tree-AllReduce等中心化方案。许多面试题会问到“为什么大集群里用Ring而不用中心化方案”另一个因素就是负载均衡和容错。5.2 如何估算AllReduce的最低带宽需求面试中经常出现的一道估算题给定N张GPU卡、单卡梯度量G字节问Ring-AllReduce理论上需要多久完成全局聚合。我的计算方法如下Ring-AllReduce的通信过程每张卡在每一轮只需要发出N份数据中的一份总共需要N-1轮传完。但实际上每个数据分片经过环上每一条链路所以总传输量与节点数无关更准确的表述是每个节点的发送量为2(N-1)/N × G当N足够大时约等于2G。也就是说在这个理想模型下千卡集群完成一次AllReduce的通信时间约等于2 × 单卡梯度大小 / 单卡有效带宽。我用一个实际数字来演示假设单卡梯度大小为200MB网卡带宽为400Gbps换算约为50GB/s。那么理论AllReduce耗时约为2 × 200MB / 50GB/s ≈ 8毫秒。这在真实集群中已经是非常好的水平如果实际测量值超过这个理论值两倍以上说明网络存在拥塞、拓扑收敛或设备配置问题。这个估算方法我自己在一次面试中被问到过当时用这个模型快速算出预期值再让候选人分析实际值与理论值偏差的可能原因。能在现场快速做这类估算的人通常对网络系统的理解比较扎实。5.3 AlltoAll容易被忽视但难点集中的通信模式相比AllReduceAlltoAll在面试中出现的频率稍低但实际难度更高。AlltoAll要求每个节点把数据切分成N份分别发给其余N-1个节点同时接受来自其余节点的数据。这个模式下每个节点都要同时和多点通信流量交叉严重对网络的并发能力要求非常高。MoEMixture of Experts模型是AlltoAll的典型应用场景。每个Token需要被路由到对应的专家节点而Token的分配模式是动态的、无法预先确定的导致网络流量出现突发性不均衡。这种场景下胖树拓扑的多路径调度能力尤为重要。如果面试官问你“MoE模型对网络有什么特殊要求”你可以说三点一是流量动态变化需要网络路径的快速适应能力二是单个Token的数据量很小但数量极大对消息调度效率要求高三是不同专家的负载天然不均衡可能造成某些网络链路的局部拥塞。能在这种问题上给出多维度的回答基本就能展示出你对网络与模型训练的交叉理解这在面试中是加分项。6. 拥塞控制与无损网络的底层机制6.1 为什么无损网络对AI集群至关重要传统以太网的设计逻辑是“尽力而为”数据包一旦冲突或拥塞就丢弃由上层协议重传。这种策略对普通网页浏览和视频流媒体没问题但对RDMA并不适用因为RDMA直接访问远程内存操作系统不参与重传逻辑。一旦丢包只能靠网卡硬件重传而硬件重传的机制恢复慢会让通信时间呈现“悬崖式”恶化。AI训练通信以Burst流量为主GPU每完成一次计算所有梯度几乎同时涌向网络形成瞬间并发。如果网络没有无损能力交换机的缓存就会被瞬时填满丢包就会发生。一个集群一旦开始频繁丢包训练的稳定性就会急剧下降严重时甚至出现训练直接中断。所以无损网络的目标就是保证数据在传输过程中不被丢弃靠三层手段实现流控PFC、显式拥塞通知ECN、以及端到端的拥塞控制算法DCQCN。这套机制组合在一起让RDMA在以太网上也能获得接近InfiniBand的稳定传输表现。6.2 PFC、ECN、DCQCN到底在干什么PFCPriority Flow Control优先级流控是一种逐跳的流控机制。它给交换机上的队列配置了不同的优先级当某个优先级队列的缓存达到阈值时交换机会向上一跳设备发送暂停帧让上一跳暂停发送该优先级的数据。PFC能防止数据包丢失但代价是有可能引发“拥塞树”问题一个队列的暂停会层层向上传播最终形成网络风暴也就是面试中常说的PFC风暴。ECNExplicit Congestion Notification显式拥塞通知则是在IP层标记拥塞状态。交换机检测到队列深度超过阈值后会在数据包头部打上CECongestion Experienced标记。接收方看到CE标记后反馈给发送方一个拥塞信号发送方据此降低发送速率。ECN的好处是“通知”而非“停发”避免了PFC那种长链路连锁反应。DCQCN是把ECN和速率控制算法结合起来。具体来说接收方收到CE标记的数据包后生成CNPCongestion Notification Packet拥塞通知包发给发送方发送方收到CNP后按比例降低当前速率再在后续过程中逐步恢复速率。这套机制可以让RoCE网络在拥塞时快速降速、拥塞消失后快速恢复兼顾了无损性和吞吐利用。面试官往往会追问“如果PFC和ECN同时存在谁优先”从实际部署效果看理想状态是在网卡侧拥塞控制生效之前尽量避免触发交换机队列的PFC。因为PFC一旦介入暂停帧可能在网络里扩散造成多路径上的入口队列无谓堆积。所以部署RoCE网络时一个核心策略是调优ECN阈值和DCQCN参数让ECN先报警、先降速PFC是最后一道防线而不是常态手段。6.3 网卡侧参数到底怎么调这部分是真正动手调优时最实用的内容也经常成为面试中的深挖点。以常见的Mellanox网卡为例RoCE模式下需要调整的关键参数如下cqe_versionRoCEv2场景下应设置为1使用MOD_ERR模式。ecn_enable必须开启这是让网卡识别交换机的CE标记并触发拥塞控制的前提。dcqcn_enable是否开启DCQCN算法通常配合ECN一起用。ratelimit设置最大发送速率上限避免单条流把集群出口带宽打满。priority设置RoCE流量对应的优先级队列确保与交换机的PFC优先级设置一一对应。不少团队反映“RoCE性能上不去”且“训练时偶发中断”我排查下来经验是七成问题都在参数错配上。比如网卡配置ECN开启但是交换机端口没有开启ECN或者网卡到交换机之间的PFC优先级不一致都会导致流控机制失效。这里需要特别提醒不同交换机厂商对ECN阈值的默认配置差异很大必须要结合实际的队列深度做针对性调优。RTT往返时延也直接决定DCQCN的反应速度跨机柜布线距离相差几米都会影响队列的初始设置。7. AI集群网络面试常见问题与排查思路7.1 高频面试问题速查表按照我在面试中的经验下面这些问题的出现频率极高而且往往是连环问的开端。常见问题期望回答要点为什么AI集群通常用RDMA而不是TCPRDMA绕过内核、CPU开销低、时延低TCP存在内核协议栈开销和丢包重传成本。IB和RoCE的核心区别是什么协议设计不同IB无损机制内生RoCE需依靠以太网流控IB生态封闭、性能上限高RoCE成本低、兼容性好。什么是PFC风暴如何避免PFC暂停帧在多跳之间连锁传播导致网络吞吐骤降通过ECN提前降速、配置优先级隔离、合理调队列阈值来规避。Ring-AllReduce相比Tree-AllReduce的优势无中心节点、负载均衡、可扩展性好Tree的中心节点容易成为瓶颈。千卡集群网络需要满足什么关键指标低延迟、高带宽、无丢包、低抖动AllReduce实测时间接近理论值。为什么大模型训练需要无阻塞网络因为集合通信流量大收敛会比物理带宽瓶颈更早出现。面试不能只背答案最好能结合实际项目讲清楚一个具体案例。比如我面试过一个候选人滔滔不绝讲了一堆协议原理但问他“你的训练集群网络遇到了什么问题、怎么定位的”他却支支吾吾答不上来。所以如果你有实际项目经历哪怕只是帮人调过一台交换机或排查过一次网卡降速也要提前整理成条理清楚的case这在面试中的说服力远超背答案。7.2 实战排查从现象到根因的定位路径分享一个真实场景一个192卡集群在训练过程中频繁出现“慢节点”某几张卡的AllReduce时间比其他卡高出10倍以上但GPU利用率DCGM监控并没有发现明显异常。我当时排查路径是这样的第一步先确认是哪张卡慢。用nccl-tests跑一轮AllReduce测试发现慢节点集中在同一个机柜。第二步看网络监控数据。查看交换机端口出现大量丢包计数以及该机柜接入交换机上联端口流量接近带宽上限。此时基本判断是物理链路饱和或配置问题。第三步检查RoCE参数。发现该机柜交换机的ECN阈值被设置得极低流量稍微波动就触发CE标记网卡侧反复降速导致通信变慢。第四步调优ECN阈值和网卡DCQCN参数后重新跑测试慢节点现象消失AllReduce时间恢复均值水平。这个case给面试官的信号比背一堆理论更有效因为它说明了候选人能根据现象判断根因类别并且有实际动手调参的经验。我认为面试中讲这种故事的价值在于能展示提问者自己的分析框架和排错逻辑而不是直接给结论。7.3 网络性能验证常用工具工具是日常运维和面试准备最实用的部分推荐下面几个我实测下来特别顺手的nccl-tests英伟达官方集合通信测试工具也是面试时最常提到的。可以分别测AllReduce、AllGather、ReduceScatter等操作的带宽和延迟通过设置-b、-e、-f等参数控制消息大小范围。ib_write_bw/ib_read_bw测试RDMA单链路带宽和延迟用来验证网卡与交换机之间的物理链路状况。perftestMellanox官方性能测试套件用法简单适合直接跑点对点和集合通信测试。ethtool -S查看网卡侧的丢包、PFC暂停帧技术是定位RoCE网络问题最关键的命令之一。top/nvidia-smi排查GPU利用率与网络通信是否符合预期区分是计算瓶颈还是通信瓶颈。我建议你在面试前花一个周末在自己手头或申请的测试集群上跑一遍这些命令把典型输出截图记录在案。面试时直接说“我用nccl-tests把千卡集群的AllReduce带宽从X提升到了Y”这比任何堆砌概念都有说服力。技术面试中权威工具输出比形容词更有可信度。8. 从面试视角延伸AI Infra岗位真正关心的三种能力前面讲了很多具体知识点但我想在最后从面试官视角把考察点抽象一下。AI Infra岗位面试的候选人数不少能完整背诵IB和RoCE知识点的人已经很多真正稀缺的是把知识点组织成“系统能力”的人。第一种能力叫“链路视野”。你在解决一个慢节点问题时不是只盯网卡或GPU而是能画出完整的数据路径从GPU显存到NVLink、PCIe、网卡、线缆、交换机端口、远端网卡每一跳都可能成为瓶颈。面试时如果被问“集群性能上不去怎么排查”你会从最细的链路开始逐段隔离定位这属于系统性的能力靠背题练不出来必须通过实操积累。第二种能力叫“成本判断”。任何网络方案都是在带宽、成本、规模、稳定性之间取平衡。我在实际项目里遇到过为了最优性能强行上全套IB方案结果预算超支导致项目停滞的案例。面试时如果你能主动讨论“如果预算有限我会优先保证无阻塞网络的哪几层”面试官基本会给你打高分。这些判断中的细节比如哪些层的带宽收敛比可以略微让步、哪些层必须无阻塞来自对具体场景的长期观察而不是教科书上的通用答案。第三种能力叫“故障反应速度”。大模型训练集群故障发生频率不低而且代价高昂——一个千卡集群闲置一小时的成本抵得上很多普通项目的整体预算。面试时考察的不只是你会不会修而是你的修复过程有没有章法能否快速定位、隔离、止血而不是盲目反复重启。训练任务恢复时安全和规范操作要优于“立刻恢复训练”的冲动这点在面试中谈出来也很加分。最后分享一个小心得如果你正在准备AI Infra面试不要只盯着面试题去刷找一个真实的分布式训练集群哪怕只有几十张卡把集合通信测试、RoCE参数调优、PFC排查这些操作亲手做一遍收获会远超你背二十篇八股文。网络是一个实践性极强的领域纸上得来终觉浅面试官也是从实践的泥潭里爬出来的你聊到哪个深度他自然知道你是真懂还是背题这个装不了。
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。