最近更新时间:2026-08-10 14:14:40
本文主要介绍资源组的节点碎片管理功能。
节点碎片整理用于优化资源组内 GPU 负载的摆放位置,清理因负载零散分布导致的 GPU 碎片,从而提升资源利用率、缓解任务排队情况。
例如:您有 3 台 8 卡机器,当前负载分别为 7 卡、6 卡、7 卡,碎片整理可将第三台机器上的零散负载迁移走,腾出完整 4 卡资源给新任务使用。
可迁移任务:
开启"使用闲时资源"的训练任务。
多副本模型在线服务。
不可迁移任务:
开发任务、数据处理任务、模型微调任务。
未开启"使用闲时资源"的训练任务。
单副本模型在线服务。
节点要求:剩余节点(即除整理任务所在节点)需有足够剩余资源(GPU、CPU、内存)承接被整理的任务。
操作限制:每次仅可针对一个节点发起碎片整理。
该步骤主要目的是选择一个因集群碎片导致排队的任务,系统将按该任务申请的资源量为目标,整理并释放可用空间。
在碎片整理页面,选择手动整理页签。
选择任务类型,并在任务名称下拉列表中,选择目标任务,页面将自动展示该任务的所需的节点卡型和资源。
若下图所示,当前排队中的开发任务,其所需的节点卡型为GM302,所需的资源为1卡2核4Gi。
在碎片节点区域,可查看候选节点列表,即当前任务可调度到的目标节点。
勾选目标碎片节点(一次仅支持勾选一个节点), 节点负载区域将展示该节点上运行中的实例(Pod)及关联任务。
若未选择任务:展示资源组所有状态为"正常"的节点。
已选择任务:
若任务加入物理队列,仅展示该物理队列中的节点。
若任务属于普通队列,将过滤已加入物理队列的节点。
在 节点负载中,查看任务实例列表,勾选需要迁移的任务实例。
当前仅支持对以下两类任务进行整理:
训练任务:必须开启"使用闲时资源"。
模型在线服务:需大于一个副本,迁移时采用滚动更新,保证至少一个副本运行。
部分实例会以置灰状态显示,无法勾选。将鼠标悬停在置灰实例上可查看具体原因。
置灰原因 | 说明 |
|---|---|
已占满节点全部 GPU(≥8 卡) | 该实例本身已无碎片空间可利用 |
未开启“使用闲时资源” | 碎片整理过程中任务会重启,因此普通训练任务不支持碎片整理 |
单副本模型在线服务 | 迁移会导致服务中断 |
任务类型不支持 | 开发任务、数据处理任务、模型微调任务不支持碎片整理 |
节点资源不足或存储协议不匹配 | 其他候选节点无法满足任务的调度要求 |
实例正在碎片整理中 | 避免重复碎片整理造成调度行为不符合预期 |
确认已勾选的实例无误后,单击碎片整理按钮。
在提示窗口中,单击确定,系统对所选实例发起重调度,迁移到其他节点。
所选中的训练任务将重启,请确认代码中已配置 checkpoint 机制,确保重启后可接续训练。
模型在线服务将通过滚动更新迁移,迁移期间至少保持一个副本运行。
至此,碎片整理按钮将置灰,提示"请等待碎片整理完成"。
置灰状态对该资源组所有用户生效。
符合以下任一情况时按钮自动恢复:
所勾选实例全部迁移完成
碎片整理操作发起超过 10 分钟
按钮恢复后,页面自动刷新 节点负载详情,显示整理后各节点当前运行中的实例。
当任务因碎片整理而重启时:
任务时间线中状态变为重启中。
提示信息为:自动重启:节点碎片整理。
停止后任务将被重新调度,状态依次变为:排队中 → 部署中 → 运行中。
可直接参考资源管理常见问题相关内容。
纯净模式
