MMPOSE实验记录26.8.28
发布时间:2026/9/4 17:06:39 锦皓数字建站

实验一RTMPose-M 在 CrowdPose 上的 baseline 训练实验准备设备情况单张 NVIDIA GeForce RTX 507012 GB 专用显存官方配置里的batch_size64/GPU很可能不适合直接照搬。结合你刚才的配置我建议第一次 baseline先用 batch_size32 试跑如果 CUDA OOM再降到 16。你的官方配置基准总 batch 是8×64512并且已经写了auto_scale_lr dict(base_batch_size512)所以单卡训练时可以让 MMPose 自动按实际 batch 缩放学习率。例如先不要修改原始 config直接命令行覆盖python tools/train.py configs/body_2d_keypoint/rtmpose/crowdpose/rtmpose-m_8xb64-210e_crowdpose-256x192.py --work-dir work_dirs/baseline_rtmpose_m_crowdpose --amp --auto-scale-lr --cfg-options train_dataloader.batch_size32当前虚拟环境mmcv未安装Python 包albumentationspip install albumentations1.3.1安装完先检查python -c import albumentations as A; print(A.__version__)xtcocotools的 C 扩展_mask在编译时使用的 NumPy API 版本与当前环境中 NumPy 的版本不匹配强制重新编译_mask扩展使其匹配当前 NumPy。pip uninstall xtcocotools pip install --no-build-isolation --no-binary xtcocotools xtcocotools python -c import xtcocotools; print(OK)实验输出1.baseline结果文件路径--work-dir work_dirs/baseline_rtmpose_m_crowdposertmpose-m_8xb64-210e_crowdpose-256x192.py本次实验实际使用的配置文件副本。训练启动时 MMPose 自动保存用于复现实验。best_crowdpose_AP_epoch_110.pth验证集 AP 最优的模型权重产生于第 110 个 epoch约 123 MB。做正式测试、推理或作为后续改进方法的基线权重时通常优先用它。epoch_210.pth第 210 个 epoch 结束时保存的 checkpoint约 243 MB。它除了模型参数外通常还包含优化器、学习率调度器等训练状态主要用于断点续训。last_checkpoint文本指针文件内容指向epoch_210.pth供训练程序自动判断从哪个 checkpoint 恢复。20260828_105142/、20260828_152621/、20260828_152837/等目录每次启动训练或测试时MMPose/MMEngine 生成的按时间戳区分的日志目录。下文的时间戳文件时间戳/时间戳.log训练或测试过程的文字日志例如 epoch、loss、学习率、评估指标、报错信息等。时间戳/vis_data/config.py此次运行使用的完整配置快照通常会比原配置更完整包含继承配置展开后的最终参数。时间戳/vis_data/时间戳.json结构化训练日志记录每次迭代或每轮验证的指标数据。scalars.json可视化标量记录例如训练损失、学习率、验证 AP 等TensorBoard 或其他可视化工具可读取或转换它。中最关键的两个文件是继续训练使用 epoch_210.pth做最终测试、报告实验结果通常使用 best_crowdpose_AP_epoch_110.pth。注意epoch_210.pth是训练最后一次保存的权重并不必然是验证集性能最好的权重从文件名看你这次实验的最佳 AP 出现在第 110 个 epoch。
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。