Hugging Face Blog·· 20 天前精选AI 评分64
Hugging Face 用 Storage Bucket 和代理实现跨 Jobs 的异步 GRPO LoRA 训练,500 步从 3 小时 27 分压到 53 分钟
Async GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCL
AI 导读
Hugging Face 团队展示 TRL v1.14 的 AsyncGRPOTrainer 如何只同步几 MB 的 LoRA 适配器到 vLLM,借助 Storage Bucket 挂载和一个小型代理,让训练与推理在不同 HF Jobs 机器上运行且不需要 NCCL。
推荐理由
原文给出完整的跨机 LoRA 异步 GRPO 架构与五轮调优数据,读者可以照搬这套用指标定位瓶颈的方法。
来源:Hugging Face Blog · huggingface.co