跳到正文
原文
Hugging Face Blog·· 20 天前精选AI 评分64

Hugging Face 用 Storage Bucket 和代理实现跨 Jobs 的异步 GRPO LoRA 训练,500 步从 3 小时 27 分压到 53 分钟

Async GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCL

AI 导读

Hugging Face 团队展示 TRL v1.14 的 AsyncGRPOTrainer 如何只同步几 MB 的 LoRA 适配器到 vLLM,借助 Storage Bucket 挂载和一个小型代理,让训练与推理在不同 HF Jobs 机器上运行且不需要 NCCL。

推荐理由

原文给出完整的跨机 LoRA 异步 GRPO 架构与五轮调优数据,读者可以照搬这套用指标定位瓶颈的方法。

来源:Hugging Face Blog · huggingface.co