Hugging Face Blog·· 28 天前AI 评分58
Hugging Face 用 100 步 GRPO 微调 LFM2.5-350M 提升结构化输出能力
Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps
AI 导读
Hugging Face 发布教程,用 TRL 库以 GRPO 微调 LiquidAI/LFM2.5-350M,仅约 500 样本、100 训练步即可在免费级 Colab 或 Kaggle GPU 上完成。
来源:Hugging Face Blog · huggingface.co