Hugging Face Blog·· 29 天前精选AI 评分65
用 100 个 GRPO 步骤微调 LFM2.5-350M,提升结构化输出表现
Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps
AI 导读
Hugging Face Blog 用 TRL 和 GRPO 微调 LFM2.5-350M,在 IFStruct 上把通过率从 22.6% 提升到 29.7%。
推荐理由
原文把训练数据改造、奖励函数和本地评测命令连在一起,便于复现实验并迁移到结构化输出任务。
来源:Hugging Face Blog · huggingface.co