跳到正文
原文
Hugging Face Blog·· 29 天前精选AI 评分65

用 100 个 GRPO 步骤微调 LFM2.5-350M,提升结构化输出表现

Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps

AI 导读

Hugging Face Blog 用 TRL 和 GRPO 微调 LFM2.5-350M,在 IFStruct 上把通过率从 22.6% 提升到 29.7%。

推荐理由

原文把训练数据改造、奖励函数和本地评测命令连在一起,便于复现实验并迁移到结构化输出任务。

来源:Hugging Face Blog · huggingface.co