跳到正文
原文
Hugging Face Blog·· 2026-08-25AI 评分48

Quantization-Aware Healing:压缩后 4-bit GPT-OSS 60B 超越全精度原版

Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original

AI 导读

Hugging Face 提出 Quantization-Aware Healing,将 GPT-OSS 120B 压缩到 60B 并量化为 MXFP4 后,在 9 个 benchmark 中有 7 个超过对应 60B bfloat16 checkpoint。QAH 直接从压缩前原始模型蒸馏,并用分块 KL-divergence loss 支持最长 32k tokens 的 healing。

来源:Hugging Face Blog · huggingface.co