oMLX 创建者 Jun Kim 加入 Hugging Face 支持 MLX 社区
Hugging Face 宣布 oMLX 创建者和维护者 Jun Kim 加入团队,以支持 MLX 社区和本地 AI 生态。MLX 是 Apple 面向本地 AI、尤其优化 Apple Silicon 的框架;oMLX 将继续采用 Apache 2.0,Jun 仍将领导该项目。
Hugging Face 宣布 oMLX 创建者和维护者 Jun Kim 加入团队,以支持 MLX 社区和本地 AI 生态。MLX 是 Apple 面向本地 AI、尤其优化 Apple Silicon 的框架;oMLX 将继续采用 Apache 2.0,Jun 仍将领导该项目。
Hugging Face 介绍 tokenizers v1 release candidate,称其在 Apple M4 Max 单线程下对十个模型家族的编码速度较 v0.23 快 3 到 30 倍。
推荐理由:文章给出性能数据和实现拆解,可帮助判断 tokenizers v1 对训练与服务瓶颈的影响。
IBM Research 在 ALTK-Evolve 中引入 Consistency Analyzer 和 consistency guidelines,用于衡量并降低 AI 智能体重复执行同一任务时的波动。
推荐理由:原文把平均准确率与重复成功率分开衡量,为排查智能体生产环境波动提供了可迁移方法。
TRL v1.14 的 AsyncGRPOTrainer 现在可训练 LoRA adapter,并只把该 adapter 同步到 vLLM。
推荐理由:文章把 LoRA 适配器同步、HF Jobs 编排和瓶颈定位串成可复现实验,便于迁移到异步 RL 训练。
H Company 发布 NeoMME,一组 260M 和 800M 多语言多模态编码器,已在 Hugging Face Transformers 提供并以 Apache 2.0 许可发布检查点。
推荐理由:文章同时给出架构、ViDoRe 结果和索引压缩方案,可作为视觉文档检索选型参考。
Hugging Face Blog 用 TRL 和 GRPO 微调 LFM2.5-350M,在 IFStruct 上把通过率从 22.6% 提升到 29.7%。
推荐理由:原文把训练数据改造、奖励函数和本地评测命令连在一起,便于复现实验并迁移到结构化输出任务。
作者用 TRL 和 OpenEnv 复现了让编码模型写 JavaScript 绘制水彩画的训练流程,并公开了参考池数据集、RL 环境、训练脚本和训练模型。流程让模型通过 p5.brush 生成约 150 行 JavaScript,用 gate、长度、pairwise judge 和 HPSv3 组成奖励,其中参考池包含 178 幅由作者手工评级的模型生成画作。
推荐理由:文章把审美奖励训练拆成数据池、环境、评审模型和成本,适合作为复现同类实验的工程参考。
Hugging Face 发布 @huggingface/kernels,一个用于从 Hugging Face Hub 加载并运行优化 WebGPU kernels 的最小库,同时推出 207 个 WebGPU kernels 和浏览器内 GPU 基准测试套件 Fleet。
推荐理由:文章给出内核打包、加载和基准结果,可帮助开发者评估浏览器本地推理的底层优化路径。
Sentence Transformers v6.0 引入第四种模型类型 MultiVectorEncoder,用于 ColBERT-style late interaction retrieval,并给出完整训练方法。
推荐理由:文章把训练脚本、评测对比和索引压缩放在同一流程中,便于迁移到垂直领域检索场景。
IBM 发布 Granite 4.2 推理 LLM 家族,包含 3B、8B、30B 三种 dense decoder-only 模型,并以 Apache 2.0 许可证开放。
推荐理由:文章拆解了 Granite 4.2 从预训练到多阶段 RL 的流程,便于比较开源推理模型的训练取舍。
Hugging Face 提出 Quantization-Aware Healing,将 GPT-OSS 120B 压缩到 60B 并量化为 MXFP4 后,在 9 个 benchmark 中有 7 个超过对应 60B bfloat16 checkpoint。QAH 直接从压缩前原始模型蒸馏,并用分块 KL-divergence loss 支持最长 32k tokens 的 healing。
Gradio 的 gr.Workflow 将 AI 应用管线描述为类型化节点图,并提供拖拽画布,让每个节点可运行、中间结果可见。同一图也会成为 REST API,并可一条命令部署到 Hugging Face Spaces。
推荐理由:原文展示了 gr.Workflow 如何把多步 AI 管线做成可运行画布和 REST API,便于复用到 Gradio 应用。
Hugging Face 的最新研究提出三项测试,用于量化语音识别中的 benchmark optimization 或 benchmaxxing 现象。研究评估了 11 个常用开源 ASR 模型,发现部分高分系统会复现 VoxPopuli English 和 LibriSpeech 的基准转写,即使音频与参考文本矛盾、相关词被静音,或同一音频支持不同书写形式。
推荐理由:文章用三类探针展示公开语音基准的过拟合迹象,可帮助评估者区分榜单分数与真实转写能力。
Hugging Face 解释了 Papers with Code 搜索如何由 Inference Endpoints、Jobs 和 Buckets 支撑,采用离线语料构建和在线混合搜索分离的架构。
推荐理由:文章把离线向量构建、在线查询嵌入和全文检索降级拆开,提供了搜索系统的工程取舍参考。
Liquid AI 发布 LFM2.5 系列 3 个模型的 DSpark draft model checkpoints,为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 增加投机解码路径。
Hugging Face 的开放模型现状夏季报告分析了 2026 年 1 月至 8 月的 Hub 数据,公共模型仓库从 2.43 million 增至 2.96 million,数据集从 711,000 增至 1 million,Spaces 从 1.00 million 增至 1.44 million。
推荐理由:报告用 Hub 下载、点赞和衍生仓库数据,展示开放模型生态在规模、采用与运行层的分化。
Hugging Face Blog 介绍了 Strands Robots 中的流式数据闭环,用一个 agent 循环录制机器人演示、把 LeRobotDataset 同步到 Storage Bucket、从 Hub 流式读取训练,并将 checkpoint 部署回硬件。
推荐理由:文章把录制、同步、流式训练和部署串成同一流程,便于复用到机器人数据采集闭环。
IBM Research 在 Hugging Face Blog 对比 ALTK-Evolve 与 ACE,称两者都让智能体从自身轨迹中学习,但 ALTK-Evolve 通过可校准的 guideline 投递减少推理 token。
NVIDIA Magpie Multilingual TTS 发布最新开放权重版本,提供 364M 参数模型、NVIDIA NIM 生产部署和 12 种语言支持。
推荐理由:原文把开放权重、NIM 部署和延迟数据放在同一语音流水线中,便于评估自托管方案的取舍。
Meta 发布 Muse Glimmer-30B,这是从 Muse 蒸馏到 30B 参数的开源多模态模型,面向本地智能体用例并采用 Apache 2.0 license。
推荐理由:原文同时给出架构、基准和本地部署示例,便于比较开源多模态模型在本地智能体场景的工程落地路径。
NVIDIA 推出 Cosmos-H-Dreams,这是面向手术机器人的实时、动作条件生成式仿真模型。它将 Cosmos-H-Surgical-Simulator 蒸馏为因果、少步学生模型,并通过 FlashDreams 提供流式推理,在单张 NVIDIA RTX PRO 6000 上达到交互式运行约 ~160 frames per second。
推荐理由:原文同时交代蒸馏流程、FlashDreams 推理优化和开放资源,便于理解世界模型如何进入闭环机器人训练。
Hugging Face 在 Diffusers 中加入 Nunchaku Lite 支持,预量化 Nunchaku checkpoint 可用 from_pretrained() 直接加载,无需自定义 pipeline、单独推理引擎或本地 CUDA 编译。
推荐理由:原文同时给出加载方式、硬件支持和基准数据,便于评估4-bit扩散推理在现有Diffusers流程中的接入成本。
Grabette 发布为一个开源、低成本的手持夹爪系统,用于在没有机器人、实验室或遥操作装置的情况下记录机器人操作数据。它包含 Grabette 手持示教设备和 Gripette 机器人夹爪,BOM 成本分别约为 490€ 和 120€,并通过浏览器处理流程把采集片段上传到 HF Hub、运行 SLAM、转换为 LeRobot 数据集。
推荐理由:原文把硬件、采集流程和 LeRobot 数据格式串起来,展示低成本采集机器人操作数据的路径。
Mistral AI 发布 Voxtral TTS,这是其首个文本转语音模型,参数量 4B,支持 9 种语言的多语言语音生成。该模型支持情绪表达、低延迟、语音适配和 zero-shot 跨语言语音适配,典型输入 10 秒语音样本和 500 字符时模型延迟为 70ms,RTF ≈9.7x。
推荐理由:原文同时给出语言覆盖、延迟、价格、架构细节与适用场景,便于评估企业语音工作流的接入成本。
Mistral AI 发布 Voxtral Transcribe 2,包括用于批量转写的 Voxtral Mini Transcribe V2 和用于实时应用的 Voxtral Realtime,并在 Mistral Studio 推出音频 playground。
推荐理由:原文同时给出延迟、价格、开源权重和多项基准对比,便于评估语音转写在实时与离线场景的部署取舍。
Mistral AI 发布 Mistral 3,包括 14B、8B、3B 三个小型 dense 模型,以及 41B active、675B total 参数的 MoE 模型 Mistral Large 3,全部以 Apache 2.0 license 发布。
推荐理由:原文同时交代模型规模、开源许可、压缩格式和上线渠道,便于比较前沿与端侧模型的部署取舍。
Code Llama 是围绕编码能力的 Llama 2 相关模型。材料抓取失败,仅有 Hugging Face Blog 标题“Code Llama: Llama 2 learns to code”可用。
Hugging Face Blog 介绍 IDEFICS,这是一个对 SOTA 视觉语言模型的开放复现项目。材料抓取失败,仅标题可用。
Hugging Face 发布 Swift Transformers,用于在 Apple 设备上运行端侧 LLM。材料抓取失败,仅标题可用,未提供更多功能细节。