H Company 发布 NeoMME 多语言多模态编码器,提供 260M 和 800M 版本
H Company 发布 NeoMME,一组 260M 和 800M 多语言多模态编码器,已在 Hugging Face Transformers 提供并以 Apache 2.0 许可发布检查点。
推荐理由:文章同时给出架构、ViDoRe 结果和索引压缩方案,可作为视觉文档检索选型参考。
H Company 发布 NeoMME,一组 260M 和 800M 多语言多模态编码器,已在 Hugging Face Transformers 提供并以 Apache 2.0 许可发布检查点。
推荐理由:文章同时给出架构、ViDoRe 结果和索引压缩方案,可作为视觉文档检索选型参考。
IBM 发布 Granite 4.2 推理 LLM 家族,包含 3B、8B、30B 三种 dense decoder-only 模型,并以 Apache 2.0 许可证开放。
推荐理由:文章拆解了 Granite 4.2 从预训练到多阶段 RL 的流程,便于比较开源推理模型的训练取舍。
Liquid AI 发布 LFM2.5 系列 3 个模型的 DSpark draft model checkpoints,为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 增加投机解码路径。
NVIDIA Magpie Multilingual TTS 发布最新开放权重版本,提供 364M 参数模型、NVIDIA NIM 生产部署和 12 种语言支持。
推荐理由:原文把开放权重、NIM 部署和延迟数据放在同一语音流水线中,便于评估自托管方案的取舍。
Meta 发布 Muse Glimmer-30B,这是从 Muse 蒸馏到 30B 参数的开源多模态模型,面向本地智能体用例并采用 Apache 2.0 license。
推荐理由:原文同时给出架构、基准和本地部署示例,便于比较开源多模态模型在本地智能体场景的工程落地路径。
NVIDIA 推出 Cosmos-H-Dreams,这是面向手术机器人的实时、动作条件生成式仿真模型。它将 Cosmos-H-Surgical-Simulator 蒸馏为因果、少步学生模型,并通过 FlashDreams 提供流式推理,在单张 NVIDIA RTX PRO 6000 上达到交互式运行约 ~160 frames per second。
推荐理由:原文同时交代蒸馏流程、FlashDreams 推理优化和开放资源,便于理解世界模型如何进入闭环机器人训练。
Mistral AI 发布 Voxtral TTS,这是其首个文本转语音模型,参数量 4B,支持 9 种语言的多语言语音生成。该模型支持情绪表达、低延迟、语音适配和 zero-shot 跨语言语音适配,典型输入 10 秒语音样本和 500 字符时模型延迟为 70ms,RTF ≈9.7x。
推荐理由:原文同时给出语言覆盖、延迟、价格、架构细节与适用场景,便于评估企业语音工作流的接入成本。
Mistral AI 发布 Voxtral Transcribe 2,包括用于批量转写的 Voxtral Mini Transcribe V2 和用于实时应用的 Voxtral Realtime,并在 Mistral Studio 推出音频 playground。
推荐理由:原文同时给出延迟、价格、开源权重和多项基准对比,便于评估语音转写在实时与离线场景的部署取舍。
Mistral AI 发布 Mistral 3,包括 14B、8B、3B 三个小型 dense 模型,以及 41B active、675B total 参数的 MoE 模型 Mistral Large 3,全部以 Apache 2.0 license 发布。
推荐理由:原文同时交代模型规模、开源许可、压缩格式和上线渠道,便于比较前沿与端侧模型的部署取舍。
Code Llama 是围绕编码能力的 Llama 2 相关模型。材料抓取失败,仅有 Hugging Face Blog 标题“Code Llama: Llama 2 learns to code”可用。
Hugging Face Blog 介绍 IDEFICS,这是一个对 SOTA 视觉语言模型的开放复现项目。材料抓取失败,仅标题可用。