H Company 发布 NeoMME 多语言多模态编码器,提供 260M 和 800M 版本
H Company 发布 NeoMME,一组 260M 和 800M 多语言多模态编码器,已在 Hugging Face Transformers 提供并以 Apache 2.0 许可发布检查点。
推荐理由:文章同时给出架构、ViDoRe 结果和索引压缩方案,可作为视觉文档检索选型参考。
H Company 发布 NeoMME,一组 260M 和 800M 多语言多模态编码器,已在 Hugging Face Transformers 提供并以 Apache 2.0 许可发布检查点。
推荐理由:文章同时给出架构、ViDoRe 结果和索引压缩方案,可作为视觉文档检索选型参考。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API in Google AI Studio 为开发者提供更可控的生成式视频能力。
推荐理由:原文列出场景延展、关键帧插值和4K升级等接口细节,便于评估视频生成工作流接入方式。
Google DeepMind 推出大规模多语言手语转文本翻译模型 SL2T,用于 Pixel 11 上 Gboard 和 Live Transcribe 的手语转文本功能,先支持 ASL 到英语。
推荐理由:原文披露了训练规模、隐私处理和产品入口,可了解手语模型从研究走向手机输入的路径。
Meta 发布 Muse Glimmer-30B,这是从 Muse 蒸馏到 30B 参数的开源多模态模型,面向本地智能体用例并采用 Apache 2.0 license。
推荐理由:原文同时给出架构、基准和本地部署示例,便于比较开源多模态模型在本地智能体场景的工程落地路径。
Mistral AI 发布 Shieldstral,一个 3B 开放权重、策略自适应的多模态安全分类器。它在推理时接受自然语言政策问题,将文本和图像安全评估统一为二元问答任务,无需重训,并输出校准后的安全分数。
推荐理由:它把内容审核改写为可提问的安全判断,为需要按场景调整策略且不想重训的产品提供参考。
Google DeepMind 发布 Gemini Robotics ER 2,称其为面向机器人的最强“具身推理”模型,用于视频理解、任务编排和多机器人协作。
推荐理由:原文同时给出开放入口、机器人协作示例和安全评测维度,便于理解具身模型在真实任务中的落地路径。
Google DeepMind 发布 Gemini Robotics 2,包括 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2 三个模型,面向机器人全身控制、双手或夹爪灵巧操作和多机器人协作。
推荐理由:原文同时列出云端、端侧和安全评测细节,可用于理解机器人模型从演示走向部署的路径。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,面向规模化 AI 智能体提供更高 token 效率、更低延迟和更可靠性能。
推荐理由:原文同时给出价格、token效率和基准差异,便于比较Flash系列在智能体工作流中的取舍。
Mistral AI 发布 Robostral Navigate,这是其首个面向具身导航的 8B 模型,可用单个 RGB 摄像头和自然语言指令让机器人在环境中移动。
推荐理由:原文同时给出传感器配置、基准成绩和训练流程,便于比较具身导航路线的取舍。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一次主要版本,将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力整合到一个模型中。
推荐理由:原文列出架构、上下文和部署入口,可比较开放 MoE 模型在推理与多模态任务中的取舍。
Mistral AI 发布 Mistral 3,包括 14B、8B、3B 三个小型 dense 模型,以及 41B active、675B total 参数的 MoE 模型 Mistral Large 3,全部以 Apache 2.0 license 发布。
推荐理由:原文同时交代模型规模、开源许可、压缩格式和上线渠道,便于比较前沿与端侧模型的部署取舍。
OpenAI 介绍了 Sora 2,这是一款支持同步对白和音效的视频生成模型。材料同时说明,Sora 产品已不再可用。
推荐理由:原文只给出同步对白、音效和产品不可用信息,适合把握 Sora 2 发布的基本边界。
OpenAI 发布 Sora 2 System Card,称 Sora 2 是新的 SOTA 视频和音频生成模型。该模型基于 Sora,引入更准确的物理、更清晰的真实感、同步音频、增强可控性和扩展的风格范围。
推荐理由:原文概括了 Sora 2 相比前代在物理、真实感、同步音频和可控性上的变化。
OpenAI 发布更先进的语音到语音模型 gpt-realtime,并更新 Realtime API。新增 API 能力包括 MCP server 支持、图像输入和 SIP 电话呼叫支持。
推荐理由:原文同时列出语音模型和 Realtime API 能力变化,可用于把握实时语音交互接口的更新方向。
OpenAI 推出 GPT-5,称其为迄今最好的 AI 系统。OpenAI 表示,GPT-5 相比其以往所有模型在智能上有显著提升,在编码、数学、写作、健康、视觉感知等方面具备先进性能。
推荐理由:原文列出 GPT-5 相比既有模型的覆盖领域,便于快速把握 OpenAI 对本代模型的定位。
OpenAI o3 和 o4-mini System Card 称,两款模型结合了 state-of-the-art 推理与完整工具能力。材料列出的工具包括 web browsing、Python、图像和文件分析、图像生成、canvas、automations、file search 和 memory。
推荐理由:材料列出 o3 与 o4-mini 的推理和工具能力范围,便于了解官方对模型定位的表述。
OpenAI 在 2025 launch 中为 GPT‑4o 引入原生图像生成,包括更强的文本渲染和指令跟随能力。原文还提到可探索 ChatGPT Images 2.5。
推荐理由:原文概括了 GPT‑4o 图像生成的能力重点,可作为了解文本渲染和指令跟随改进的入口。
Hugging Face Blog 介绍 IDEFICS,这是一个对 SOTA 视觉语言模型的开放复现项目。材料抓取失败,仅标题可用。