NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 预览提交中给出性能结果
NVIDIA 在 MLPerf Inference v6.1 中提交 Vera Rubin NVL72 预览结果,称其在 Qwen3-VL 上吞吐最高比 GB300 NVL72 高 3.7x,在 DeepSeek-R1 上最高高 2.5x。
NVIDIA 在 MLPerf Inference v6.1 中提交 Vera Rubin NVL72 预览结果,称其在 Qwen3-VL 上吞吐最高比 GB300 NVL72 高 3.7x,在 DeepSeek-R1 上最高高 2.5x。
GitHub 推出 Project HydraFusion 研究预览,在 GitHub Copilot CLI 中通过运行时多模型编排完成编码任务。HydraFusion 面向所有 GitHub Copilot 计划用户开放,可通过 /experimental 使用,并会在 Single、Cascade、Critique 三种执行模式中选择工作流。
推荐理由:原文披露了路由模式、使用入口和三项编码基准结果,可用于比较多模型编排的成本取舍。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,面向智能体工作流、编码推理和网络安全任务。
推荐理由:原文同时披露通用版与安全版的定价、访问范围和评测结果,便于比较部署取舍。
IBM 发布 Granite 4.2 推理 LLM 家族,包含 3B、8B、30B 三种 dense decoder-only 模型,并以 Apache 2.0 许可证开放。
推荐理由:文章拆解了 Granite 4.2 从预训练到多阶段 RL 的流程,便于比较开源推理模型的训练取舍。
Hugging Face 提出 Quantization-Aware Healing,将 GPT-OSS 120B 压缩到 60B 并量化为 MXFP4 后,在 9 个 benchmark 中有 7 个超过对应 60B bfloat16 checkpoint。QAH 直接从压缩前原始模型蒸馏,并用分块 KL-divergence loss 支持最长 32k tokens 的 healing。
Google DeepMind 回顾了从 Atari 到 EVE Online 的 15 年游戏 AI 研究,并介绍其与游戏开发者合作原型化新玩法体验的方向。文章梳理了 DQN、AlphaGo、AlphaZero、MuZero、AlphaStar 和 AlphaFold 的关联,并称 SIMA 2 由 Gemini 驱动,可在屏幕观察、自然语言指令和键鼠控制下作为交互式伴侣。
Liquid AI 发布 LFM2.5 系列 3 个模型的 DSpark draft model checkpoints,为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 增加投机解码路径。
Google DeepMind 发布 Gemini 3.7 Flash,称其是面向编码和 AI 智能体的最智能主力模型,并较 Gemini 3.6 Flash 改进软件工程、知识工作和 Web 开发工作流。
推荐理由:原文同时给出相对 3.6 Flash 的基准差距与阶段性价格,便于评估编码智能体成本。
Microsoft Research 介绍 CARE-X,这是一个面向胸部 X 光多任务解读的统一放射学 VLM 研究模型,可生成报告、做结构化预测并给出可调阈值的置信分数。
IBM Research 在 Hugging Face Blog 对比 ALTK-Evolve 与 ACE,称两者都让智能体从自身轨迹中学习,但 ALTK-Evolve 通过可校准的 guideline 投递减少推理 token。
Google DeepMind 将 computer use 作为内置工具加入 Gemini 3.5 Flash,用于构建可跨浏览器、移动和桌面环境交互的智能体。
推荐理由:原文说明了能力入口和安全措施,可帮助开发者评估跨浏览器、移动和桌面自动化的接入方式。
Google DeepMind 推出 DiffusionGemma,这是一个实验性开放文本扩散模型,在专用 GPU 上文本生成最高快 4x,用于探索速度敏感的交互式本地工作流。
推荐理由:原文清楚交代了扩散式文本生成的速度收益、硬件条件和质量取舍,便于评估本地交互场景适配度。
Mistral 在 AI Now Summit 2026 公布面向企业和政府的 full-stack AI 方案,包括 Mistral for Industrial Engineering、Vibe 更新和 Les Ulis data center。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一次主要版本,将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力整合到一个模型中。
推荐理由:原文列出架构、上下文和部署入口,可比较开放 MoE 模型在推理与多模态任务中的取舍。
Mistral AI 发布 Mistral 3,包括 14B、8B、3B 三个小型 dense 模型,以及 41B active、675B total 参数的 MoE 模型 Mistral Large 3,全部以 Apache 2.0 license 发布。
推荐理由:原文同时交代模型规模、开源许可、压缩格式和上线渠道,便于比较前沿与端侧模型的部署取舍。