Google DeepMind 发布 Gemini 3.8 Flash 和 3.8 Flash Cyber
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,面向智能体工作流、编码推理和网络安全任务。
推荐理由:原文同时披露通用版与安全版的定价、访问范围和评测结果,便于比较部署取舍。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,面向智能体工作流、编码推理和网络安全任务。
推荐理由:原文同时披露通用版与安全版的定价、访问范围和评测结果,便于比较部署取舍。
IBM 发布 Granite 4.2 推理 LLM 家族,包含 3B、8B、30B 三种 dense decoder-only 模型,并以 Apache 2.0 许可证开放。
推荐理由:文章拆解了 Granite 4.2 从预训练到多阶段 RL 的流程,便于比较开源推理模型的训练取舍。
Liquid AI 发布 LFM2.5 系列 3 个模型的 DSpark draft model checkpoints,为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 增加投机解码路径。
Google DeepMind 发布 Gemini 3.7 Flash,称其是面向编码和 AI 智能体的最智能主力模型,并较 Gemini 3.6 Flash 改进软件工程、知识工作和 Web 开发工作流。
推荐理由:原文同时给出相对 3.6 Flash 的基准差距与阶段性价格,便于评估编码智能体成本。
Google DeepMind 推出 DiffusionGemma,这是一个实验性开放文本扩散模型,在专用 GPU 上文本生成最高快 4x,用于探索速度敏感的交互式本地工作流。
推荐理由:原文清楚交代了扩散式文本生成的速度收益、硬件条件和质量取舍,便于评估本地交互场景适配度。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一次主要版本,将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力整合到一个模型中。
推荐理由:原文列出架构、上下文和部署入口,可比较开放 MoE 模型在推理与多模态任务中的取舍。
Mistral AI 发布 Mistral 3,包括 14B、8B、3B 三个小型 dense 模型,以及 41B active、675B total 参数的 MoE 模型 Mistral Large 3,全部以 Apache 2.0 license 发布。
推荐理由:原文同时交代模型规模、开源许可、压缩格式和上线渠道,便于比较前沿与端侧模型的部署取舍。
OpenAI 在 API 平台推出面向开发者的 GPT-5,提供高推理性能和新的开发者控制项。OpenAI 称其在真实编码任务上取得同类最佳结果。
推荐理由:原文直接给出开发者 API 的能力侧重点,可用于了解 GPT-5 面向编码场景的定位。
GPT-5 System Card 解释了统一模型路由系统如何通过 gpt-5-main、gpt-5-thinking 和 gpt-5-thinking-nano 等轻量版本提供快速且智能的响应。不同版本针对不同任务和开发者用途优化。
推荐理由:材料概述了 GPT-5 的模型路由组成和轻量版本定位,便于理解不同任务下的响应分工。
OpenAI 介绍了 gpt-oss-120b 和 gpt-oss-20b 两个开放权重推理模型。它们根据 Apache 2.0 许可证和 OpenAI 的 gpt-oss 使用政策提供。
推荐理由:材料说明两款开放权重推理模型的许可方式和使用政策,可用于判断后续复用边界和部署选择。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b,两款开放权重语言模型采用 Apache 2.0 license。它们强调低成本的现实表现,在推理任务上优于同等规模开放模型,具备较强工具使用能力,并针对消费级硬件高效部署优化。
推荐理由:原文同时给出开源许可、低成本部署和推理表现,便于比较开放权重模型取向。
OpenAI 发布 o3 和 o4-mini,称其为迄今最聪明、能力最强的模型,并具备完整工具访问能力。Feed 仅提供摘要,未包含更多功能、评测或开放细节。
推荐理由:原文虽为摘要,但交代了 o3 与 o4-mini 的定位和完整工具访问这一核心变化。
OpenAI o3 和 o4-mini System Card 称,两款模型结合了 state-of-the-art 推理与完整工具能力。材料列出的工具包括 web browsing、Python、图像和文件分析、图像生成、canvas、automations、file search 和 memory。
推荐理由:材料列出 o3 与 o4-mini 的推理和工具能力范围,便于了解官方对模型定位的表述。
OpenAI o3-mini 系统卡概述了该模型的安全工作,涵盖安全评估、外部红队测试和 Preparedness Framework 评估。