Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线
AWS 宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 可用,定位为更智能、更高效的 Sonnet 模型,适合聚焦编码和知识工作。
推荐理由:原文同时给出 Bedrock 调用方式和适用场景,便于评估 Sonnet 5.5 在 AWS 工作流中的落地成本。
AWS 宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 可用,定位为更智能、更高效的 Sonnet 模型,适合聚焦编码和知识工作。
推荐理由:原文同时给出 Bedrock 调用方式和适用场景,便于评估 Sonnet 5.5 在 AWS 工作流中的落地成本。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,面向智能体工作流、编码推理和网络安全任务。
推荐理由:原文同时披露通用版与安全版的定价、访问范围和评测结果,便于比较部署取舍。
IBM 发布 Granite 4.2 推理 LLM 家族,包含 3B、8B、30B 三种 dense decoder-only 模型,并以 Apache 2.0 许可证开放。
推荐理由:文章拆解了 Granite 4.2 从预训练到多阶段 RL 的流程,便于比较开源推理模型的训练取舍。
Liquid AI 发布 LFM2.5 系列 3 个模型的 DSpark draft model checkpoints,为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 增加投机解码路径。
Google DeepMind 发布 Gemini 3.7 Flash,称其是面向编码和 AI 智能体的最智能主力模型,并较 Gemini 3.6 Flash 改进软件工程、知识工作和 Web 开发工作流。
推荐理由:原文同时给出相对 3.6 Flash 的基准差距与阶段性价格,便于评估编码智能体成本。
NVIDIA Magpie Multilingual TTS 发布最新开放权重版本,提供 364M 参数模型、NVIDIA NIM 生产部署和 12 种语言支持。
推荐理由:原文把开放权重、NIM 部署和延迟数据放在同一语音流水线中,便于评估自托管方案的取舍。
Meta 发布 Muse Glimmer-30B,这是从 Muse 蒸馏到 30B 参数的开源多模态模型,面向本地智能体用例并采用 Apache 2.0 license。
推荐理由:原文同时给出架构、基准和本地部署示例,便于比较开源多模态模型在本地智能体场景的工程落地路径。
Google DeepMind 发布 Gemini Robotics ER 2,称其为面向机器人的最强“具身推理”模型,用于视频理解、任务编排和多机器人协作。
推荐理由:原文同时给出开放入口、机器人协作示例和安全评测维度,便于理解具身模型在真实任务中的落地路径。
Google DeepMind 发布 Gemini Robotics 2,包括 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2 三个模型,面向机器人全身控制、双手或夹爪灵巧操作和多机器人协作。
推荐理由:原文同时列出云端、端侧和安全评测细节,可用于理解机器人模型从演示走向部署的路径。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,面向规模化 AI 智能体提供更高 token 效率、更低延迟和更可靠性能。
推荐理由:原文同时给出价格、token效率和基准差异,便于比较Flash系列在智能体工作流中的取舍。
Google DeepMind 推出 Gemini 3.5 Flash Cyber,这是一款基于 3.5 Flash 微调的轻量级网络安全模型,用于快速查找、验证和修补漏洞。
推荐理由:原文披露了受限开放方式、基准对比和内部落地案例,可帮助判断安全模型在漏洞修复流程中的应用边界。
Mistral 发布 Mistral OCR 4,文档解析会在提取文本外返回边界框、块类型分类和按页、按词的内联置信度分数。该模型支持 170 种语言、可在单个容器中自托管,并可作为企业搜索、RAG 和特定领域检索管线的摄取组件。
推荐理由:原文同时给出结构化输出、部署形态和价格,可用于评估文档解析接入RAG与企业搜索的成本。
Mistral AI 发布 Voxtral TTS,这是其首个文本转语音模型,参数量 4B,支持 9 种语言的多语言语音生成。该模型支持情绪表达、低延迟、语音适配和 zero-shot 跨语言语音适配,典型输入 10 秒语音样本和 500 字符时模型延迟为 70ms,RTF ≈9.7x。
推荐理由:原文同时给出语言覆盖、延迟、价格、架构细节与适用场景,便于评估企业语音工作流的接入成本。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一次主要版本,将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力整合到一个模型中。
推荐理由:原文列出架构、上下文和部署入口,可比较开放 MoE 模型在推理与多模态任务中的取舍。
Mistral AI 发布 Leanstral,这是面向 Lean 4 的开源代码 Agent,权重采用 Apache 2.0 许可,并可在 Mistral Vibe、free/near-free API endpoint labs-leanstral-2603 和自托管方式使用。
推荐理由:原文包含开放方式、FLTEval 对比和案例,便于评估形式化证明编码场景的成本与表现。
Mistral AI 发布 Voxtral Transcribe 2,包括用于批量转写的 Voxtral Mini Transcribe V2 和用于实时应用的 Voxtral Realtime,并在 Mistral Studio 推出音频 playground。
推荐理由:原文同时给出延迟、价格、开源权重和多项基准对比,便于评估语音转写在实时与离线场景的部署取舍。
Mistral AI 发布 Devstral 2 编码模型家族,包括 Devstral 2 (123B) 和 Devstral Small 2 (24B),并推出面向 Devstral 的开源命令行编码助手 Mistral Vibe CLI。
推荐理由:材料同时给出参数规模、SWE-bench 成绩、部署门槛和 CLI 入口,便于比较开源编码模型的落地成本。
OpenAI 在 GPT-5 system card 附录中介绍新模型 GPT-5-Codex,这是一个为 Codex 中智能体编码进一步优化的 GPT-5 版本。GPT-5-Codex 会根据任务复杂度更动态地调整思考投入,对简单对话查询或小任务快速响应,对更复杂任务则独立工作更久。
推荐理由:原文说明了 GPT-5-Codex 面向 Codex 中智能体编码的优化方向,可用于了解其任务复杂度适配思路。
OpenAI 发布 o3 和 o4-mini 系统卡的 Codex 补充说明,介绍 Codex 是云端编码智能体。Codex 由 codex-1 驱动,codex-1 是针对软件工程优化的 OpenAI o3 版本。codex-1 使用强化学习在多种环境中的真实编码任务上训练,可生成接近人类风格和 PR 偏好的代码,遵循指令,并迭代运行测试直到通过。
推荐理由:材料交代了 Codex 与 codex-1 的关系,并说明训练如何面向真实软件工程任务与测试循环。
OpenAI 在 API 中推出下一代音频模型,开发者可以指示文本转语音模型按特定方式说话。示例包括让模型“像有同理心的客服智能体一样说话”,用于提升语音智能体的定制能力。
推荐理由:原文给出文本转语音可控表达的新用法,适合关注语音智能体定制能力的开发者参考。