Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线
AWS 宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 可用,定位为更智能、更高效的 Sonnet 模型,适合聚焦编码和知识工作。
推荐理由:原文同时给出 Bedrock 调用方式和适用场景,便于评估 Sonnet 5.5 在 AWS 工作流中的落地成本。
AWS 宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 可用,定位为更智能、更高效的 Sonnet 模型,适合聚焦编码和知识工作。
推荐理由:原文同时给出 Bedrock 调用方式和适用场景,便于评估 Sonnet 5.5 在 AWS 工作流中的落地成本。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,面向智能体工作流、编码推理和网络安全任务。
推荐理由:原文同时披露通用版与安全版的定价、访问范围和评测结果,便于比较部署取舍。
IBM 发布 Granite 4.2 推理 LLM 家族,包含 3B、8B、30B 三种 dense decoder-only 模型,并以 Apache 2.0 许可证开放。
推荐理由:文章拆解了 Granite 4.2 从预训练到多阶段 RL 的流程,便于比较开源推理模型的训练取舍。
Google DeepMind 发布 Gemini 3.7 Flash,称其是面向编码和 AI 智能体的最智能主力模型,并较 Gemini 3.6 Flash 改进软件工程、知识工作和 Web 开发工作流。
推荐理由:原文同时给出相对 3.6 Flash 的基准差距与阶段性价格,便于评估编码智能体成本。
Meta 发布 Muse Glimmer-30B,这是从 Muse 蒸馏到 30B 参数的开源多模态模型,面向本地智能体用例并采用 Apache 2.0 license。
推荐理由:原文同时给出架构、基准和本地部署示例,便于比较开源多模态模型在本地智能体场景的工程落地路径。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,面向规模化 AI 智能体提供更高 token 效率、更低延迟和更可靠性能。
推荐理由:原文同时给出价格、token效率和基准差异,便于比较Flash系列在智能体工作流中的取舍。
Google DeepMind 推出 Gemini 3.5 Flash Cyber,这是一款基于 3.5 Flash 微调的轻量级网络安全模型,用于快速查找、验证和修补漏洞。
推荐理由:原文披露了受限开放方式、基准对比和内部落地案例,可帮助判断安全模型在漏洞修复流程中的应用边界。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一次主要版本,将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力整合到一个模型中。
推荐理由:原文列出架构、上下文和部署入口,可比较开放 MoE 模型在推理与多模态任务中的取舍。
Mistral AI 发布 Leanstral,这是面向 Lean 4 的开源代码 Agent,权重采用 Apache 2.0 许可,并可在 Mistral Vibe、free/near-free API endpoint labs-leanstral-2603 和自托管方式使用。
推荐理由:原文包含开放方式、FLTEval 对比和案例,便于评估形式化证明编码场景的成本与表现。
Mistral AI 发布 Devstral 2 编码模型家族,包括 Devstral 2 (123B) 和 Devstral Small 2 (24B),并推出面向 Devstral 的开源命令行编码助手 Mistral Vibe CLI。
推荐理由:材料同时给出参数规模、SWE-bench 成绩、部署门槛和 CLI 入口,便于比较开源编码模型的落地成本。
OpenAI 在 GPT-5 system card 附录中介绍新模型 GPT-5-Codex,这是一个为 Codex 中智能体编码进一步优化的 GPT-5 版本。GPT-5-Codex 会根据任务复杂度更动态地调整思考投入,对简单对话查询或小任务快速响应,对更复杂任务则独立工作更久。
推荐理由:原文说明了 GPT-5-Codex 面向 Codex 中智能体编码的优化方向,可用于了解其任务复杂度适配思路。
OpenAI 在 API 平台推出面向开发者的 GPT-5,提供高推理性能和新的开发者控制项。OpenAI 称其在真实编码任务上取得同类最佳结果。
推荐理由:原文直接给出开发者 API 的能力侧重点,可用于了解 GPT-5 面向编码场景的定位。
GPT-5 在编程和设计场景中被定位为可解锁新可能的模型。原文仅点明 coding and design 方向,未给出具体功能、benchmark 分数、价格或可用性信息。
OpenAI 推出 GPT-5,称其为迄今最好的 AI 系统。OpenAI 表示,GPT-5 相比其以往所有模型在智能上有显著提升,在编码、数学、写作、健康、视觉感知等方面具备先进性能。
推荐理由:原文列出 GPT-5 相比既有模型的覆盖领域,便于快速把握 OpenAI 对本代模型的定位。
OpenAI 发布 o3 和 o4-mini 系统卡的 Codex 补充说明,介绍 Codex 是云端编码智能体。Codex 由 codex-1 驱动,codex-1 是针对软件工程优化的 OpenAI o3 版本。codex-1 使用强化学习在多种环境中的真实编码任务上训练,可生成接近人类风格和 PR 偏好的代码,遵循指令,并迭代运行测试直到通过。
推荐理由:材料交代了 Codex 与 codex-1 的关系,并说明训练如何面向真实软件工程任务与测试循环。
OpenAI 在 API 中推出 GPT-4.1,这是一个新的模型家族,在编码、指令遵循和长上下文理解方面都有改进。OpenAI 同时发布其 nano 模型,今天起向全球开发者开放。
推荐理由:摘要点明了编码、指令遵循和长上下文三项改进,可用于判断 API 迁移关注点。
Code Llama 是围绕编码能力的 Llama 2 相关模型。材料抓取失败,仅有 Hugging Face Blog 标题“Code Llama: Llama 2 learns to code”可用。