Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线
AWS 宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 可用,定位为更智能、更高效的 Sonnet 模型,适合聚焦编码和知识工作。
推荐理由:原文同时给出 Bedrock 调用方式和适用场景,便于评估 Sonnet 5.5 在 AWS 工作流中的落地成本。
AWS 宣布 Claude Sonnet 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 可用,定位为更智能、更高效的 Sonnet 模型,适合聚焦编码和知识工作。
推荐理由:原文同时给出 Bedrock 调用方式和适用场景,便于评估 Sonnet 5.5 在 AWS 工作流中的落地成本。
GitHub 推出 Project HydraFusion 研究预览,在 GitHub Copilot CLI 中通过运行时多模型编排完成编码任务。HydraFusion 面向所有 GitHub Copilot 计划用户开放,可通过 /experimental 使用,并会在 Single、Cascade、Critique 三种执行模式中选择工作流。
推荐理由:原文披露了路由模式、使用入口和三项编码基准结果,可用于比较多模型编排的成本取舍。
GitHub Copilot app 可以在同一项目中同时运行多个独立的智能体会话,并通过 sessions view 管理进度。每个会话可运行在自己的 Git worktree 中,保留各自上下文,切换时不需要重新解释任务。文章用 tailspin-toys 示例演示同时添加 funded sort、做 accessibility review 和运行测试,并建议先尝试并行启动两个小任务。
作者用 TRL 和 OpenEnv 复现了让编码模型写 JavaScript 绘制水彩画的训练流程,并公开了参考池数据集、RL 环境、训练脚本和训练模型。流程让模型通过 p5.brush 生成约 150 行 JavaScript,用 gate、长度、pairwise judge 和 HPSv3 组成奖励,其中参考池包含 178 幅由作者手工评级的模型生成画作。
推荐理由:文章把审美奖励训练拆成数据池、环境、评审模型和成本,适合作为复现同类实验的工程参考。
Google DeepMind 推出 Fairwind Program,向政府、可信合作伙伴和部分 Google Cloud 客户开放先进网络防御能力。该计划将 Gemini 3.8 Flash Cyber 与 CodeMender harness 结合,用于自主发现、验证和修复漏洞,并称可在组织的安全云环境中数分钟生成经验证、可部署的补丁。
推荐理由:材料展示 Google 将 Gemini 网络安全模型与 CodeMender 组合给政府和企业的部署路径,便于观察 AI 防御能力的落地边界。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,面向智能体工作流、编码推理和网络安全任务。
推荐理由:原文同时披露通用版与安全版的定价、访问范围和评测结果,便于比较部署取舍。
IBM 发布 Granite 4.2 推理 LLM 家族,包含 3B、8B、30B 三种 dense decoder-only 模型,并以 Apache 2.0 许可证开放。
推荐理由:文章拆解了 Granite 4.2 从预训练到多阶段 RL 的流程,便于比较开源推理模型的训练取舍。
Hugging Face 提出 Quantization-Aware Healing,将 GPT-OSS 120B 压缩到 60B 并量化为 MXFP4 后,在 9 个 benchmark 中有 7 个超过对应 60B bfloat16 checkpoint。QAH 直接从压缩前原始模型蒸馏,并用分块 KL-divergence loss 支持最长 32k tokens 的 healing。
Google DeepMind 发布 Gemini 3.7 Flash,称其是面向编码和 AI 智能体的最智能主力模型,并较 Gemini 3.6 Flash 改进软件工程、知识工作和 Web 开发工作流。
推荐理由:原文同时给出相对 3.6 Flash 的基准差距与阶段性价格,便于评估编码智能体成本。
Meta 发布 Muse Glimmer-30B,这是从 Muse 蒸馏到 30B 参数的开源多模态模型,面向本地智能体用例并采用 Apache 2.0 license。
推荐理由:原文同时给出架构、基准和本地部署示例,便于比较开源多模态模型在本地智能体场景的工程落地路径。
Microsoft Research 推出 Orchard,一个用于可扩展、低成本 Agentic AI 研究的开源框架,核心是可复用的 Kubernetes 环境服务 Orchard Env。
推荐理由:原文把环境层、训练配方和评测结果放在一起,便于理解开源 Agent 研究中工程成本与复用方式的变化。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,面向规模化 AI 智能体提供更高 token 效率、更低延迟和更可靠性能。
推荐理由:原文同时给出价格、token效率和基准差异,便于比较Flash系列在智能体工作流中的取舍。
Google DeepMind 推出 Gemini 3.5 Flash Cyber,这是一款基于 3.5 Flash 微调的轻量级网络安全模型,用于快速查找、验证和修补漏洞。
推荐理由:原文披露了受限开放方式、基准对比和内部落地案例,可帮助判断安全模型在漏洞修复流程中的应用边界。
Google DeepMind 发布 AI Control Roadmap,用于保护 Google 内部部署的高能力、可能未完全对齐的 AI 智能体。
推荐理由:原文给出从威胁建模到监控拦截的分层方案,可作为评估企业内部智能体安全治理的参考。
Mistral 在 AI Now Summit 2026 公布面向企业和政府的 full-stack AI 方案,包括 Mistral for Industrial Engineering、Vibe 更新和 Les Ulis data center。
Mistral 将 Le Chat 更名并升级为 Vibe,定位为覆盖工作和编码的统一 AI 智能体,原有对话、设置和套餐会迁移。Work Mode 面向企业工具中的多步骤任务,支持知识搜索、数据分析、文档合成、定时任务和可复用技能;Code Mode 可在网页中连接 GitHub、管理项目、启动远程编码会话并推进到 pull request。
推荐理由:原文同时列出工作与编码两条模式,能帮助判断 Vibe 对企业流程和开发协作的覆盖范围。
Mistral AI 发布 Mistral Small 4,这是 Mistral Small 系列的下一次主要版本,将 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力整合到一个模型中。
推荐理由:原文列出架构、上下文和部署入口,可比较开放 MoE 模型在推理与多模态任务中的取舍。
Mistral AI 发布 Leanstral,这是面向 Lean 4 的开源代码 Agent,权重采用 Apache 2.0 许可,并可在 Mistral Vibe、free/near-free API endpoint labs-leanstral-2603 和自托管方式使用。
推荐理由:原文包含开放方式、FLTEval 对比和案例,便于评估形式化证明编码场景的成本与表现。
Mistral AI 构建了一个自动为 Rails 单体应用生成或改进 RSpec 测试的 Agent,可读取源码、验证风格和覆盖率,并在 CI/CD 管道中无人干预运行。
推荐理由:文章拆解了上下文文件、技能分流和验证工具的组合方式,可迁移到代码测试类 Agent 的工程设计。
Mistral 发布 Mistral Vibe 2.0,这是其终端原生编码智能体的一次重大升级,由 Devstral 2 模型家族驱动。新版支持自定义子智能体、多选澄清、slash-command 技能、统一 Agent 模式和自动更新,面向 Le Chat Pro 和 Team 计划开放,支持 PAYG 额外用量或 BYOK。
推荐理由:原文同时说明了新工作流控制、订阅入口和 Devstral 2 API 价格,便于评估团队接入成本。
Mistral AI 发布 Devstral 2 编码模型家族,包括 Devstral 2 (123B) 和 Devstral Small 2 (24B),并推出面向 Devstral 的开源命令行编码助手 Mistral Vibe CLI。
推荐理由:材料同时给出参数规模、SWE-bench 成绩、部署门槛和 CLI 入口,便于比较开源编码模型的落地成本。
OpenAI 宣布 Codex 升级,称其速度更快、可靠性更高,并改进了实时协作和独立处理任务的能力。Codex 可在终端、IDE、网页或手机等开发场景中使用。
推荐理由:原文概括了 Codex 在速度、可靠性和协作上的升级,并列出终端、IDE、网页和手机等入口。
OpenAI 在 GPT-5 system card 附录中介绍新模型 GPT-5-Codex,这是一个为 Codex 中智能体编码进一步优化的 GPT-5 版本。GPT-5-Codex 会根据任务复杂度更动态地调整思考投入,对简单对话查询或小任务快速响应,对更复杂任务则独立工作更久。
推荐理由:原文说明了 GPT-5-Codex 面向 Codex 中智能体编码的优化方向,可用于了解其任务复杂度适配思路。
OpenAI 在 API 平台推出面向开发者的 GPT-5,提供高推理性能和新的开发者控制项。OpenAI 称其在真实编码任务上取得同类最佳结果。
推荐理由:原文直接给出开发者 API 的能力侧重点,可用于了解 GPT-5 面向编码场景的定位。
GPT-5 在编程和设计场景中被定位为可解锁新可能的模型。原文仅点明 coding and design 方向,未给出具体功能、benchmark 分数、价格或可用性信息。
OpenAI 推出 GPT-5,称其为迄今最好的 AI 系统。OpenAI 表示,GPT-5 相比其以往所有模型在智能上有显著提升,在编码、数学、写作、健康、视觉感知等方面具备先进性能。
推荐理由:原文列出 GPT-5 相比既有模型的覆盖领域,便于快速把握 OpenAI 对本代模型的定位。
Cursor 使用 GPT-5 是核心内容,正文仅说明可了解 Cursor 如何使用 GPT-5,未提供版本细节、性能数字或可用性信息。
OpenAI 发布 ChatGPT agent System Card,称其智能体模型结合研究、浏览器自动化和代码工具,并在 Preparedness Framework 下配套防护措施。
推荐理由:材料概括了 ChatGPT agent 的工具范围和安全框架,可作为理解其风险边界的入口。
CodeRabbit 使用 OpenAI 的 o3、o4-mini 和 GPT-4.1 改进代码审查,提升准确性并加快 PR 合并。该方案帮助开发者减少 bug、更快交付代码,并提高 ROI。
OpenAI 发布 o3 和 o4-mini 系统卡的 Codex 补充说明,介绍 Codex 是云端编码智能体。Codex 由 codex-1 驱动,codex-1 是针对软件工程优化的 OpenAI o3 版本。codex-1 使用强化学习在多种环境中的真实编码任务上训练,可生成接近人类风格和 PR 偏好的代码,遵循指令,并迭代运行测试直到通过。
推荐理由:材料交代了 Codex 与 codex-1 的关系,并说明训练如何面向真实软件工程任务与测试循环。
OpenAI 在 API 中推出 GPT-4.1,这是一个新的模型家族,在编码、指令遵循和长上下文理解方面都有改进。OpenAI 同时发布其 nano 模型,今天起向全球开发者开放。
推荐理由:摘要点明了编码、指令遵循和长上下文三项改进,可用于判断 API 迁移关注点。
使用 OpenAI 可将工程周期加速 20%。原文未提及具体模型、功能或适用场景。
OpenAI 推出 SWE-Lancer benchmark,用于评估前沿 LLMs 能否通过真实世界自由职业软件工程任务赚取 $1 million。该 benchmark 聚焦软件工程能力与现实任务表现。
Code Llama 是围绕编码能力的 Llama 2 相关模型。材料抓取失败,仅有 Hugging Face Blog 标题“Code Llama: Llama 2 learns to code”可用。