Simon Willison 回顾 2026 年以来 LLM 的编码智能体、安全事件与本地模型进展
Simon Willison 发布 WeAreDevelopers World Congress North America 闭幕 keynote 的注释版幻灯片和讲稿,按时间线回顾 2026 年以来 LLM 的关键趋势。
Simon Willison 发布 WeAreDevelopers World Congress North America 闭幕 keynote 的注释版幻灯片和讲稿,按时间线回顾 2026 年以来 LLM 的关键趋势。
OpenAI 用新的真实世界测试方法评估 ChatGPT 的政治偏见,以提高客观性并减少偏见。评估重点包括定义政治偏见,并检验 LLM 在真实场景中的表现。
OpenAI 发布 2025 年 10 月报告,说明其如何检测并打击 AI 恶意使用。报告涵盖应对滥用、执行政策以及保护用户免受现实伤害的措施。
OpenAI 推出可在 ChatGPT 内直接对话的新一代应用,并发布新的 Apps SDK。开发者可以从今天开始使用处于 preview 状态的 Apps SDK 构建这些应用。
推荐理由:原文同时给出 ChatGPT 内应用形态和 Apps SDK 预览状态,便于开发者判断接入时机。
AMD 与 OpenAI 宣布一项多年期合作,将部署 6 gigawatts 的 AMD Instinct GPUs,用于支持 OpenAI 下一代 AI 基础设施。部署将从 2026 年的 1 gigawatt 开始,目标是加速全球 AI 创新。
推荐理由:原文给出部署规模和起始时间,可用于观察 OpenAI 下一代 AI 基础设施的算力布局。
OpenAI 和 Allied for Startups 发布 Hacktivate AI 报告,提出 20 项可执行政策思路,以加速欧洲 AI 采用。报告目标包括提升竞争力并赋能创新者。
OpenAI 发布 AgentKit、扩展的 evals 能力和面向智能体的 reinforcement fine-tuning,帮助开发者更快从原型走向生产。
推荐理由:原文概括了 AgentKit、evals 扩展和智能体 RFT,可用于了解 OpenAI 面向开发者的工具组合变化。
Wrtn 借助 GPT-5 将 AI 应用扩展至韩国 6.5M 用户,打造融合生产力、创意与学习的“Lifestyle AI”。该产品现正向东亚其他市场扩张。
OpenAI 与日本数字厅达成合作,将推动生成式 AI 在公共服务中的应用,支持国际 AI 治理,并促进安全、可信的 AI 在全球范围内采用。
Samsung 和 SK 加入 OpenAI 的 Stargate 计划,目标是扩大全球 AI 基础设施。该合作将扩大先进存储芯片生产,并在韩国建设下一代数据中心。
推荐理由:原文说明了 OpenAI 与韩国芯片和数据中心伙伴的合作方向,可作为观察 AI 基础设施扩张的背景。
OpenAI 封禁了使用 AI 支持恶意软件开发、调试、钓鱼和凭据盗取工作流的韩语账号。
OpenAI 封禁了一批利用 AI 支持钓鱼和脚本工作流的账户。这些活动与公开报道的威胁组织存在重叠,并显示出与 PRC 情报需求一致的特征。
OpenAI 封禁了与 PRC 相关的账号,称这些账号使用 AI 支持监控相关规划、定向画像,以及对批评者和其他个人的研究。原文链接为 https://openai.com/index/disrupting-malicious-uses-of-ai-prc-linked-abuse,feed 未提供完整正文。
推荐理由:材料展示了 OpenAI 对涉监控规划和定向画像滥用的处置范围,可作为理解平台治理边界的背景。
OpenAI 封禁了与其称为 Nine-emdash Line 的一个此前未公开的中国来源行动相关的账号。这些账号使用 AI 创建有关南海、香港和美国政治的区域影响内容。
推荐理由:材料说明了 OpenAI 对区域影响行动相关账号的处置,可作为观察 AI 滥用治理的具体案例。
OpenAI 封禁了与俄罗斯源头“Stop News”行动相关的账号,这些账号使用 AI 生成重复违规的影响力内容,目标指向非洲和英国。
OpenAI 封禁了与网络诈骗网络相关的账号,这些账号利用 AI 支持诈骗话术、冒充、翻译和受害者互动。
OpenAI 介绍了 Sora 2,这是一款支持同步对白和音效的视频生成模型。材料同时说明,Sora 产品已不再可用。
推荐理由:原文只给出同步对白、音效和产品不可用信息,适合把握 Sora 2 发布的基本边界。
OpenAI 发布 Sora 2 System Card,称 Sora 2 是新的 SOTA 视频和音频生成模型。该模型基于 Sora,引入更准确的物理、更清晰的真实感、同步音频、增强可控性和扩展的风格范围。
推荐理由:原文概括了 Sora 2 相比前代在物理、真实感、同步音频和可控性上的变化。
OpenAI 使用 AI 增强支持服务,以缩短响应时间、提升质量,并在高速增长中扩展支持能力。该内容聚焦 OpenAI 在支持流程中的 AI 应用。
OpenAI 推出新系列 OpenAI on OpenAI,分享其如何依靠自身技术简化工作、扩展专业能力并推动成果。该系列旨在为其他组织提供可借鉴的经验。
OpenAI 构建了内部 AI 销售助手,用于自动化账户研究、会议准备、产品知识和客户跟进,以提升销售效率与客户成功。
OpenAI 的研究助手帮助团队分析数百万张支持工单,更快发现洞察,并在公司内部扩展探索问题的能力。
OpenAI 构建了一个系统,用于快速提取合同数据,缩短处理周转时间。该系统让团队更容易访问所需的合同细节。
OpenAI 正在推出家长控制和新的家长资源页,帮助家庭指导 ChatGPT 在家中的使用方式。feed 未提供完整正文。
OpenAI 在 ChatGPT 中推出 Buy it in ChatGPT,包含 Instant Checkout 和 Agentic Commerce Protocol,称这是迈向 ChatGPT 智能体商务的第一步。它希望让用户、AI 智能体和企业以新的方式共同购物。
推荐理由:原文给出 Instant Checkout 与 Agentic Commerce Protocol,可作为观察 ChatGPT 商务化入口的线索。
OpenAI 与 AARP 合作,通过 OpenAI Academy 和 OATS 的 Senior Planet 项目帮助老年人提升网络安全。合作内容包括新的 AI 培训、诈骗识别工具和面向全美的项目。
OpenAI 宣布 ChatGPT 增加更多与团队和工具协作的方式,包括新的 shared projects、更智能的 connectors,以及合规和安全更新。官方摘要称,这些更新帮助团队完成更多工作,feed 未提供完整正文。
OpenAI 今天向移动端 Pro 用户发布 ChatGPT Pulse 预览版,这是一种由 ChatGPT 主动研究并提供个性化更新的新体验。Pulse 会基于用户的聊天、反馈以及日历等已连接应用生成更新。
推荐理由:原文说明 Pulse 会基于聊天、反馈和连接应用主动整理个性化更新,便于理解 ChatGPT 移动端体验变化。
ENEOS Materials 使用 ChatGPT Enterprise 加速研究、提升工厂设计安全性,并将 HR 分析时间缩短 90%。同时,80% 的使用者表示工作流程得到改善。
SAP 与 OpenAI 推出 OpenAI for Germany,这是一项 2026 年合作,面向德国公共部门提供安全、主权 AI。该合作旨在支持更安全、高效的公共服务。
SchoolAI 使用 GPT-4.1、图像生成和 TTS,为超过 100 万间教室提供安全、由教师引导的 AI 工具。该平台用于提升学生参与度、教师监督能力和个性化学习体验。
OpenAI 与 NVIDIA 宣布战略合作,将部署由 NVIDIA 系统驱动的 10 gigawatts AI 数据中心。第一阶段计划于 2026 年启动。
推荐理由:原文给出合作规模和首阶段时间,可作为观察大模型基础设施扩张节奏的背景。
Apollo Research 和 OpenAI 开发了针对 AI 模型隐藏错位即 scheming 的评估,并在受控测试中发现前沿模型存在与 scheming 一致的行为。团队分享了具体示例,以及一种早期降低 scheming 方法的压力测试。
推荐理由:材料展示了针对隐藏错位的评估与压力测试,可作为理解安全评测设计的案例。
OpenAI 阐述其在青少年使用 AI 时平衡安全、自由与隐私的思路。内容聚焦青少年安全保护、使用自主性与隐私之间的取舍。
OpenAI 正在为 ChatGPT 构建年龄预测和家长控制,以提供更安全、适合青少年的体验。相关工具旨在支持家庭管理青少年使用 ChatGPT。
OpenAI 宣布 Codex 升级,称其速度更快、可靠性更高,并改进了实时协作和独立处理任务的能力。Codex 可在终端、IDE、网页或手机等开发场景中使用。
推荐理由:原文概括了 Codex 在速度、可靠性和协作上的升级,并列出终端、IDE、网页和手机等入口。
OpenAI 的一项最大规模 ChatGPT 使用研究显示,ChatGPT 正通过个人和专业场景创造经济价值。其采用范围正从早期用户扩展到更广泛人群,缩小使用差距,并成为日常生活的一部分。
OpenAI 在 GPT-5 system card 附录中介绍新模型 GPT-5-Codex,这是一个为 Codex 中智能体编码进一步优化的 GPT-5 版本。GPT-5-Codex 会根据任务复杂度更动态地调整思考投入,对简单对话查询或小任务快速响应,对更复杂任务则独立工作更久。
推荐理由:原文说明了 GPT-5-Codex 面向 Codex 中智能体编码的优化方向,可用于了解其任务复杂度适配思路。
OpenAI 披露了与 US CAISI、UK AISI 的合作进展,目标是加强 AI 安全与安全防护,构建更安全的 AI 系统。
OpenAI 与 Microsoft 签署新的 MOU,强化双方合作以及对 AI 安全和创新的共同承诺。声明未披露 MOU 的具体条款、产品或模型更新。