跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 21–27 条 · 共 27 条
10月6日周一
10月1日周三
9月22日周一
8月7日周四
  1. OpenAI News77

    GPT-5 System Card 说明统一模型路由系统

    GPT-5 System Card 解释了统一模型路由系统如何通过 gpt-5-main、gpt-5-thinking 和 gpt-5-thinking-nano 等轻量版本提供快速且智能的响应。不同版本针对不同任务和开发者用途优化。

    推荐理由:材料概述了 GPT-5 的模型路由组成和轻量版本定位,便于理解不同任务下的响应分工。

8月5日周二
  1. OpenAI News85

    OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 开放权重语言模型

    OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b,两款开放权重语言模型采用 Apache 2.0 license。它们强调低成本的现实表现,在推理任务上优于同等规模开放模型,具备较强工具使用能力,并针对消费级硬件高效部署优化。

    推荐理由:原文同时给出开源许可、低成本部署和推理表现,便于比较开放权重模型取向。

7月22日周二
  1. OpenAI News69

    OpenAI 与 Oracle 达成 4.5 GW Stargate 数据中心容量合作

    Oracle 与 OpenAI 达成协议,将在美国开发额外 4.5 gigawatts 的 Stargate 数据中心容量。OpenAI 称这项投资将创造新就业、加速美国再工业化,并推进美国 AI 领导地位;这也是 Stargate 这一 OpenAI AI 基础设施平台的重要里程碑。

    推荐理由:原文提供了 Stargate 在美国扩充数据中心容量的规模,可用于了解 OpenAI 基础设施布局。

5月22日周四