OpenAI 在 API 中推出下一代音频模型
OpenAI 在 API 中推出下一代音频模型,开发者可以指示文本转语音模型按特定方式说话。示例包括让模型“像有同理心的客服智能体一样说话”,用于提升语音智能体的定制能力。
推荐理由:原文给出文本转语音可控表达的新用法,适合关注语音智能体定制能力的开发者参考。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
OpenAI 在 API 中推出下一代音频模型,开发者可以指示文本转语音模型按特定方式说话。示例包括让模型“像有同理心的客服智能体一样说话”,用于提升语音智能体的定制能力。
推荐理由:原文给出文本转语音可控表达的新用法,适合关注语音智能体定制能力的开发者参考。
OpenAI 发布 GPT-4.5 研究预览版,称其为该公司迄今规模最大、知识最丰富的模型。
推荐理由:材料说明 GPT-4.5 以研究预览形式发布,可用于了解 OpenAI 对新模型的定位。
OpenAI 的视频生成模型 Sora 现已可在 sora.com 使用,用户可生成最高 1080p、最长 20 sec 的视频。Sora 支持宽屏、竖屏或方形画幅,可使用自有素材进行扩展、remix 和 blend,也可从文本生成全新内容。
推荐理由:原文给出 Sora 的开放入口、分辨率、时长和画幅信息,可帮助视频生成用户评估适用场景。
Code Llama 是围绕编码能力的 Llama 2 相关模型。材料抓取失败,仅有 Hugging Face Blog 标题“Code Llama: Llama 2 learns to code”可用。