OpenAI 发布 o3 和 o4-mini
OpenAI 发布 o3 和 o4-mini,称其为迄今最聪明、能力最强的模型,并具备完整工具访问能力。Feed 仅提供摘要,未包含更多功能、评测或开放细节。
推荐理由:原文虽为摘要,但交代了 o3 与 o4-mini 的定位和完整工具访问这一核心变化。
OpenAI 发布 o3 和 o4-mini,称其为迄今最聪明、能力最强的模型,并具备完整工具访问能力。Feed 仅提供摘要,未包含更多功能、评测或开放细节。
推荐理由:原文虽为摘要,但交代了 o3 与 o4-mini 的定位和完整工具访问这一核心变化。
OpenAI o3 和 o4-mini System Card 称,两款模型结合了 state-of-the-art 推理与完整工具能力。材料列出的工具包括 web browsing、Python、图像和文件分析、图像生成、canvas、automations、file search 和 memory。
推荐理由:材料列出 o3 与 o4-mini 的推理和工具能力范围,便于了解官方对模型定位的表述。
OpenAI 在 API 中推出 GPT-4.1,这是一个新的模型家族,在编码、指令遵循和长上下文理解方面都有改进。OpenAI 同时发布其 nano 模型,今天起向全球开发者开放。
推荐理由:摘要点明了编码、指令遵循和长上下文三项改进,可用于判断 API 迁移关注点。
OpenAI 在 2025 launch 中为 GPT‑4o 引入原生图像生成,包括更强的文本渲染和指令跟随能力。原文还提到可探索 ChatGPT Images 2.5。
推荐理由:原文概括了 GPT‑4o 图像生成的能力重点,可作为了解文本渲染和指令跟随改进的入口。
OpenAI 在 API 中推出下一代音频模型,开发者可以指示文本转语音模型按特定方式说话。示例包括让模型“像有同理心的客服智能体一样说话”,用于提升语音智能体的定制能力。
推荐理由:原文给出文本转语音可控表达的新用法,适合关注语音智能体定制能力的开发者参考。
OpenAI 发布 GPT-4.5 研究预览版,称其为该公司迄今规模最大、知识最丰富的模型。
推荐理由:材料说明 GPT-4.5 以研究预览形式发布,可用于了解 OpenAI 对新模型的定位。
OpenAI 的视频生成模型 Sora 现已可在 sora.com 使用,用户可生成最高 1080p、最长 20 sec 的视频。Sora 支持宽屏、竖屏或方形画幅,可使用自有素材进行扩展、remix 和 blend,也可从文本生成全新内容。
推荐理由:原文给出 Sora 的开放入口、分辨率、时长和画幅信息,可帮助视频生成用户评估适用场景。
Code Llama 是围绕编码能力的 Llama 2 相关模型。材料抓取失败,仅有 Hugging Face Blog 标题“Code Llama: Llama 2 learns to code”可用。
Hugging Face Blog 介绍 IDEFICS,这是一个对 SOTA 视觉语言模型的开放复现项目。材料抓取失败,仅标题可用。