NVIDIA Magpie Multilingual TTS 更新开放权重模型,支持 12 种语言和自托管部署
NVIDIA Magpie Multilingual TTS 发布最新开放权重版本,提供 364M 参数模型、NVIDIA NIM 生产部署和 12 种语言支持。
推荐理由:原文把开放权重、NIM 部署和延迟数据放在同一语音流水线中,便于评估自托管方案的取舍。
NVIDIA Magpie Multilingual TTS 发布最新开放权重版本,提供 364M 参数模型、NVIDIA NIM 生产部署和 12 种语言支持。
推荐理由:原文把开放权重、NIM 部署和延迟数据放在同一语音流水线中,便于评估自托管方案的取舍。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是用于实时语音到语音翻译的最新音频模型,可自动检测 70+ 语言并生成自然流畅的译语音频。
推荐理由:原文同时给出语言覆盖、延迟形态和接入渠道,可用于比较实时语音翻译的产品落地路径。
Mistral AI 发布 Voxtral TTS,这是其首个文本转语音模型,参数量 4B,支持 9 种语言的多语言语音生成。该模型支持情绪表达、低延迟、语音适配和 zero-shot 跨语言语音适配,典型输入 10 秒语音样本和 500 字符时模型延迟为 70ms,RTF ≈9.7x。
推荐理由:原文同时给出语言覆盖、延迟、价格、架构细节与适用场景,便于评估企业语音工作流的接入成本。
Mistral AI 发布 Voxtral Transcribe 2,包括用于批量转写的 Voxtral Mini Transcribe V2 和用于实时应用的 Voxtral Realtime,并在 Mistral Studio 推出音频 playground。
推荐理由:原文同时给出延迟、价格、开源权重和多项基准对比,便于评估语音转写在实时与离线场景的部署取舍。
OpenAI 发布 Sora 2 System Card,称 Sora 2 是新的 SOTA 视频和音频生成模型。该模型基于 Sora,引入更准确的物理、更清晰的真实感、同步音频、增强可控性和扩展的风格范围。
推荐理由:原文概括了 Sora 2 相比前代在物理、真实感、同步音频和可控性上的变化。
OpenAI 发布更先进的语音到语音模型 gpt-realtime,并更新 Realtime API。新增 API 能力包括 MCP server 支持、图像输入和 SIP 电话呼叫支持。
推荐理由:原文同时列出语音模型和 Realtime API 能力变化,可用于把握实时语音交互接口的更新方向。
OpenAI 在 API 中推出下一代音频模型,开发者可以指示文本转语音模型按特定方式说话。示例包括让模型“像有同理心的客服智能体一样说话”,用于提升语音智能体的定制能力。
推荐理由:原文给出文本转语音可控表达的新用法,适合关注语音智能体定制能力的开发者参考。