跳到正文

#语音

今日 0 条
8月11日周二
6月9日周二
3月24日周二
  1. Mistral AI74

    Mistral AI 发布 Voxtral TTS 4B 文本转语音模型,支持 9 种语言

    Mistral AI 发布 Voxtral TTS,这是其首个文本转语音模型,参数量 4B,支持 9 种语言的多语言语音生成。该模型支持情绪表达、低延迟、语音适配和 zero-shot 跨语言语音适配,典型输入 10 秒语音样本和 500 字符时模型延迟为 70ms,RTF ≈9.7x。

    推荐理由:原文同时给出语言覆盖、延迟、价格、架构细节与适用场景,便于评估企业语音工作流的接入成本。

2月5日周四
9月30日周二
8月28日周四
3月20日周四
  1. OpenAI News69

    OpenAI 在 API 中推出下一代音频模型

    OpenAI 在 API 中推出下一代音频模型,开发者可以指示文本转语音模型按特定方式说话。示例包括让模型“像有同理心的客服智能体一样说话”,用于提升语音智能体的定制能力。

    推荐理由:原文给出文本转语音可控表达的新用法,适合关注语音智能体定制能力的开发者参考。