跳到正文

#语音

今日 0 条
9月29日周二
9月24日周四
8月25日周二
  1. Hugging Face Blog79

    Gradio gr.Workflow 支持用画布构建、运行和部署 AI 工作流

    Gradio 的 gr.Workflow 将 AI 应用管线描述为类型化节点图,并提供拖拽画布,让每个节点可运行、中间结果可见。同一图也会成为 REST API,并可一条命令部署到 Hugging Face Spaces。

    推荐理由:原文展示了 gr.Workflow 如何把多步 AI 管线做成可运行画布和 REST API,便于复用到 Gradio 应用。

8月21日周五
  1. Hugging Face Blog69

    Hugging Face 研究如何衡量语音识别中的基准优化

    Hugging Face 的最新研究提出三项测试,用于量化语音识别中的 benchmark optimization 或 benchmaxxing 现象。研究评估了 11 个常用开源 ASR 模型,发现部分高分系统会复现 VoxPopuli English 和 LibriSpeech 的基准转写,即使音频与参考文本矛盾、相关词被静音,或同一音频支持不同书写形式。

    推荐理由:文章用三类探针展示公开语音基准的过拟合迹象,可帮助评估者区分榜单分数与真实转写能力。

8月11日周二
6月9日周二
3月24日周二
  1. Mistral AI74

    Mistral AI 发布 Voxtral TTS 4B 文本转语音模型,支持 9 种语言

    Mistral AI 发布 Voxtral TTS,这是其首个文本转语音模型,参数量 4B,支持 9 种语言的多语言语音生成。该模型支持情绪表达、低延迟、语音适配和 zero-shot 跨语言语音适配,典型输入 10 秒语音样本和 500 字符时模型延迟为 70ms,RTF ≈9.7x。

    推荐理由:原文同时给出语言覆盖、延迟、价格、架构细节与适用场景,便于评估企业语音工作流的接入成本。

2月5日周四