跳到正文
原文
Mistral AI·· 2026-03-24精选AI 评分64

Mistral AI 发布 Voxtral TTS 语音生成模型

Speaking of Voxtral

AI 导读

Mistral AI 发布其首个文本转语音模型 Voxtral TTS,4B 参数,支持 9 种语言。人类评测显示自然度优于 ElevenLabs v2.5 Flash、与 ElevenLabs v3 质量相当;模型延迟 70ms,10 秒参考音频即可克隆声音,支持零样本跨语言语音适配,可通过 API 使用($0.016 per 1k characters),并提供带参考声音的开放权重版本。

推荐理由

官方给出人评对比、延迟数字和架构细节,读者可据此评估其语音智能体场景的可用性。

来源:Mistral AI · mistral.ai