Mistral AI·· 2026-03-24精选AI 评分64
Mistral AI 发布 Voxtral TTS 语音生成模型
Speaking of Voxtral
AI 导读
Mistral AI 发布其首个文本转语音模型 Voxtral TTS,4B 参数,支持 9 种语言。人类评测显示自然度优于 ElevenLabs v2.5 Flash、与 ElevenLabs v3 质量相当;模型延迟 70ms,10 秒参考音频即可克隆声音,支持零样本跨语言语音适配,可通过 API 使用($0.016 per 1k characters),并提供带参考声音的开放权重版本。
推荐理由
官方给出人评对比、延迟数字和架构细节,读者可据此评估其语音智能体场景的可用性。
来源:Mistral AI · mistral.ai