亚马逊祭出10亿参数BASE TTS

admin1 • 2024年 2月 21日 pm5:01 • Amazon

　　伴随着生成式深度学习模型的飞速发展，自然语言处理（NLP）和计算机视觉（CV）已经经历了根本性的转变，从有监督训练的专门模型，转变为只需有限的明确指令就能完成各种任务的通用模型。

　　在语音处理和文本到语音（TTS）领域，这样的转变也正在发生，模型能够利用数千小时的数据，使合成结果越来越接近类人语音。

　　在最近的一项研究中，亚马逊跨境电商正式推出了 BASE TTS，将 TTS 模型的参数规模提升到了前所未有的 10 亿级别。

　　BASE TTS 是一个多语言、多说话人的大型 TTS（LTTS）系统，在约 10 万小时的公共领域语音数据上进行了训练，比此前的训练数据量最高者 VALL-E 翻了一番。受 LLM 成功经验的启发，BASE TTS 将 TTS 视为下一个 token 预测的问题。这种方法通常与大量训练数据结合使用，以实现强大的多语言和多说话人能力。

THE END

二维码

亚马逊配送费怎么算？自发货一单运费多少钱？

< <上一篇

亚马逊运营专员靠谱吗？亚马逊运营岗位怎么样？

下一篇>>

CorePress

搜索内容

亚马逊祭出10亿参数BASE TTS

取消回复

共有 0 条评论

最新文章

热门标签