Seed-TTS:字节跳动开发的高质量文本到语音TTS模型

最近,TTS领域爆发了。就在chatTTS开源之后,Byte发布了seed-tts,效果很好。

Seed-TTS,是由字节跳动开发的高质量文本到语音(TTS)模型,Seed-TTS模型能够生成与人类语音几乎没有区别的语音。

作为语音生成的基础模型,Seed-TTS 在语音上下文学习方面表现出色,在说话者相似度和自然度方面的表现在客观和主观评估方面都与真实人类语音相匹配。

Seed-TTS在无需训练的情况下,只需要简短的语音片段即可克隆生成高度自然且富有表现力的语音,可以胜任读小说、配音等任务。

Seed-TTS还提供了对各种语音属性的高级控制能力,包括但不限于情感、语调、说话风格等,还可以通过编辑文本来编辑生成的语音。

Seed-TTS可以修改音频中的内容,同时保持音色、音调和情感不变。

Seed-TTS能进行语速调节,自由控制音频速度。

Seed-TTS 对各种语音属性(例如情感)提供卓越的可控性,并且能够为野外说话者生成高度表现力和多样化的语音。

Seed-TTS.jpeg

此外,我们提出了一种用于语音分解的自蒸馏方法,以及一种强化学习方法来增强模型的鲁棒性、说话人的相似性和可控性。我们还提出了 Seed-TTS 模型的非自回归 (NAR) 变体,名为 Seed-TTS DiT ,它采用完全基于扩散的架构。与之前基于 NAR 的 TTS 系统不同,Seed-TTS DiT 不依赖于预先估计的音素持续时间,并通过端到端处理执行语音生成。我们证明该变体在客观和主观评估中都达到了与基于语言模型的变体相当的性能,并展示了其在语音编辑中的有效性。

论文:https://arxiv.org/abs/2406.02430

收藏
最新工具
法大大iTerms
法大大iTerms

法大大推出的一站式法律AI工作台,基于自研法律大模型的AI智能体...

Relume
Relume

一个通过AI来优化网站设计与搭建流程的平台,可以快速生成网站地图...

Pomelli
Pomelli

Google开发的AI营销工具,主要服务中小商家。你只需要提供企...

Gartic.io
Gartic.io

一个很受欢迎的在线绘画猜词游戏。它把经典的“你画我猜”玩法和多人...

LandPPT
LandPPT

一个基于大语言模型的开源免费AIPPT生成平台,支持将文档内容自...

AppleWalls
AppleWalls

一个免费提供苹果官方内置壁纸下载的网站,包括iPhone、iPa...

Coddy.Tech
Coddy.Tech

一个免费、有趣且实用的编程学习平台。支持学习包括 Python、...

森林电台Tree.FM
森林电台Tree.FM

一个能让你收听世界各地森林声音的网站。通过随机收听功能,你可以沉...

Sweezy Cursors
Sweezy Cursors

一个提供免费鼠标光标​​的网站,支持​​Chrome浏览器​​和...

YumCheck
YumCheck

一款能帮用户解析食品包装上的营养成分标签,评估食品是否健康的免费...