关于 VibeVoice

VibeVoice 是一个致力于推动语音合成技术发展的开源社区。我们的目标是让高质量、长篇幅、多角色的语音生成变得触手可及。

🔓

开源开放

我们相信开源的力量,致力于构建一个透明、协作的社区。MIT/Apache 许可证让每个人都能自由使用。

🚀

技术创新

不断探索 LLM 和 Diffusion 模型在语音领域的应用边界,推动语音合成技术的发展。

👥

社区驱动

倾听用户的声音,与开发者共同成长,打造更好的语音生成工具。

关于项目

VibeVoice 由微软亚洲研究院开发,是一个基于 next-token diffusion 机制的语音生成模型。它能够生成长达 90 分钟的高质量音频,支持最多 4 位说话人的自然对话。

该项目的核心创新在于将大语言模型(LLM)的上下文理解能力与扩散模型(Diffusion)的高保真音频生成能力相结合,实现了前所未有的语音自然度和表现力。

我们的目标是让播客、有声书、视频配音等内容创作变得更加简单和高效,让每个人都能轻松创建专业级的语音内容。