← 返回工具
VibeVoice

VibeVoice

已验证

用于对话音频和播客生成的开源多说话人 TTS。

功能

前沿的开源文本转语音模型

概述

VibeVoice 是由微软亚洲研究院通用人工智能团队设计的一个新颖框架,用于从文本生成富有表现力的、长格式的、多说话人的对话音频。它解决了传统 TTS 中的关键挑战,包括可扩展性、说话人一致性以及自然的轮流发言,使其非常适合制作播客风格的内容和其他对话驱动的音频。

核心功能

  • 多说话人生成: 创建具有多个不同说话人的音频,每个说话人在长序列中保持一致的音色。
  • 超低帧率分词器: 使用以 7.5 Hz 运行的连续语音分词器(声学和语义),极大地提高了计算效率,同时不牺牲音频保真度。
  • 长格式合成: 处理扩展的音频生成,可实现完整的播客剧集或长篇叙述。
  • 自然轮流发言: 模拟具有适当停顿和说话人转换的真实对话流程。
  • 开源且可自托管: 完整的代码、模型权重和工具在 GitHub 和 Hugging Face 上可用,允许本地部署和定制。

使用场景

  • 播客和音频节目: 从文本脚本自动生成多说话人播客。
  • 有声读物旁白: 为小说和非小说作品用不同的角色声音赋予故事生命。
  • 对话式 AI: 用更自然的语音为聊天机器人和虚拟助手提供语音界面。
  • 内容创作: 以最少的工作量制作旁白、解说视频和教育材料。

定价

VibeVoice 完全免费且开源。您可以克隆仓库,下载模型,并在自己的基础设施上免费运行。请务必查看具体的开源许可证,了解任何再分发要求。

Frequently Asked Questions

Summarized from the official site: https://microsoft.github.io/VibeVoice

VibeVoice 是免费的吗?

是的,VibeVoice 完全免费且开源。您可以克隆仓库,下载模型,并在自己的基础设施上免费运行。

VibeVoice 是什么?

VibeVoice 是由微软亚洲研究院开发的一个开源文本转语音框架,用于生成富有表现力的、长格式的、多说话人的对话音频。

VibeVoice 是开源的吗?

是的,VibeVoice 完全开源,其代码、模型权重和工具在 GitHub 和 Hugging Face 上可用。请注意查看具体的开源许可证以了解任何再分发要求。

VibeVoice 可以用来制作播客吗?

可以,VibeVoice 非常适合从文本脚本自动生成多说话人的播客音频。它支持长格式合成并保持不同说话人音色的一致性。

VibeVoice 能够生成多个不同说话人的对话音频吗?

是的,VibeVoice 支持多说话人生成,能够模拟具有自然轮流发言和适当停顿的真实对话流程。

相关工具

Open-Generative-AI

Open-Generative-AI

已验证

一个免费、可自托管的 AI 工作室,内置 200 多个无审查的视频和图像模型。

Open Sourceaivideoimageself-hosted
ECC

ECC

已验证

使用这款开源框架优化并保护您的 AI 编程助手安全。

Open SourceAutomationaiagentdeveloper-tools
Amazon Polly

Amazon Polly

已验证

基于云端的文本转语音服务,提供47种自然语音。

aitext-to-speechaudioaws