200種類以上の無修正動画・画像モデルを備えた、無料のセルフホスト型AIスタジオ。
最先端のオープンソース テキスト読み上げモデル
VibeVoice は Microsoft Research Asia の GeneralAI グループによる新しいフレームワークで、テキストから表現力豊かな長時間のマルチスピーカー会話音声を生成するために設計されています。従来の TTS が抱える拡張性、話者の一貫性、自然な話者交替といった主要な課題に対処し、ポッドキャスト形式のコンテンツやその他の対話駆動型音声の制作に最適です。
VibeVoice は完全に無料かつオープンソースです。リポジトリをクローンし、モデルをダウンロードして、ご自身のインフラストラクチャ上で無料で実行できます。再配布に関する要件については、特定のオープンソース ライセンスを必ず確認してください。
Summarized from the official site: https://microsoft.github.io/VibeVoice
はい、VibeVoiceは完全に無料で利用できます。ご自身のインフラストラクチャ上でダウンロードして無料で実行することが可能です。
はい、VibeVoiceは完全なオープンソースプロジェクトです。コード、モデルの重み、ツールがGitHubとHugging Faceで公開されています。
VibeVoiceは、テキストから表現力豊かな長時間のマルチスピーカー会話音声を生成するフレームワークです。ポッドキャスト形式のコンテンツや対話駆動型音声の制作に最適化されています。
はい、複数の異なる話者による音声を生成し、各話者の声の一貫性を維持することができます。また、自然な話者交替の間や切り替えもモデル化しています。
はい、テキストスクリプトからマルチスピーカーのポッドキャストを自動生成する用途に対応しています。長時間の音声合成が可能なため、完全なエピソードの制作にも適しています。
200種類以上の無修正動画・画像モデルを備えた、無料のセルフホスト型AIスタジオ。
このオープンソースのハーネスを使用して、AIコーディングエージェントを最適化および保護します。
Stable Diffusion 3.5を使って、テキストから極めてリアルなAI画像を生成します。