overview
Voiceboxとは?
Voiceboxは、開発者によって開発されたAI音声スタジオツールであり、開発者、コンテンツクリエーター、アクセシビリティユーザーが音声をクローンし、音声を生成し、システム全体でディクテーションできるようにします。ユーザーのマシン上で完全に動作し、データプライバシーを確保し、サブスクリプション料金を不要にします。Voicebox.shは、MetaのVoicebox生成AIモデルとは異なり、ローカルでの操作、プライバシー、ユーザーコントロールを重視した包括的なAI音声スタジオとして機能します。その主要な機能には、最小限のオーディオからの音声生成とクローニング、7つの異なるText-to-Speech (TTS) エンジン(例:Qwen3-TTS、LuxTTS、HumeAI TADA)を使用した23言語での音声生成、およびグローバルホットキーを介した任意のテキストフィールドへのシステム全体のディクテーションが含まれます。このプラットフォームには、トランスクリプトの洗練のためのバンドルされたローカルLarge Language Model (LLM) も組み込まれており、クロスリンガルスタイル転送をサポートしているため、ユーザーはクローンされた音声でサポートされている任意の言語を話すことができます。
