ElevenLabs
ElevenLabsは、表現力豊かなテキスト読み上げ、多言語ナレーション、対話生成、ボイスデザイン、テキストからの効果音生成まで手がける、AI音声分野を代表するモデルファミリーです。Astorieでは、ノードベースのオーディオワークフローの中でEleven v3、Multilingual v2、Turbo v2.5、Dialogue v3、Sound Effects v2を利用できます。
Eleven v3はElevenLabsの最新表現力特化型音声合成モデルで、感情表現、インライン音声タグ、70以上の言語をまたぐ自然な複数話者の対話生成のために設計されています。Multilingual v2は、長尺ナレーション、企業向けボイスオーバー、eラーニングなど、最大限の表現力よりも一貫性を重視するプロジェクトに向いた安定した選択肢です。Flash v2.5はElevenLabsが現在推奨する低遅延モデルですが、Astorieでは既存ワークフローとの互換性のためTurbo v2.5も引き続き利用できます。ElevenLabsによれば、Turbo v2.5はFlash v2.5と機能的に同等で、通常はFlashの方が遅延が低い程度の違いとのことです。Sound Effects v2は公式のeleven_text_to_sound_v2モデルを使用し、風切り音、環境音、UI音、衝撃音、シームレスループ、仕上げ用の音響ディテールを生成します。Astorie上ではこれらのオーディオノードを動画・画像・脚本ノードと接続できるため、シーンの下書きからナレーション生成、効果音の追加まで、制作全体を1つのグラフの中で完結できます。
| Variant | Description |
|---|---|
| ElevenLabs TTS Eleven v3 | プロバイダーモデルeleven_v3による高表現力TTS。音声タグ、感情表現、70以上の言語に対応し、1リクエストあたり5,000文字まで対応します。 |
| ElevenLabs Dialogue Eleven v3 | 自然な会話、キャラクター同士のやり取り、ドラマ調の朗読、台本形式のやり取りに対応する複数話者対話モードです。 |
| ElevenLabs TTS Multilingual v2 | ナレーション、eラーニング、企業向け動画、長尺音声向けの安定した高品質多言語TTSで、29言語に対応します。 |
| ElevenLabs TTS Turbo v2.5 | 既存ワークフロー向けに提供され続けている低遅延の多言語TTSです。ElevenLabsは現在、低遅延用途としてより新しいFlash v2.5を推奨しています。 |
| ElevenLabs Sound Effects v2 | eleven_text_to_sound_v2によるテキストから音への生成機能で、環境音、衝撃音、転換音、UIフィードバック音、ループ、シネマティックなレイヤー音に対応します。 |
Connect ElevenLabs with video, image, script, and music nodes on Astorie's infinite canvas. No GPU required — start free.
Get Started Free表現力のある演技や対話が重要な場合はEleven v3、安定した長尺ナレーションにはMultilingual v2、既存の低遅延Astorieワークフローとの互換性が必要な場合はTurbo v2.5、ナレーション以外の制作用音声にはSound Effects v2を使用してください。
対応しています。Eleven v3は感情・演技・非言語的な反応を表すインライン音声タグに対応しており、ElevenLabsは自然な複数話者音声を生成するための対話用エンドポイントも提供しています。
いいえ。Flashの方が通常は遅延が低いため、ElevenLabsは新規の低遅延用途ではTurbo v2.5よりFlash v2.5を推奨しています。Astorieでは、既にTurbo v2.5に依存しているワークフローのために引き続き利用可能にしています。