ElevenLabs

ElevenLabs

ElevenLabsは、表現力豊かなテキスト読み上げ、多言語ナレーション、対話生成、ボイスデザイン、テキストからの効果音生成まで手がける、AI音声分野を代表するモデルファミリーです。Astorieでは、ノードベースのオーディオワークフローの中でEleven v3、Multilingual v2、Turbo v2.5、Dialogue v3、Sound Effects v2を利用できます。

Eleven v3はElevenLabsの最新表現力特化型音声合成モデルで、感情表現、インライン音声タグ、70以上の言語をまたぐ自然な複数話者の対話生成のために設計されています。Multilingual v2は、長尺ナレーション、企業向けボイスオーバー、eラーニングなど、最大限の表現力よりも一貫性を重視するプロジェクトに向いた安定した選択肢です。Flash v2.5はElevenLabsが現在推奨する低遅延モデルですが、Astorieでは既存ワークフローとの互換性のためTurbo v2.5も引き続き利用できます。ElevenLabsによれば、Turbo v2.5はFlash v2.5と機能的に同等で、通常はFlashの方が遅延が低い程度の違いとのことです。Sound Effects v2は公式のeleven_text_to_sound_v2モデルを使用し、風切り音、環境音、UI音、衝撃音、シームレスループ、仕上げ用の音響ディテールを生成します。Astorie上ではこれらのオーディオノードを動画・画像・脚本ノードと接続できるため、シーンの下書きからナレーション生成、効果音の追加まで、制作全体を1つのグラフの中で完結できます。

ElevenLabs Variants

VariantDescription
ElevenLabs TTS Eleven v3プロバイダーモデルeleven_v3による高表現力TTS。音声タグ、感情表現、70以上の言語に対応し、1リクエストあたり5,000文字まで対応します。
ElevenLabs Dialogue Eleven v3自然な会話、キャラクター同士のやり取り、ドラマ調の朗読、台本形式のやり取りに対応する複数話者対話モードです。
ElevenLabs TTS Multilingual v2ナレーション、eラーニング、企業向け動画、長尺音声向けの安定した高品質多言語TTSで、29言語に対応します。
ElevenLabs TTS Turbo v2.5既存ワークフロー向けに提供され続けている低遅延の多言語TTSです。ElevenLabsは現在、低遅延用途としてより新しいFlash v2.5を推奨しています。
ElevenLabs Sound Effects v2eleven_text_to_sound_v2によるテキストから音への生成機能で、環境音、衝撃音、転換音、UIフィードバック音、ループ、シネマティックなレイヤー音に対応します。

Capabilities

Text-to-Speech
Dialogue
Sound Effects
Voice Cloning
Music Generation
Multilingual

Best For

  • 感情表現を作り込んだキャラクターボイス
  • 複数話者の対話、台本のあるシーン、オーディオドラマ
  • 声の一貫性が求められる長尺ナレーション
  • 既存のTurboワークフローに対応した高速な多言語音声生成
  • 動画・ゲーム・SNS向けショート動画のためのテキスト生成効果音

Strengths

  • Eleven v3は、感情や演技の方向性、笑い声やため息といった非言語的な反応までインライン音声タグで指定できます。
  • Eleven v3の対話ワークフローにより、自然な複数話者の会話を生成できます。
  • Multilingual v2は、安定した長尺ナレーションや数字の多いコンテンツに強みがあります。
  • 音声クローン、ボイスデザイン、豊富なプリセットボイスを備えた大規模な音声エコシステムを持っています。
  • Sound Effects v2は、ナレーション以外の制作用音声ニーズにも対応します。

Limitations

  • Eleven v3はv2.5やFlash系モデルに比べて出力にばらつきがあり遅延も大きいため、リアルタイムエージェント用途には向いていません。
  • 新規に低遅延用途を検討する場合、ElevenLabsはTurbo v2.5よりFlash v2.5を推奨しています。
  • Eleven v3は1リクエストあたりの文字数上限がMultilingual v2やFlash v2.5より低いため、長い文章は分割が必要になる場合があります。
  • 効果音の品質は、タイミング・質感・強度・環境を具体的に記述したプロンプトに大きく左右されます。

Tips & Best Practices

演技の質にこだわりたいときはEleven v3を使いましょう。[whispers]、[laughs]、[sighs]、[excited]のような短いタグを、影響させたい語句の近くに追加します。
オーディオブック、ブランドナレーション、研修動画など、長い文章全体で安定した話し方が必要な場合はMultilingual v2を使いましょう。
既存のAstorieワークフローとの互換性を保つならTurbo v2.5のままで問題ありませんが、Astorie外で新しくリアルタイム音声プロダクトを構築する場合はFlash v2.5の採用を検討してください。
対話を作る際は話者の交代を明確に書き、各セリフは簡潔にまとめましょう。感情タグは局所的かつ控えめに使うほど効果的です。
効果音を作る際は、音源・動作・空間・距離・強度を具体的に描写しましょう。「door sound」よりも「close metallic door slam in a narrow concrete hallway, short reverb」のような描写の方が高品質な結果につながります。

Use ElevenLabs on Astorie

Connect ElevenLabs with video, image, script, and music nodes on Astorie's infinite canvas. No GPU required — start free.

Get Started Free

Frequently Asked Questions

Astorieでは、どのElevenLabsモデルを使えばいいですか?

表現力のある演技や対話が重要な場合はEleven v3、安定した長尺ナレーションにはMultilingual v2、既存の低遅延Astorieワークフローとの互換性が必要な場合はTurbo v2.5、ナレーション以外の制作用音声にはSound Effects v2を使用してください。

Eleven v3は感情タグや複数話者に対応していますか?

対応しています。Eleven v3は感情・演技・非言語的な反応を表すインライン音声タグに対応しており、ElevenLabsは自然な複数話者音声を生成するための対話用エンドポイントも提供しています。

Turbo v2.5は今でもElevenLabsの最新の低遅延モデルですか?

いいえ。Flashの方が通常は遅延が低いため、ElevenLabsは新規の低遅延用途ではTurbo v2.5よりFlash v2.5を推奨しています。Astorieでは、既にTurbo v2.5に依存しているワークフローのために引き続き利用可能にしています。

Related Features

How-To Guides

Related Reading

Related Audio Models

Back to All Audio Models