Fish Audio

Fish Audio S2

Fish Audio S2-Proは、自然な音声生成、自由記述型の感情タグ、複数話者対話、音声クローン、80以上の言語に対応するFish Audioの次世代高表現力テキスト読み上げモデルです。

Fish Audioは現在、新規プロジェクトにs2-proを推奨しています。S2-Proは[whispers sweetly]や[laughing nervously]のような自然言語の角括弧表記による制御に対応し、複数話者対話をサポート、80以上の言語をカバーし、最初の音声が届くまでの時間は100msを目標としています。さらにオープンソースのSGLangベースの配信スタックも提供されています。前世代のs1モデルも既存の統合向けに引き続き利用可能で、括弧記法による感情表現の構文に依存するワークフローでは今でも有用です。AstorieのSEOページ上では、Fish AudioはElevenLabsやMinimax Speechなど他のTTSシステムと比較するための高表現力な音声基盤モデルという位置づけです。別途ランタイム統合を追加しない限り、Astorieの実際の生成メニューには組み込まれていません。

Fish Audio S2 Variants

VariantDescription
Fish Audio S2-Pro角括弧形式の自然言語制御、複数話者対話、80以上の言語対応、オープンソース配信を備えた、現在推奨されているモデルです。
Fish Audio S1括弧記法による感情制御に対応した、40億パラメータの旧世代モデルです。既存の統合向けに提供が続けられています。

Capabilities

Text-to-Speech
Dialogue
Sound Effects
Voice Cloning
Music Generation
Multilingual

Best For

  • 自然言語による感情・演技指示を反映した高表現力のボイスオーバー
  • 複数話者対話やキャラクター音声のプロトタイプ制作
  • オープンソースでの配信やファインチューニングを求める開発者
  • 参照音声を直接指定する音声クローンのワークフロー
  • 幅広い言語をカバーする多言語音声の実験

Strengths

  • S2-Proは、Fish Audioが新規プロジェクト向けに現在推奨しているモデルです。
  • 自由記述型の角括弧制御は、固定された感情トークンのリストよりも柔軟です。
  • Fish Audio TTS APIにおいて、複数話者対話に対応するのはS2-Proのみです。
  • 80以上の言語に対応し、言語の自動判定も可能です。
  • モデルと配信スタックがオープンソースであるため、自前でホスティングできるチームにとってはベンダーロックインを抑えられます。

Limitations

  • 本番用のランタイム統合が追加されるまで、Astorie上のFish AudioはSEO目的の掲載にとどまります。
  • S2-ProはS1と異なる角括弧構文を使用するため、従来の括弧形式のプロンプトは書き換えが必要になる場合があります。
  • セルフホスティングやファインチューニングには、インフラと音声エンジニアリングの工数が必要です。
  • 音声品質は、明瞭な参照音声・正確な書き起こし・プロンプトの精度に依然として左右されます。

Tips & Best Practices

新しいFish Audioプロジェクトにはs2-proを使用し、s1は旧来のプロンプトや互換性テスト用に残しておきましょう。
角括弧タグは局所的に使いましょう。[whispering]、[pause]、[laughing nervously]などのタグは、演技を変化させたい箇所に正確に配置します。
対話を作る際は話者タグを明示し、素早く確認・再生成できる程度に各ターンを短く保ちましょう。
音声をクローンする際は、プロンプトのスタイルを調整する前に、書き起こしと一致するクリーンな参照音声を用意しましょう。
表現力のある対話が必要な場合はEleven v3と、長尺での安定性が必要な場合はMultilingual v2とFish Audioを比較してみてください。

Use Fish Audio S2 on Astorie

Connect Fish Audio S2 with video, image, script, and music nodes on Astorie's infinite canvas. No GPU required — start free.

Get Started Free

Frequently Asked Questions

Fish Audioの最新TTSモデルは何ですか?

Fish Audioは現在、新規プロジェクトにs2-proを推奨しています。s2-proは自然言語による角括弧制御、複数話者対話、80以上の言語対応、短い初回音声応答時間、オープンソースの配信スタックを備えています。s1は既存の統合向けに引き続き利用可能です。

Fish Audio S2はAstorieの生成モデルとして利用できますか?

このページはSEO・比較用のページです。今回の変更でFish AudioがAstorieの本番の音声生成メニューに追加されるわけではありません。それには別途、ランタイム側のプロバイダー統合、課金、UIコントロール、webhook処理の実装が必要です。

Fish AudioはElevenLabsとどう違うのですか?

Fish Audio S2はオープンソースでの配信、柔軟な角括弧形式の制御、セルフホスティングの選択肢を重視しています。一方ElevenLabsは、成熟したホスティング型の音声エコシステム、Eleven v3の表現力、Multilingual v2の安定性、テキストからの効果音生成を強みとしています。

Related Features

How-To Guides

Related Reading

Related Audio Models

Back to All Audio Models