Fish Audio
Fish Audio S2-Proは、自然な音声生成、自由記述型の感情タグ、複数話者対話、音声クローン、80以上の言語に対応するFish Audioの次世代高表現力テキスト読み上げモデルです。
Fish Audioは現在、新規プロジェクトにs2-proを推奨しています。S2-Proは[whispers sweetly]や[laughing nervously]のような自然言語の角括弧表記による制御に対応し、複数話者対話をサポート、80以上の言語をカバーし、最初の音声が届くまでの時間は100msを目標としています。さらにオープンソースのSGLangベースの配信スタックも提供されています。前世代のs1モデルも既存の統合向けに引き続き利用可能で、括弧記法による感情表現の構文に依存するワークフローでは今でも有用です。AstorieのSEOページ上では、Fish AudioはElevenLabsやMinimax Speechなど他のTTSシステムと比較するための高表現力な音声基盤モデルという位置づけです。別途ランタイム統合を追加しない限り、Astorieの実際の生成メニューには組み込まれていません。
| Variant | Description |
|---|---|
| Fish Audio S2-Pro | 角括弧形式の自然言語制御、複数話者対話、80以上の言語対応、オープンソース配信を備えた、現在推奨されているモデルです。 |
| Fish Audio S1 | 括弧記法による感情制御に対応した、40億パラメータの旧世代モデルです。既存の統合向けに提供が続けられています。 |
Connect Fish Audio S2 with video, image, script, and music nodes on Astorie's infinite canvas. No GPU required — start free.
Get Started FreeFish Audioは現在、新規プロジェクトにs2-proを推奨しています。s2-proは自然言語による角括弧制御、複数話者対話、80以上の言語対応、短い初回音声応答時間、オープンソースの配信スタックを備えています。s1は既存の統合向けに引き続き利用可能です。
このページはSEO・比較用のページです。今回の変更でFish AudioがAstorieの本番の音声生成メニューに追加されるわけではありません。それには別途、ランタイム側のプロバイダー統合、課金、UIコントロール、webhook処理の実装が必要です。
Fish Audio S2はオープンソースでの配信、柔軟な角括弧形式の制御、セルフホスティングの選択肢を重視しています。一方ElevenLabsは、成熟したホスティング型の音声エコシステム、Eleven v3の表現力、Multilingual v2の安定性、テキストからの効果音生成を強みとしています。