Fish Audio
Fish Audio S2-Pro는 자연스러운 음성 생성, 개방형 감정 태그, 다중 화자 대화, 보이스 클로닝, 80개 이상 언어 워크플로우를 지원하는 Fish Audio의 차세대 고표현력 TTS 모델입니다.
Fish Audio는 현재 신규 프로젝트에 s2-pro를 권장합니다. S2-Pro는 [whispers sweetly]나 [laughing nervously]처럼 자연어 대괄호로 감정을 제어할 수 있고, 다중 화자 대화를 지원하며, 80개 이상의 언어를 다루고, 최초 오디오 응답까지 100ms를 목표로 하며, 오픈소스 SGLang 기반 서빙 스택과 함께 제공됩니다. 이전 버전인 s1은 기존 통합 환경을 위해 계속 제공되며, 괄호 기반 감정 문법에 의존하는 워크플로우에는 여전히 유용합니다. Astorie의 SEO 페이지에서 Fish Audio는 ElevenLabs, Minimax Speech 등 다른 TTS 시스템과 비교할 수 있는 고표현력 음성 파운데이션 모델로 소개됩니다. 별도의 런타임 통합이 추가되지 않는 한 Astorie의 정식 생성 메뉴에는 연결되어 있지 않습니다.
| Variant | Description |
|---|---|
| Fish Audio S2-Pro | 대괄호 스타일의 자연어 제어, 다중 화자 대화, 80개 이상 언어, 오픈소스 서빙을 갖춘 현재 권장 모델입니다. |
| Fish Audio S1 | 괄호 기반 감정 제어를 지원하는 이전 세대 4B 파라미터 모델로, 기존 통합 환경을 위해 유지됩니다. |
Connect Fish Audio S2 with video, image, script, and music nodes on Astorie's infinite canvas. No GPU required — start free.
Get Started FreeFish Audio는 현재 신규 프로젝트에 s2-pro를 권장합니다. 자연어 대괄호 감정 제어, 다중 화자 대화, 80개 이상 언어, 짧은 최초 오디오 응답 시간, 오픈소스 서빙 스택을 갖추고 있습니다. S1은 기존 통합 환경을 위해 계속 제공됩니다.
이 페이지는 SEO 및 비교용 페이지입니다. 이번 변경만으로는 Fish Audio가 Astorie의 정식 오디오 생성 메뉴에 추가되지 않습니다. 실제로 사용하려면 별도의 런타임 provider 통합, 결제 처리, UI 구성, 웹훅 처리가 필요합니다.
Fish Audio S2는 오픈소스 서빙, 유연한 대괄호 스타일 제어, 자체 호스팅 옵션을 강점으로 내세웁니다. ElevenLabs는 성숙한 호스팅형 음성 생태계, Eleven v3의 표현력, Multilingual v2의 안정성, 텍스트 기반 효과음 기능을 강점으로 합니다.