Fish Audio

Fish Audio S2

Fish Audio S2-Pro는 자연스러운 음성 생성, 개방형 감정 태그, 다중 화자 대화, 보이스 클로닝, 80개 이상 언어 워크플로우를 지원하는 Fish Audio의 차세대 고표현력 TTS 모델입니다.

Fish Audio는 현재 신규 프로젝트에 s2-pro를 권장합니다. S2-Pro는 [whispers sweetly]나 [laughing nervously]처럼 자연어 대괄호로 감정을 제어할 수 있고, 다중 화자 대화를 지원하며, 80개 이상의 언어를 다루고, 최초 오디오 응답까지 100ms를 목표로 하며, 오픈소스 SGLang 기반 서빙 스택과 함께 제공됩니다. 이전 버전인 s1은 기존 통합 환경을 위해 계속 제공되며, 괄호 기반 감정 문법에 의존하는 워크플로우에는 여전히 유용합니다. Astorie의 SEO 페이지에서 Fish Audio는 ElevenLabs, Minimax Speech 등 다른 TTS 시스템과 비교할 수 있는 고표현력 음성 파운데이션 모델로 소개됩니다. 별도의 런타임 통합이 추가되지 않는 한 Astorie의 정식 생성 메뉴에는 연결되어 있지 않습니다.

Fish Audio S2 Variants

VariantDescription
Fish Audio S2-Pro대괄호 스타일의 자연어 제어, 다중 화자 대화, 80개 이상 언어, 오픈소스 서빙을 갖춘 현재 권장 모델입니다.
Fish Audio S1괄호 기반 감정 제어를 지원하는 이전 세대 4B 파라미터 모델로, 기존 통합 환경을 위해 유지됩니다.

Capabilities

Text-to-Speech
Dialogue
Sound Effects
Voice Cloning
Music Generation
Multilingual

Best For

  • 자연어 감정·연기 큐를 담은 표현력 있는 보이스오버
  • 다중 화자 대화와 캐릭터 오디오 프로토타입
  • 오픈소스 서빙과 파인튜닝 옵션이 필요한 개발자
  • 직접 참조 음성이 필요한 보이스 클로닝 워크플로우
  • 폭넓은 언어를 아우르는 다국어 오디오 실험

Strengths

  • S2-Pro는 Fish Audio가 신규 프로젝트에 권장하는 현재 모델입니다
  • 개방형 대괄호 제어는 고정된 감정 토큰 목록보다 훨씬 유연합니다
  • 다중 화자 대화는 Fish Audio TTS API 중 S2-Pro에서만 지원합니다
  • 자동 언어 감지 기능을 갖춘 80개 이상 언어 지원
  • 오픈소스 모델과 서빙 스택 덕분에 자체 호스팅이 가능한 팀은 벤더 종속을 줄일 수 있습니다

Limitations

  • 정식 런타임 통합이 추가되기 전까지 Fish Audio는 Astorie에서 SEO 콘텐츠 용도로만 존재합니다
  • S2-Pro는 S1과 다른 대괄호 문법을 사용하므로 기존 괄호 기반 프롬프트는 다시 작성해야 할 수 있습니다
  • 자체 호스팅과 파인튜닝에는 인프라 구축과 오디오 엔지니어링 역량이 필요합니다
  • 음성 품질은 여전히 명확한 참조 음성과 정확한 대본, 체계적인 프롬프트 작성에 좌우됩니다

Tips & Best Practices

새 Fish Audio 프로젝트에는 s2-pro를 사용하고, s1은 레거시 프롬프트나 호환성 테스트용으로 남겨두세요.
대괄호 큐는 국소적으로 사용하세요. [whispering], [pause], [laughing nervously] 같은 태그는 연기가 바뀌어야 하는 정확한 위치에 넣습니다.
대화를 만들 때는 화자 태그를 명확히 표시하고, 빠르게 확인하고 재생성할 수 있도록 각 대사를 짧게 유지하세요.
음성을 복제할 때는 프롬프트 스타일을 다듬기 전에 먼저 깨끗한 참조 오디오와 정확히 일치하는 대본을 준비하세요.
표현력 있는 대화가 필요하면 Fish Audio를 Eleven v3와, 장편 안정성이 필요하면 Multilingual v2와 비교해 보세요.

Use Fish Audio S2 on Astorie

Connect Fish Audio S2 with video, image, script, and music nodes on Astorie's infinite canvas. No GPU required — start free.

Get Started Free

Frequently Asked Questions

Fish Audio의 최신 TTS 모델은 무엇인가요?

Fish Audio는 현재 신규 프로젝트에 s2-pro를 권장합니다. 자연어 대괄호 감정 제어, 다중 화자 대화, 80개 이상 언어, 짧은 최초 오디오 응답 시간, 오픈소스 서빙 스택을 갖추고 있습니다. S1은 기존 통합 환경을 위해 계속 제공됩니다.

Fish Audio S2를 Astorie에서 바로 생성에 사용할 수 있나요?

이 페이지는 SEO 및 비교용 페이지입니다. 이번 변경만으로는 Fish Audio가 Astorie의 정식 오디오 생성 메뉴에 추가되지 않습니다. 실제로 사용하려면 별도의 런타임 provider 통합, 결제 처리, UI 구성, 웹훅 처리가 필요합니다.

Fish Audio는 ElevenLabs와 어떻게 다른가요?

Fish Audio S2는 오픈소스 서빙, 유연한 대괄호 스타일 제어, 자체 호스팅 옵션을 강점으로 내세웁니다. ElevenLabs는 성숙한 호스팅형 음성 생태계, Eleven v3의 표현력, Multilingual v2의 안정성, 텍스트 기반 효과음 기능을 강점으로 합니다.

Related Features

How-To Guides

Related Reading

Related Audio Models

Back to All Audio Models