Tencent

HunyuanVideo-Foley

HunyuanVideo-Foley(Hunyuan Foley 또는 Hunyuan Video Foley로도 표기)는 Tencent의 비디오-투-오디오 폴리 모델로, 무음 클립을 분석해 발소리, 충돌음, 문 닫는 소리, 환경음 같은 동기화된 효과음을 화면 속 동작에 맞춰 생성합니다. 비디오는 생성하지 않으며, 어떤 소스의 영상이든 빠져 있는 사운드트랙을 채워 넣습니다. Astorie에서는 Hunyuan Foley를 무한 캔버스 위의 노드 하나로 실행하며, 50개 이상의 이미지·비디오·오디오 모델과 나란히 사용한 다음 믹스해 타임라인으로 내보낼 수 있습니다.

HunyuanVideo-Foley는 AI 비디오 제작에서 가장 큰 공백, 즉 무음 클립 문제를 해결합니다. Sora 2, Kling, Seedance, Veo를 비롯한 대부분의 텍스트-투-비디오와 이미지-투-비디오 모델은 화면은 아름답지만 소리가 없는 영상을 만들어내기 때문에, 결국 별도의 NLE에서 발소리와 환경음 하나하나를 직접 디자인해야 했습니다. Hunyuan Video Foley는 이 공백을 자동으로 메워줍니다. 어떤 비디오든 입력하면 모델이 시각적 내용을 프레임 단위로 분석해 소리가 나는 이벤트를 인식하고, 각 효과음이 그것을 유발한 동작에 정확히 맞춰떨어지는 오디오 트랙을 만들어냅니다. 시간적 정렬을 이해하기 때문에 자갈을 밟는 발, 테이블에 내려놓는 유리잔, 창문에 떨어지는 빗소리 모두 어긋남 없이 정확한 프레임에서 소리가 납니다. 2026년 기준으로 Tencent의 연구는 HunyuanVideo-Foley를 다양한 장면에서 강력한 시청각 동기화를 갖춘 고품질 전문가급 폴리를 위해 학습된 텍스트-비디오-투-오디오 시스템으로 소개하고 있습니다. Astorie에서는 그래서 파이프라인의 자연스러운 마지막 단계가 됩니다. 비디오를 생성하거나 업로드해 Hunyuan Foley 노드에 연결하면, 소리를 하나도 직접 녹음하지 않고도 완성된 시청각 에셋을 얻을 수 있습니다. 텍스트 설명으로 오디오를 만드는 ElevenLabs Sound Effects v2 같은 프롬프트 기반 효과음 생성기와 달리, Hunyuan Foley는 화면에서 직접 소리를 이끌어내기 때문에 원래는 직접 글로 묘사해야 했을 움직임과 타이밍까지 그대로 포착합니다. 같은 무음 클립을 Hunyuan Foley와 음악·환경음 모델에 동시에 팬아웃해 모든 결과물을 버전 트레이에 보관하고, 편집에 가장 잘 맞는 믹스를 고를 수 있습니다.

Illustrative sample: a HunyuanVideo-Foley node on the Astorie canvas adding synchronized footstep and ambience audio to a silent AI-generated video clip, with the generated waveform aligned to on-screen action.
Illustrative sample — representative output, not a verbatim model render

Capabilities

Text-to-Video
Image-to-Video
Video-to-Video
Reference Images
End Frame
Storyboard
Audio-Driven

Supported Aspect Ratios

16:99:161:14:33:4

Best For

  • AI로 생성한 무음 비디오 클립에 동기화된 소리 추가
  • 숏폼과 소셜 비디오를 위한 후반 작업 폴리
  • 완전한 사운드 디자인 작업 전 빠른 오디오 프로토타이핑
  • 수동 폴리 녹음 없이 시청각 에셋 완성

Strengths

  • 화면 속 이벤트와 오디오의 정밀한 시간 정렬
  • 텍스트 프롬프트가 아니라 화면 자체에서 소리를 도출
  • 발소리, 충돌음, 환경음 등 폭넓은 소리 카테고리 이해
  • 수동 폴리 녹음과 음향 라이브러리 검색이 필요 없음
  • 어떤 소스나 생성 모델의 비디오에도 사용 가능

Limitations

  • 비디오는 생성하지 않으며, 기존 영상에 대한 오디오만 출력
  • 겹치는 이벤트가 많은 복잡한 사운드스케이프에서는 정밀도가 떨어질 수 있음
  • 생성된 오디오는 믹스된 트랙으로, 개별 편집 가능한 스템이 아님
  • 가장 좋은 결과를 얻으려면 클립에 소리를 내는 동작이 명확하게 보여야 함

Tips & Best Practices

HunyuanVideo-Foley는 마지막 단계로 사용하세요 — 먼저 비디오를 생성하거나 확정한 다음 오디오를 추가하세요.
가장 정확한 폴리 동기화를 위해 소스 영상의 움직임을 명확하고 뚜렷하게 유지하세요.
생성 전에 클립에 충돌, 움직임, 상호작용 같은 소리를 내는 이벤트가 잘 보이는지 확인하세요.
완전한 사운드 디자인을 원한다면 폴리 트랙 아래에 음악이나 환경음 모델을 겹친 다음, NLE로 내보내기 전에 캔버스에서 믹스하세요.

Use HunyuanVideo-Foley on Astorie

Connect HunyuanVideo-Foley with other AI models on Astorie's infinite canvas. No GPU required — start free.

Get Started Free

Frequently Asked Questions

HunyuanVideo-Foley는 어디에 사용하나요?

HunyuanVideo-Foley는 무음 비디오에 발소리, 충돌음, 문 닫는 소리, 환경음 같은 동기화된 효과음과 폴리 사운드를 추가하는 데 사용합니다. 기존 클립을 입력하면 화면 속 동작에 맞춰 타이밍이 맞는 오디오 트랙을 생성해, AI로 생성했거나 업로드한 영상이 더는 무음 초안처럼 들리지 않게 해줍니다. 비디오를 만드는 것이 아니라 이미 가지고 있는 비디오의 사운드트랙을 만들어줍니다.

폴리(Foley)란 무엇이고, 비디오에서 만드는 AI 효과음이란 무엇인가요?

폴리는 발소리, 옷깃 스치는 소리, 물건을 다루는 소리 같은 일상적인 효과음을 화면과 동기화해 녹음하는 작업으로, 전통적으로는 스튜디오에서 사람이 직접 수행해 왔습니다. 비디오에서 만드는 AI 효과음은 이 과정을 자동화합니다. Hunyuan Foley 같은 비디오-투-오디오 모델이 영상을 분석해 어떤 일이 벌어지는지 인식하고, 각 프레임에 맞춰 정렬된 소리를 만들어내어 수동 녹음과 음향 라이브러리 검색을 대신합니다.

Hunyuan Foley는 비디오를 생성하나요?

아니요. Hunyuan Foley는 오디오만 생성합니다. 기존 클립을 분석해 동기화된 사운드 트랙을 출력하는 비디오-투-오디오 모델이며, 새로운 프레임을 만들지는 않습니다. 화면을 먼저 만들려면 Astorie에서 Sora 2, Kling, Seedance, Veo 같은 텍스트-투-비디오나 이미지-투-비디오 모델과 함께 사용한 다음, 무음 결과물을 Hunyuan Foley 노드로 보내 소리를 입히세요.

HunyuanVideo-Foley는 누가 만들었나요?

HunyuanVideo-Foley는 Tencent가 자사의 Hunyuan 생성 모델 패밀리의 일부로 개발했습니다. 고품질의 전문가급 폴리와 강력한 시청각 동기화에 초점을 맞춘 텍스트-비디오-투-오디오 시스템입니다. Astorie에서는 로컬 설정이나 GPU 관리 없이 표준 노드로 이용할 수 있습니다.

Hunyuan Foley는 ElevenLabs 같은 효과음 생성기와 어떻게 다른가요?

ElevenLabs Sound Effects v2 같은 프롬프트 기반 생성기는 사용자가 작성한 텍스트 설명으로 오디오를 만드는 반면, HunyuanVideo-Foley는 비디오 자체에서 직접 소리를 이끌어내기 때문에 움직임과 타이밍, 이벤트 순서를 자동으로 포착합니다. 2026년 기준으로 실용적인 작업 흐름은 화면에 동기화된 폴리에는 Hunyuan Foley를, 특정한 디자인 효과음에는 프롬프트 기반 생성기를 사용한 다음 캔버스에서 둘을 믹스하는 것입니다.

Astorie에서 AI 비디오에 Hunyuan Foley 오디오는 어떻게 추가하나요?

Astorie에서는 비디오 노드를 HunyuanVideo-Foley 노드에 연결하고 생성하면, 동기화된 오디오가 버전 트레이에 하나의 결과물로 나타납니다. Astorie는 설치나 GPU가 필요 없는 브라우저 기반 노드 캔버스이므로, 같은 무음 클립을 Foley와 음악·환경음 모델에 동시에 팬아웃해 믹스를 비교하고, 완성된 시청각 클립을 NLE 타임라인으로 내보낼 수 있습니다.

HunyuanVideo-Foley는 어떤 종류의 소리를 생성할 수 있나요?

HunyuanVideo-Foley는 화면에 보이는 동작과 연결된 다양한 다이제틱 사운드를 생성합니다. 여러 표면 위의 발소리, 충돌음과 물건을 다루는 소리, 기계음과 문소리, 비나 바람 같은 환경음까지 포함합니다. 클립에 소리를 내는 동작이 명확하게 보일 때 가장 잘 작동하며, 겹치는 이벤트가 매우 많은 밀도 높은 장면에서는 정밀도가 다소 떨어질 수 있습니다.

Related Features

How-To Guides

Related Reading

Related Video Models

Back to All Video Models