Tencent

HunyuanVideo-Foley

HunyuanVideo-Foley(Hunyuan FoleyやHunyuan Video Foleyとも表記されます)は、Tencentによる動画から音声を生成するフォーリーモデルです。無声のクリップを解析し、足音・衝突音・ドアの音・環境音といった、画面上のアクションに同期した効果音を生成します。動画は生成せず、あらゆるソースの映像に足りないサウンドトラックを追加します。Astorie上では、Hunyuan Foleyを無限キャンバス上の1つのノードとして、他50以上の画像・動画・音声モデルと並べて実行し、ミックスしてタイムラインに書き出せます。

HunyuanVideo-Foleyは、AI動画制作における最大の課題――無音のクリップ――を埋めます。Sora 2、Kling、Seedance、Veoなど、ほとんどのテキストから動画生成・画像から動画生成モデルは、美しい映像を音声なしで出力するため、足音や環境音のひとつひとつを別のNLEで手作業で作り込む必要がありました。Hunyuan Video Foleyはそのギャップを自動的に埋めます。任意の動画を入力すると、モデルは映像の内容をフレームごとに解析し、音の発生源となる出来事を認識し、それぞれの効果音がその原因となる動作に正確に重なる音声トラックをレンダリングします。時間的な整合性を理解しているため、砂利を踏む足、グラスを置く音、窓を打つ雨音のいずれも、ずれることなく正しいフレームで鳴ります。2026年時点で、Tencentの研究はHunyuanVideo-Foleyを、幅広いシーンにわたって強力な音声・映像の同期を実現する、高忠実度かつプロフェッショナル品質のフォーリー向けに学習された「テキスト・動画から音声への変換」システムと位置づけています。Astorie上では、これが制作パイプラインの自然な最終ステップになります――動画を生成またはアップロードし、Hunyuan Foleyノードに接続するだけで、音を一切録音せずに完全な視聴覚アセットが手に入ります。ElevenLabs Sound Effects v2のような、テキストの説明から音声を組み立てるプロンプト駆動型の効果音ジェネレーターとは異なり、Hunyuan Foleyは画面そのものから直接音を導き出します――そのため、本来なら手作業で記述しなければならない動きとタイミングを自動的に捉えます。同じ無音クリップをHunyuan Foleyと音楽・環境音モデルに同時に流し込み、すべてのテイクをバージョントレイに残して、編集に合うミックスを選ぶこともできます。

Illustrative sample: a HunyuanVideo-Foley node on the Astorie canvas adding synchronized footstep and ambience audio to a silent AI-generated video clip, with the generated waveform aligned to on-screen action.
Illustrative sample — representative output, not a verbatim model render

Capabilities

Text-to-Video
Image-to-Video
Video-to-Video
Reference Images
End Frame
Storyboard
Audio-Driven

Supported Aspect Ratios

16:99:161:14:33:4

Best For

  • AI生成された無声動画クリップへの同期音声の追加
  • ショート動画・SNS動画の後工程フォーリー制作
  • 本格的なサウンドデザイン前の、素早い音声プロトタイピング
  • 手作業でのフォーリー録音を行わずに視聴覚アセットを完成させること

Strengths

  • 画面上の出来事と音声の精密な時間的整合
  • テキストプロンプトだけでなく、映像そのものから音を導出
  • 足音・衝突音・環境音など幅広い音のカテゴリーを理解
  • 手作業でのフォーリー録音や効果音ライブラリの検索が不要に
  • どのソース・生成モデルの動画にも対応

Limitations

  • 動画は生成せず、既存の映像に対する音声のみの出力
  • 重なり合う出来事が多い複雑な音響シーンでは、精度が低下することがある
  • 生成される音声はミックス済みトラックであり、個別に編集可能なステムではない
  • 最良の結果には、クリップ内に明確で視認できる、音が発生する動きが必要

Tips & Best Practices

HunyuanVideo-Foleyは最終ステップとして使いましょう――先に動画を生成・確定させてから、音声を追加します。
最も正確なフォーリー同期を得るには、ソース動画の動きを明確ではっきりしたものにしましょう。
生成前に、クリップ内に視認できる音の発生イベント(衝突、動き、インタラクション)があることを確認しましょう。
本格的なサウンドデザインには、フォーリートラックの下に音楽や環境音モデルを重ね、NLEへ書き出す前にキャンバス上でミックスしましょう。

Use HunyuanVideo-Foley on Astorie

Connect HunyuanVideo-Foley with other AI models on Astorie's infinite canvas. No GPU required — start free.

Get Started Free

Frequently Asked Questions

HunyuanVideo-Foleyは何に使われますか?

HunyuanVideo-Foleyは、無音の動画に足音・衝突音・ドアの音・環境音といった同期した効果音とフォーリーを追加するために使われます。既存のクリップを入力すると、画面上のアクションに合わせたタイミングで音声トラックを生成するため、AI生成や自分でアップロードした映像が、無音の下書きのように聞こえなくなります。動画そのものは作らず、すでにある動画のためのサウンドトラックを作ります。

フォーリーとは何ですか?また、動画から生成するAI効果音とは何ですか?

フォーリーとは、足音、衣擦れ、物の扱いといった日常的な効果音を、映像に同期させて録音する技法で、伝統的にはスタジオで手作業により行われてきました。動画から生成するAI効果音は、その工程を自動化するものです。Hunyuan Foleyのような動画から音声を生成するモデルが映像を解析して何が起きているかを認識し、各フレームに合わせた対応する音を生成することで、手作業の録音や効果音ライブラリの検索を置き換えます。

Hunyuan Foleyは動画を生成しますか?

生成しません。Hunyuan Foleyは音声のみを出力します。既存のクリップを解析して同期した音声トラックを出力する、動画から音声へのモデルであり、新しい映像フレームは生成しません。先に映像を作りたい場合は、Astorie上でSora 2、Kling、Seedance、Veoなどのテキストから動画生成・画像から動画生成モデルと組み合わせ、その無音の結果をHunyuan Foleyノードに送って音声をつけましょう。

HunyuanVideo-Foleyを開発したのはどこですか?

HunyuanVideo-Foleyは、Tencentがその生成モデルファミリーHunyuanの一部として開発しました。高忠実度でプロフェッショナル品質のフォーリーと、強力な音声・映像の同期に重点を置いた「テキスト・動画から音声への変換」システムです。Astorie上では、ローカル環境やGPUを管理することなく、標準的なノードとして利用できます。

Hunyuan FoleyはElevenLabsのような効果音ジェネレーターとどう違いますか?

ElevenLabs Sound Effects v2のようなプロンプト駆動型のジェネレーターは、あなたが書いたテキストの説明から音声を組み立てますが、HunyuanVideo-Foleyは動画そのものから直接音を導き出します――そのため、動き・タイミング・出来事の順序を自動的に捉えます。2026年時点での実用的なワークフローは、画面と同期したフォーリーにはHunyuan Foleyを、特定にデザインされた効果音にはプロンプト駆動型のジェネレーターを使い、両方をキャンバス上でミックスすることです。

AstorieでAI動画にHunyuan Foleyの音声を追加するにはどうすればよいですか?

Astorie上では、動画ノードをHunyuanVideo-Foleyノードに接続して生成すると、同期した音声がバージョントレイにテイクとして表示されます。AstorieはインストールもGPUも不要なブラウザベースのノードキャンバスなので、同じ無音クリップをFoleyと音楽・環境音モデルに同時に流し込んでミックスを比較し、完成した視聴覚クリップをNLEタイムラインに書き出せます。

HunyuanVideo-Foleyはどんな音を生成できますか?

HunyuanVideo-Foleyは、目に見えるアクションに結びついた幅広い音を生成できます――さまざまな表面での足音、衝突音や物の扱う音、機械音やドアの音、雨や風といった環境音などです。クリップ内に明確で視認できる、音が発生する動きが含まれているときに最も効果を発揮します。重なり合う出来事が非常に多い密度の高いシーンでは、精度がやや低下することがあります。

Related Features

How-To Guides

Related Reading

Related Video Models

Back to All Video Models