Tencent
HunyuanVideo-Foley(Hunyuan FoleyやHunyuan Video Foleyとも表記されます)は、Tencentによる動画から音声を生成するフォーリーモデルです。無声のクリップを解析し、足音・衝突音・ドアの音・環境音といった、画面上のアクションに同期した効果音を生成します。動画は生成せず、あらゆるソースの映像に足りないサウンドトラックを追加します。Astorie上では、Hunyuan Foleyを無限キャンバス上の1つのノードとして、他50以上の画像・動画・音声モデルと並べて実行し、ミックスしてタイムラインに書き出せます。
HunyuanVideo-Foleyは、AI動画制作における最大の課題――無音のクリップ――を埋めます。Sora 2、Kling、Seedance、Veoなど、ほとんどのテキストから動画生成・画像から動画生成モデルは、美しい映像を音声なしで出力するため、足音や環境音のひとつひとつを別のNLEで手作業で作り込む必要がありました。Hunyuan Video Foleyはそのギャップを自動的に埋めます。任意の動画を入力すると、モデルは映像の内容をフレームごとに解析し、音の発生源となる出来事を認識し、それぞれの効果音がその原因となる動作に正確に重なる音声トラックをレンダリングします。時間的な整合性を理解しているため、砂利を踏む足、グラスを置く音、窓を打つ雨音のいずれも、ずれることなく正しいフレームで鳴ります。2026年時点で、Tencentの研究はHunyuanVideo-Foleyを、幅広いシーンにわたって強力な音声・映像の同期を実現する、高忠実度かつプロフェッショナル品質のフォーリー向けに学習された「テキスト・動画から音声への変換」システムと位置づけています。Astorie上では、これが制作パイプラインの自然な最終ステップになります――動画を生成またはアップロードし、Hunyuan Foleyノードに接続するだけで、音を一切録音せずに完全な視聴覚アセットが手に入ります。ElevenLabs Sound Effects v2のような、テキストの説明から音声を組み立てるプロンプト駆動型の効果音ジェネレーターとは異なり、Hunyuan Foleyは画面そのものから直接音を導き出します――そのため、本来なら手作業で記述しなければならない動きとタイミングを自動的に捉えます。同じ無音クリップをHunyuan Foleyと音楽・環境音モデルに同時に流し込み、すべてのテイクをバージョントレイに残して、編集に合うミックスを選ぶこともできます。

Connect HunyuanVideo-Foley with other AI models on Astorie's infinite canvas. No GPU required — start free.
Get Started FreeHunyuanVideo-Foleyは、無音の動画に足音・衝突音・ドアの音・環境音といった同期した効果音とフォーリーを追加するために使われます。既存のクリップを入力すると、画面上のアクションに合わせたタイミングで音声トラックを生成するため、AI生成や自分でアップロードした映像が、無音の下書きのように聞こえなくなります。動画そのものは作らず、すでにある動画のためのサウンドトラックを作ります。
フォーリーとは、足音、衣擦れ、物の扱いといった日常的な効果音を、映像に同期させて録音する技法で、伝統的にはスタジオで手作業により行われてきました。動画から生成するAI効果音は、その工程を自動化するものです。Hunyuan Foleyのような動画から音声を生成するモデルが映像を解析して何が起きているかを認識し、各フレームに合わせた対応する音を生成することで、手作業の録音や効果音ライブラリの検索を置き換えます。
生成しません。Hunyuan Foleyは音声のみを出力します。既存のクリップを解析して同期した音声トラックを出力する、動画から音声へのモデルであり、新しい映像フレームは生成しません。先に映像を作りたい場合は、Astorie上でSora 2、Kling、Seedance、Veoなどのテキストから動画生成・画像から動画生成モデルと組み合わせ、その無音の結果をHunyuan Foleyノードに送って音声をつけましょう。
HunyuanVideo-Foleyは、Tencentがその生成モデルファミリーHunyuanの一部として開発しました。高忠実度でプロフェッショナル品質のフォーリーと、強力な音声・映像の同期に重点を置いた「テキスト・動画から音声への変換」システムです。Astorie上では、ローカル環境やGPUを管理することなく、標準的なノードとして利用できます。
ElevenLabs Sound Effects v2のようなプロンプト駆動型のジェネレーターは、あなたが書いたテキストの説明から音声を組み立てますが、HunyuanVideo-Foleyは動画そのものから直接音を導き出します――そのため、動き・タイミング・出来事の順序を自動的に捉えます。2026年時点での実用的なワークフローは、画面と同期したフォーリーにはHunyuan Foleyを、特定にデザインされた効果音にはプロンプト駆動型のジェネレーターを使い、両方をキャンバス上でミックスすることです。
Astorie上では、動画ノードをHunyuanVideo-Foleyノードに接続して生成すると、同期した音声がバージョントレイにテイクとして表示されます。AstorieはインストールもGPUも不要なブラウザベースのノードキャンバスなので、同じ無音クリップをFoleyと音楽・環境音モデルに同時に流し込んでミックスを比較し、完成した視聴覚クリップをNLEタイムラインに書き出せます。
HunyuanVideo-Foleyは、目に見えるアクションに結びついた幅広い音を生成できます――さまざまな表面での足音、衝突音や物の扱う音、機械音やドアの音、雨や風といった環境音などです。クリップ内に明確で視認できる、音が発生する動きが含まれているときに最も効果を発揮します。重なり合う出来事が非常に多い密度の高いシーンでは、精度がやや低下することがあります。