FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, You, Zhou, Dewei, Ma, Fan, Li, Fu, He, Dongliang, Yang, Yi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
par: Li, Fu, et autres
Publié: (2025)
par: Li, Fu, et autres
Publié: (2025)
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
par: Shan, Sizhe, et autres
Publié: (2025)
par: Shan, Sizhe, et autres
Publié: (2025)
FoleySpace: Vision-Aligned Binaural Spatial Audio Generation
par: Zhao, Lei, et autres
Publié: (2025)
par: Zhao, Lei, et autres
Publié: (2025)
Video-to-Audio Generation with Fine-grained Temporal Semantics
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
StereoFoley: Object-Aware Stereo Audio Generation from Video
par: Karchkhadze, Tornike, et autres
Publié: (2025)
par: Karchkhadze, Tornike, et autres
Publié: (2025)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
par: Huang, Zhiqi, et autres
Publié: (2024)
par: Huang, Zhiqi, et autres
Publié: (2024)
Video-Foley: Two-Stage Video-To-Sound Generation via Temporal Event Condition For Foley Sound
par: Lee, Junwon, et autres
Publié: (2024)
par: Lee, Junwon, et autres
Publié: (2024)
Kling-Foley: Multimodal Diffusion Transformer for High-Quality Video-to-Audio Generation
par: Wang, Jun, et autres
Publié: (2025)
par: Wang, Jun, et autres
Publié: (2025)
FoleyBench: A Benchmark For Video-to-Audio Models
par: Dixit, Satvik, et autres
Publié: (2025)
par: Dixit, Satvik, et autres
Publié: (2025)
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
par: Sun, Luoyi, et autres
Publié: (2026)
par: Sun, Luoyi, et autres
Publié: (2026)
Audio ControlNet for Fine-Grained Audio Generation and Editing
par: Zhu, Haina, et autres
Publié: (2026)
par: Zhu, Haina, et autres
Publié: (2026)
AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis with Acoustic Transfer
par: Fang, Pengjun, et autres
Publié: (2026)
par: Fang, Pengjun, et autres
Publié: (2026)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
par: Yang, Jianxuan, et autres
Publié: (2026)
par: Yang, Jianxuan, et autres
Publié: (2026)
Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance
par: Zhang, Yaoyun, et autres
Publié: (2024)
par: Zhang, Yaoyun, et autres
Publié: (2024)
Foley Control: Aligning a Frozen Latent Text-to-Audio Model to Video
par: Rowles, Ciara, et autres
Publié: (2025)
par: Rowles, Ciara, et autres
Publié: (2025)
EmoSteer-TTS: Fine-Grained and Training-Free Emotion-Controllable Text-to-Speech via Activation Steering
par: Xie, Tianxin, et autres
Publié: (2025)
par: Xie, Tianxin, et autres
Publié: (2025)
FoleyGRAM: Video-to-Audio Generation with GRAM-Aligned Multimodal Encoders
par: Gramaccioni, Riccardo Fosco, et autres
Publié: (2025)
par: Gramaccioni, Riccardo Fosco, et autres
Publié: (2025)
SegTune: Structured and Fine-Grained Control for Song Generation
par: Cai, Pengfei, et autres
Publié: (2025)
par: Cai, Pengfei, et autres
Publié: (2025)
MambaFoley: Foley Sound Generation using Selective State-Space Models
par: Colombo, Marco Furio, et autres
Publié: (2024)
par: Colombo, Marco Furio, et autres
Publié: (2024)
FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining
par: Li, Xiquan, et autres
Publié: (2026)
par: Li, Xiquan, et autres
Publié: (2026)
Foley-Flow: Coordinated Video-to-Audio Generation with Masked Audio-Visual Alignment and Dynamic Conditional Flows
par: Mo, Shentong, et autres
Publié: (2026)
par: Mo, Shentong, et autres
Publié: (2026)
SARSteer: Safeguarding Large Audio-Language Models via Safe-Ablated Refusal Steering
par: Lin, Weilin, et autres
Publié: (2025)
par: Lin, Weilin, et autres
Publié: (2025)
Video-Guided Foley Sound Generation with Multimodal Controls
par: Chen, Ziyang, et autres
Publié: (2024)
par: Chen, Ziyang, et autres
Publié: (2024)
SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet
par: Zhong, Zhi, et autres
Publié: (2025)
par: Zhong, Zhi, et autres
Publié: (2025)
Audio Palette: A Diffusion Transformer with Multi-Signal Conditioning for Controllable Foley Synthesis
par: Wang, Junnuo
Publié: (2025)
par: Wang, Junnuo
Publié: (2025)
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
par: Zhou, Yang-Hao, et autres
Publié: (2026)
par: Zhou, Yang-Hao, et autres
Publié: (2026)
MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation
par: Fu, Ruibo, et autres
Publié: (2024)
par: Fu, Ruibo, et autres
Publié: (2024)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
par: Li, Xiquan, et autres
Publié: (2026)
par: Li, Xiquan, et autres
Publié: (2026)
Fine-Grained Quantitative Emotion Editing for Speech Generation
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio Storytelling
par: Ren, Yiming, et autres
Publié: (2026)
par: Ren, Yiming, et autres
Publié: (2026)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
par: Ren, Yong, et autres
Publié: (2024)
par: Ren, Yong, et autres
Publié: (2024)
PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation
par: Xie, Tianxin, et autres
Publié: (2025)
par: Xie, Tianxin, et autres
Publié: (2025)
Listening Between the Frames: Bridging Temporal Gaps in Large Audio-Language Models
par: Wang, Hualei, et autres
Publié: (2025)
par: Wang, Hualei, et autres
Publié: (2025)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
par: Glazer, Neta, et autres
Publié: (2026)
par: Glazer, Neta, et autres
Publié: (2026)
FolAI: Synchronized Foley Sound Generation with Semantic and Temporal Alignment
par: Gramaccioni, Riccardo Fosco, et autres
Publié: (2024)
par: Gramaccioni, Riccardo Fosco, et autres
Publié: (2024)
MOVA: Towards Scalable and Synchronized Video-Audio Generation
par: OpenMOSS Team, et autres
Publié: (2026)
par: OpenMOSS Team, et autres
Publié: (2026)
Efficient Video to Audio Mapper with Visual Scene Detection
par: Yi, Mingjing, et autres
Publié: (2024)
par: Yi, Mingjing, et autres
Publié: (2024)
MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation
par: Yang, Xiaoran, et autres
Publié: (2025)
par: Yang, Xiaoran, et autres
Publié: (2025)
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions
par: Wang, Yuanyuan, et autres
Publié: (2024)
par: Wang, Yuanyuan, et autres
Publié: (2024)
Detecting and Mitigating Insertion Hallucination in Video-to-Audio Generation
par: Chen, Liyang, et autres
Publié: (2025)
par: Chen, Liyang, et autres
Publié: (2025)
Documents similaires
-
DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
par: Li, Fu, et autres
Publié: (2025) -
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
par: Shan, Sizhe, et autres
Publié: (2025) -
FoleySpace: Vision-Aligned Binaural Spatial Audio Generation
par: Zhao, Lei, et autres
Publié: (2025) -
Video-to-Audio Generation with Fine-grained Temporal Semantics
par: Hu, Yuchen, et autres
Publié: (2024) -
StereoFoley: Object-Aware Stereo Audio Generation from Video
par: Karchkhadze, Tornike, et autres
Publié: (2025)