FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, You, Zhou, Dewei, Ma, Fan, Li, Fu, He, Dongliang, Yang, Yi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
di: Li, Fu, et al.
Pubblicazione: (2025)
di: Li, Fu, et al.
Pubblicazione: (2025)
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
di: Shan, Sizhe, et al.
Pubblicazione: (2025)
di: Shan, Sizhe, et al.
Pubblicazione: (2025)
FoleySpace: Vision-Aligned Binaural Spatial Audio Generation
di: Zhao, Lei, et al.
Pubblicazione: (2025)
di: Zhao, Lei, et al.
Pubblicazione: (2025)
Video-to-Audio Generation with Fine-grained Temporal Semantics
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
StereoFoley: Object-Aware Stereo Audio Generation from Video
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2025)
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2025)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
di: Huang, Zhiqi, et al.
Pubblicazione: (2024)
di: Huang, Zhiqi, et al.
Pubblicazione: (2024)
Video-Foley: Two-Stage Video-To-Sound Generation via Temporal Event Condition For Foley Sound
di: Lee, Junwon, et al.
Pubblicazione: (2024)
di: Lee, Junwon, et al.
Pubblicazione: (2024)
Kling-Foley: Multimodal Diffusion Transformer for High-Quality Video-to-Audio Generation
di: Wang, Jun, et al.
Pubblicazione: (2025)
di: Wang, Jun, et al.
Pubblicazione: (2025)
FoleyBench: A Benchmark For Video-to-Audio Models
di: Dixit, Satvik, et al.
Pubblicazione: (2025)
di: Dixit, Satvik, et al.
Pubblicazione: (2025)
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
di: Sun, Luoyi, et al.
Pubblicazione: (2026)
di: Sun, Luoyi, et al.
Pubblicazione: (2026)
Audio ControlNet for Fine-Grained Audio Generation and Editing
di: Zhu, Haina, et al.
Pubblicazione: (2026)
di: Zhu, Haina, et al.
Pubblicazione: (2026)
AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis with Acoustic Transfer
di: Fang, Pengjun, et al.
Pubblicazione: (2026)
di: Fang, Pengjun, et al.
Pubblicazione: (2026)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
di: Yang, Jianxuan, et al.
Pubblicazione: (2026)
di: Yang, Jianxuan, et al.
Pubblicazione: (2026)
Smooth-Foley: Creating Continuous Sound for Video-to-Audio Generation Under Semantic Guidance
di: Zhang, Yaoyun, et al.
Pubblicazione: (2024)
di: Zhang, Yaoyun, et al.
Pubblicazione: (2024)
Foley Control: Aligning a Frozen Latent Text-to-Audio Model to Video
di: Rowles, Ciara, et al.
Pubblicazione: (2025)
di: Rowles, Ciara, et al.
Pubblicazione: (2025)
EmoSteer-TTS: Fine-Grained and Training-Free Emotion-Controllable Text-to-Speech via Activation Steering
di: Xie, Tianxin, et al.
Pubblicazione: (2025)
di: Xie, Tianxin, et al.
Pubblicazione: (2025)
FoleyGRAM: Video-to-Audio Generation with GRAM-Aligned Multimodal Encoders
di: Gramaccioni, Riccardo Fosco, et al.
Pubblicazione: (2025)
di: Gramaccioni, Riccardo Fosco, et al.
Pubblicazione: (2025)
SegTune: Structured and Fine-Grained Control for Song Generation
di: Cai, Pengfei, et al.
Pubblicazione: (2025)
di: Cai, Pengfei, et al.
Pubblicazione: (2025)
MambaFoley: Foley Sound Generation using Selective State-Space Models
di: Colombo, Marco Furio, et al.
Pubblicazione: (2024)
di: Colombo, Marco Furio, et al.
Pubblicazione: (2024)
FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining
di: Li, Xiquan, et al.
Pubblicazione: (2026)
di: Li, Xiquan, et al.
Pubblicazione: (2026)
Foley-Flow: Coordinated Video-to-Audio Generation with Masked Audio-Visual Alignment and Dynamic Conditional Flows
di: Mo, Shentong, et al.
Pubblicazione: (2026)
di: Mo, Shentong, et al.
Pubblicazione: (2026)
SARSteer: Safeguarding Large Audio-Language Models via Safe-Ablated Refusal Steering
di: Lin, Weilin, et al.
Pubblicazione: (2025)
di: Lin, Weilin, et al.
Pubblicazione: (2025)
Video-Guided Foley Sound Generation with Multimodal Controls
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
di: Chen, Ziyang, et al.
Pubblicazione: (2024)
SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet
di: Zhong, Zhi, et al.
Pubblicazione: (2025)
di: Zhong, Zhi, et al.
Pubblicazione: (2025)
Audio Palette: A Diffusion Transformer with Multi-Signal Conditioning for Controllable Foley Synthesis
di: Wang, Junnuo
Pubblicazione: (2025)
di: Wang, Junnuo
Pubblicazione: (2025)
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
di: Zhou, Yang-Hao, et al.
Pubblicazione: (2026)
di: Zhou, Yang-Hao, et al.
Pubblicazione: (2026)
MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
di: Li, Xiquan, et al.
Pubblicazione: (2026)
di: Li, Xiquan, et al.
Pubblicazione: (2026)
Fine-Grained Quantitative Emotion Editing for Speech Generation
di: Inoue, Sho, et al.
Pubblicazione: (2024)
di: Inoue, Sho, et al.
Pubblicazione: (2024)
AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio Storytelling
di: Ren, Yiming, et al.
Pubblicazione: (2026)
di: Ren, Yiming, et al.
Pubblicazione: (2026)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
di: Ren, Yong, et al.
Pubblicazione: (2024)
di: Ren, Yong, et al.
Pubblicazione: (2024)
PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation
di: Xie, Tianxin, et al.
Pubblicazione: (2025)
di: Xie, Tianxin, et al.
Pubblicazione: (2025)
Listening Between the Frames: Bridging Temporal Gaps in Large Audio-Language Models
di: Wang, Hualei, et al.
Pubblicazione: (2025)
di: Wang, Hualei, et al.
Pubblicazione: (2025)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
di: Glazer, Neta, et al.
Pubblicazione: (2026)
di: Glazer, Neta, et al.
Pubblicazione: (2026)
FolAI: Synchronized Foley Sound Generation with Semantic and Temporal Alignment
di: Gramaccioni, Riccardo Fosco, et al.
Pubblicazione: (2024)
di: Gramaccioni, Riccardo Fosco, et al.
Pubblicazione: (2024)
MOVA: Towards Scalable and Synchronized Video-Audio Generation
di: OpenMOSS Team, et al.
Pubblicazione: (2026)
di: OpenMOSS Team, et al.
Pubblicazione: (2026)
Efficient Video to Audio Mapper with Visual Scene Detection
di: Yi, Mingjing, et al.
Pubblicazione: (2024)
di: Yi, Mingjing, et al.
Pubblicazione: (2024)
MeanFlow-Accelerated Multimodal Video-to-Audio Synthesis via One-Step Generation
di: Yang, Xiaoran, et al.
Pubblicazione: (2025)
di: Yang, Xiaoran, et al.
Pubblicazione: (2025)
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions
di: Wang, Yuanyuan, et al.
Pubblicazione: (2024)
di: Wang, Yuanyuan, et al.
Pubblicazione: (2024)
Detecting and Mitigating Insertion Hallucination in Video-to-Audio Generation
di: Chen, Liyang, et al.
Pubblicazione: (2025)
di: Chen, Liyang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
di: Li, Fu, et al.
Pubblicazione: (2025) -
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
di: Shan, Sizhe, et al.
Pubblicazione: (2025) -
FoleySpace: Vision-Aligned Binaural Spatial Audio Generation
di: Zhao, Lei, et al.
Pubblicazione: (2025) -
Video-to-Audio Generation with Fine-grained Temporal Semantics
di: Hu, Yuchen, et al.
Pubblicazione: (2024) -
StereoFoley: Object-Aware Stereo Audio Generation from Video
di: Karchkhadze, Tornike, et al.
Pubblicazione: (2025)