FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Mengtian, Dai, Kunyan, Ding, Yi, Ni, Ruobing, Zhang, Ying, Wang, Wenwu, Xie, Zhifeng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
par: Shan, Sizhe, et autres
Publié: (2025)
par: Shan, Sizhe, et autres
Publié: (2025)
FolAI: Synchronized Foley Sound Generation with Semantic and Temporal Alignment
par: Gramaccioni, Riccardo Fosco, et autres
Publié: (2024)
par: Gramaccioni, Riccardo Fosco, et autres
Publié: (2024)
Video-Foley: Two-Stage Video-To-Sound Generation via Temporal Event Condition For Foley Sound
par: Lee, Junwon, et autres
Publié: (2024)
par: Lee, Junwon, et autres
Publié: (2024)
FilmComposer: LLM-Driven Music Production for Silent Film Clips
par: Xie, Zhifeng, et autres
Publié: (2025)
par: Xie, Zhifeng, et autres
Publié: (2025)
FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts
par: Li, You, et autres
Publié: (2026)
par: Li, You, et autres
Publié: (2026)
FilmSceneDesigner: Chaining Set Design for Procedural Film Scene Generation
par: Xie, Zhifeng, et autres
Publié: (2025)
par: Xie, Zhifeng, et autres
Publié: (2025)
Video-Guided Foley Sound Generation with Multimodal Controls
par: Chen, Ziyang, et autres
Publié: (2024)
par: Chen, Ziyang, et autres
Publié: (2024)
EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation
par: Li, Bingxuan, et autres
Publié: (2025)
par: Li, Bingxuan, et autres
Publié: (2025)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
par: Yang, Jianxuan, et autres
Publié: (2026)
par: Yang, Jianxuan, et autres
Publié: (2026)
FoleyGRAM: Video-to-Audio Generation with GRAM-Aligned Multimodal Encoders
par: Gramaccioni, Riccardo Fosco, et autres
Publié: (2025)
par: Gramaccioni, Riccardo Fosco, et autres
Publié: (2025)
Foley-Flow: Coordinated Video-to-Audio Generation with Masked Audio-Visual Alignment and Dynamic Conditional Flows
par: Mo, Shentong, et autres
Publié: (2026)
par: Mo, Shentong, et autres
Publié: (2026)
Foley Control: Aligning a Frozen Latent Text-to-Audio Model to Video
par: Rowles, Ciara, et autres
Publié: (2025)
par: Rowles, Ciara, et autres
Publié: (2025)
FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds
par: Zhang, Yiming, et autres
Publié: (2024)
par: Zhang, Yiming, et autres
Publié: (2024)
HieraFashDiff: Hierarchical Fashion Design with Multi-stage Diffusion Models
par: Xie, Zhifeng, et autres
Publié: (2024)
par: Xie, Zhifeng, et autres
Publié: (2024)
LiDAR Prompted Spatio-Temporal Multi-View Stereo for Autonomous Driving
par: Sun, Qihao, et autres
Publié: (2026)
par: Sun, Qihao, et autres
Publié: (2026)
StereoFoley: Object-Aware Stereo Audio Generation from Video
par: Karchkhadze, Tornike, et autres
Publié: (2025)
par: Karchkhadze, Tornike, et autres
Publié: (2025)
CounterFlow: A Two-Phase Inference-Time Sampling for Counterfactual Video Foley Generation
par: Lee, Gyubin, et autres
Publié: (2026)
par: Lee, Gyubin, et autres
Publié: (2026)
AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis with Acoustic Transfer
par: Fang, Pengjun, et autres
Publié: (2026)
par: Fang, Pengjun, et autres
Publié: (2026)
MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation
par: Fu, Ruibo, et autres
Publié: (2024)
par: Fu, Ruibo, et autres
Publié: (2024)
GaussianBody: Clothed Human Reconstruction via 3d Gaussian Splatting
par: Li, Mengtian, et autres
Publié: (2024)
par: Li, Mengtian, et autres
Publié: (2024)
GardenDesigner: Encoding Aesthetic Principles into Jiangnan Garden Construction via a Chain of Agents
par: Li, Mengtian, et autres
Publié: (2026)
par: Li, Mengtian, et autres
Publié: (2026)
MambaFoley: Foley Sound Generation using Selective State-Space Models
par: Colombo, Marco Furio, et autres
Publié: (2024)
par: Colombo, Marco Furio, et autres
Publié: (2024)
Infinite Motion: Extended Motion Generation via Long Text Instructions
par: Li, Mengtian, et autres
Publié: (2024)
par: Li, Mengtian, et autres
Publié: (2024)
VERTIGO: Visual Preference Optimization for Cinematic Camera Trajectory Generation
par: Li, Mengtian, et autres
Publié: (2026)
par: Li, Mengtian, et autres
Publié: (2026)
Stereo Any Video: Temporally Consistent Stereo Matching
par: Jing, Junpeng, et autres
Publié: (2025)
par: Jing, Junpeng, et autres
Publié: (2025)
Video-Language Alignment via Spatio-Temporal Graph Transformer
par: Zhang, Shi-Xue, et autres
Publié: (2024)
par: Zhang, Shi-Xue, et autres
Publié: (2024)
Match-Stereo-Videos: Bidirectional Alignment for Consistent Dynamic Stereo Matching
par: Jing, Junpeng, et autres
Publié: (2024)
par: Jing, Junpeng, et autres
Publié: (2024)
Temporally Consistent Stereo Matching
par: Zeng, Jiaxi, et autres
Publié: (2024)
par: Zeng, Jiaxi, et autres
Publié: (2024)
Rethinking the Spatio-Temporal Alignment of End-to-End 3D Perception
par: Li, Xiaoyu, et autres
Publié: (2025)
par: Li, Xiaoyu, et autres
Publié: (2025)
Bridging Time and Space: Decoupled Spatio-Temporal Alignment for Video Grounding
par: Tu, Xuezhen, et autres
Publié: (2026)
par: Tu, Xuezhen, et autres
Publié: (2026)
AniGaussian: Animatable Gaussian Avatar with Pose-guided Deformation
par: Li, Mengtian, et autres
Publié: (2025)
par: Li, Mengtian, et autres
Publié: (2025)
SemMorph3D: Unsupervised Semantic-Aware 3D Morphing via Mesh-Guided Gaussians
par: Li, Mengtian, et autres
Publié: (2025)
par: Li, Mengtian, et autres
Publié: (2025)
Temporal Reversal Regularization for Spiking Neural Networks: Hybrid Spatio-Temporal Invariance for Generalization
par: Zuo, Lin, et autres
Publié: (2024)
par: Zuo, Lin, et autres
Publié: (2024)
Mono2Stereo: A Benchmark and Empirical Study for Stereo Conversion
par: Yu, Songsong, et autres
Publié: (2025)
par: Yu, Songsong, et autres
Publié: (2025)
Enhancing Video-Language Representations with Structural Spatio-Temporal Alignment
par: Fei, Hao, et autres
Publié: (2024)
par: Fei, Hao, et autres
Publié: (2024)
Match Stereo Videos via Bidirectional Alignment
par: Jing, Junpeng, et autres
Publié: (2024)
par: Jing, Junpeng, et autres
Publié: (2024)
StereoPilot: Learning Unified and Efficient Stereo Conversion via Generative Priors
par: Shen, Guibao, et autres
Publié: (2025)
par: Shen, Guibao, et autres
Publié: (2025)
UniTS: Unified Spatio-Temporal Generative Model for Remote Sensing
par: Zhang, Yuxiang, et autres
Publié: (2025)
par: Zhang, Yuxiang, et autres
Publié: (2025)
ClipTBP: Clip-Pair based Temporal Boundary Prediction with Boundary-Aware Learning for Moment Retrieval
par: Kim, Ji-Hyeon, et autres
Publié: (2026)
par: Kim, Ji-Hyeon, et autres
Publié: (2026)
Magic 1-For-1: Generating One Minute Video Clips within One Minute
par: Yi, Hongwei, et autres
Publié: (2025)
par: Yi, Hongwei, et autres
Publié: (2025)
Documents similaires
-
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
par: Shan, Sizhe, et autres
Publié: (2025) -
FolAI: Synchronized Foley Sound Generation with Semantic and Temporal Alignment
par: Gramaccioni, Riccardo Fosco, et autres
Publié: (2024) -
Video-Foley: Two-Stage Video-To-Sound Generation via Temporal Event Condition For Foley Sound
par: Lee, Junwon, et autres
Publié: (2024) -
FilmComposer: LLM-Driven Music Production for Silent Film Clips
par: Xie, Zhifeng, et autres
Publié: (2025) -
FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts
par: Li, You, et autres
Publié: (2026)