FilmComposer: LLM-Driven Music Production for Silent Film Clips
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xie, Zhifeng, He, Qile, Zhu, Youjia, He, Qiwei, Li, Mengtian |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SonicVisionLM: Playing Sound with Vision Language Models
par: Xie, Zhifeng, et autres
Publié: (2024)
par: Xie, Zhifeng, et autres
Publié: (2024)
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
par: Rai, Aashish, et autres
Publié: (2024)
par: Rai, Aashish, et autres
Publié: (2024)
Learning Musical Representations for Music Performance Question Answering
par: Diao, Xingjian, et autres
Publié: (2025)
par: Diao, Xingjian, et autres
Publié: (2025)
MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions
par: Chi, Xiaowei, et autres
Publié: (2024)
par: Chi, Xiaowei, et autres
Publié: (2024)
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
par: Lin, Yan-Bo, et autres
Publié: (2024)
par: Lin, Yan-Bo, et autres
Publié: (2024)
Bridging Paintings and Music -- Exploring Emotion based Music Generation through Paintings
par: Hisariya, Tanisha, et autres
Publié: (2024)
par: Hisariya, Tanisha, et autres
Publié: (2024)
AutoMV: An Automatic Multi-Agent System for Music Video Generation
par: Tang, Xiaoxuan, et autres
Publié: (2025)
par: Tang, Xiaoxuan, et autres
Publié: (2025)
JEN-1 Composer: A Unified Framework for High-Fidelity Multi-Track Music Generation
par: Yao, Yao, et autres
Publié: (2023)
par: Yao, Yao, et autres
Publié: (2023)
Multimodal Music Generation with Explicit Bridges and Retrieval Augmentation
par: Wang, Baisen, et autres
Publié: (2024)
par: Wang, Baisen, et autres
Publié: (2024)
Learning Sparsity for Effective and Efficient Music Performance Question Answering
par: Diao, Xingjian, et autres
Publié: (2025)
par: Diao, Xingjian, et autres
Publié: (2025)
DanceChat: Large Language Model-Guided Music-to-Dance Generation
par: Wang, Qing, et autres
Publié: (2025)
par: Wang, Qing, et autres
Publié: (2025)
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
par: You, Wenhao, et autres
Publié: (2025)
par: You, Wenhao, et autres
Publié: (2025)
MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization
par: Li, Ruiqi, et autres
Publié: (2024)
par: Li, Ruiqi, et autres
Publié: (2024)
Art2Mus: Bridging Visual Arts and Music through Cross-Modal Generation
par: Rinaldi, Ivan, et autres
Publié: (2024)
par: Rinaldi, Ivan, et autres
Publié: (2024)
Reverse the auditory processing pathway: Coarse-to-fine audio reconstruction from fMRI
par: Liu, Che, et autres
Publié: (2024)
par: Liu, Che, et autres
Publié: (2024)
SoundLoc3D: Invisible 3D Sound Source Localization and Classification Using a Multimodal RGB-D Acoustic Camera
par: He, Yuhang, et autres
Publié: (2024)
par: He, Yuhang, et autres
Publié: (2024)
Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners
par: Xing, Yazhou, et autres
Publié: (2024)
par: Xing, Yazhou, et autres
Publié: (2024)
MuteSwap: Visual-informed Silent Video Identity Conversion
par: Liu, Yifan, et autres
Publié: (2025)
par: Liu, Yifan, et autres
Publié: (2025)
Mechanisms of Multimodal Synchronization: Insights from Decoder-Based Video-Text-to-Speech Synthesis
par: Gupta, Akshita, et autres
Publié: (2024)
par: Gupta, Akshita, et autres
Publié: (2024)
Scaling and Enhancing LLM-based AVSR: A Sparse Mixture of Projectors Approach
par: Cappellazzo, Umberto, et autres
Publié: (2025)
par: Cappellazzo, Umberto, et autres
Publié: (2025)
Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation
par: Kang, Fang, et autres
Publié: (2025)
par: Kang, Fang, et autres
Publié: (2025)
FlowDubber: Movie Dubbing with LLM-based Semantic-aware Learning and Flow Matching based Voice Enhancing
par: Cong, Gaoxiang, et autres
Publié: (2025)
par: Cong, Gaoxiang, et autres
Publié: (2025)
MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens
par: Yeo, Jeong Hun, et autres
Publié: (2025)
par: Yeo, Jeong Hun, et autres
Publié: (2025)
Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning
par: Sun, Luoyi, et autres
Publié: (2023)
par: Sun, Luoyi, et autres
Publié: (2023)
YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls
par: Chen, Zihao, et autres
Publié: (2024)
par: Chen, Zihao, et autres
Publié: (2024)
3D Audio-Visual Segmentation
par: Sokolov, Artem, et autres
Publié: (2024)
par: Sokolov, Artem, et autres
Publié: (2024)
Images that Sound: Composing Images and Sounds on a Single Canvas
par: Chen, Ziyang, et autres
Publié: (2024)
par: Chen, Ziyang, et autres
Publié: (2024)
Controllable Dance Generation with Style-Guided Motion Diffusion
par: Wang, Hongsong, et autres
Publié: (2024)
par: Wang, Hongsong, et autres
Publié: (2024)
Aligned Better, Listen Better for Audio-Visual Large Language Models
par: Guo, Yuxin, et autres
Publié: (2025)
par: Guo, Yuxin, et autres
Publié: (2025)
CoComposer: LLM Multi-agent Collaborative Music Composition
par: Xing, Peiwen, et autres
Publié: (2025)
par: Xing, Peiwen, et autres
Publié: (2025)
Vision-to-Music Generation: A Survey
par: Wang, Zhaokai, et autres
Publié: (2025)
par: Wang, Zhaokai, et autres
Publié: (2025)
Sonic: Shifting Focus to Global Audio Perception in Portrait Animation
par: Ji, Xiaozhong, et autres
Publié: (2024)
par: Ji, Xiaozhong, et autres
Publié: (2024)
EXPOTION: Facial Expression and Motion Control for Multimodal Music Generation
par: Izzati, Fathinah, et autres
Publié: (2025)
par: Izzati, Fathinah, et autres
Publié: (2025)
UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization
par: Geng, Tiantian, et autres
Publié: (2024)
par: Geng, Tiantian, et autres
Publié: (2024)
AV-Surf: Surface-Enhanced Geometry-Aware Novel-View Acoustic Synthesis
par: Baek, Hadam, et autres
Publié: (2025)
par: Baek, Hadam, et autres
Publié: (2025)
Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations
par: Yeo, Jeong Hun, et autres
Publié: (2025)
par: Yeo, Jeong Hun, et autres
Publié: (2025)
Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
par: Low, Chetwin, et autres
Publié: (2025)
par: Low, Chetwin, et autres
Publié: (2025)
AISHELL6-whisper: A Chinese Mandarin Audio-visual Whisper Speech Dataset with Speech Recognition Baselines
par: Li, Cancan, et autres
Publié: (2025)
par: Li, Cancan, et autres
Publié: (2025)
IIANet: An Intra- and Inter-Modality Attention Network for Audio-Visual Speech Separation
par: Li, Kai, et autres
Publié: (2023)
par: Li, Kai, et autres
Publié: (2023)
Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning
par: Li, Wenrui, et autres
Publié: (2024)
par: Li, Wenrui, et autres
Publié: (2024)
Documents similaires
-
SonicVisionLM: Playing Sound with Vision Language Models
par: Xie, Zhifeng, et autres
Publié: (2024) -
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
par: Rai, Aashish, et autres
Publié: (2024) -
Learning Musical Representations for Music Performance Question Answering
par: Diao, Xingjian, et autres
Publié: (2025) -
MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions
par: Chi, Xiaowei, et autres
Publié: (2024) -
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
par: Lin, Yan-Bo, et autres
Publié: (2024)