Video-Robin: Autoregressive Diffusion Planning for Intent-Grounded Video-to-Music Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lokegaonkar, Vaibhavi, Bhosale, Aryan Vijay, Raj, Vishnu, KV, Gouthaman, Duraiswami, Ramani, Lu, Lie, Ghosh, Sreyan, Manocha, Dinesh |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RECAP: Retrieval-Augmented Audio Captioning
par: Ghosh, Sreyan, et autres
Publié: (2023)
par: Ghosh, Sreyan, et autres
Publié: (2023)
SPUR: A Plug-and-Play Framework for Integrating Spatial Audio Understanding and Reasoning into Large Audio-Language Models
par: Sakshi, S, et autres
Publié: (2025)
par: Sakshi, S, et autres
Publié: (2025)
ReCLAP: Improving Zero Shot Audio Classification by Describing Sounds
par: Ghosh, Sreyan, et autres
Publié: (2024)
par: Ghosh, Sreyan, et autres
Publié: (2024)
Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval
par: Stewart, Shanti, et autres
Publié: (2024)
par: Stewart, Shanti, et autres
Publié: (2024)
MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark
par: Sakshi, S, et autres
Publié: (2024)
par: Sakshi, S, et autres
Publié: (2024)
TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification
par: Anand, Nishit, et autres
Publié: (2024)
par: Anand, Nishit, et autres
Publié: (2024)
CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models
par: Ghosh, Sreyan, et autres
Publié: (2023)
par: Ghosh, Sreyan, et autres
Publié: (2023)
GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities
par: Ghosh, Sreyan, et autres
Publié: (2024)
par: Ghosh, Sreyan, et autres
Publié: (2024)
Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning
par: Yang, Chao-Han Huck, et autres
Publié: (2025)
par: Yang, Chao-Han Huck, et autres
Publié: (2025)
AV-RIR: Audio-Visual Room Impulse Response Estimation
par: Ratnarajah, Anton, et autres
Publié: (2023)
par: Ratnarajah, Anton, et autres
Publié: (2023)
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
par: Goel, Arushi, et autres
Publié: (2025)
par: Goel, Arushi, et autres
Publié: (2025)
EGOILLUSION: Benchmarking Hallucinations in Egocentric Video Understanding
par: Seth, Ashish, et autres
Publié: (2025)
par: Seth, Ashish, et autres
Publié: (2025)
EH-MAM: Easy-to-Hard Masked Acoustic Modeling for Self-Supervised Speech Representation Learning
par: Seth, Ashish, et autres
Publié: (2024)
par: Seth, Ashish, et autres
Publié: (2024)
Failing Forward: Improving Generative Error Correction for ASR with Synthetic Data and Retrieval Augmentation
par: Ghosh, Sreyan, et autres
Publié: (2024)
par: Ghosh, Sreyan, et autres
Publié: (2024)
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music
par: Ghosh, Sreyan, et autres
Publié: (2026)
par: Ghosh, Sreyan, et autres
Publié: (2026)
LipGER: Visually-Conditioned Generative Error Correction for Robust Automatic Speech Recognition
par: Ghosh, Sreyan, et autres
Publié: (2024)
par: Ghosh, Sreyan, et autres
Publié: (2024)
PAT: Parameter-Free Audio-Text Aligner to Boost Zero-Shot Audio Classification
par: Seth, Ashish, et autres
Publié: (2024)
par: Seth, Ashish, et autres
Publié: (2024)
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
par: Ghosh, Sreyan, et autres
Publié: (2025)
par: Ghosh, Sreyan, et autres
Publié: (2025)
Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models
par: Seth, Ashish, et autres
Publié: (2026)
par: Seth, Ashish, et autres
Publié: (2026)
Do Audio-Visual Large Language Models Really See and Hear?
par: Selvakumar, Ramaneswaran, et autres
Publié: (2026)
par: Selvakumar, Ramaneswaran, et autres
Publié: (2026)
MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models
par: Wu, Xiyang, et autres
Publié: (2025)
par: Wu, Xiyang, et autres
Publié: (2025)
Room Impulse Response Synthesis via Differentiable Feedback Delay Networks for Efficient Spatial Audio Rendering
par: Gerami, Armin, et autres
Publié: (2025)
par: Gerami, Armin, et autres
Publié: (2025)
Music Flamingo: Scaling Music Understanding in Audio Language Models
par: Ghosh, Sreyan, et autres
Publié: (2025)
par: Ghosh, Sreyan, et autres
Publié: (2025)
A Closer Look at the Limitations of Instruction Tuning
par: Ghosh, Sreyan, et autres
Publié: (2024)
par: Ghosh, Sreyan, et autres
Publié: (2024)
Applying Automatic Differentiation to Optimize Differential Microphone Array Designs
par: Galougah, Siminfar Samakoush, et autres
Publié: (2024)
par: Galougah, Siminfar Samakoush, et autres
Publié: (2024)
Analytical Exploration of Spatial Audio Cues: A Differentiable Multi-Sphere Scattering Model
par: Galougah, Siminfar Samakoush, et autres
Publié: (2026)
par: Galougah, Siminfar Samakoush, et autres
Publié: (2026)
Biomimetic Frontend for Differentiable Audio Processing
par: Famularo, Ruolan Leslie, et autres
Publié: (2024)
par: Famularo, Ruolan Leslie, et autres
Publié: (2024)
Listen2Scene: Interactive material-aware binaural sound propagation for reconstructed 3D scenes
par: Ratnarajah, Anton, et autres
Publié: (2023)
par: Ratnarajah, Anton, et autres
Publié: (2023)
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
par: Lin, Yan-Bo, et autres
Publié: (2024)
par: Lin, Yan-Bo, et autres
Publié: (2024)
Temporally Aligned Audio for Video with Autoregression
par: Viertola, Ilpo, et autres
Publié: (2024)
par: Viertola, Ilpo, et autres
Publié: (2024)
Predicting User Intents and Musical Attributes from Music Discovery Conversations
par: Kwon, Daeyong, et autres
Publié: (2024)
par: Kwon, Daeyong, et autres
Publié: (2024)
Moment Sampling in Video LLMs for Long-Form Video QA
par: Chasmai, Mustafa, et autres
Publié: (2025)
par: Chasmai, Mustafa, et autres
Publié: (2025)
Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation
par: Zhou, Yupeng, et autres
Publié: (2026)
par: Zhou, Yupeng, et autres
Publié: (2026)
Do Vision-Language Models Understand Compound Nouns?
par: Kumar, Sonal, et autres
Publié: (2024)
par: Kumar, Sonal, et autres
Publié: (2024)
Cross-Modal Learning for Music-to-Music-Video Description Generation
par: Mao, Zhuoyuan, et autres
Publié: (2025)
par: Mao, Zhuoyuan, et autres
Publié: (2025)
Video-based Music Generation
par: Sulun, Serkan
Publié: (2026)
par: Sulun, Serkan
Publié: (2026)
Do Audio-Language Models Understand Linguistic Variations?
par: Selvakumar, Ramaneswaran, et autres
Publié: (2024)
par: Selvakumar, Ramaneswaran, et autres
Publié: (2024)
Learning Illumination Control in Diffusion Models
par: Anand, Nishit, et autres
Publié: (2026)
par: Anand, Nishit, et autres
Publié: (2026)
Sound Sparks Motion: Audio and Text Tuning for Video Editing
par: Razlighi, AmirHossein Naghi, et autres
Publié: (2026)
par: Razlighi, AmirHossein Naghi, et autres
Publié: (2026)
Beyond Musical Descriptors: Extracting Preference-Bearing Intent in Music Queries
par: Baranes, Marion, et autres
Publié: (2026)
par: Baranes, Marion, et autres
Publié: (2026)
Documents similaires
-
RECAP: Retrieval-Augmented Audio Captioning
par: Ghosh, Sreyan, et autres
Publié: (2023) -
SPUR: A Plug-and-Play Framework for Integrating Spatial Audio Understanding and Reasoning into Large Audio-Language Models
par: Sakshi, S, et autres
Publié: (2025) -
ReCLAP: Improving Zero Shot Audio Classification by Describing Sounds
par: Ghosh, Sreyan, et autres
Publié: (2024) -
Semi-Supervised Contrastive Learning for Controllable Video-to-Music Retrieval
par: Stewart, Shanti, et autres
Publié: (2024) -
MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark
par: Sakshi, S, et autres
Publié: (2024)