Aurelia: Test-time Reasoning Distillation in Audio-Visual LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Chowdhury, Sanjoy, Gani, Hanan, Anand, Nishit, Nag, Sayan, Gao, Ruohan, Elhoseiny, Mohamed, Khan, Salman, Manocha, Dinesh |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Meerkat: Audio-Visual Large Language Model for Grounding in Space and Time
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2024)
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2024)
TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification
di: Anand, Nishit, et al.
Pubblicazione: (2024)
di: Anand, Nishit, et al.
Pubblicazione: (2024)
MeLFusion: Synthesizing Music from Image and Language Cues using Diffusion Models
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2024)
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2024)
Do Audio-Language Models Understand Linguistic Variations?
di: Selvakumar, Ramaneswaran, et al.
Pubblicazione: (2024)
di: Selvakumar, Ramaneswaran, et al.
Pubblicazione: (2024)
AVTrustBench: Assessing and Enhancing Reliability and Robustness in Audio-Visual LLMs
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2025)
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2025)
PAT: Parameter-Free Audio-Text Aligner to Boost Zero-Shot Audio Classification
di: Seth, Ashish, et al.
Pubblicazione: (2024)
di: Seth, Ashish, et al.
Pubblicazione: (2024)
SPUR: A Plug-and-Play Framework for Integrating Spatial Audio Understanding and Reasoning into Large Audio-Language Models
di: Sakshi, S, et al.
Pubblicazione: (2025)
di: Sakshi, S, et al.
Pubblicazione: (2025)
MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2025)
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2025)
SILA: Signal-to-Language Augmentation for Enhanced Control in Text-to-Audio Generation
di: Kumar, Sonal, et al.
Pubblicazione: (2024)
di: Kumar, Sonal, et al.
Pubblicazione: (2024)
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
di: Ghosh, Sreyan, et al.
Pubblicazione: (2025)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2025)
Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation Models
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
SALAD-VAE: Semantic Audio Compression with Language-Audio Distillation
di: Braun, Sebastian, et al.
Pubblicazione: (2025)
di: Braun, Sebastian, et al.
Pubblicazione: (2025)
GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
Gencho: Room Impulse Response Generation from Reverberant Speech and Text via Diffusion Transformers
di: Lin, Jackie, et al.
Pubblicazione: (2026)
di: Lin, Jackie, et al.
Pubblicazione: (2026)
MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark
di: Sakshi, S, et al.
Pubblicazione: (2024)
di: Sakshi, S, et al.
Pubblicazione: (2024)
ReCLAP: Improving Zero Shot Audio Classification by Describing Sounds
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
Synthio: Augmenting Small-Scale Audio Classification Datasets with Synthetic Data
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
RECAP: Retrieval-Augmented Audio Captioning
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music
di: Ghosh, Sreyan, et al.
Pubblicazione: (2026)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2026)
CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models
di: Li, Longhao, et al.
Pubblicazione: (2026)
di: Li, Longhao, et al.
Pubblicazione: (2026)
Generative AI in Signal Processing Education: An Audio Foundation Model Based Approach
di: Khan, Muhammad Salman, et al.
Pubblicazione: (2026)
di: Khan, Muhammad Salman, et al.
Pubblicazione: (2026)
ModalityMirror: Improving Audio Classification in Modality Heterogeneity Federated Learning with Multimodal Distillation
di: Feng, Tiantian, et al.
Pubblicazione: (2024)
di: Feng, Tiantian, et al.
Pubblicazione: (2024)
Audio-Visual Speech Enhancement for Spatial Audio - Spatial-VisualVoice and the MAVE Database
di: Yaffe, Danielle, et al.
Pubblicazione: (2025)
di: Yaffe, Danielle, et al.
Pubblicazione: (2025)
Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs
di: Anand, et al.
Pubblicazione: (2025)
di: Anand, et al.
Pubblicazione: (2025)
Teaching Audio Models to Reason: A Unified Framework for Source- and Layer-wise Distillation
di: Yang, Runyan, et al.
Pubblicazione: (2025)
di: Yang, Runyan, et al.
Pubblicazione: (2025)
MMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence
di: Kumar, Sonal, et al.
Pubblicazione: (2025)
di: Kumar, Sonal, et al.
Pubblicazione: (2025)
Music Flamingo: Scaling Music Understanding in Audio Language Models
di: Ghosh, Sreyan, et al.
Pubblicazione: (2025)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2025)
SONAR: Self-Distilled Continual Pre-training for Domain Adaptive Audio Representation
di: Zhang, Yizhou, et al.
Pubblicazione: (2025)
di: Zhang, Yizhou, et al.
Pubblicazione: (2025)
Probing Cross-modal Information Hubs in Audio-Visual LLMs
di: Jung, Jihoo, et al.
Pubblicazione: (2026)
di: Jung, Jihoo, et al.
Pubblicazione: (2026)
AudioLog: LLMs-Powered Long Audio Logging with Hybrid Token-Semantic Contrastive Learning
di: Bai, Jisheng, et al.
Pubblicazione: (2023)
di: Bai, Jisheng, et al.
Pubblicazione: (2023)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
Interpretable Audio Editing Evaluation via Chain-of-Thought Difference-Commonality Reasoning with Multimodal LLMs
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
ProSE: Diffusion Priors for Speech Enhancement
di: Kumar, Sonal, et al.
Pubblicazione: (2025)
di: Kumar, Sonal, et al.
Pubblicazione: (2025)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
A Survey of Audio Reasoning in Multimodal Foundation Models
di: Guo, Zhihan, et al.
Pubblicazione: (2026)
di: Guo, Zhihan, et al.
Pubblicazione: (2026)
DASS: Distilled Audio State Space Models Are Stronger and More Duration-Scalable Learners
di: Bhati, Saurabhchand, et al.
Pubblicazione: (2024)
di: Bhati, Saurabhchand, et al.
Pubblicazione: (2024)
Interpreting the Role of Visemes in Audio-Visual Speech Recognition
di: Papadopoulos, Aristeidis, et al.
Pubblicazione: (2025)
di: Papadopoulos, Aristeidis, et al.
Pubblicazione: (2025)
Structural and Statistical Audio Texture Knowledge Distillation for Acoustic Classification
di: Ritu, Jarin, et al.
Pubblicazione: (2025)
di: Ritu, Jarin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Meerkat: Audio-Visual Large Language Model for Grounding in Space and Time
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2024) -
TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification
di: Anand, Nishit, et al.
Pubblicazione: (2024) -
MeLFusion: Synthesizing Music from Image and Language Cues using Diffusion Models
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2024) -
Do Audio-Language Models Understand Linguistic Variations?
di: Selvakumar, Ramaneswaran, et al.
Pubblicazione: (2024) -
AVTrustBench: Assessing and Enhancing Reliability and Robustness in Audio-Visual LLMs
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2025)