ReCLAP: Improving Zero Shot Audio Classification by Describing Sounds
Fuente:
arXiv
Salvato in:
| Autori principali: | Ghosh, Sreyan, Kumar, Sonal, Evuru, Chandra Kiran Reddy, Nieto, Oriol, Duraiswami, Ramani, Manocha, Dinesh |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RECAP: Retrieval-Augmented Audio Captioning
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
PAT: Parameter-Free Audio-Text Aligner to Boost Zero-Shot Audio Classification
di: Seth, Ashish, et al.
Pubblicazione: (2024)
di: Seth, Ashish, et al.
Pubblicazione: (2024)
MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark
di: Sakshi, S, et al.
Pubblicazione: (2024)
di: Sakshi, S, et al.
Pubblicazione: (2024)
TSPE: Task-Specific Prompt Ensemble for Improved Zero-Shot Audio Classification
di: Anand, Nishit, et al.
Pubblicazione: (2024)
di: Anand, Nishit, et al.
Pubblicazione: (2024)
ProSE: Diffusion Priors for Speech Enhancement
di: Kumar, Sonal, et al.
Pubblicazione: (2025)
di: Kumar, Sonal, et al.
Pubblicazione: (2025)
SILA: Signal-to-Language Augmentation for Enhanced Control in Text-to-Audio Generation
di: Kumar, Sonal, et al.
Pubblicazione: (2024)
di: Kumar, Sonal, et al.
Pubblicazione: (2024)
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
di: Goel, Arushi, et al.
Pubblicazione: (2025)
di: Goel, Arushi, et al.
Pubblicazione: (2025)
Room Impulse Response Synthesis via Differentiable Feedback Delay Networks for Efficient Spatial Audio Rendering
di: Gerami, Armin, et al.
Pubblicazione: (2025)
di: Gerami, Armin, et al.
Pubblicazione: (2025)
Do Audio-Language Models Understand Linguistic Variations?
di: Selvakumar, Ramaneswaran, et al.
Pubblicazione: (2024)
di: Selvakumar, Ramaneswaran, et al.
Pubblicazione: (2024)
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
di: Ghosh, Sreyan, et al.
Pubblicazione: (2025)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2025)
SPUR: A Plug-and-Play Framework for Integrating Spatial Audio Understanding and Reasoning into Large Audio-Language Models
di: Sakshi, S, et al.
Pubblicazione: (2025)
di: Sakshi, S, et al.
Pubblicazione: (2025)
Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning
di: Yang, Chao-Han Huck, et al.
Pubblicazione: (2025)
di: Yang, Chao-Han Huck, et al.
Pubblicazione: (2025)
Applying Automatic Differentiation to Optimize Differential Microphone Array Designs
di: Galougah, Siminfar Samakoush, et al.
Pubblicazione: (2024)
di: Galougah, Siminfar Samakoush, et al.
Pubblicazione: (2024)
EH-MAM: Easy-to-Hard Masked Acoustic Modeling for Self-Supervised Speech Representation Learning
di: Seth, Ashish, et al.
Pubblicazione: (2024)
di: Seth, Ashish, et al.
Pubblicazione: (2024)
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music
di: Ghosh, Sreyan, et al.
Pubblicazione: (2026)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2026)
LipGER: Visually-Conditioned Generative Error Correction for Robust Automatic Speech Recognition
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations
di: García, Hugo Flores, et al.
Pubblicazione: (2024)
di: García, Hugo Flores, et al.
Pubblicazione: (2024)
Masked Audio Modeling with CLAP and Multi-Objective Learning
di: Xin, Yifei, et al.
Pubblicazione: (2024)
di: Xin, Yifei, et al.
Pubblicazione: (2024)
Zero-Shot Crate Digging: DJ Tool Retrieval Using Speech Activity, Music Structure And CLAP Embeddings
di: Orife, Iroro
Pubblicazione: (2024)
di: Orife, Iroro
Pubblicazione: (2024)
MMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence
di: Kumar, Sonal, et al.
Pubblicazione: (2025)
di: Kumar, Sonal, et al.
Pubblicazione: (2025)
Synthio: Augmenting Small-Scale Audio Classification Datasets with Synthetic Data
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
Failing Forward: Improving Generative Error Correction for ASR with Synthetic Data and Retrieval Augmentation
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
Text2FX: Harnessing CLAP Embeddings for Text-Guided Audio Effects
di: Chu, Annie, et al.
Pubblicazione: (2024)
di: Chu, Annie, et al.
Pubblicazione: (2024)
EnCLAP++: Analyzing the EnCLAP Framework for Optimizing Automated Audio Captioning Performance
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
DRCap: Decoding CLAP Latents with Retrieval-Augmented Generation for Zero-shot Audio Captioning
di: Li, Xiquan, et al.
Pubblicazione: (2024)
di: Li, Xiquan, et al.
Pubblicazione: (2024)
SmoothCLAP: Soft-Target Enhanced Contrastive Language\--Audio Pretraining for Affective Computing
di: Jing, Xin, et al.
Pubblicazione: (2026)
di: Jing, Xin, et al.
Pubblicazione: (2026)
SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs
di: Chen, Wenxi, et al.
Pubblicazione: (2024)
di: Chen, Wenxi, et al.
Pubblicazione: (2024)
Enhancing Zero-shot Audio Classification using Sound Attribute Knowledge from Large Language Models
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
The TMU System for the XACLE Challenge: Training Large Audio Language Models with CLAP Pseudo-Labels
di: Tsutsumi, Ayuto, et al.
Pubblicazione: (2026)
di: Tsutsumi, Ayuto, et al.
Pubblicazione: (2026)
Multi-label Zero-Shot Audio Classification with Temporal Attention
di: Dogan, Duygu, et al.
Pubblicazione: (2024)
di: Dogan, Duygu, et al.
Pubblicazione: (2024)
Zero-Shot Audio Captioning Using Soft and Hard Prompts
di: Zhang, Yiming, et al.
Pubblicazione: (2024)
di: Zhang, Yiming, et al.
Pubblicazione: (2024)
Embedding-Space Diffusion for Zero-Shot Environmental Sound Classification
di: Sims, Ysobel, et al.
Pubblicazione: (2024)
di: Sims, Ysobel, et al.
Pubblicazione: (2024)
RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval
di: Sun, Haoqin, et al.
Pubblicazione: (2025)
di: Sun, Haoqin, et al.
Pubblicazione: (2025)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
Biomimetic Frontend for Differentiable Audio Processing
di: Famularo, Ruolan Leslie, et al.
Pubblicazione: (2024)
di: Famularo, Ruolan Leslie, et al.
Pubblicazione: (2024)
Audiobox TTA-RAG: Improving Zero-Shot and Few-Shot Text-To-Audio with Retrieval-Augmented Generation
di: Yang, Mu, et al.
Pubblicazione: (2024)
di: Yang, Mu, et al.
Pubblicazione: (2024)
Can Quantized Audio Language Models Perform Zero-Shot Spoofing Detection?
di: Dutta, Bikash, et al.
Pubblicazione: (2025)
di: Dutta, Bikash, et al.
Pubblicazione: (2025)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
Documenti analoghi
-
RECAP: Retrieval-Augmented Audio Captioning
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023) -
GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024) -
CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023) -
PAT: Parameter-Free Audio-Text Aligner to Boost Zero-Shot Audio Classification
di: Seth, Ashish, et al.
Pubblicazione: (2024) -
MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark
di: Sakshi, S, et al.
Pubblicazione: (2024)