MUKA: Multi Kernel Audio Adaptation Of Audio-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bensaid, Reda, Ouasfi, Amine, Bendou, Yassir, Moummad, Ilyass, Gripon, Vincent, Leduc-Primeau, François, Boukhayma, Adnane |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ProKeR: A Kernel Perspective on Few-Shot Adaptation of Large Vision-Language Models
par: Bendou, Yassir, et autres
Publié: (2025)
par: Bendou, Yassir, et autres
Publié: (2025)
SLAD : Shared LoRA Adapters for Task Specific Distillation
par: Bensaid, Reda, et autres
Publié: (2026)
par: Bensaid, Reda, et autres
Publié: (2026)
Few-Shot Unsupervised Implicit Neural Shape Representation Learning with Spatial Adversaries
par: Ouasfi, Amine, et autres
Publié: (2024)
par: Ouasfi, Amine, et autres
Publié: (2024)
Unsupervised Occupancy Learning from Sparse Point Cloud
par: Ouasfi, Amine, et autres
Publié: (2024)
par: Ouasfi, Amine, et autres
Publié: (2024)
TensLoRA: Tensor Alternatives for Low-Rank Adaptation
par: Marmoret, Axel, et autres
Publié: (2025)
par: Marmoret, Axel, et autres
Publié: (2025)
Unmute the Patch Tokens: Rethinking Probing in Multi-Label Audio Classification
par: Rauch, Lukas, et autres
Publié: (2025)
par: Rauch, Lukas, et autres
Publié: (2025)
SparseCraft: Few-Shot Neural Reconstruction through Stereopsis Guided Geometric Linearization
par: Younes, Mae, et autres
Publié: (2024)
par: Younes, Mae, et autres
Publié: (2024)
Audio-to-Image Bird Species Retrieval without Audio-Image Pairs via Text Distillation
par: Moummad, Ilyass, et autres
Publié: (2026)
par: Moummad, Ilyass, et autres
Publié: (2026)
A Novel Benchmark for Few-Shot Semantic Segmentation in the Era of Foundation Models
par: Bensaid, Reda, et autres
Publié: (2024)
par: Bensaid, Reda, et autres
Publié: (2024)
Mixture of Mixups for Multi-label Classification of Rare Anuran Sounds
par: Moummad, Ilyass, et autres
Publié: (2024)
par: Moummad, Ilyass, et autres
Publié: (2024)
Self-Supervised Learning for Few-Shot Bird Sound Classification
par: Moummad, Ilyass, et autres
Publié: (2023)
par: Moummad, Ilyass, et autres
Publié: (2023)
Regularized Contrastive Pre-training for Few-shot Bioacoustic Sound Detection
par: Moummad, Ilyass, et autres
Publié: (2023)
par: Moummad, Ilyass, et autres
Publié: (2023)
Toward Robust Neural Reconstruction from Sparse Point Sets
par: Ouasfi, Amine, et autres
Publié: (2024)
par: Ouasfi, Amine, et autres
Publié: (2024)
Sparfels: Fast Reconstruction from Sparse Unposed Imagery
par: Jena, Shubhendu, et autres
Publié: (2025)
par: Jena, Shubhendu, et autres
Publié: (2025)
Domain-Invariant Representation Learning of Bird Sounds
par: Moummad, Ilyass, et autres
Publié: (2024)
par: Moummad, Ilyass, et autres
Publié: (2024)
Acoustic identification of individual animals with hierarchical contrastive learning
par: Nolasco, Ines, et autres
Publié: (2024)
par: Nolasco, Ines, et autres
Publié: (2024)
Domain Adaptation for Contrastive Audio-Language Models
par: Deshmukh, Soham, et autres
Publié: (2024)
par: Deshmukh, Soham, et autres
Publié: (2024)
Segmentwise Pruning in Audio-Language Models
par: Gibier, Marcel, et autres
Publié: (2025)
par: Gibier, Marcel, et autres
Publié: (2025)
MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
par: Tao, Ye, et autres
Publié: (2025)
par: Tao, Ye, et autres
Publié: (2025)
AudioToolAgent: An Agentic Framework for Audio-Language Models
par: Wijngaard, Gijs, et autres
Publié: (2025)
par: Wijngaard, Gijs, et autres
Publié: (2025)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
par: Luo, Kaiwen, et autres
Publié: (2026)
par: Luo, Kaiwen, et autres
Publié: (2026)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
par: Zhao, Junqi, et autres
Publié: (2025)
par: Zhao, Junqi, et autres
Publié: (2025)
Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models
par: Seth, Ashish, et autres
Publié: (2026)
par: Seth, Ashish, et autres
Publié: (2026)
UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
par: Yang, Dongchao, et autres
Publié: (2026)
par: Yang, Dongchao, et autres
Publié: (2026)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
par: Glazer, Neta, et autres
Publié: (2026)
par: Glazer, Neta, et autres
Publié: (2026)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
par: Wang, Yuxuan, et autres
Publié: (2026)
par: Wang, Yuxuan, et autres
Publié: (2026)
Pengi: An Audio Language Model for Audio Tasks
par: Deshmukh, Soham, et autres
Publié: (2023)
par: Deshmukh, Soham, et autres
Publié: (2023)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
par: Zhang, Dan, et autres
Publié: (2026)
par: Zhang, Dan, et autres
Publié: (2026)
Can Masked Autoencoders Also Listen to Birds?
par: Rauch, Lukas, et autres
Publié: (2025)
par: Rauch, Lukas, et autres
Publié: (2025)
A Sensitivity Analysis of Multi-Event Audio Grounding in Audio LLMs
par: Lee, Taehan, et autres
Publié: (2026)
par: Lee, Taehan, et autres
Publié: (2026)
ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling
par: Yang, Dongchao, et autres
Publié: (2025)
par: Yang, Dongchao, et autres
Publié: (2025)
The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization
par: Zhang, Ruixing, et autres
Publié: (2026)
par: Zhang, Ruixing, et autres
Publié: (2026)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
par: Chen, Wei-Chih, et autres
Publié: (2026)
par: Chen, Wei-Chih, et autres
Publié: (2026)
PAM: Prompting Audio-Language Models for Audio Quality Assessment
par: Deshmukh, Soham, et autres
Publié: (2024)
par: Deshmukh, Soham, et autres
Publié: (2024)
Focus Then Listen: Exploring Plug-and-Play Audio Enhancer for Noise-Robust Large Audio Language Models
par: Yin, Han, et autres
Publié: (2026)
par: Yin, Han, et autres
Publié: (2026)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
par: Li, Xiquan, et autres
Publié: (2026)
par: Li, Xiquan, et autres
Publié: (2026)
Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio
par: Chen, Gongyu, et autres
Publié: (2024)
par: Chen, Gongyu, et autres
Publié: (2024)
Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models
par: Chen, Yiming, et autres
Publié: (2024)
par: Chen, Yiming, et autres
Publié: (2024)
Words at Play: Benchmarking Audio Pun Understanding in Large Audio-Language Models
par: Su, Yuchen, et autres
Publié: (2026)
par: Su, Yuchen, et autres
Publié: (2026)
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
par: Lee, Kuan-Yi, et autres
Publié: (2025)
par: Lee, Kuan-Yi, et autres
Publié: (2025)
Documents similaires
-
ProKeR: A Kernel Perspective on Few-Shot Adaptation of Large Vision-Language Models
par: Bendou, Yassir, et autres
Publié: (2025) -
SLAD : Shared LoRA Adapters for Task Specific Distillation
par: Bensaid, Reda, et autres
Publié: (2026) -
Few-Shot Unsupervised Implicit Neural Shape Representation Learning with Spatial Adversaries
par: Ouasfi, Amine, et autres
Publié: (2024) -
Unsupervised Occupancy Learning from Sparse Point Cloud
par: Ouasfi, Amine, et autres
Publié: (2024) -
TensLoRA: Tensor Alternatives for Low-Rank Adaptation
par: Marmoret, Axel, et autres
Publié: (2025)