Towards Audio Token Compression in Large Audio Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Bhati, Saurabhchand, Thomas, Samuel, Kuehne, Hilde, Feris, Rogerio, Glass, James |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
State-Space Large Audio Language Models
por: Bhati, Saurabhchand, et al.
Publicado: (2024)
por: Bhati, Saurabhchand, et al.
Publicado: (2024)
DASS: Distilled Audio State Space Models Are Stronger and More Duration-Scalable Learners
por: Bhati, Saurabhchand, et al.
Publicado: (2024)
por: Bhati, Saurabhchand, et al.
Publicado: (2024)
Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?
por: Rouditchenko, Andrew, et al.
Publicado: (2025)
por: Rouditchenko, Andrew, et al.
Publicado: (2025)
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition
por: Rouditchenko, Andrew, et al.
Publicado: (2025)
por: Rouditchenko, Andrew, et al.
Publicado: (2025)
USAD: Universal Speech and Audio Representation via Distillation
por: Chang, Heng-Jui, et al.
Publicado: (2025)
por: Chang, Heng-Jui, et al.
Publicado: (2025)
CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment
por: Araujo, Edson, et al.
Publicado: (2025)
por: Araujo, Edson, et al.
Publicado: (2025)
Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation
por: Rouditchenko, Andrew, et al.
Publicado: (2024)
por: Rouditchenko, Andrew, et al.
Publicado: (2024)
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
por: Goel, Arushi, et al.
Publicado: (2025)
por: Goel, Arushi, et al.
Publicado: (2025)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
por: Li, Kai, et al.
Publicado: (2025)
por: Li, Kai, et al.
Publicado: (2025)
Audio-Aware Large Language Models as Judges for Speaking Styles
por: Chiang, Cheng-Han, et al.
Publicado: (2025)
por: Chiang, Cheng-Han, et al.
Publicado: (2025)
Extending Audio Context for Long-Form Understanding in Large Audio-Language Models
por: Chaichana, Yuatyong, et al.
Publicado: (2025)
por: Chaichana, Yuatyong, et al.
Publicado: (2025)
Benchmarking Open-ended Audio Dialogue Understanding for Large Audio-Language Models
por: Gao, Kuofeng, et al.
Publicado: (2024)
por: Gao, Kuofeng, et al.
Publicado: (2024)
Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey
por: Yang, Chih-Kai, et al.
Publicado: (2025)
por: Yang, Chih-Kai, et al.
Publicado: (2025)
SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models
por: Yang, Chih-Kai, et al.
Publicado: (2025)
por: Yang, Chih-Kai, et al.
Publicado: (2025)
Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models
por: Chen, Yiming, et al.
Publicado: (2024)
por: Chen, Yiming, et al.
Publicado: (2024)
AudioBERT: Audio Knowledge Augmented Language Model
por: Ok, Hyunjong, et al.
Publicado: (2024)
por: Ok, Hyunjong, et al.
Publicado: (2024)
AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models
por: Yang, Chih-Kai, et al.
Publicado: (2025)
por: Yang, Chih-Kai, et al.
Publicado: (2025)
GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities
por: Ghosh, Sreyan, et al.
Publicado: (2024)
por: Ghosh, Sreyan, et al.
Publicado: (2024)
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
por: Foo, Leonardo Haw-Yang, et al.
Publicado: (2026)
por: Foo, Leonardo Haw-Yang, et al.
Publicado: (2026)
Discrete Audio Tokens: More Than a Survey!
por: Mousavi, Pooneh, et al.
Publicado: (2025)
por: Mousavi, Pooneh, et al.
Publicado: (2025)
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music
por: Ghosh, Sreyan, et al.
Publicado: (2026)
por: Ghosh, Sreyan, et al.
Publicado: (2026)
Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation
por: Xue, Jinlong, et al.
Publicado: (2024)
por: Xue, Jinlong, et al.
Publicado: (2024)
MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
por: Yang, Chih-Kai, et al.
Publicado: (2026)
por: Yang, Chih-Kai, et al.
Publicado: (2026)
How Should We Extract Discrete Audio Tokens from Self-Supervised Models?
por: Mousavi, Pooneh, et al.
Publicado: (2024)
por: Mousavi, Pooneh, et al.
Publicado: (2024)
Investigating Safety Vulnerabilities of Large Audio-Language Models Under Speaker Emotional Variations
por: Feng, Bo-Han, et al.
Publicado: (2025)
por: Feng, Bo-Han, et al.
Publicado: (2025)
When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition
por: Moure, Pehuén, et al.
Publicado: (2026)
por: Moure, Pehuén, et al.
Publicado: (2026)
KoALa-Bench: Evaluating Large Audio Language Models on Korean Speech Understanding and Faithfulness
por: Kim, Jinyoung, et al.
Publicado: (2026)
por: Kim, Jinyoung, et al.
Publicado: (2026)
ALICE: A Multifaceted Evaluation Framework of Large Audio-Language Models' In-Context Learning Ability
por: Piao, Yen-Ting, et al.
Publicado: (2026)
por: Piao, Yen-Ting, et al.
Publicado: (2026)
AudioMarathon: A Comprehensive Benchmark for Long-Context Audio Understanding and Efficiency in Audio LLMs
por: He, Peize, et al.
Publicado: (2025)
por: He, Peize, et al.
Publicado: (2025)
Hello-Chat: Towards Realistic Social Audio Interactions
por: Hou, Yueran, et al.
Publicado: (2026)
por: Hou, Yueran, et al.
Publicado: (2026)
Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models
por: Ieong, Lok-Lam, et al.
Publicado: (2026)
por: Ieong, Lok-Lam, et al.
Publicado: (2026)
Enhancing Low-Resource Language and Instruction Following Capabilities of Audio Language Models
por: Manakul, Potsawee, et al.
Publicado: (2024)
por: Manakul, Potsawee, et al.
Publicado: (2024)
Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models
por: Xie, Zhifei, et al.
Publicado: (2025)
por: Xie, Zhifei, et al.
Publicado: (2025)
Style-Talker: Finetuning Audio Language Model and Style-Based Text-to-Speech Model for Fast Spoken Dialogue Generation
por: Li, Yinghao Aaron, et al.
Publicado: (2024)
por: Li, Yinghao Aaron, et al.
Publicado: (2024)
CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models
por: Ghosh, Sreyan, et al.
Publicado: (2023)
por: Ghosh, Sreyan, et al.
Publicado: (2023)
MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders
por: Zhang, Wenyu, et al.
Publicado: (2024)
por: Zhang, Wenyu, et al.
Publicado: (2024)
Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model
por: Ye, Zhen, et al.
Publicado: (2024)
por: Ye, Zhen, et al.
Publicado: (2024)
ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling
por: Jiang, Yuxuan, et al.
Publicado: (2025)
por: Jiang, Yuxuan, et al.
Publicado: (2025)
PAL: Probing Audio Encoders via LLMs -- Audio Information Transfer into LLMs
por: Alex, Tony, et al.
Publicado: (2025)
por: Alex, Tony, et al.
Publicado: (2025)
MMMOS: Multi-domain Multi-axis Audio Quality Assessment
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
por: Lin, Yi-Cheng, et al.
Publicado: (2025)
Ejemplares similares
-
State-Space Large Audio Language Models
por: Bhati, Saurabhchand, et al.
Publicado: (2024) -
DASS: Distilled Audio State Space Models Are Stronger and More Duration-Scalable Learners
por: Bhati, Saurabhchand, et al.
Publicado: (2024) -
Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?
por: Rouditchenko, Andrew, et al.
Publicado: (2025) -
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition
por: Rouditchenko, Andrew, et al.
Publicado: (2025) -
USAD: Universal Speech and Audio Representation via Distillation
por: Chang, Heng-Jui, et al.
Publicado: (2025)