On Barriers to Archival Audio Processing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sullivan, Peter, Abdul-Mageed, Muhammad |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
To Distill or Not to Distill? On the Robustness of Robust Knowledge Distillation
par: Waheed, Abdul, et autres
Publié: (2024)
par: Waheed, Abdul, et autres
Publié: (2024)
Towards Zero-Shot Text-To-Speech for Arabic Dialects
par: Doan, Khai Duy, et autres
Publié: (2024)
par: Doan, Khai Duy, et autres
Publié: (2024)
uDistil-Whisper: Label-Free Data Filtering for Knowledge Distillation in Low-Data Regimes
par: Waheed, Abdul, et autres
Publié: (2024)
par: Waheed, Abdul, et autres
Publié: (2024)
PAL: Probing Audio Encoders via LLMs -- Audio Information Transfer into LLMs
par: Alex, Tony, et autres
Publié: (2025)
par: Alex, Tony, et autres
Publié: (2025)
Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models
par: Chen, Yiming, et autres
Publié: (2024)
par: Chen, Yiming, et autres
Publié: (2024)
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
par: Foo, Leonardo Haw-Yang, et autres
Publié: (2026)
par: Foo, Leonardo Haw-Yang, et autres
Publié: (2026)
AudioMarathon: A Comprehensive Benchmark for Long-Context Audio Understanding and Efficiency in Audio LLMs
par: He, Peize, et autres
Publié: (2025)
par: He, Peize, et autres
Publié: (2025)
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
par: Goel, Arushi, et autres
Publié: (2025)
par: Goel, Arushi, et autres
Publié: (2025)
AudioBERT: Audio Knowledge Augmented Language Model
par: Ok, Hyunjong, et autres
Publié: (2024)
par: Ok, Hyunjong, et autres
Publié: (2024)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
par: Li, Kai, et autres
Publié: (2025)
par: Li, Kai, et autres
Publié: (2025)
MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders
par: Zhang, Wenyu, et autres
Publié: (2024)
par: Zhang, Wenyu, et autres
Publié: (2024)
Extending Audio Context for Long-Form Understanding in Large Audio-Language Models
par: Chaichana, Yuatyong, et autres
Publié: (2025)
par: Chaichana, Yuatyong, et autres
Publié: (2025)
Benchmarking Open-ended Audio Dialogue Understanding for Large Audio-Language Models
par: Gao, Kuofeng, et autres
Publié: (2024)
par: Gao, Kuofeng, et autres
Publié: (2024)
AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models
par: Yang, Chih-Kai, et autres
Publié: (2025)
par: Yang, Chih-Kai, et autres
Publié: (2025)
Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music
par: Ghosh, Sreyan, et autres
Publié: (2026)
par: Ghosh, Sreyan, et autres
Publié: (2026)
GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities
par: Ghosh, Sreyan, et autres
Publié: (2024)
par: Ghosh, Sreyan, et autres
Publié: (2024)
Fun-Audio-Chat Technical Report
par: Tongyi Fun Team, et autres
Publié: (2025)
par: Tongyi Fun Team, et autres
Publié: (2025)
BLAB: Brutally Long Audio Bench
par: Ahia, Orevaoghene, et autres
Publié: (2025)
par: Ahia, Orevaoghene, et autres
Publié: (2025)
RECAP: Retrieval-Augmented Audio Captioning
par: Ghosh, Sreyan, et autres
Publié: (2023)
par: Ghosh, Sreyan, et autres
Publié: (2023)
ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling
par: Jiang, Yuxuan, et autres
Publié: (2025)
par: Jiang, Yuxuan, et autres
Publié: (2025)
An Investigation Into Explainable Audio Hate Speech Detection
par: An, Jinmyeong, et autres
Publié: (2024)
par: An, Jinmyeong, et autres
Publié: (2024)
Discrete Audio Tokens: More Than a Survey!
par: Mousavi, Pooneh, et autres
Publié: (2025)
par: Mousavi, Pooneh, et autres
Publié: (2025)
Hello-Chat: Towards Realistic Social Audio Interactions
par: Hou, Yueran, et autres
Publié: (2026)
par: Hou, Yueran, et autres
Publié: (2026)
InstructAudio: Unified speech and music generation with natural language instruction
par: Qiang, Chunyu, et autres
Publié: (2025)
par: Qiang, Chunyu, et autres
Publié: (2025)
CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models
par: Ghosh, Sreyan, et autres
Publié: (2023)
par: Ghosh, Sreyan, et autres
Publié: (2023)
Audio Contrastive-based Fine-tuning: Decoupling Representation Learning and Classification
par: Wang, Yang, et autres
Publié: (2023)
par: Wang, Yang, et autres
Publié: (2023)
MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark
par: Sakshi, S, et autres
Publié: (2024)
par: Sakshi, S, et autres
Publié: (2024)
ASDA: Audio Spectrogram Differential Attention Mechanism for Self-Supervised Representation Learning
par: Wang, Junyu, et autres
Publié: (2025)
par: Wang, Junyu, et autres
Publié: (2025)
Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey
par: Yang, Chih-Kai, et autres
Publié: (2025)
par: Yang, Chih-Kai, et autres
Publié: (2025)
SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models
par: Yang, Chih-Kai, et autres
Publié: (2025)
par: Yang, Chih-Kai, et autres
Publié: (2025)
Kling-Foley: Multimodal Diffusion Transformer for High-Quality Video-to-Audio Generation
par: Wang, Jun, et autres
Publié: (2025)
par: Wang, Jun, et autres
Publié: (2025)
Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio
par: He, Xinlu, et autres
Publié: (2025)
par: He, Xinlu, et autres
Publié: (2025)
Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation
par: Xue, Jinlong, et autres
Publié: (2024)
par: Xue, Jinlong, et autres
Publié: (2024)
Leveraging Audio and Text Modalities in Mental Health: A Study of LLMs Performance
par: Ali, Abdelrahman A., et autres
Publié: (2024)
par: Ali, Abdelrahman A., et autres
Publié: (2024)
Enhancing Low-Resource Language and Instruction Following Capabilities of Audio Language Models
par: Manakul, Potsawee, et autres
Publié: (2024)
par: Manakul, Potsawee, et autres
Publié: (2024)
Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model
par: Ye, Zhen, et autres
Publié: (2024)
par: Ye, Zhen, et autres
Publié: (2024)
MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
par: Yang, Chih-Kai, et autres
Publié: (2026)
par: Yang, Chih-Kai, et autres
Publié: (2026)
MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks
par: Niu, Yadong, et autres
Publié: (2025)
par: Niu, Yadong, et autres
Publié: (2025)
CMDAR: A Chinese Multi-scene Dynamic Audio Reasoning Benchmark with Diverse Challenges
par: Li, Hui, et autres
Publié: (2025)
par: Li, Hui, et autres
Publié: (2025)
Ming-UniAudio: Speech LLM for Joint Understanding, Generation and Editing with Unified Representation
par: Yan, Canxiang, et autres
Publié: (2025)
par: Yan, Canxiang, et autres
Publié: (2025)
Documents similaires
-
To Distill or Not to Distill? On the Robustness of Robust Knowledge Distillation
par: Waheed, Abdul, et autres
Publié: (2024) -
Towards Zero-Shot Text-To-Speech for Arabic Dialects
par: Doan, Khai Duy, et autres
Publié: (2024) -
uDistil-Whisper: Label-Free Data Filtering for Knowledge Distillation in Low-Data Regimes
par: Waheed, Abdul, et autres
Publié: (2024) -
PAL: Probing Audio Encoders via LLMs -- Audio Information Transfer into LLMs
par: Alex, Tony, et autres
Publié: (2025) -
Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models
par: Chen, Yiming, et autres
Publié: (2024)