Salvato in:
| Autori principali: | Lee, Insung, Jeong, Taeyoung, Yoo, Haejun, Chang, Du-Seong, Koo, Myoung-Wan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2603.19615 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval
di: Yoo, HaeJun, et al.
Pubblicazione: (2026)
di: Yoo, HaeJun, et al.
Pubblicazione: (2026)
EnCLAP++: Analyzing the EnCLAP Framework for Optimizing Automated Audio Captioning Performance
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
Benchmarking and Confidence Evaluation of LALMs For Temporal Reasoning
di: Bhattacharya, Debarpan, et al.
Pubblicazione: (2025)
di: Bhattacharya, Debarpan, et al.
Pubblicazione: (2025)
Expanding on EnCLAP with Auxiliary Retrieval Model for Automated Audio Captioning
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
EvA: An Evidence-First Audio Understanding Paradigm for LALMs
di: Xie, Xinyuan, et al.
Pubblicazione: (2026)
di: Xie, Xinyuan, et al.
Pubblicazione: (2026)
Speech Recognition-based Feature Extraction for Enhanced Automatic Severity Classification in Dysarthric Speech
di: Choi, Yerin, et al.
Pubblicazione: (2024)
di: Choi, Yerin, et al.
Pubblicazione: (2024)
DRCap: Decoding CLAP Latents with Retrieval-Augmented Generation for Zero-shot Audio Captioning
di: Li, Xiquan, et al.
Pubblicazione: (2024)
di: Li, Xiquan, et al.
Pubblicazione: (2024)
AudioBERT: Audio Knowledge Augmented Language Model
di: Ok, Hyunjong, et al.
Pubblicazione: (2024)
di: Ok, Hyunjong, et al.
Pubblicazione: (2024)
Inappropriate Pause Detection In Dysarthric Speech Using Large-Scale Speech Recognition
di: Lee, Jeehyun, et al.
Pubblicazione: (2024)
di: Lee, Jeehyun, et al.
Pubblicazione: (2024)
RECAP: Retrieval-Augmented Audio Captioning
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining
di: Diwan, Anuj, et al.
Pubblicazione: (2026)
di: Diwan, Anuj, et al.
Pubblicazione: (2026)
When Scaling Fails: Mitigating Audio Perception Decay of LALMs via Multi-Step Perception-Aware Reasoning
di: Mao, Ruixiang, et al.
Pubblicazione: (2026)
di: Mao, Ruixiang, et al.
Pubblicazione: (2026)
Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation
di: Feng, Bo-Han, et al.
Pubblicazione: (2026)
di: Feng, Bo-Han, et al.
Pubblicazione: (2026)
BRACE: A Benchmark for Robust Audio Caption Quality Evaluation
di: Guo, Tianyu, et al.
Pubblicazione: (2025)
di: Guo, Tianyu, et al.
Pubblicazione: (2025)
T-CLAP: Temporal-Enhanced Contrastive Language-Audio Pretraining
di: Yuan, Yi, et al.
Pubblicazione: (2024)
di: Yuan, Yi, et al.
Pubblicazione: (2024)
ReCLAP: Improving Zero Shot Audio Classification by Describing Sounds
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2024)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
FLowHigh: Towards Efficient and High-Quality Audio Super-Resolution with Single-Step Flow Matching
di: Yun, Jun-Hak, et al.
Pubblicazione: (2025)
di: Yun, Jun-Hak, et al.
Pubblicazione: (2025)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
tinyCLAP: Distilling Constrastive Language-Audio Pretrained Models
di: Paissan, Francesco, et al.
Pubblicazione: (2023)
di: Paissan, Francesco, et al.
Pubblicazione: (2023)
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
di: Foo, Leonardo Haw-Yang, et al.
Pubblicazione: (2026)
di: Foo, Leonardo Haw-Yang, et al.
Pubblicazione: (2026)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization
di: Luo, Jiehui, et al.
Pubblicazione: (2025)
di: Luo, Jiehui, et al.
Pubblicazione: (2025)
SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs
di: Chen, Wenxi, et al.
Pubblicazione: (2024)
di: Chen, Wenxi, et al.
Pubblicazione: (2024)
Revealing the Role of Audio Channels in ASR Performance Degradation
di: Huang, Kuan-Tang, et al.
Pubblicazione: (2025)
di: Huang, Kuan-Tang, et al.
Pubblicazione: (2025)
Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs
di: Yin, Han, et al.
Pubblicazione: (2025)
di: Yin, Han, et al.
Pubblicazione: (2025)
Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions
di: Tian, Jinchuan, et al.
Pubblicazione: (2026)
di: Tian, Jinchuan, et al.
Pubblicazione: (2026)
Diverse Audio Embeddings -- Bringing Features Back Outperforms CLAP!
di: Verma, Prateek
Pubblicazione: (2023)
di: Verma, Prateek
Pubblicazione: (2023)
AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
Improving Text-To-Audio Models with Synthetic Captions
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
Audio ControlNet for Fine-Grained Audio Generation and Editing
di: Zhu, Haina, et al.
Pubblicazione: (2026)
di: Zhu, Haina, et al.
Pubblicazione: (2026)
Spatial Audio Motion Understanding and Reasoning
di: Sridhar, Arvind Krishna, et al.
Pubblicazione: (2025)
di: Sridhar, Arvind Krishna, et al.
Pubblicazione: (2025)
Fish Audio S2 Technical Report
di: Liao, Shijia, et al.
Pubblicazione: (2026)
di: Liao, Shijia, et al.
Pubblicazione: (2026)
Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody
di: Yoon, Jinsung, et al.
Pubblicazione: (2025)
di: Yoon, Jinsung, et al.
Pubblicazione: (2025)
Classifier-Guided Captioning Across Modalities
di: Shaulov, Ariel, et al.
Pubblicazione: (2025)
di: Shaulov, Ariel, et al.
Pubblicazione: (2025)
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
di: Goel, Arushi, et al.
Pubblicazione: (2025)
di: Goel, Arushi, et al.
Pubblicazione: (2025)
An Investigation Into Explainable Audio Hate Speech Detection
di: An, Jinmyeong, et al.
Pubblicazione: (2024)
di: An, Jinmyeong, et al.
Pubblicazione: (2024)
MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
di: Yang, Chih-Kai, et al.
Pubblicazione: (2026)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval
di: Yoo, HaeJun, et al.
Pubblicazione: (2026) -
EnCLAP++: Analyzing the EnCLAP Framework for Optimizing Automated Audio Captioning Performance
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024) -
Benchmarking and Confidence Evaluation of LALMs For Temporal Reasoning
di: Bhattacharya, Debarpan, et al.
Pubblicazione: (2025) -
Expanding on EnCLAP with Auxiliary Retrieval Model for Automated Audio Captioning
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024) -
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)