Salvato in:
| Autori principali: | Wijngaard, Gijs, Formisano, Elia, Dumontier, Michel, Jitsev, Jenia |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2510.02995 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Audio-Language Datasets of Scenes and Events: A Survey
di: Wijngaard, Gijs, et al.
Pubblicazione: (2024)
di: Wijngaard, Gijs, et al.
Pubblicazione: (2024)
AudSemThinker: Enhancing Audio-Language Models through Reasoning over Semantics of Sound
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
Data-Balanced Curriculum Learning for Audio Question Answering
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025)
ACES: Evaluating Automated Audio Captioning Models on the Semantics of Sounds
di: Wijngaard, Gijs, et al.
Pubblicazione: (2024)
di: Wijngaard, Gijs, et al.
Pubblicazione: (2024)
Audio-Mind: An Auditable Agentic Framework for Audio Understanding
di: Wang, Yucheng, et al.
Pubblicazione: (2026)
di: Wang, Yucheng, et al.
Pubblicazione: (2026)
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
di: Lee, Kuan-Yi, et al.
Pubblicazione: (2025)
di: Lee, Kuan-Yi, et al.
Pubblicazione: (2025)
MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
di: Tao, Ye, et al.
Pubblicazione: (2025)
di: Tao, Ye, et al.
Pubblicazione: (2025)
MUKA: Multi Kernel Audio Adaptation Of Audio-Language Models
di: Bensaid, Reda, et al.
Pubblicazione: (2026)
di: Bensaid, Reda, et al.
Pubblicazione: (2026)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
di: Luo, Kaiwen, et al.
Pubblicazione: (2026)
di: Luo, Kaiwen, et al.
Pubblicazione: (2026)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
di: Glazer, Neta, et al.
Pubblicazione: (2026)
di: Glazer, Neta, et al.
Pubblicazione: (2026)
Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models
di: Seth, Ashish, et al.
Pubblicazione: (2026)
di: Seth, Ashish, et al.
Pubblicazione: (2026)
Pengi: An Audio Language Model for Audio Tasks
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
AudioFab: Building A General and Intelligent Audio Factory through Tool Learning
di: Zhu, Cheng, et al.
Pubblicazione: (2025)
di: Zhu, Cheng, et al.
Pubblicazione: (2025)
UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
di: Yang, Dongchao, et al.
Pubblicazione: (2026)
di: Yang, Dongchao, et al.
Pubblicazione: (2026)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
di: Wang, Yuxuan, et al.
Pubblicazione: (2026)
di: Wang, Yuxuan, et al.
Pubblicazione: (2026)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
di: Zhang, Dan, et al.
Pubblicazione: (2026)
di: Zhang, Dan, et al.
Pubblicazione: (2026)
The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization
di: Zhang, Ruixing, et al.
Pubblicazione: (2026)
di: Zhang, Ruixing, et al.
Pubblicazione: (2026)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
di: Chen, Wei-Chih, et al.
Pubblicazione: (2026)
di: Chen, Wei-Chih, et al.
Pubblicazione: (2026)
PAM: Prompting Audio-Language Models for Audio Quality Assessment
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling
di: Yang, Dongchao, et al.
Pubblicazione: (2025)
di: Yang, Dongchao, et al.
Pubblicazione: (2025)
Words at Play: Benchmarking Audio Pun Understanding in Large Audio-Language Models
di: Su, Yuchen, et al.
Pubblicazione: (2026)
di: Su, Yuchen, et al.
Pubblicazione: (2026)
Continuous Audio Language Models
di: Rouard, Simon, et al.
Pubblicazione: (2025)
di: Rouard, Simon, et al.
Pubblicazione: (2025)
Focus Then Listen: Exploring Plug-and-Play Audio Enhancer for Noise-Robust Large Audio Language Models
di: Yin, Han, et al.
Pubblicazione: (2026)
di: Yin, Han, et al.
Pubblicazione: (2026)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
di: Li, Xiquan, et al.
Pubblicazione: (2026)
di: Li, Xiquan, et al.
Pubblicazione: (2026)
UniTok-Audio: A Unified Audio Generation Framework via Generative Modeling on Discrete Codec Tokens
di: Liu, Chengwei, et al.
Pubblicazione: (2025)
di: Liu, Chengwei, et al.
Pubblicazione: (2025)
AuTAgent: A Reinforcement Learning Framework for Tool-Augmented Audio Reasoning
di: Tong, Siqian, et al.
Pubblicazione: (2026)
di: Tong, Siqian, et al.
Pubblicazione: (2026)
Guiding Audio Editing with Audio Language Model
di: Lan, Zitong, et al.
Pubblicazione: (2025)
di: Lan, Zitong, et al.
Pubblicazione: (2025)
Segmentwise Pruning in Audio-Language Models
di: Gibier, Marcel, et al.
Pubblicazione: (2025)
di: Gibier, Marcel, et al.
Pubblicazione: (2025)
Audio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic Manipulation
di: Wei, Xiangyi, et al.
Pubblicazione: (2025)
di: Wei, Xiangyi, et al.
Pubblicazione: (2025)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
di: Zhao, Feiyu, et al.
Pubblicazione: (2026)
di: Zhao, Feiyu, et al.
Pubblicazione: (2026)
Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs
di: Yin, Han, et al.
Pubblicazione: (2025)
di: Yin, Han, et al.
Pubblicazione: (2025)
StyleBreak: Revealing Alignment Vulnerabilities in Large Audio-Language Models via Style-Aware Audio Jailbreak
di: Li, Hongyi, et al.
Pubblicazione: (2025)
di: Li, Hongyi, et al.
Pubblicazione: (2025)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
di: Rong, Yan, et al.
Pubblicazione: (2025)
di: Rong, Yan, et al.
Pubblicazione: (2025)
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
di: Su, Yi, et al.
Pubblicazione: (2025)
di: Su, Yi, et al.
Pubblicazione: (2025)
AudioBERT: Audio Knowledge Augmented Language Model
di: Ok, Hyunjong, et al.
Pubblicazione: (2024)
di: Ok, Hyunjong, et al.
Pubblicazione: (2024)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
di: Gong, Yitian, et al.
Pubblicazione: (2026)
di: Gong, Yitian, et al.
Pubblicazione: (2026)
ChildVox: A Speech, Audio, and Large Audio-Language Model Benchmark in Understanding and Characterizing Sound across Childhood
di: Feng, Tiantian, et al.
Pubblicazione: (2026)
di: Feng, Tiantian, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Audio-Language Datasets of Scenes and Events: A Survey
di: Wijngaard, Gijs, et al.
Pubblicazione: (2024) -
AudSemThinker: Enhancing Audio-Language Models through Reasoning over Semantics of Sound
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025) -
Data-Balanced Curriculum Learning for Audio Question Answering
di: Wijngaard, Gijs, et al.
Pubblicazione: (2025) -
ACES: Evaluating Automated Audio Captioning Models on the Semantics of Sounds
di: Wijngaard, Gijs, et al.
Pubblicazione: (2024) -
Audio-Mind: An Auditable Agentic Framework for Audio Understanding
di: Wang, Yucheng, et al.
Pubblicazione: (2026)