Bridging Language Gaps in Audio-Text Retrieval
Fuente:
arXiv
Salvato in:
| Autori principali: | Yan, Zhiyong, Dinkel, Heinrich, Wang, Yongqing, Liu, Jizhong, Zhang, Junbo, Wang, Yujun, Wang, Bin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
di: Liu, Jizhong, et al.
Pubblicazione: (2024)
di: Liu, Jizhong, et al.
Pubblicazione: (2024)
Streaming Audio Transformers for Online Audio Tagging
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
Scaling up masked audio encoder learning for general audio classification
di: Dinkel, Heinrich, et al.
Pubblicazione: (2024)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2024)
GLAP: General contrastive audio-text pretraining across domains and languages
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering
di: Li, Gang, et al.
Pubblicazione: (2025)
di: Li, Gang, et al.
Pubblicazione: (2025)
MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks
di: Niu, Yadong, et al.
Pubblicazione: (2025)
di: Niu, Yadong, et al.
Pubblicazione: (2025)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio
di: Chen, Guoguo, et al.
Pubblicazione: (2021)
di: Chen, Guoguo, et al.
Pubblicazione: (2021)
The ICME 2025 Audio Encoder Capability Challenge
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
ACAVCaps: Enabling large-scale training for fine-grained and diverse audio understanding
di: Niu, Yadong, et al.
Pubblicazione: (2026)
di: Niu, Yadong, et al.
Pubblicazione: (2026)
X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
Advancing Singlish Understanding: Bridging the Gap with Datasets and Multimodal Models
di: Wang, Bin, et al.
Pubblicazione: (2025)
di: Wang, Bin, et al.
Pubblicazione: (2025)
StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion
di: Li, Fengjin, et al.
Pubblicazione: (2025)
di: Li, Fengjin, et al.
Pubblicazione: (2025)
AudioBench: A Universal Benchmark for Audio Large Language Models
di: Wang, Bin, et al.
Pubblicazione: (2024)
di: Wang, Bin, et al.
Pubblicazione: (2024)
Language-based Audio Moment Retrieval
di: Munakata, Hokuto, et al.
Pubblicazione: (2024)
di: Munakata, Hokuto, et al.
Pubblicazione: (2024)
Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders
di: Sun, Xingwei, et al.
Pubblicazione: (2025)
di: Sun, Xingwei, et al.
Pubblicazione: (2025)
Closing the Modality Reasoning Gap for Speech Large Language Models
di: Wang, Chaoren, et al.
Pubblicazione: (2026)
di: Wang, Chaoren, et al.
Pubblicazione: (2026)
Guided by the Plan: Enhancing Faithful Autoregressive Text-to-Audio Generation with Guided Decoding
di: Wang, Juncheng, et al.
Pubblicazione: (2026)
di: Wang, Juncheng, et al.
Pubblicazione: (2026)
MiMo-Audio: Audio Language Models are Few-Shot Learners
di: Core Team, et al.
Pubblicazione: (2025)
di: Core Team, et al.
Pubblicazione: (2025)
Direct Simultaneous Translation Activation for Large Audio-Language Models
di: Zhang, Pei, et al.
Pubblicazione: (2025)
di: Zhang, Pei, et al.
Pubblicazione: (2025)
SAFE-QAQ: End-to-End Slow-Thinking Audio-Text Fraud Detection via Reinforcement Learning
di: Wang, Peidong, et al.
Pubblicazione: (2026)
di: Wang, Peidong, et al.
Pubblicazione: (2026)
Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model
di: Huang, Ailin, et al.
Pubblicazione: (2025)
di: Huang, Ailin, et al.
Pubblicazione: (2025)
Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving
di: Xie, Jingran, et al.
Pubblicazione: (2025)
di: Xie, Jingran, et al.
Pubblicazione: (2025)
Probing Audio-Generation Capabilities of Text-Based Language Models
di: Anbazhagan, Arjun Prasaath, et al.
Pubblicazione: (2025)
di: Anbazhagan, Arjun Prasaath, et al.
Pubblicazione: (2025)
DashengTokenizer: One layer is enough for unified audio understanding and generation
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
di: Chen, Chen, et al.
Pubblicazione: (2025)
di: Chen, Chen, et al.
Pubblicazione: (2025)
Emotional Dimension Control in Language Model-Based Text-to-Speech: Spanning a Broad Spectrum of Human Emotions
di: Zhou, Kun, et al.
Pubblicazione: (2024)
di: Zhou, Kun, et al.
Pubblicazione: (2024)
Phonetic Enhanced Language Modeling for Text-to-Speech Synthesis
di: Zhou, Kun, et al.
Pubblicazione: (2024)
di: Zhou, Kun, et al.
Pubblicazione: (2024)
An Audio-textual Diffusion Model For Converting Speech Signals Into Ultrasound Tongue Imaging Data
di: Yang, Yudong, et al.
Pubblicazione: (2024)
di: Yang, Yudong, et al.
Pubblicazione: (2024)
SepALM: Audio Language Models Are Error Correctors for Robust Speech Separation
di: Mu, Zhaoxi, et al.
Pubblicazione: (2025)
di: Mu, Zhaoxi, et al.
Pubblicazione: (2025)
Mind the Gap! Static and Interactive Evaluations of Large Audio Models
di: Li, Minzhi, et al.
Pubblicazione: (2025)
di: Li, Minzhi, et al.
Pubblicazione: (2025)
Pay More Attention To Audio: Mitigating Imbalance of Cross-Modal Attention in Large Audio Language Models
di: Wang, Junyu, et al.
Pubblicazione: (2025)
di: Wang, Junyu, et al.
Pubblicazione: (2025)
ALLM4ADD: Unlocking the Capabilities of Audio Large Language Models for Audio Deepfake Detection
di: Gu, Hao, et al.
Pubblicazione: (2025)
di: Gu, Hao, et al.
Pubblicazione: (2025)
Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning
di: Wu, Shu, et al.
Pubblicazione: (2025)
di: Wu, Shu, et al.
Pubblicazione: (2025)
Beyond Classification: Towards Speech Emotion Reasoning with Multitask AudioLLMs
di: Zhang, Wenyu, et al.
Pubblicazione: (2025)
di: Zhang, Wenyu, et al.
Pubblicazione: (2025)
BATON: Aligning Text-to-Audio Model with Human Preference Feedback
di: Liao, Huan, et al.
Pubblicazione: (2024)
di: Liao, Huan, et al.
Pubblicazione: (2024)
The FruitShell French synthesis system at the Blizzard 2023 Challenge
di: Qi, Xin, et al.
Pubblicazione: (2023)
di: Qi, Xin, et al.
Pubblicazione: (2023)
Diffusion Gaussian Mixture Audio Denoise
di: Wang, Pu, et al.
Pubblicazione: (2024)
di: Wang, Pu, et al.
Pubblicazione: (2024)
Kid-Whisper: Towards Bridging the Performance Gap in Automatic Speech Recognition for Children VS. Adults
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2023)
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
di: Liu, Jizhong, et al.
Pubblicazione: (2024) -
Streaming Audio Transformers for Online Audio Tagging
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023) -
Scaling up masked audio encoder learning for general audio classification
di: Dinkel, Heinrich, et al.
Pubblicazione: (2024) -
GLAP: General contrastive audio-text pretraining across domains and languages
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025) -
Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering
di: Li, Gang, et al.
Pubblicazione: (2025)