The ICME 2025 Audio Encoder Capability Challenge
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Junbo, Dinkel, Heinrich, Song, Qiong, Wang, Helen, Niu, Yadong, Cheng, Si, Xin, Xiaofeng, Li, Ke, Wang, Wenwu, Wang, Yujun, Luan, Jian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders
di: Sun, Xingwei, et al.
Pubblicazione: (2025)
di: Sun, Xingwei, et al.
Pubblicazione: (2025)
Streaming Audio Transformers for Online Audio Tagging
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
The CMU-AIST submission for the ICME 2025 Audio Encoder Challenge
di: Bharadwaj, Shikhar, et al.
Pubblicazione: (2026)
di: Bharadwaj, Shikhar, et al.
Pubblicazione: (2026)
Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering
di: Li, Gang, et al.
Pubblicazione: (2025)
di: Li, Gang, et al.
Pubblicazione: (2025)
ACAVCaps: Enabling large-scale training for fine-grained and diverse audio understanding
di: Niu, Yadong, et al.
Pubblicazione: (2026)
di: Niu, Yadong, et al.
Pubblicazione: (2026)
Scaling up masked audio encoder learning for general audio classification
di: Dinkel, Heinrich, et al.
Pubblicazione: (2024)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2024)
Bridging Language Gaps in Audio-Text Retrieval
di: Yan, Zhiyong, et al.
Pubblicazione: (2024)
di: Yan, Zhiyong, et al.
Pubblicazione: (2024)
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
di: Liu, Jizhong, et al.
Pubblicazione: (2024)
di: Liu, Jizhong, et al.
Pubblicazione: (2024)
MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks
di: Niu, Yadong, et al.
Pubblicazione: (2025)
di: Niu, Yadong, et al.
Pubblicazione: (2025)
GLAP: General contrastive audio-text pretraining across domains and languages
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
DashengTokenizer: One layer is enough for unified audio understanding and generation
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
The AudioMOS Challenge 2025
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025)
A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining
di: Xiao, Feiyang, et al.
Pubblicazione: (2024)
di: Xiao, Feiyang, et al.
Pubblicazione: (2024)
Robust Audio Tagging under Class-wise Supervision Unreliability
di: Hou, Yuanbo, et al.
Pubblicazione: (2026)
di: Hou, Yuanbo, et al.
Pubblicazione: (2026)
HearFit+: Personalized Fitness Monitoring via Audio Signals on Smart Speakers
di: Xie, Yadong, et al.
Pubblicazione: (2025)
di: Xie, Yadong, et al.
Pubblicazione: (2025)
Genuine-Focused Learning using Mask AutoEncoder for Generalized Fake Audio Detection
di: Wang, Xiaopeng, et al.
Pubblicazione: (2024)
di: Wang, Xiaopeng, et al.
Pubblicazione: (2024)
Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders
di: Shan, Weiqiao, et al.
Pubblicazione: (2025)
di: Shan, Weiqiao, et al.
Pubblicazione: (2025)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
di: Lin, Jingru, et al.
Pubblicazione: (2026)
di: Lin, Jingru, et al.
Pubblicazione: (2026)
Audio-Visual Speaker Tracking: Progress, Challenges, and Future Directions
di: Zhao, Jinzheng, et al.
Pubblicazione: (2023)
di: Zhao, Jinzheng, et al.
Pubblicazione: (2023)
First-Shot Unsupervised Anomalous Sound Detection With Unknown Anomalies Estimated by Metadata-Assisted Audio Generation
di: Zhang, Hejing, et al.
Pubblicazione: (2023)
di: Zhang, Hejing, et al.
Pubblicazione: (2023)
Low-Resource Audio Codec (LRAC): 2025 Challenge Description
di: Wojcicki, Kamil, et al.
Pubblicazione: (2025)
di: Wojcicki, Kamil, et al.
Pubblicazione: (2025)
CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation
di: Oh, Hyunwoo, et al.
Pubblicazione: (2025)
di: Oh, Hyunwoo, et al.
Pubblicazione: (2025)
StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion
di: Li, Fengjin, et al.
Pubblicazione: (2025)
di: Li, Fengjin, et al.
Pubblicazione: (2025)
ASTAR-NTU solution to AudioMOS Challenge 2025 Track1
di: Ritter-Gutierrez, Fabian, et al.
Pubblicazione: (2025)
di: Ritter-Gutierrez, Fabian, et al.
Pubblicazione: (2025)
T2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI Feedback
di: Wang, Zehan, et al.
Pubblicazione: (2025)
di: Wang, Zehan, et al.
Pubblicazione: (2025)
Zero-Shot Audio Captioning Using Soft and Hard Prompts
di: Zhang, Yiming, et al.
Pubblicazione: (2024)
di: Zhang, Yiming, et al.
Pubblicazione: (2024)
Region-Specific Audio Tagging for Spatial Sound
di: Zhao, Jinzheng, et al.
Pubblicazione: (2025)
di: Zhao, Jinzheng, et al.
Pubblicazione: (2025)
Description on IEEE ICME 2024 Grand Challenge: Semi-supervised Acoustic Scene Classification under Domain Shift
di: Bai, Jisheng, et al.
Pubblicazione: (2024)
di: Bai, Jisheng, et al.
Pubblicazione: (2024)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
An Empirical Analysis of Task-Induced Encoder Bias in Fréchet Audio Distance
di: Jeong, Wonwoo
Pubblicazione: (2026)
di: Jeong, Wonwoo
Pubblicazione: (2026)
The T12 System for AudioMOS Challenge 2025: Audio Aesthetics Score Prediction System Using KAN- and VERSA-based Models
di: Yamamoto, Katsuhiko, et al.
Pubblicazione: (2025)
di: Yamamoto, Katsuhiko, et al.
Pubblicazione: (2025)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
di: Yuan, Yi, et al.
Pubblicazione: (2025)
di: Yuan, Yi, et al.
Pubblicazione: (2025)
OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder
di: Bharadwaj, Shikhar, et al.
Pubblicazione: (2025)
di: Bharadwaj, Shikhar, et al.
Pubblicazione: (2025)
Fx-Encoder++: Extracting Instrument-Wise Audio Effects Representations from Mixtures
di: Yeh, Yen-Tung, et al.
Pubblicazione: (2025)
di: Yeh, Yen-Tung, et al.
Pubblicazione: (2025)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
di: Gong, Yitian, et al.
Pubblicazione: (2026)
di: Gong, Yitian, et al.
Pubblicazione: (2026)
Audio-Mind: An Auditable Agentic Framework for Audio Understanding
di: Wang, Yucheng, et al.
Pubblicazione: (2026)
di: Wang, Yucheng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026) -
X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance
di: Zhang, Junbo, et al.
Pubblicazione: (2025) -
Efficient Speech Enhancement via Embeddings from Pre-trained Generative Audioencoders
di: Sun, Xingwei, et al.
Pubblicazione: (2025) -
Streaming Audio Transformers for Online Audio Tagging
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023) -
MiDashengLM: Efficient Audio Understanding with General Audio Captions
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)