ALICE: A Multifaceted Evaluation Framework of Large Audio-Language Models' In-Context Learning Ability
Fuente:
arXiv
Guardado en:
| Autores principales: | Piao, Yen-Ting, Liao, Jay Chiehen, Chien, Wei-Tang, Ogimoto, Toshiki, Chen, Shang-Tse, Chen, Yun-Nung, Lee, Chun-Yi, Lo, Shao-Yuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Advancing Automated Speaking Assessment Leveraging Multifaceted Relevance and Grammar Information
por: Lu, Hao-Chien, et al.
Publicado: (2025)
por: Lu, Hao-Chien, et al.
Publicado: (2025)
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
por: Yang, Chih-Kai, et al.
Publicado: (2025)
por: Yang, Chih-Kai, et al.
Publicado: (2025)
SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models
por: Yang, Chih-Kai, et al.
Publicado: (2025)
por: Yang, Chih-Kai, et al.
Publicado: (2025)
AudioGAN: A Compact and Efficient Framework for Real-Time High-Fidelity Text-to-Audio Generation
por: Chung, HaeChun
Publicado: (2025)
por: Chung, HaeChun
Publicado: (2025)
MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
por: Yang, Chih-Kai, et al.
Publicado: (2026)
por: Yang, Chih-Kai, et al.
Publicado: (2026)
An Intra-BRNN and GB-RVQ Based END-TO-END Neural Audio Codec
por: Xu, Linping, et al.
Publicado: (2024)
por: Xu, Linping, et al.
Publicado: (2024)
SynthCloner: Synthesizer-style Audio Transfer via Factorized Codec with ADSR Envelope Control
por: Liu, Jeng-Yue, et al.
Publicado: (2025)
por: Liu, Jeng-Yue, et al.
Publicado: (2025)
Fx-Encoder++: Extracting Instrument-Wise Audio Effects Representations from Mixtures
por: Yeh, Yen-Tung, et al.
Publicado: (2025)
por: Yeh, Yen-Tung, et al.
Publicado: (2025)
SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
por: Wang, Helin, et al.
Publicado: (2024)
por: Wang, Helin, et al.
Publicado: (2024)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
por: Gong, Yitian, et al.
Publicado: (2026)
por: Gong, Yitian, et al.
Publicado: (2026)
PolyBench: A Benchmark for Compositional Reasoning in Polyphonic Audio
por: Chen, Yuanjian, et al.
Publicado: (2026)
por: Chen, Yuanjian, et al.
Publicado: (2026)
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework
por: Jia, Yuhang, et al.
Publicado: (2024)
por: Jia, Yuhang, et al.
Publicado: (2024)
Improving Audio Question Answering with Variational Inference
por: Chen, Haolin
Publicado: (2026)
por: Chen, Haolin
Publicado: (2026)
PyNeuralFx: A Python Package for Neural Audio Effect Modeling
por: Yeh, Yen-Tung, et al.
Publicado: (2024)
por: Yeh, Yen-Tung, et al.
Publicado: (2024)
Efficient Long-Form Speech Recognition for General Speech In-Context Learning
por: Yen, Hao, et al.
Publicado: (2024)
por: Yen, Hao, et al.
Publicado: (2024)
Towards Generalizability to Tone and Content Variations in the Transcription of Amplifier Rendered Electric Guitar Audio
por: Chen, Yu-Hua, et al.
Publicado: (2025)
por: Chen, Yu-Hua, et al.
Publicado: (2025)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
por: Lin, Jingru, et al.
Publicado: (2026)
por: Lin, Jingru, et al.
Publicado: (2026)
Hyper Recurrent Neural Network: Condition Mechanisms for Black-box Audio Effect Modeling
por: Yeh, Yen-Tung, et al.
Publicado: (2024)
por: Yeh, Yen-Tung, et al.
Publicado: (2024)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
por: Li, Kai, et al.
Publicado: (2025)
por: Li, Kai, et al.
Publicado: (2025)
Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning
por: Tian, Wenjie, et al.
Publicado: (2026)
por: Tian, Wenjie, et al.
Publicado: (2026)
LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement
por: Chen, Chih-Ning, et al.
Publicado: (2026)
por: Chen, Chih-Ning, et al.
Publicado: (2026)
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions
por: Wang, Yuanyuan, et al.
Publicado: (2024)
por: Wang, Yuanyuan, et al.
Publicado: (2024)
Leveraging Self-supervised Audio Representations for Data-Efficient Acoustic Scene Classification
por: Cai, Yiqiang, et al.
Publicado: (2024)
por: Cai, Yiqiang, et al.
Publicado: (2024)
Unsupervised Single-Channel Audio Separation with Diffusion Source Priors
por: Shi, Runwu, et al.
Publicado: (2025)
por: Shi, Runwu, et al.
Publicado: (2025)
Unified Audio Event Detection
por: Jiang, Yidi, et al.
Publicado: (2024)
por: Jiang, Yidi, et al.
Publicado: (2024)
Audio Prompt Adapter: Unleashing Music Editing Abilities for Text-to-Music with Lightweight Finetuning
por: Tsai, Fang-Duo, et al.
Publicado: (2024)
por: Tsai, Fang-Duo, et al.
Publicado: (2024)
AUV: Teaching Audio Universal Vector Quantization with Single Nested Codebook
por: Chen, Yushen, et al.
Publicado: (2025)
por: Chen, Yushen, et al.
Publicado: (2025)
Bias in the Ear of the Listener: Assessing Sensitivity in Audio Language Models Across Linguistic, Demographic, and Positional Variations
por: Wei, Sheng-Lun, et al.
Publicado: (2026)
por: Wei, Sheng-Lun, et al.
Publicado: (2026)
Deep Learning for Personalized Binaural Audio Reproduction
por: Lu, Xikun, et al.
Publicado: (2025)
por: Lu, Xikun, et al.
Publicado: (2025)
Source Tracing of Audio Deepfake Systems
por: Klein, Nicholas, et al.
Publicado: (2024)
por: Klein, Nicholas, et al.
Publicado: (2024)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
por: Jia, Yuhang, et al.
Publicado: (2025)
por: Jia, Yuhang, et al.
Publicado: (2025)
Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
por: Kong, Zhifeng, et al.
Publicado: (2024)
por: Kong, Zhifeng, et al.
Publicado: (2024)
QuarkAudio Technical Report
por: Liu, Chengwei, et al.
Publicado: (2025)
por: Liu, Chengwei, et al.
Publicado: (2025)
The NTNU System at the S&I Challenge 2025 SLA Open Track
por: Lin, Hong-Yun, et al.
Publicado: (2025)
por: Lin, Hong-Yun, et al.
Publicado: (2025)
NDVQ: Robust Neural Audio Codec with Normal Distribution-Based Vector Quantization
por: Niu, Zhikang, et al.
Publicado: (2024)
por: Niu, Zhikang, et al.
Publicado: (2024)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
por: Zhao, Xiaohan, et al.
Publicado: (2025)
por: Zhao, Xiaohan, et al.
Publicado: (2025)
Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems
por: Xiao, Yang, et al.
Publicado: (2026)
por: Xiao, Yang, et al.
Publicado: (2026)
WAKE: Watermarking Audio with Key Enrichment
por: Xu, Yaoxun, et al.
Publicado: (2025)
por: Xu, Yaoxun, et al.
Publicado: (2025)
Video-to-Audio Generation with Fine-grained Temporal Semantics
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
Differentiable Time-Varying Linear Prediction in the Context of End-to-End Analysis-by-Synthesis
por: Yu, Chin-Yun, et al.
Publicado: (2024)
por: Yu, Chin-Yun, et al.
Publicado: (2024)
Ejemplares similares
-
Advancing Automated Speaking Assessment Leveraging Multifaceted Relevance and Grammar Information
por: Lu, Hao-Chien, et al.
Publicado: (2025) -
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
por: Yang, Chih-Kai, et al.
Publicado: (2025) -
SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models
por: Yang, Chih-Kai, et al.
Publicado: (2025) -
AudioGAN: A Compact and Efficient Framework for Real-Time High-Fidelity Text-to-Audio Generation
por: Chung, HaeChun
Publicado: (2025) -
MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
por: Yang, Chih-Kai, et al.
Publicado: (2026)