Guardado en:
| Autores principales: | Sun, Bochao, Xiao, Yang, Yin, Han |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2601.06829 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
por: Foo, Leonardo Haw-Yang, et al.
Publicado: (2026)
por: Foo, Leonardo Haw-Yang, et al.
Publicado: (2026)
AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
por: Wang, Junyou, et al.
Publicado: (2025)
por: Wang, Junyou, et al.
Publicado: (2025)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
Exploring Text-Queried Sound Event Detection with Audio Source Separation
por: Yin, Han, et al.
Publicado: (2024)
por: Yin, Han, et al.
Publicado: (2024)
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
por: Cappellazzo, Umberto, et al.
Publicado: (2025)
por: Cappellazzo, Umberto, et al.
Publicado: (2025)
UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
por: Yang, Dongchao, et al.
Publicado: (2026)
por: Yang, Dongchao, et al.
Publicado: (2026)
MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders
por: Zhang, Wenyu, et al.
Publicado: (2024)
por: Zhang, Wenyu, et al.
Publicado: (2024)
MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts
por: Lou, Yuxuan, et al.
Publicado: (2026)
por: Lou, Yuxuan, et al.
Publicado: (2026)
MoLEx: Mixture of LoRA Experts in Speech Self-Supervised Models for Audio Deepfake Detection
por: Pan, Zihan, et al.
Publicado: (2025)
por: Pan, Zihan, et al.
Publicado: (2025)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
por: Liu, Huadai, et al.
Publicado: (2024)
por: Liu, Huadai, et al.
Publicado: (2024)
Steer-MoE: Efficient Audio-Language Alignment with a Mixture-of-Experts Steering Module
por: Feng, Ruitao, et al.
Publicado: (2025)
por: Feng, Ruitao, et al.
Publicado: (2025)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
por: Zhao, Junqi, et al.
Publicado: (2025)
por: Zhao, Junqi, et al.
Publicado: (2025)
Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text
por: Mei, Jiahao, et al.
Publicado: (2026)
por: Mei, Jiahao, et al.
Publicado: (2026)
AudioGenX: Explainability on Text-to-Audio Generative Models
por: Kang, Hyunju, et al.
Publicado: (2025)
por: Kang, Hyunju, et al.
Publicado: (2025)
When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
por: Li, Chen-An, et al.
Publicado: (2025)
por: Li, Chen-An, et al.
Publicado: (2025)
Focus Then Listen: Exploring Plug-and-Play Audio Enhancer for Noise-Robust Large Audio Language Models
por: Yin, Han, et al.
Publicado: (2026)
por: Yin, Han, et al.
Publicado: (2026)
AudioSpa: Spatializing Sound Events with Text
por: Feng, Linfeng, et al.
Publicado: (2025)
por: Feng, Linfeng, et al.
Publicado: (2025)
TAIL: Text-Audio Incremental Learning
por: Sun, Yingfei, et al.
Publicado: (2025)
por: Sun, Yingfei, et al.
Publicado: (2025)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
por: Chen, Wei-Chih, et al.
Publicado: (2026)
por: Chen, Wei-Chih, et al.
Publicado: (2026)
MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows
por: Li, Xiquan, et al.
Publicado: (2025)
por: Li, Xiquan, et al.
Publicado: (2025)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
por: Liu, Huadai, et al.
Publicado: (2024)
por: Liu, Huadai, et al.
Publicado: (2024)
TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
Evaluating Semantic Fragility in Text-to-Audio Generation Systems Under Controlled Prompt Perturbations
por: Wu, Jiahui
Publicado: (2026)
por: Wu, Jiahui
Publicado: (2026)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
por: Hai, Jiarui, et al.
Publicado: (2024)
por: Hai, Jiarui, et al.
Publicado: (2024)
Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval
por: Yoo, HaeJun, et al.
Publicado: (2026)
por: Yoo, HaeJun, et al.
Publicado: (2026)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
por: Yuan, Yi, et al.
Publicado: (2025)
por: Yuan, Yi, et al.
Publicado: (2025)
Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR
por: Magoshi, Ryo, et al.
Publicado: (2026)
por: Magoshi, Ryo, et al.
Publicado: (2026)
TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling
por: Xie, Hao-Hui, et al.
Publicado: (2026)
por: Xie, Hao-Hui, et al.
Publicado: (2026)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
por: Li, Xiquan, et al.
Publicado: (2026)
por: Li, Xiquan, et al.
Publicado: (2026)
BATON: Aligning Text-to-Audio Model with Human Preference Feedback
por: Liao, Huan, et al.
Publicado: (2024)
por: Liao, Huan, et al.
Publicado: (2024)
Comparative Evaluation of Text and Audio Simplification: A Methodological Replication Study
por: Barai, Prosanta, et al.
Publicado: (2025)
por: Barai, Prosanta, et al.
Publicado: (2025)
PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation
por: Xie, Tianxin, et al.
Publicado: (2025)
por: Xie, Tianxin, et al.
Publicado: (2025)
Scaling Audio-Text Retrieval with Multimodal Large Language Models
por: Xu, Jilan, et al.
Publicado: (2026)
por: Xu, Jilan, et al.
Publicado: (2026)
Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs
por: Yin, Han, et al.
Publicado: (2025)
por: Yin, Han, et al.
Publicado: (2025)
The T12 System for AudioMOS Challenge 2025: Audio Aesthetics Score Prediction System Using KAN- and VERSA-based Models
por: Yamamoto, Katsuhiko, et al.
Publicado: (2025)
por: Yamamoto, Katsuhiko, et al.
Publicado: (2025)
Cacophony: An Improved Contrastive Audio-Text Model
por: Zhu, Ge, et al.
Publicado: (2024)
por: Zhu, Ge, et al.
Publicado: (2024)
Enhancing Crowdsourced Audio for Text-to-Speech Models
por: Giraldo, José, et al.
Publicado: (2024)
por: Giraldo, José, et al.
Publicado: (2024)
Towards Weakly Supervised Text-to-Audio Grounding
por: Xu, Xuenan, et al.
Publicado: (2024)
por: Xu, Xuenan, et al.
Publicado: (2024)
Precise and Simple Audio-to-Score Alignment
por: Peter, Silvan, et al.
Publicado: (2026)
por: Peter, Silvan, et al.
Publicado: (2026)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
por: Luo, Kaiwen, et al.
Publicado: (2026)
por: Luo, Kaiwen, et al.
Publicado: (2026)
Ejemplares similares
-
All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation
por: Foo, Leonardo Haw-Yang, et al.
Publicado: (2026) -
AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
por: Wang, Junyou, et al.
Publicado: (2025) -
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
por: Wang, Hui, et al.
Publicado: (2025) -
Exploring Text-Queried Sound Event Detection with Audio Source Separation
por: Yin, Han, et al.
Publicado: (2024) -
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
por: Cappellazzo, Umberto, et al.
Publicado: (2025)