Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Dan, Lei, Yishu, Hu, Jing, He, Shuwei, Deng, Songhe, Luo, Xianlong, Zhu, Danxiang, Feng, Shikun, Liu, Rui, He, Jingzhou, Sun, Yu, Wu, Hua, Wang, Haifeng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MoE Adapter for Large Audio Language Models: Sparsity, Disentanglement, and Gradient-Conflict-Free
par: Lei, Yishu, et autres
Publié: (2026)
par: Lei, Yishu, et autres
Publié: (2026)
CORD: Bridging the Audio-Text Reasoning Gap via Weighted On-policy Cross-modal Distillation
par: Hu, Jing, et autres
Publié: (2026)
par: Hu, Jing, et autres
Publié: (2026)
CodecCap: High-Fidelity Codec-Inspired Residual Modeling for Dense Video Captioning
par: Lin, Zihan, et autres
Publié: (2026)
par: Lin, Zihan, et autres
Publié: (2026)
AudioFab: Building A General and Intelligent Audio Factory through Tool Learning
par: Zhu, Cheng, et autres
Publié: (2025)
par: Zhu, Cheng, et autres
Publié: (2025)
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
par: Zhu, Xinfa, et autres
Publié: (2025)
par: Zhu, Xinfa, et autres
Publié: (2025)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
par: Wang, Yuxuan, et autres
Publié: (2026)
par: Wang, Yuxuan, et autres
Publié: (2026)
Audio-Visual Speech Enhancement: Architectural Design and Deployment Strategies
par: Hamadouche, Anis, et autres
Publié: (2025)
par: Hamadouche, Anis, et autres
Publié: (2025)
AudioRWKV: Efficient and Stable Bidirectional RWKV for Audio Pattern Recognition
par: Xiong, Jiayu, et autres
Publié: (2025)
par: Xiong, Jiayu, et autres
Publié: (2025)
Multi-Source Spatial Knowledge Understanding for Immersive Visual Text-to-Speech
par: He, Shuwei, et autres
Publié: (2024)
par: He, Shuwei, et autres
Publié: (2024)
AudioSpa: Spatializing Sound Events with Text
par: Feng, Linfeng, et autres
Publié: (2025)
par: Feng, Linfeng, et autres
Publié: (2025)
HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models
par: He, Peize, et autres
Publié: (2026)
par: He, Peize, et autres
Publié: (2026)
DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners
par: Luo, Xiaoxue, et autres
Publié: (2025)
par: Luo, Xiaoxue, et autres
Publié: (2025)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
par: Luo, Kaiwen, et autres
Publié: (2026)
par: Luo, Kaiwen, et autres
Publié: (2026)
TinyMU: A Compact Audio-Language Model for Music Understanding
par: Li, Xiquan, et autres
Publié: (2026)
par: Li, Xiquan, et autres
Publié: (2026)
SemanticAudio: Audio Generation and Editing in Semantic Space
par: Dai, Zheqi, et autres
Publié: (2026)
par: Dai, Zheqi, et autres
Publié: (2026)
AudioGAN: A Compact and Efficient Framework for Real-Time High-Fidelity Text-to-Audio Generation
par: Chung, HaeChun
Publié: (2025)
par: Chung, HaeChun
Publié: (2025)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
par: Huang, Zhiqi, et autres
Publié: (2024)
par: Huang, Zhiqi, et autres
Publié: (2024)
Discrete Audio Representations for Automated Audio Captioning
par: Tian, Jingguang, et autres
Publié: (2025)
par: Tian, Jingguang, et autres
Publié: (2025)
Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
par: Lin, Jiaju, et autres
Publié: (2024)
par: Lin, Jiaju, et autres
Publié: (2024)
Precise and Simple Audio-to-Score Alignment
par: Peter, Silvan, et autres
Publié: (2026)
par: Peter, Silvan, et autres
Publié: (2026)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
par: Zhao, Junqi, et autres
Publié: (2025)
par: Zhao, Junqi, et autres
Publié: (2025)
A Streamable Neural Audio Codec with Residual Scalar-Vector Quantization for Real-Time Communication
par: Jiang, Xiao-Hang, et autres
Publié: (2025)
par: Jiang, Xiao-Hang, et autres
Publié: (2025)
PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation
par: Xie, Tianxin, et autres
Publié: (2025)
par: Xie, Tianxin, et autres
Publié: (2025)
Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training
par: Qiu, Jielin, et autres
Publié: (2026)
par: Qiu, Jielin, et autres
Publié: (2026)
AudioMarathon: A Comprehensive Benchmark for Long-Context Audio Understanding and Efficiency in Audio LLMs
par: He, Peize, et autres
Publié: (2025)
par: He, Peize, et autres
Publié: (2025)
AudioSet-R: A Refined AudioSet with Multi-Stage LLM Label Reannotation
par: Sun, Yulin, et autres
Publié: (2025)
par: Sun, Yulin, et autres
Publié: (2025)
TAME: Temporal Audio-based Mamba for Enhanced Drone Trajectory Estimation and Classification
par: Xiao, Zhenyuan, et autres
Publié: (2024)
par: Xiao, Zhenyuan, et autres
Publié: (2024)
Audio Mamba: Selective State Spaces for Self-Supervised Audio Representations
par: Yadav, Sarthak, et autres
Publié: (2024)
par: Yadav, Sarthak, et autres
Publié: (2024)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
par: Li, Xiquan, et autres
Publié: (2026)
par: Li, Xiquan, et autres
Publié: (2026)
AudioToolAgent: An Agentic Framework for Audio-Language Models
par: Wijngaard, Gijs, et autres
Publié: (2025)
par: Wijngaard, Gijs, et autres
Publié: (2025)
MUKA: Multi Kernel Audio Adaptation Of Audio-Language Models
par: Bensaid, Reda, et autres
Publié: (2026)
par: Bensaid, Reda, et autres
Publié: (2026)
UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
par: Yang, Dongchao, et autres
Publié: (2026)
par: Yang, Dongchao, et autres
Publié: (2026)
AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
par: Wang, Junyou, et autres
Publié: (2025)
par: Wang, Junyou, et autres
Publié: (2025)
Retrieval-Augmented Audio Deepfake Detection
par: Kang, Zuheng, et autres
Publié: (2024)
par: Kang, Zuheng, et autres
Publié: (2024)
The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization
par: Zhang, Ruixing, et autres
Publié: (2026)
par: Zhang, Ruixing, et autres
Publié: (2026)
Audio-Mind: An Auditable Agentic Framework for Audio Understanding
par: Wang, Yucheng, et autres
Publié: (2026)
par: Wang, Yucheng, et autres
Publié: (2026)
FoleySpace: Vision-Aligned Binaural Spatial Audio Generation
par: Zhao, Lei, et autres
Publié: (2025)
par: Zhao, Lei, et autres
Publié: (2025)
Manipulated Regions Localization For Partially Deepfake Audio: A Survey
par: He, Jiayi, et autres
Publié: (2025)
par: He, Jiayi, et autres
Publié: (2025)
Audio Hallucination Attacks: Probing the Reliability of Large Audio Language Models
par: Seth, Ashish, et autres
Publié: (2026)
par: Seth, Ashish, et autres
Publié: (2026)
AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing
par: Chen, William, et autres
Publié: (2026)
par: Chen, William, et autres
Publié: (2026)
Documents similaires
-
MoE Adapter for Large Audio Language Models: Sparsity, Disentanglement, and Gradient-Conflict-Free
par: Lei, Yishu, et autres
Publié: (2026) -
CORD: Bridging the Audio-Text Reasoning Gap via Weighted On-policy Cross-modal Distillation
par: Hu, Jing, et autres
Publié: (2026) -
CodecCap: High-Fidelity Codec-Inspired Residual Modeling for Dense Video Captioning
par: Lin, Zihan, et autres
Publié: (2026) -
AudioFab: Building A General and Intelligent Audio Factory through Tool Learning
par: Zhu, Cheng, et autres
Publié: (2025) -
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
par: Zhu, Xinfa, et autres
Publié: (2025)