Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Daiqing, Zhang, Xuan, Yang, Dongbao, Yao, Jiashu, Chen, Longfei, Liu, Qingsong, Zhao, Sicheng, Ma, Can, Kang, Yangyang, Zhou, Yu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ATIR: Towards Audio-Text Interleaved Contextual Retrieval
por: Zhao, Tong, et al.
Publicado: (2026)
por: Zhao, Tong, et al.
Publicado: (2026)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
por: Luo, Kaiwen, et al.
Publicado: (2026)
por: Luo, Kaiwen, et al.
Publicado: (2026)
EmoCaliber: Advancing Reliable Visual Emotion Comprehension via Confidence Verbalization and Calibration
por: Wu, Daiqing, et al.
Publicado: (2025)
por: Wu, Daiqing, et al.
Publicado: (2025)
AudioGuard: Toward Comprehensive Audio Safety Protection Across Diverse Threat Models
por: Kang, Mintong, et al.
Publicado: (2026)
por: Kang, Mintong, et al.
Publicado: (2026)
StyleBreak: Revealing Alignment Vulnerabilities in Large Audio-Language Models via Style-Aware Audio Jailbreak
por: Li, Hongyi, et al.
Publicado: (2025)
por: Li, Hongyi, et al.
Publicado: (2025)
An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM
por: Liu, Jiawei, et al.
Publicado: (2025)
por: Liu, Jiawei, et al.
Publicado: (2025)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
por: Yang, Dongchao, et al.
Publicado: (2023)
por: Yang, Dongchao, et al.
Publicado: (2023)
An Empirical Study on Configuring In-Context Learning Demonstrations for Unleashing MLLMs' Sentimental Perception Capability
por: Wu, Daiqing, et al.
Publicado: (2025)
por: Wu, Daiqing, et al.
Publicado: (2025)
Customizing Visual Emotion Evaluation for MLLMs: An Open-vocabulary, Multifaceted, and Scalable Approach
por: Wu, Daiqing, et al.
Publicado: (2025)
por: Wu, Daiqing, et al.
Publicado: (2025)
Towards Weakly Supervised Text-to-Audio Grounding
por: Xu, Xuenan, et al.
Publicado: (2024)
por: Xu, Xuenan, et al.
Publicado: (2024)
AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
por: Wang, Lu, et al.
Publicado: (2025)
por: Wang, Lu, et al.
Publicado: (2025)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
por: Zhao, Junqi, et al.
Publicado: (2025)
por: Zhao, Junqi, et al.
Publicado: (2025)
ASAudio: A Survey of Advanced Spatial Audio Research
por: Zhu, Zhiyuan, et al.
Publicado: (2025)
por: Zhu, Zhiyuan, et al.
Publicado: (2025)
The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents
por: Ma, Ziyang, et al.
Publicado: (2026)
por: Ma, Ziyang, et al.
Publicado: (2026)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
por: Zhao, Feiyu, et al.
Publicado: (2026)
por: Zhao, Feiyu, et al.
Publicado: (2026)
SAR-LM: Symbolic Audio Reasoning with Large Language Models
por: Taheri, Termeh, et al.
Publicado: (2025)
por: Taheri, Termeh, et al.
Publicado: (2025)
Audio Pirates: Black-box Audio Watermark Removal via Diffusion Priors
por: Yao, Lingfeng, et al.
Publicado: (2026)
por: Yao, Lingfeng, et al.
Publicado: (2026)
MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
por: Tao, Ye, et al.
Publicado: (2025)
por: Tao, Ye, et al.
Publicado: (2025)
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
por: Wang, Jieyi, et al.
Publicado: (2026)
por: Wang, Jieyi, et al.
Publicado: (2026)
AudioComposer: Towards Fine-grained Audio Generation with Natural Language Descriptions
por: Wang, Yuanyuan, et al.
Publicado: (2024)
por: Wang, Yuanyuan, et al.
Publicado: (2024)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
por: Deshmukh, Soham, et al.
Publicado: (2024)
por: Deshmukh, Soham, et al.
Publicado: (2024)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
por: Li, Xiquan, et al.
Publicado: (2026)
por: Li, Xiquan, et al.
Publicado: (2026)
Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer
por: Lei, Ke, et al.
Publicado: (2026)
por: Lei, Ke, et al.
Publicado: (2026)
EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs
por: Lin, Liang, et al.
Publicado: (2026)
por: Lin, Liang, et al.
Publicado: (2026)
AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
por: Rong, Yan, et al.
Publicado: (2025)
por: Rong, Yan, et al.
Publicado: (2025)
Towards Interpretable Framework for Neural Audio Codecs via Sparse Autoencoders: A Case Study on Accent Information
por: Wang, Shih-Heng, et al.
Publicado: (2026)
por: Wang, Shih-Heng, et al.
Publicado: (2026)
UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
por: Yang, Dongchao, et al.
Publicado: (2026)
por: Yang, Dongchao, et al.
Publicado: (2026)
Audio Spatially-Guided Fusion for Audio-Visual Navigation
por: Zhou, Xinyu, et al.
Publicado: (2026)
por: Zhou, Xinyu, et al.
Publicado: (2026)
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
por: Lee, Kuan-Yi, et al.
Publicado: (2025)
por: Lee, Kuan-Yi, et al.
Publicado: (2025)
UniTok-Audio: A Unified Audio Generation Framework via Generative Modeling on Discrete Codec Tokens
por: Liu, Chengwei, et al.
Publicado: (2025)
por: Liu, Chengwei, et al.
Publicado: (2025)
UltraEval-Audio: A Unified Framework for Comprehensive Evaluation of Audio Foundation Models
por: Shi, Qundong, et al.
Publicado: (2026)
por: Shi, Qundong, et al.
Publicado: (2026)
A Generalist Audio Foundation Model for Comprehensive Body Sound Auscultation
por: Wang, Pingjie, et al.
Publicado: (2024)
por: Wang, Pingjie, et al.
Publicado: (2024)
Audio ControlNet for Fine-Grained Audio Generation and Editing
por: Zhu, Haina, et al.
Publicado: (2026)
por: Zhu, Haina, et al.
Publicado: (2026)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
por: Lin, Jingru, et al.
Publicado: (2026)
por: Lin, Jingru, et al.
Publicado: (2026)
UniFlow-Audio: Unified Flow Matching for Audio Generation from Omni-Modalities
por: Xu, Xuenan, et al.
Publicado: (2025)
por: Xu, Xuenan, et al.
Publicado: (2025)
Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text
por: Mei, Jiahao, et al.
Publicado: (2026)
por: Mei, Jiahao, et al.
Publicado: (2026)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
por: Sun, Zhe, et al.
Publicado: (2025)
por: Sun, Zhe, et al.
Publicado: (2025)
Towards Audio Codec-based Speech Separation
por: Yip, Jia Qi, et al.
Publicado: (2024)
por: Yip, Jia Qi, et al.
Publicado: (2024)
AudioSAE: Towards Understanding of Audio-Processing Models with Sparse AutoEncoders
por: Aparin, Georgii, et al.
Publicado: (2026)
por: Aparin, Georgii, et al.
Publicado: (2026)
ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling
por: Yang, Dongchao, et al.
Publicado: (2025)
por: Yang, Dongchao, et al.
Publicado: (2025)
Ejemplares similares
-
ATIR: Towards Audio-Text Interleaved Contextual Retrieval
por: Zhao, Tong, et al.
Publicado: (2026) -
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
por: Luo, Kaiwen, et al.
Publicado: (2026) -
EmoCaliber: Advancing Reliable Visual Emotion Comprehension via Confidence Verbalization and Calibration
por: Wu, Daiqing, et al.
Publicado: (2025) -
AudioGuard: Toward Comprehensive Audio Safety Protection Across Diverse Threat Models
por: Kang, Mintong, et al.
Publicado: (2026) -
StyleBreak: Revealing Alignment Vulnerabilities in Large Audio-Language Models via Style-Aware Audio Jailbreak
por: Li, Hongyi, et al.
Publicado: (2025)