Guardado en:
| Autores principales: | Zhao, Tong, Zhang, Chenghao, Zhu, Yutao, Dou, Zhicheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2604.20267 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation
por: Zhang, Chenghao, et al.
Publicado: (2026)
por: Zhang, Chenghao, et al.
Publicado: (2026)
FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion
por: Chen, Shunian, et al.
Publicado: (2025)
por: Chen, Shunian, et al.
Publicado: (2025)
FreeAudio: Training-Free Timing Planning for Controllable Long-Form Text-to-Audio Generation
por: Jiang, Yuxuan, et al.
Publicado: (2025)
por: Jiang, Yuxuan, et al.
Publicado: (2025)
Retrieval-Augmented Text-to-Audio Generation
por: Yuan, Yi, et al.
Publicado: (2023)
por: Yuan, Yi, et al.
Publicado: (2023)
ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling
por: Jiang, Yuxuan, et al.
Publicado: (2025)
por: Jiang, Yuxuan, et al.
Publicado: (2025)
Revisiting Deep Audio-Text Retrieval Through the Lens of Transportation
por: Luong, Manh, et al.
Publicado: (2024)
por: Luong, Manh, et al.
Publicado: (2024)
MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows
por: Li, Xiquan, et al.
Publicado: (2025)
por: Li, Xiquan, et al.
Publicado: (2025)
PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation
por: Xie, Tianxin, et al.
Publicado: (2025)
por: Xie, Tianxin, et al.
Publicado: (2025)
From Talking to Singing: A New Challenge for Audio-Visual Deepfake Detection
por: Liu, Ke, et al.
Publicado: (2026)
por: Liu, Ke, et al.
Publicado: (2026)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
por: Zhao, Junqi, et al.
Publicado: (2025)
por: Zhao, Junqi, et al.
Publicado: (2025)
Towards Streaming Target Speaker Extraction via Chunk-wise Interleaved Splicing of Autoregressive Language Model
por: Peng, Shuhai, et al.
Publicado: (2026)
por: Peng, Shuhai, et al.
Publicado: (2026)
MOSS-Audio Technical Report
por: Yang, Chen, et al.
Publicado: (2026)
por: Yang, Chen, et al.
Publicado: (2026)
The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization
por: Zhang, Ruixing, et al.
Publicado: (2026)
por: Zhang, Ruixing, et al.
Publicado: (2026)
RFM-Editing: Rectified Flow Matching for Text-guided Audio Editing
por: Gao, Liting, et al.
Publicado: (2025)
por: Gao, Liting, et al.
Publicado: (2025)
Retrieval-Augmented Audio Deepfake Detection
por: Kang, Zuheng, et al.
Publicado: (2024)
por: Kang, Zuheng, et al.
Publicado: (2024)
AudioSAE: Towards Understanding of Audio-Processing Models with Sparse AutoEncoders
por: Aparin, Georgii, et al.
Publicado: (2026)
por: Aparin, Georgii, et al.
Publicado: (2026)
TTMBA: Towards Text To Multiple Sources Binaural Audio Generation
por: He, Yuxuan, et al.
Publicado: (2025)
por: He, Yuxuan, et al.
Publicado: (2025)
AudioGuard: Toward Comprehensive Audio Safety Protection Across Diverse Threat Models
por: Kang, Mintong, et al.
Publicado: (2026)
por: Kang, Mintong, et al.
Publicado: (2026)
ATRI: Mitigating Multilingual Audio Text Retrieval Inconsistencies by Reducing Data Distribution Errors
por: Yin, Yuguo, et al.
Publicado: (2025)
por: Yin, Yuguo, et al.
Publicado: (2025)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
por: Zhao, Feiyu, et al.
Publicado: (2026)
por: Zhao, Feiyu, et al.
Publicado: (2026)
RAMoEA-QA: Hierarchical Specialization for Robust Respiratory Audio Question Answering
por: Bertolino, Gaia A., et al.
Publicado: (2026)
por: Bertolino, Gaia A., et al.
Publicado: (2026)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
por: Qiu, Jielin, et al.
Publicado: (2026)
por: Qiu, Jielin, et al.
Publicado: (2026)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
por: Zhang, Dan, et al.
Publicado: (2026)
por: Zhang, Dan, et al.
Publicado: (2026)
AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
por: Wang, Junyou, et al.
Publicado: (2025)
por: Wang, Junyou, et al.
Publicado: (2025)
Towards Explicit Acoustic Evidence Perception in Audio LLMs for Speech Deepfake Detection
por: Guo, Xiaoxuan, et al.
Publicado: (2026)
por: Guo, Xiaoxuan, et al.
Publicado: (2026)
RespLLM: Unifying Audio and Text with Multimodal LLMs for Generalized Respiratory Health Prediction
por: Zhang, Yuwei, et al.
Publicado: (2024)
por: Zhang, Yuwei, et al.
Publicado: (2024)
Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt
por: Shi, Yanfeng, et al.
Publicado: (2026)
por: Shi, Yanfeng, et al.
Publicado: (2026)
Evaluating Semantic Fragility in Text-to-Audio Generation Systems Under Controlled Prompt Perturbations
por: Wu, Jiahui
Publicado: (2026)
por: Wu, Jiahui
Publicado: (2026)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
por: Yuan, Yi, et al.
Publicado: (2025)
por: Yuan, Yi, et al.
Publicado: (2025)
SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization
por: Luo, Jiehui, et al.
Publicado: (2025)
por: Luo, Jiehui, et al.
Publicado: (2025)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
por: Glazer, Neta, et al.
Publicado: (2026)
por: Glazer, Neta, et al.
Publicado: (2026)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
por: Kim, Jaeyeon, et al.
Publicado: (2024)
por: Kim, Jaeyeon, et al.
Publicado: (2024)
Towards Mixed-Modal Retrieval for Universal Retrieval-Augmented Generation
por: Zhang, Chenghao, et al.
Publicado: (2025)
por: Zhang, Chenghao, et al.
Publicado: (2025)
Toward Noise-Aware Audio Deepfake Detection: Survey, SNR-Benchmarks, and Practical Recipes
por: Sen, Udayon, et al.
Publicado: (2025)
por: Sen, Udayon, et al.
Publicado: (2025)
ERF-BA-TFD+: A Multimodal Model for Audio-Visual Deepfake Detection
por: Zhang, Xin, et al.
Publicado: (2025)
por: Zhang, Xin, et al.
Publicado: (2025)
AuTAgent: A Reinforcement Learning Framework for Tool-Augmented Audio Reasoning
por: Tong, Siqian, et al.
Publicado: (2026)
por: Tong, Siqian, et al.
Publicado: (2026)
WavRAG: Audio-Integrated Retrieval Augmented Generation for Spoken Dialogue Models
por: Chen, Yifu, et al.
Publicado: (2025)
por: Chen, Yifu, et al.
Publicado: (2025)
VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models
por: Chen, Yukun, et al.
Publicado: (2026)
por: Chen, Yukun, et al.
Publicado: (2026)
Unify Variables in Neural Scaling Laws for General Audio Representations via Embedding Effective Rank
por: Deng, Xuyao, et al.
Publicado: (2025)
por: Deng, Xuyao, et al.
Publicado: (2025)
VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories
por: Zhang, Qian, et al.
Publicado: (2026)
por: Zhang, Qian, et al.
Publicado: (2026)
Ejemplares similares
-
Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation
por: Zhang, Chenghao, et al.
Publicado: (2026) -
FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion
por: Chen, Shunian, et al.
Publicado: (2025) -
FreeAudio: Training-Free Timing Planning for Controllable Long-Form Text-to-Audio Generation
por: Jiang, Yuxuan, et al.
Publicado: (2025) -
Retrieval-Augmented Text-to-Audio Generation
por: Yuan, Yi, et al.
Publicado: (2023) -
ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling
por: Jiang, Yuxuan, et al.
Publicado: (2025)