Guardado en:
| Autores principales: | Sun, Yirong, Chen, Yanjun, Qiu, Xin, Zhang, Gang, Chen, Hongyu, Wu, Daokuan, Li, Chengming, Yang, Min, Zhu, Dawei, Zhang, Wei, Shen, Xiaoyu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2601.11039 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model
por: Sun, Yirong, et al.
Publicado: (2025)
por: Sun, Yirong, et al.
Publicado: (2025)
Sonic: Shifting Focus to Global Audio Perception in Portrait Animation
por: Ji, Xiaozhong, et al.
Publicado: (2024)
por: Ji, Xiaozhong, et al.
Publicado: (2024)
Sonic4D: Spatial Audio Generation for Immersive 4D Scene Exploration
por: Xie, Siyi, et al.
Publicado: (2025)
por: Xie, Siyi, et al.
Publicado: (2025)
AudioBench: A Universal Benchmark for Audio Large Language Models
por: Wang, Bin, et al.
Publicado: (2024)
por: Wang, Bin, et al.
Publicado: (2024)
ISA-Bench: Benchmarking Instruction Sensitivity for Large Audio Language Models
por: Li, Bohan, et al.
Publicado: (2025)
por: Li, Bohan, et al.
Publicado: (2025)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
por: Qiu, Jielin, et al.
Publicado: (2026)
por: Qiu, Jielin, et al.
Publicado: (2026)
SonicSense: Object Perception from In-Hand Acoustic Vibration
por: Liu, Jiaxun, et al.
Publicado: (2024)
por: Liu, Jiaxun, et al.
Publicado: (2024)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
por: Sun, Zhe, et al.
Publicado: (2025)
por: Sun, Zhe, et al.
Publicado: (2025)
RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios
por: Zhang, Yibo, et al.
Publicado: (2026)
por: Zhang, Yibo, et al.
Publicado: (2026)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
por: Li, Xiquan, et al.
Publicado: (2026)
por: Li, Xiquan, et al.
Publicado: (2026)
VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents
por: Hu, Jiliang, et al.
Publicado: (2025)
por: Hu, Jiliang, et al.
Publicado: (2025)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
por: Zhao, Xiaohan, et al.
Publicado: (2025)
por: Zhao, Xiaohan, et al.
Publicado: (2025)
AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation
por: Wang, Lu, et al.
Publicado: (2025)
por: Wang, Lu, et al.
Publicado: (2025)
VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories
por: Zhang, Qian, et al.
Publicado: (2026)
por: Zhang, Qian, et al.
Publicado: (2026)
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
por: Pian, Weiguo, et al.
Publicado: (2026)
por: Pian, Weiguo, et al.
Publicado: (2026)
Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders
por: Shan, Weiqiao, et al.
Publicado: (2025)
por: Shan, Weiqiao, et al.
Publicado: (2025)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
por: Zhao, Feiyu, et al.
Publicado: (2026)
por: Zhao, Feiyu, et al.
Publicado: (2026)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
por: Luo, Kaiwen, et al.
Publicado: (2026)
por: Luo, Kaiwen, et al.
Publicado: (2026)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
por: Zhao, Junqi, et al.
Publicado: (2025)
por: Zhao, Junqi, et al.
Publicado: (2025)
Audio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic Manipulation
por: Wei, Xiangyi, et al.
Publicado: (2025)
por: Wei, Xiangyi, et al.
Publicado: (2025)
AudioCIL: A Python Toolbox for Audio Class-Incremental Learning with Multiple Scenes
por: Xu, Qisheng, et al.
Publicado: (2024)
por: Xu, Qisheng, et al.
Publicado: (2024)
Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models
por: Cheng, Hao, et al.
Publicado: (2025)
por: Cheng, Hao, et al.
Publicado: (2025)
AHA: Aligning Large Audio-Language Models for Reasoning Hallucinations via Counterfactual Hard Negatives
por: Chen, Yanxi, et al.
Publicado: (2025)
por: Chen, Yanxi, et al.
Publicado: (2025)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
por: Chen, Wei-Chih, et al.
Publicado: (2026)
por: Chen, Wei-Chih, et al.
Publicado: (2026)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
por: Wang, Yuxuan, et al.
Publicado: (2026)
por: Wang, Yuxuan, et al.
Publicado: (2026)
Audio-Visual Speech Separation via Bottleneck Iterative Network
por: Zhang, Sidong, et al.
Publicado: (2025)
por: Zhang, Sidong, et al.
Publicado: (2025)
Enhancing Automated Audio Captioning via Large Language Models with Optimized Audio Encoding
por: Liu, Jizhong, et al.
Publicado: (2024)
por: Liu, Jizhong, et al.
Publicado: (2024)
A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook
por: Luo, Kaiwen, et al.
Publicado: (2026)
por: Luo, Kaiwen, et al.
Publicado: (2026)
Can Large Language Models Understand Spatial Audio?
por: Tang, Changli, et al.
Publicado: (2024)
por: Tang, Changli, et al.
Publicado: (2024)
The Accuracy Paradox in RLHF: When Better Reward Models Don't Yield Better Language Models
por: Chen, Yanjun, et al.
Publicado: (2024)
por: Chen, Yanjun, et al.
Publicado: (2024)
Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs
por: Zhang, Linhao, et al.
Publicado: (2026)
por: Zhang, Linhao, et al.
Publicado: (2026)
Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations
por: García, Hugo Flores, et al.
Publicado: (2024)
por: García, Hugo Flores, et al.
Publicado: (2024)
EgoSonics: Generating Synchronized Audio for Silent Egocentric Videos
por: Rai, Aashish, et al.
Publicado: (2024)
por: Rai, Aashish, et al.
Publicado: (2024)
Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt
por: Shi, Yanfeng, et al.
Publicado: (2026)
por: Shi, Yanfeng, et al.
Publicado: (2026)
Dissecting Performance Degradation in Audio Source Separation under Sampling Frequency Mismatch
por: Imamura, Kanami, et al.
Publicado: (2026)
por: Imamura, Kanami, et al.
Publicado: (2026)
PitchBench: Measuring Pitch Hearing in Audio-Language Models
por: Dujardin, Milan Liessens, et al.
Publicado: (2026)
por: Dujardin, Milan Liessens, et al.
Publicado: (2026)
Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models
por: Chen, Yiming, et al.
Publicado: (2024)
por: Chen, Yiming, et al.
Publicado: (2024)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
por: Song, Zirui, et al.
Publicado: (2025)
por: Song, Zirui, et al.
Publicado: (2025)
ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
por: Sun, Jiahui, et al.
Publicado: (2025)
por: Sun, Jiahui, et al.
Publicado: (2025)
From Coarse to Fine: Recursive Audio-Visual Semantic Enhancement for Speech Separation
por: Xue, Ke, et al.
Publicado: (2025)
por: Xue, Ke, et al.
Publicado: (2025)
Ejemplares similares
-
LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model
por: Sun, Yirong, et al.
Publicado: (2025) -
Sonic: Shifting Focus to Global Audio Perception in Portrait Animation
por: Ji, Xiaozhong, et al.
Publicado: (2024) -
Sonic4D: Spatial Audio Generation for Immersive 4D Scene Exploration
por: Xie, Siyi, et al.
Publicado: (2025) -
AudioBench: A Universal Benchmark for Audio Large Language Models
por: Wang, Bin, et al.
Publicado: (2024) -
ISA-Bench: Benchmarking Instruction Sensitivity for Large Audio Language Models
por: Li, Bohan, et al.
Publicado: (2025)