Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Linhao, Song, Yuhan, Liu, Aiwei, Wu, Chuhan, Zhang, Sijun, Jia, Wei, Liu, Yuan, Wang, Houfeng, Zhou, Xiao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs
par: Song, Yuhan, et autres
Publié: (2025)
par: Song, Yuhan, et autres
Publié: (2025)
Beyond Classification: Towards Speech Emotion Reasoning with Multitask AudioLLMs
par: Zhang, Wenyu, et autres
Publié: (2025)
par: Zhang, Wenyu, et autres
Publié: (2025)
MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders
par: Zhang, Wenyu, et autres
Publié: (2024)
par: Zhang, Wenyu, et autres
Publié: (2024)
AR&D: A Framework for Retrieving and Describing Concepts for Interpreting AudioLLMs
par: Chowdhury, Townim Faisal, et autres
Publié: (2026)
par: Chowdhury, Townim Faisal, et autres
Publié: (2026)
UniFlow-Audio: Unified Flow Matching for Audio Generation from Omni-Modalities
par: Xu, Xuenan, et autres
Publié: (2025)
par: Xu, Xuenan, et autres
Publié: (2025)
Beyond Transcripts: A Renewed Perspective on Audio Chaptering
par: Retkowski, Fabian, et autres
Publié: (2026)
par: Retkowski, Fabian, et autres
Publié: (2026)
UniTok-Audio: A Unified Audio Generation Framework via Generative Modeling on Discrete Codec Tokens
par: Liu, Chengwei, et autres
Publié: (2025)
par: Liu, Chengwei, et autres
Publié: (2025)
UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
par: Yang, Dongchao, et autres
Publié: (2026)
par: Yang, Dongchao, et autres
Publié: (2026)
Towards Explicit Acoustic Evidence Perception in Audio LLMs for Speech Deepfake Detection
par: Guo, Xiaoxuan, et autres
Publié: (2026)
par: Guo, Xiaoxuan, et autres
Publié: (2026)
MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
par: Tao, Ye, et autres
Publié: (2025)
par: Tao, Ye, et autres
Publié: (2025)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
par: Sun, Zhe, et autres
Publié: (2025)
par: Sun, Zhe, et autres
Publié: (2025)
Zero-Shot Cognitive Impairment Detection from Speech Using AudioLLM
par: Shahin, Mostafa, et autres
Publié: (2025)
par: Shahin, Mostafa, et autres
Publié: (2025)
Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text
par: Mei, Jiahao, et autres
Publié: (2026)
par: Mei, Jiahao, et autres
Publié: (2026)
TART: A Comprehensive Tool for Technique-Aware Audio-to-Tab Guitar Transcription
par: Gupta, Akshaj, et autres
Publié: (2025)
par: Gupta, Akshaj, et autres
Publié: (2025)
Multi-Task Instruction Tuning via Data Scheduling for Low-Resource Arabic AudioLLMs
par: Bhatti, Hunzalah Hassan, et autres
Publié: (2026)
par: Bhatti, Hunzalah Hassan, et autres
Publié: (2026)
Audio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic Manipulation
par: Wei, Xiangyi, et autres
Publié: (2025)
par: Wei, Xiangyi, et autres
Publié: (2025)
MENASpeechBank: A Reference Voice Bank with Persona-Conditioned Multi-Turn Conversations for AudioLLMs
par: Ali, Zien Sheikh, et autres
Publié: (2026)
par: Ali, Zien Sheikh, et autres
Publié: (2026)
AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing
par: Chen, William, et autres
Publié: (2026)
par: Chen, William, et autres
Publié: (2026)
Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models
par: Li, Yanda, et autres
Publié: (2026)
par: Li, Yanda, et autres
Publié: (2026)
Emotion and Acoustics Should Agree: Cross-Level Inconsistency Analysis for Audio Deepfake Detection
par: Zhang, Jinhua, et autres
Publié: (2026)
par: Zhang, Jinhua, et autres
Publié: (2026)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
par: Luo, Kaiwen, et autres
Publié: (2026)
par: Luo, Kaiwen, et autres
Publié: (2026)
StyleBreak: Revealing Alignment Vulnerabilities in Large Audio-Language Models via Style-Aware Audio Jailbreak
par: Li, Hongyi, et autres
Publié: (2025)
par: Li, Hongyi, et autres
Publié: (2025)
VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models
par: Chen, Yukun, et autres
Publié: (2026)
par: Chen, Yukun, et autres
Publié: (2026)
A Sensitivity Analysis of Multi-Event Audio Grounding in Audio LLMs
par: Lee, Taehan, et autres
Publié: (2026)
par: Lee, Taehan, et autres
Publié: (2026)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
par: Jia, Yuhang, et autres
Publié: (2025)
par: Jia, Yuhang, et autres
Publié: (2025)
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
par: Wang, Yuxuan, et autres
Publié: (2026)
par: Wang, Yuxuan, et autres
Publié: (2026)
UltraEval-Audio: A Unified Framework for Comprehensive Evaluation of Audio Foundation Models
par: Shi, Qundong, et autres
Publié: (2026)
par: Shi, Qundong, et autres
Publié: (2026)
From Vision to Audio and Beyond: A Unified Model for Audio-Visual Representation and Generation
par: Su, Kun, et autres
Publié: (2024)
par: Su, Kun, et autres
Publié: (2024)
Beyond Video-to-SFX: Video to Audio Synthesis with Environmentally Aware Speech
par: Niu, Xinlei, et autres
Publié: (2025)
par: Niu, Xinlei, et autres
Publié: (2025)
Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning
par: Wu, Daiqing, et autres
Publié: (2026)
par: Wu, Daiqing, et autres
Publié: (2026)
Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt
par: Shi, Yanfeng, et autres
Publié: (2026)
par: Shi, Yanfeng, et autres
Publié: (2026)
Audio-Guided Dynamic Modality Fusion with Stereo-Aware Attention for Audio-Visual Navigation
par: Li, Jia, et autres
Publié: (2025)
par: Li, Jia, et autres
Publié: (2025)
Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning
par: Xie, Yuankun, et autres
Publié: (2026)
par: Xie, Yuankun, et autres
Publié: (2026)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
par: Dinkel, Heinrich, et autres
Publié: (2025)
par: Dinkel, Heinrich, et autres
Publié: (2025)
RUMAA: Repeat-Aware Unified Music Audio Analysis for Score-Performance Alignment, Transcription, and Mistake Detection
par: Chang, Sungkyun, et autres
Publié: (2025)
par: Chang, Sungkyun, et autres
Publié: (2025)
AudioX: A Unified Framework for Anything-to-Audio Generation
par: Tian, Zeyue, et autres
Publié: (2025)
par: Tian, Zeyue, et autres
Publié: (2025)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
par: Liu, Huadai, et autres
Publié: (2024)
par: Liu, Huadai, et autres
Publié: (2024)
SonicBench: Dissecting the Physical Perception Bottleneck in Large Audio Language Models
par: Sun, Yirong, et autres
Publié: (2026)
par: Sun, Yirong, et autres
Publié: (2026)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
par: Yang, Dongchao, et autres
Publié: (2023)
par: Yang, Dongchao, et autres
Publié: (2023)
The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization
par: Zhang, Ruixing, et autres
Publié: (2026)
par: Zhang, Ruixing, et autres
Publié: (2026)
Documents similaires
-
StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs
par: Song, Yuhan, et autres
Publié: (2025) -
Beyond Classification: Towards Speech Emotion Reasoning with Multitask AudioLLMs
par: Zhang, Wenyu, et autres
Publié: (2025) -
MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders
par: Zhang, Wenyu, et autres
Publié: (2024) -
AR&D: A Framework for Retrieving and Describing Concepts for Interpreting AudioLLMs
par: Chowdhury, Townim Faisal, et autres
Publié: (2026) -
UniFlow-Audio: Unified Flow Matching for Audio Generation from Omni-Modalities
par: Xu, Xuenan, et autres
Publié: (2025)