Salvato in:
| Autori principali: | Hu, Xiaolin, Yuan, Hang, Sang, Xinzhu, Yan, Binbin, Yu, Zhou, Huang, Cong, Chen, Kai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2602.04913 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DialogGraph-LLM: Graph-Informed LLMs for End-to-End Audio Dialogue Intent Recognition
di: Liu, HongYu, et al.
Pubblicazione: (2025)
di: Liu, HongYu, et al.
Pubblicazione: (2025)
TDFNet: An Efficient Audio-Visual Speech Separation Model with Top-down Fusion
di: Pegg, Samuel, et al.
Pubblicazione: (2024)
di: Pegg, Samuel, et al.
Pubblicazione: (2024)
Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels
di: Weng, Yuzhe, et al.
Pubblicazione: (2026)
di: Weng, Yuzhe, et al.
Pubblicazione: (2026)
An Audio-Visual Speech Separation Model Inspired by Cortico-Thalamo-Cortical Circuits
di: Li, Kai, et al.
Pubblicazione: (2022)
di: Li, Kai, et al.
Pubblicazione: (2022)
OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation
di: Zhang, Qinglin, et al.
Pubblicazione: (2024)
di: Zhang, Qinglin, et al.
Pubblicazione: (2024)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
di: Sang, Wendi, et al.
Pubblicazione: (2025)
di: Sang, Wendi, et al.
Pubblicazione: (2025)
Benchmarking Open-ended Audio Dialogue Understanding for Large Audio-Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models
di: Chen, Guangke, et al.
Pubblicazione: (2025)
di: Chen, Guangke, et al.
Pubblicazione: (2025)
LearnAFE: Circuit-Algorithm Co-design Framework for Learnable Audio Analog Front-End
di: Hu, Jinhai, et al.
Pubblicazione: (2025)
di: Hu, Jinhai, et al.
Pubblicazione: (2025)
AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models
di: Li, Kai, et al.
Pubblicazione: (2025)
di: Li, Kai, et al.
Pubblicazione: (2025)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
di: Zhao, Feiyu, et al.
Pubblicazione: (2026)
di: Zhao, Feiyu, et al.
Pubblicazione: (2026)
AHAMask: Reliable Task Specification for Large Audio Language Models without Instructions
di: Guo, Yiwei, et al.
Pubblicazione: (2025)
di: Guo, Yiwei, et al.
Pubblicazione: (2025)
Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model
di: Huang, Ailin, et al.
Pubblicazione: (2025)
di: Huang, Ailin, et al.
Pubblicazione: (2025)
DGFNet: End-to-End Audio-Visual Source Separation Based on Dynamic Gating Fusion
di: Yu, Yinfeng, et al.
Pubblicazione: (2025)
di: Yu, Yinfeng, et al.
Pubblicazione: (2025)
SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models
di: Yin, Han, et al.
Pubblicazione: (2025)
di: Yin, Han, et al.
Pubblicazione: (2025)
A Framework for Synthetic Audio Conversations Generation using Large Language Models
di: Kyaw, Kaung Myat, et al.
Pubblicazione: (2024)
di: Kyaw, Kaung Myat, et al.
Pubblicazione: (2024)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
di: Zhang, Dan, et al.
Pubblicazione: (2026)
di: Zhang, Dan, et al.
Pubblicazione: (2026)
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
di: Lee, Kuan-Yi, et al.
Pubblicazione: (2025)
di: Lee, Kuan-Yi, et al.
Pubblicazione: (2025)
Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models
di: Ieong, Lok-Lam, et al.
Pubblicazione: (2026)
di: Ieong, Lok-Lam, et al.
Pubblicazione: (2026)
Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt
di: Shi, Yanfeng, et al.
Pubblicazione: (2026)
di: Shi, Yanfeng, et al.
Pubblicazione: (2026)
SonicSim: A customizable simulation platform for speech processing in moving sound source scenarios
di: Li, Kai, et al.
Pubblicazione: (2024)
di: Li, Kai, et al.
Pubblicazione: (2024)
Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation
di: Feng, Bo-Han, et al.
Pubblicazione: (2026)
di: Feng, Bo-Han, et al.
Pubblicazione: (2026)
Time-Frequency-Based Attention Cache Memory Model for Real-Time Speech Separation
di: Chen, Guo, et al.
Pubblicazione: (2025)
di: Chen, Guo, et al.
Pubblicazione: (2025)
Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
di: Goel, Arushi, et al.
Pubblicazione: (2025)
di: Goel, Arushi, et al.
Pubblicazione: (2025)
UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking
di: Chu, Xuangeng, et al.
Pubblicazione: (2025)
di: Chu, Xuangeng, et al.
Pubblicazione: (2025)
VAPO: End-to-end Slide-Enhanced Speech Recognition with Omni-modal Large Language Models
di: Hu, Rui, et al.
Pubblicazione: (2025)
di: Hu, Rui, et al.
Pubblicazione: (2025)
Multimodal Emotion Regression with Multi-Objective Optimization and VAD-Aware Audio Modeling for the 10th ABAW EMI Track
di: Huang, Jiawen, et al.
Pubblicazione: (2026)
di: Huang, Jiawen, et al.
Pubblicazione: (2026)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
di: Song, Zirui, et al.
Pubblicazione: (2025)
di: Song, Zirui, et al.
Pubblicazione: (2025)
The World is Not Mono: Enabling Spatial Understanding in Large Audio-Language Models
di: You, Yuhuan, et al.
Pubblicazione: (2026)
di: You, Yuhuan, et al.
Pubblicazione: (2026)
Do Audio-Visual Large Language Models Really See and Hear?
di: Selvakumar, Ramaneswaran, et al.
Pubblicazione: (2026)
di: Selvakumar, Ramaneswaran, et al.
Pubblicazione: (2026)
OWL: Geometry-Aware Spatial Reasoning for Audio Large Language Models
di: Biswas, Subrata, et al.
Pubblicazione: (2025)
di: Biswas, Subrata, et al.
Pubblicazione: (2025)
VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models
di: Chen, Yukun, et al.
Pubblicazione: (2026)
di: Chen, Yukun, et al.
Pubblicazione: (2026)
SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
di: Yang, Chih-Kai, et al.
Pubblicazione: (2026)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2026)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
di: Glazer, Neta, et al.
Pubblicazione: (2026)
di: Glazer, Neta, et al.
Pubblicazione: (2026)
Neuro-MSBG: An End-to-End Neural Model for Hearing Loss Simulation
di: Yuan, Hui-Guan, et al.
Pubblicazione: (2025)
di: Yuan, Hui-Guan, et al.
Pubblicazione: (2025)
AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
UAF: A Unified Audio Front-end LLM for Full-Duplex Speech Interaction
di: Li, Yadong, et al.
Pubblicazione: (2026)
di: Li, Yadong, et al.
Pubblicazione: (2026)
Investigating Safety Vulnerabilities of Large Audio-Language Models Under Speaker Emotional Variations
di: Feng, Bo-Han, et al.
Pubblicazione: (2025)
di: Feng, Bo-Han, et al.
Pubblicazione: (2025)
CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models
di: Mehta, Videet, et al.
Pubblicazione: (2026)
di: Mehta, Videet, et al.
Pubblicazione: (2026)
Documenti analoghi
-
DialogGraph-LLM: Graph-Informed LLMs for End-to-End Audio Dialogue Intent Recognition
di: Liu, HongYu, et al.
Pubblicazione: (2025) -
TDFNet: An Efficient Audio-Visual Speech Separation Model with Top-down Fusion
di: Pegg, Samuel, et al.
Pubblicazione: (2024) -
Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels
di: Weng, Yuzhe, et al.
Pubblicazione: (2026) -
An Audio-Visual Speech Separation Model Inspired by Cortico-Thalamo-Cortical Circuits
di: Li, Kai, et al.
Pubblicazione: (2022) -
OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation
di: Zhang, Qinglin, et al.
Pubblicazione: (2024)