HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Peize, Luo, Yaodi, Liu, Xiaoqian, Liu, Xuyang, Deng, Jiahang, Du, Yaosong, Li, Bangyu, Gui, Xiyan, Chen, Yuxuan, Zhang, Linfeng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
par: Wang, Yuxuan, et autres
Publié: (2026)
par: Wang, Yuxuan, et autres
Publié: (2026)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
par: Glazer, Neta, et autres
Publié: (2026)
par: Glazer, Neta, et autres
Publié: (2026)
AudioMarathon: A Comprehensive Benchmark for Long-Context Audio Understanding and Efficiency in Audio LLMs
par: He, Peize, et autres
Publié: (2025)
par: He, Peize, et autres
Publié: (2025)
UniWhisper: Efficient Continual Multi-task Training for Robust Universal Audio Representation
par: Chen, Yuxuan, et autres
Publié: (2026)
par: Chen, Yuxuan, et autres
Publié: (2026)
HeadRouter: A Training-free Image Editing Framework for MM-DiTs by Adaptively Routing Attention Heads
par: Xu, Yu, et autres
Publié: (2024)
par: Xu, Yu, et autres
Publié: (2024)
UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
par: Yang, Dongchao, et autres
Publié: (2026)
par: Yang, Dongchao, et autres
Publié: (2026)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
par: Gong, Yitian, et autres
Publié: (2026)
par: Gong, Yitian, et autres
Publié: (2026)
ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling
par: Yang, Dongchao, et autres
Publié: (2025)
par: Yang, Dongchao, et autres
Publié: (2025)
Accelerating Audio Research with Robotic Dummy Heads
par: Lu, Austin, et autres
Publié: (2025)
par: Lu, Austin, et autres
Publié: (2025)
Adaptive Evidence Weighting for Audio-Spatiotemporal Fusion
par: Ovanger, Oscar, et autres
Publié: (2026)
par: Ovanger, Oscar, et autres
Publié: (2026)
DreamHead: Learning Spatial-Temporal Correspondence via Hierarchical Diffusion for Audio-driven Talking Head Synthesis
par: Hong, Fa-Ting, et autres
Publié: (2024)
par: Hong, Fa-Ting, et autres
Publié: (2024)
UniTok-Audio: A Unified Audio Generation Framework via Generative Modeling on Discrete Codec Tokens
par: Liu, Chengwei, et autres
Publié: (2025)
par: Liu, Chengwei, et autres
Publié: (2025)
READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation
par: Wang, Haotian, et autres
Publié: (2025)
par: Wang, Haotian, et autres
Publié: (2025)
AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
par: Chen, Liyang, et autres
Publié: (2026)
par: Chen, Liyang, et autres
Publié: (2026)
Audio-Driven Reinforcement Learning for Head-Orientation in Naturalistic Environments
par: Ledder, Wessel, et autres
Publié: (2024)
par: Ledder, Wessel, et autres
Publié: (2024)
Token Pruning in Audio Transformers: Optimizing Performance and Decoding Patch Importance
par: Lee, Taehan, et autres
Publié: (2025)
par: Lee, Taehan, et autres
Publié: (2025)
Segmentwise Pruning in Audio-Language Models
par: Gibier, Marcel, et autres
Publié: (2025)
par: Gibier, Marcel, et autres
Publié: (2025)
Dual Audio-Centric Modality Coupling for Talking Head Generation
par: Fu, Ao, et autres
Publié: (2025)
par: Fu, Ao, et autres
Publié: (2025)
Audio-Plane: Audio Factorization Plane Gaussian Splatting for Real-Time Talking Head Synthesis
par: Shen, Shuai, et autres
Publié: (2025)
par: Shen, Shuai, et autres
Publié: (2025)
Pengi: An Audio Language Model for Audio Tasks
par: Deshmukh, Soham, et autres
Publié: (2023)
par: Deshmukh, Soham, et autres
Publié: (2023)
Weighted-Sampling Audio Adversarial Example Attack
par: Liu, Xiaolei, et autres
Publié: (2019)
par: Liu, Xiaolei, et autres
Publié: (2019)
Learning Frame-Wise Emotion Intensity for Audio-Driven Talking-Head Generation
par: Xu, Jingyi, et autres
Publié: (2024)
par: Xu, Jingyi, et autres
Publié: (2024)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
par: Yuan, Yi, et autres
Publié: (2025)
par: Yuan, Yi, et autres
Publié: (2025)
AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
par: Wang, Junyou, et autres
Publié: (2025)
par: Wang, Junyou, et autres
Publié: (2025)
EGSTalker: Real-Time Audio-Driven Talking Head Generation with Efficient Gaussian Deformation
par: Zhu, Tianheng, et autres
Publié: (2025)
par: Zhu, Tianheng, et autres
Publié: (2025)
Exploring Token-Space Manipulation in Latent Audio Tokenizers
par: Paissan, Francesco, et autres
Publié: (2026)
par: Paissan, Francesco, et autres
Publié: (2026)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
par: Zhang, Dan, et autres
Publié: (2026)
par: Zhang, Dan, et autres
Publié: (2026)
AudioSpa: Spatializing Sound Events with Text
par: Feng, Linfeng, et autres
Publié: (2025)
par: Feng, Linfeng, et autres
Publié: (2025)
Audio-Language Models for Audio-Centric Tasks: A Systematic Survey
par: Su, Yi, et autres
Publié: (2025)
par: Su, Yi, et autres
Publié: (2025)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
par: Takeuchi, Daiki, et autres
Publié: (2025)
par: Takeuchi, Daiki, et autres
Publié: (2025)
Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs
par: Zhang, Linhao, et autres
Publié: (2026)
par: Zhang, Linhao, et autres
Publié: (2026)
MelTok: 2D Tokenization for Single-Codebook Audio Compression
par: Li, Jingyi, et autres
Publié: (2025)
par: Li, Jingyi, et autres
Publié: (2025)
NeRF-3DTalker: Neural Radiance Field with 3D Prior Aided Audio Disentanglement for Talking Head Synthesis
par: Liu, Xiaoxing, et autres
Publié: (2025)
par: Liu, Xiaoxing, et autres
Publié: (2025)
AudioSet-R: A Refined AudioSet with Multi-Stage LLM Label Reannotation
par: Sun, Yulin, et autres
Publié: (2025)
par: Sun, Yulin, et autres
Publié: (2025)
ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models
par: Luo, Kaiwen, et autres
Publié: (2026)
par: Luo, Kaiwen, et autres
Publié: (2026)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
par: Zhao, Junqi, et autres
Publié: (2025)
par: Zhao, Junqi, et autres
Publié: (2025)
Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training
par: Qiu, Jielin, et autres
Publié: (2026)
par: Qiu, Jielin, et autres
Publié: (2026)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
par: Yang, Dongchao, et autres
Publié: (2023)
par: Yang, Dongchao, et autres
Publié: (2023)
APEX: Audio Prototype EXplanations for Classification Tasks
par: Kawa, Piotr, et autres
Publié: (2026)
par: Kawa, Piotr, et autres
Publié: (2026)
LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models
par: Zhao, Xiaohan, et autres
Publié: (2025)
par: Zhao, Xiaohan, et autres
Publié: (2025)
Documents similaires
-
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
par: Wang, Yuxuan, et autres
Publié: (2026) -
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
par: Glazer, Neta, et autres
Publié: (2026) -
AudioMarathon: A Comprehensive Benchmark for Long-Context Audio Understanding and Efficiency in Audio LLMs
par: He, Peize, et autres
Publié: (2025) -
UniWhisper: Efficient Continual Multi-task Training for Robust Universal Audio Representation
par: Chen, Yuxuan, et autres
Publié: (2026) -
HeadRouter: A Training-free Image Editing Framework for MM-DiTs by Adaptively Routing Attention Heads
par: Xu, Yu, et autres
Publié: (2024)