Token Pruning in Audio Transformers: Optimizing Performance and Decoding Patch Importance
Fuente:
arXiv
Guardado en:
| Autores principales: | Lee, Taehan, Lee, Hyukjun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SAM: A Mamba-2 State-Space Audio-Language Model
por: Lee, Taehan, et al.
Publicado: (2025)
por: Lee, Taehan, et al.
Publicado: (2025)
EnCLAP++: Analyzing the EnCLAP Framework for Optimizing Automated Audio Captioning Performance
por: Kim, Jaeyeon, et al.
Publicado: (2024)
por: Kim, Jaeyeon, et al.
Publicado: (2024)
Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
por: Nguyen, Tan Dat, et al.
Publicado: (2024)
por: Nguyen, Tan Dat, et al.
Publicado: (2024)
DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization
por: Lee, Geonyoung, et al.
Publicado: (2025)
por: Lee, Geonyoung, et al.
Publicado: (2025)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
por: Kim, Jaeyeon, et al.
Publicado: (2024)
por: Kim, Jaeyeon, et al.
Publicado: (2024)
Audio Enhancement for Computer Audition -- An Iterative Training Paradigm Using Sample Importance
por: Milling, Manuel, et al.
Publicado: (2024)
por: Milling, Manuel, et al.
Publicado: (2024)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
por: Han, Bing, et al.
Publicado: (2026)
por: Han, Bing, et al.
Publicado: (2026)
VocalAgent: Large Language Models for Vocal Health Diagnostics with Safety-Aware Evaluation
por: Kim, Yubin, et al.
Publicado: (2025)
por: Kim, Yubin, et al.
Publicado: (2025)
Towards Unified Neural Decoding of Perceived, Spoken and Imagined Speech from EEG Signals
por: Lee, Jung-Sun, et al.
Publicado: (2024)
por: Lee, Jung-Sun, et al.
Publicado: (2024)
Performance Improvement of Language-Queried Audio Source Separation Based on Caption Augmentation From Large Language Models for DCASE Challenge 2024 Task 9
por: Lee, Do Hyun, et al.
Publicado: (2024)
por: Lee, Do Hyun, et al.
Publicado: (2024)
Decoding Ambiguous Emotions with Test-Time Scaling in Audio-Language Models
por: Jia, Hong, et al.
Publicado: (2026)
por: Jia, Hong, et al.
Publicado: (2026)
Generalizable Prompt Tuning for Audio-Language Models via Semantic Expansion
por: Jang, Jaehyuk, et al.
Publicado: (2026)
por: Jang, Jaehyuk, et al.
Publicado: (2026)
Learning Semantic Information from Raw Audio Signal Using Both Contextual and Phonetic Representations
por: Kim, Jaeyeon, et al.
Publicado: (2024)
por: Kim, Jaeyeon, et al.
Publicado: (2024)
DRCap: Decoding CLAP Latents with Retrieval-Augmented Generation for Zero-shot Audio Captioning
por: Li, Xiquan, et al.
Publicado: (2024)
por: Li, Xiquan, et al.
Publicado: (2024)
End-to-End Real-World Polyphonic Piano Audio-to-Score Transcription with Hierarchical Decoding
por: Zeng, Wei, et al.
Publicado: (2024)
por: Zeng, Wei, et al.
Publicado: (2024)
FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion
por: Chen, Shunian, et al.
Publicado: (2025)
por: Chen, Shunian, et al.
Publicado: (2025)
LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation
por: Zhang, Zhisheng, et al.
Publicado: (2026)
por: Zhang, Zhisheng, et al.
Publicado: (2026)
Expanding on EnCLAP with Auxiliary Retrieval Model for Automated Audio Captioning
por: Kim, Jaeyeon, et al.
Publicado: (2024)
por: Kim, Jaeyeon, et al.
Publicado: (2024)
ElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions
por: Feng, Jiu, et al.
Publicado: (2024)
por: Feng, Jiu, et al.
Publicado: (2024)
AAT: Adapting Audio Transformer for Various Acoustics Recognition Tasks
por: Liang, Yun, et al.
Publicado: (2024)
por: Liang, Yun, et al.
Publicado: (2024)
Evaluating Hallucinations in Audio-Visual Multimodal LLMs with Spoken Queries under Diverse Acoustic Conditions
por: Park, Hansol, et al.
Publicado: (2025)
por: Park, Hansol, et al.
Publicado: (2025)
CTC-aligned Audio-Text Embedding for Streaming Open-vocabulary Keyword Spotting
por: Jin, Sichen, et al.
Publicado: (2024)
por: Jin, Sichen, et al.
Publicado: (2024)
SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval
por: Lin, Yueqian, et al.
Publicado: (2024)
por: Lin, Yueqian, et al.
Publicado: (2024)
SepPrune: Structured Pruning for Efficient Deep Speech Separation
por: Li, Yuqi, et al.
Publicado: (2025)
por: Li, Yuqi, et al.
Publicado: (2025)
Region-Based Optimization in Continual Learning for Audio Deepfake Detection
por: Chen, Yujie, et al.
Publicado: (2024)
por: Chen, Yujie, et al.
Publicado: (2024)
Discrete Audio Tokens: More Than a Survey!
por: Mousavi, Pooneh, et al.
Publicado: (2025)
por: Mousavi, Pooneh, et al.
Publicado: (2025)
HRTFformer: A Spatially-Aware Transformer for Individual HRTF Upsampling in Immersive Audio Rendering
por: Hu, Xuyi, et al.
Publicado: (2025)
por: Hu, Xuyi, et al.
Publicado: (2025)
CoughViT: A Self-Supervised Vision Transformer for Cough Audio Representation Learning
por: Luong, Justin, et al.
Publicado: (2025)
por: Luong, Justin, et al.
Publicado: (2025)
Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
por: Lin, Jiaju, et al.
Publicado: (2024)
por: Lin, Jiaju, et al.
Publicado: (2024)
PIAST: A Multimodal Piano Dataset with Audio, Symbolic and Text
por: Bang, Hayeon, et al.
Publicado: (2024)
por: Bang, Hayeon, et al.
Publicado: (2024)
PodEval: A Multimodal Evaluation Framework for Podcast Audio Generation
por: Xiao, Yujia, et al.
Publicado: (2025)
por: Xiao, Yujia, et al.
Publicado: (2025)
Audio Atlas: Visualizing and Exploring Audio Datasets
por: Lanzendörfer, Luca A., et al.
Publicado: (2024)
por: Lanzendörfer, Luca A., et al.
Publicado: (2024)
Affect Decoding in Phonated and Silent Speech Production from Surface EMG
por: Pistrosch, Simon, et al.
Publicado: (2026)
por: Pistrosch, Simon, et al.
Publicado: (2026)
Detecting Music Performance Errors with Transformers
por: Chou, Benjamin Shiue-Hal, et al.
Publicado: (2025)
por: Chou, Benjamin Shiue-Hal, et al.
Publicado: (2025)
Single-stage TTS with Masked Audio Token Modeling and Semantic Knowledge Distillation
por: Gállego, Gerard I., et al.
Publicado: (2024)
por: Gállego, Gerard I., et al.
Publicado: (2024)
AudioBERT: Audio Knowledge Augmented Language Model
por: Ok, Hyunjong, et al.
Publicado: (2024)
por: Ok, Hyunjong, et al.
Publicado: (2024)
Audio Spatially-Guided Fusion for Audio-Visual Navigation
por: Zhou, Xinyu, et al.
Publicado: (2026)
por: Zhou, Xinyu, et al.
Publicado: (2026)
The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition
por: Gao, Ming, et al.
Publicado: (2025)
por: Gao, Ming, et al.
Publicado: (2025)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
por: Zhao, Junqi, et al.
Publicado: (2025)
por: Zhao, Junqi, et al.
Publicado: (2025)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
por: Yuan, Yi, et al.
Publicado: (2025)
por: Yuan, Yi, et al.
Publicado: (2025)
Ejemplares similares
-
SAM: A Mamba-2 State-Space Audio-Language Model
por: Lee, Taehan, et al.
Publicado: (2025) -
EnCLAP++: Analyzing the EnCLAP Framework for Optimizing Automated Audio Captioning Performance
por: Kim, Jaeyeon, et al.
Publicado: (2024) -
Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
por: Nguyen, Tan Dat, et al.
Publicado: (2024) -
DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization
por: Lee, Geonyoung, et al.
Publicado: (2025) -
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
por: Kim, Jaeyeon, et al.
Publicado: (2024)