Attention or Convolution: Transformer Encoders in Audio Language Models for Inference Efficiency
Fuente:
arXiv
Salvato in:
| Autori principali: | Jeon, Sungho, Yeh, Ching-Feng, Inan, Hakan, Hsu, Wei-Ning, Rungta, Rashi, Mehdad, Yashar, Bikel, Daniel |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026)
Fx-Encoder++: Extracting Instrument-Wise Audio Effects Representations from Mixtures
di: Yeh, Yen-Tung, et al.
Pubblicazione: (2025)
di: Yeh, Yen-Tung, et al.
Pubblicazione: (2025)
Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders
di: Shan, Weiqiao, et al.
Pubblicazione: (2025)
di: Shan, Weiqiao, et al.
Pubblicazione: (2025)
The ICME 2025 Audio Encoder Capability Challenge
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
Multi-Level Attention Aggregation for Language-Agnostic Speaker Replication
di: Jeon, Yejin, et al.
Pubblicazione: (2024)
di: Jeon, Yejin, et al.
Pubblicazione: (2024)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
di: Han, Bing, et al.
Pubblicazione: (2026)
di: Han, Bing, et al.
Pubblicazione: (2026)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
di: Xu, Xuenan, et al.
Pubblicazione: (2024)
SynthCloner: Synthesizer-style Audio Transfer via Factorized Codec with ADSR Envelope Control
di: Liu, Jeng-Yue, et al.
Pubblicazione: (2025)
di: Liu, Jeng-Yue, et al.
Pubblicazione: (2025)
The CMU-AIST submission for the ICME 2025 Audio Encoder Challenge
di: Bharadwaj, Shikhar, et al.
Pubblicazione: (2026)
di: Bharadwaj, Shikhar, et al.
Pubblicazione: (2026)
SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
di: Wang, Helin, et al.
Pubblicazione: (2024)
di: Wang, Helin, et al.
Pubblicazione: (2024)
X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
di: Zhang, Junbo, et al.
Pubblicazione: (2025)
An Empirical Analysis of Task-Induced Encoder Bias in Fréchet Audio Distance
di: Jeong, Wonwoo
Pubblicazione: (2026)
di: Jeong, Wonwoo
Pubblicazione: (2026)
Audiobox TTA-RAG: Improving Zero-Shot and Few-Shot Text-To-Audio with Retrieval-Augmented Generation
di: Yang, Mu, et al.
Pubblicazione: (2024)
di: Yang, Mu, et al.
Pubblicazione: (2024)
OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder
di: Bharadwaj, Shikhar, et al.
Pubblicazione: (2025)
di: Bharadwaj, Shikhar, et al.
Pubblicazione: (2025)
Streaming Audio Transformers for Online Audio Tagging
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2023)
The AudioMOS Challenge 2025
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025)
GRAFX: An Open-Source Library for Audio Processing Graphs in PyTorch
di: Lee, Sungho, et al.
Pubblicazione: (2024)
di: Lee, Sungho, et al.
Pubblicazione: (2024)
Genuine-Focused Learning using Mask AutoEncoder for Generalized Fake Audio Detection
di: Wang, Xiaopeng, et al.
Pubblicazione: (2024)
di: Wang, Xiaopeng, et al.
Pubblicazione: (2024)
Attention-Based Audio Embeddings for Query-by-Example
di: Singh, Anup, et al.
Pubblicazione: (2022)
di: Singh, Anup, et al.
Pubblicazione: (2022)
PyNeuralFx: A Python Package for Neural Audio Effect Modeling
di: Yeh, Yen-Tung, et al.
Pubblicazione: (2024)
di: Yeh, Yen-Tung, et al.
Pubblicazione: (2024)
MT2KD: Towards A General-Purpose Encoder for Speech, Speaker, and Audio Events
di: Yang, Xiaoyu, et al.
Pubblicazione: (2024)
di: Yang, Xiaoyu, et al.
Pubblicazione: (2024)
Improving Audio Question Answering with Variational Inference
di: Chen, Haolin
Pubblicazione: (2026)
di: Chen, Haolin
Pubblicazione: (2026)
Hyper Recurrent Neural Network: Condition Mechanisms for Black-box Audio Effect Modeling
di: Yeh, Yen-Tung, et al.
Pubblicazione: (2024)
di: Yeh, Yen-Tung, et al.
Pubblicazione: (2024)
Speech-Aware Neural Diarization with Encoder-Decoder Attractor Guided by Attention Constraints
di: Lee, PeiYing, et al.
Pubblicazione: (2024)
di: Lee, PeiYing, et al.
Pubblicazione: (2024)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
di: Hai, Jiarui, et al.
Pubblicazione: (2024)
di: Hai, Jiarui, et al.
Pubblicazione: (2024)
Pengi: An Audio Language Model for Audio Tasks
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
di: Deshmukh, Soham, et al.
Pubblicazione: (2023)
Audio-Based Linguistic Feature Extraction for Enhancing Multi-lingual and Low-Resource Text-to-Speech
di: Kim, Youngjae, et al.
Pubblicazione: (2024)
di: Kim, Youngjae, et al.
Pubblicazione: (2024)
FAST: Fast Audio Spectrogram Transformer
di: Naman, Anugunj, et al.
Pubblicazione: (2025)
di: Naman, Anugunj, et al.
Pubblicazione: (2025)
Audios Don't Lie: Multi-Frequency Channel Attention Mechanism for Audio Deepfake Detection
di: Feng, Yangguang
Pubblicazione: (2024)
di: Feng, Yangguang
Pubblicazione: (2024)
CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation
di: Oh, Hyunwoo, et al.
Pubblicazione: (2025)
di: Oh, Hyunwoo, et al.
Pubblicazione: (2025)
Post-Training Quantization for Audio Diffusion Transformers
di: Khandelwal, Tanmay, et al.
Pubblicazione: (2025)
di: Khandelwal, Tanmay, et al.
Pubblicazione: (2025)
Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection
di: Nam, Hyeonuk, et al.
Pubblicazione: (2025)
di: Nam, Hyeonuk, et al.
Pubblicazione: (2025)
PAM: Prompting Audio-Language Models for Audio Quality Assessment
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
Attention-weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied to Speech Emotion Recognition
di: Yang, Qingran, et al.
Pubblicazione: (2026)
di: Yang, Qingran, et al.
Pubblicazione: (2026)
Continuous Audio Language Models
di: Rouard, Simon, et al.
Pubblicazione: (2025)
di: Rouard, Simon, et al.
Pubblicazione: (2025)
Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
Rethinking Speech Representation Aggregation in Speech Enhancement: A Phonetic Mutual Information Perspective
di: Han, Seungu, et al.
Pubblicazione: (2026)
di: Han, Seungu, et al.
Pubblicazione: (2026)
Continuous Learning of Transformer-based Audio Deepfake Detection
di: Le, Tuan Duy Nguyen, et al.
Pubblicazione: (2024)
di: Le, Tuan Duy Nguyen, et al.
Pubblicazione: (2024)
Complex Image-Generative Diffusion Transformer for Audio Denoising
di: Li, Junhui, et al.
Pubblicazione: (2024)
di: Li, Junhui, et al.
Pubblicazione: (2024)
Low-Complexity Acoustic Scene Classification Using Parallel Attention-Convolution Network
di: Li, Yanxiong, et al.
Pubblicazione: (2024)
di: Li, Yanxiong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
di: Dinkel, Heinrich, et al.
Pubblicazione: (2026) -
Fx-Encoder++: Extracting Instrument-Wise Audio Effects Representations from Mixtures
di: Yeh, Yen-Tung, et al.
Pubblicazione: (2025) -
Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders
di: Shan, Weiqiao, et al.
Pubblicazione: (2025) -
The ICME 2025 Audio Encoder Capability Challenge
di: Zhang, Junbo, et al.
Pubblicazione: (2025) -
Multi-Level Attention Aggregation for Language-Agnostic Speaker Replication
di: Jeon, Yejin, et al.
Pubblicazione: (2024)