Attention or Convolution: Transformer Encoders in Audio Language Models for Inference Efficiency
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jeon, Sungho, Yeh, Ching-Feng, Inan, Hakan, Hsu, Wei-Ning, Rungta, Rashi, Mehdad, Yashar, Bikel, Daniel |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
par: Dinkel, Heinrich, et autres
Publié: (2026)
par: Dinkel, Heinrich, et autres
Publié: (2026)
Fx-Encoder++: Extracting Instrument-Wise Audio Effects Representations from Mixtures
par: Yeh, Yen-Tung, et autres
Publié: (2025)
par: Yeh, Yen-Tung, et autres
Publié: (2025)
Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders
par: Shan, Weiqiao, et autres
Publié: (2025)
par: Shan, Weiqiao, et autres
Publié: (2025)
The ICME 2025 Audio Encoder Capability Challenge
par: Zhang, Junbo, et autres
Publié: (2025)
par: Zhang, Junbo, et autres
Publié: (2025)
Multi-Level Attention Aggregation for Language-Agnostic Speaker Replication
par: Jeon, Yejin, et autres
Publié: (2024)
par: Jeon, Yejin, et autres
Publié: (2024)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
par: Han, Bing, et autres
Publié: (2026)
par: Han, Bing, et autres
Publié: (2026)
Efficient Audio Captioning with Encoder-Level Knowledge Distillation
par: Xu, Xuenan, et autres
Publié: (2024)
par: Xu, Xuenan, et autres
Publié: (2024)
SynthCloner: Synthesizer-style Audio Transfer via Factorized Codec with ADSR Envelope Control
par: Liu, Jeng-Yue, et autres
Publié: (2025)
par: Liu, Jeng-Yue, et autres
Publié: (2025)
The CMU-AIST submission for the ICME 2025 Audio Encoder Challenge
par: Bharadwaj, Shikhar, et autres
Publié: (2026)
par: Bharadwaj, Shikhar, et autres
Publié: (2026)
SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer
par: Wang, Helin, et autres
Publié: (2024)
par: Wang, Helin, et autres
Publié: (2024)
X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance
par: Zhang, Junbo, et autres
Publié: (2025)
par: Zhang, Junbo, et autres
Publié: (2025)
An Empirical Analysis of Task-Induced Encoder Bias in Fréchet Audio Distance
par: Jeong, Wonwoo
Publié: (2026)
par: Jeong, Wonwoo
Publié: (2026)
Audiobox TTA-RAG: Improving Zero-Shot and Few-Shot Text-To-Audio with Retrieval-Augmented Generation
par: Yang, Mu, et autres
Publié: (2024)
par: Yang, Mu, et autres
Publié: (2024)
OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder
par: Bharadwaj, Shikhar, et autres
Publié: (2025)
par: Bharadwaj, Shikhar, et autres
Publié: (2025)
Streaming Audio Transformers for Online Audio Tagging
par: Dinkel, Heinrich, et autres
Publié: (2023)
par: Dinkel, Heinrich, et autres
Publié: (2023)
The AudioMOS Challenge 2025
par: Huang, Wen-Chin, et autres
Publié: (2025)
par: Huang, Wen-Chin, et autres
Publié: (2025)
GRAFX: An Open-Source Library for Audio Processing Graphs in PyTorch
par: Lee, Sungho, et autres
Publié: (2024)
par: Lee, Sungho, et autres
Publié: (2024)
Genuine-Focused Learning using Mask AutoEncoder for Generalized Fake Audio Detection
par: Wang, Xiaopeng, et autres
Publié: (2024)
par: Wang, Xiaopeng, et autres
Publié: (2024)
Attention-Based Audio Embeddings for Query-by-Example
par: Singh, Anup, et autres
Publié: (2022)
par: Singh, Anup, et autres
Publié: (2022)
PyNeuralFx: A Python Package for Neural Audio Effect Modeling
par: Yeh, Yen-Tung, et autres
Publié: (2024)
par: Yeh, Yen-Tung, et autres
Publié: (2024)
MT2KD: Towards A General-Purpose Encoder for Speech, Speaker, and Audio Events
par: Yang, Xiaoyu, et autres
Publié: (2024)
par: Yang, Xiaoyu, et autres
Publié: (2024)
Improving Audio Question Answering with Variational Inference
par: Chen, Haolin
Publié: (2026)
par: Chen, Haolin
Publié: (2026)
Hyper Recurrent Neural Network: Condition Mechanisms for Black-box Audio Effect Modeling
par: Yeh, Yen-Tung, et autres
Publié: (2024)
par: Yeh, Yen-Tung, et autres
Publié: (2024)
Speech-Aware Neural Diarization with Encoder-Decoder Attractor Guided by Attention Constraints
par: Lee, PeiYing, et autres
Publié: (2024)
par: Lee, PeiYing, et autres
Publié: (2024)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
par: Hai, Jiarui, et autres
Publié: (2024)
par: Hai, Jiarui, et autres
Publié: (2024)
Pengi: An Audio Language Model for Audio Tasks
par: Deshmukh, Soham, et autres
Publié: (2023)
par: Deshmukh, Soham, et autres
Publié: (2023)
Audio-Based Linguistic Feature Extraction for Enhancing Multi-lingual and Low-Resource Text-to-Speech
par: Kim, Youngjae, et autres
Publié: (2024)
par: Kim, Youngjae, et autres
Publié: (2024)
FAST: Fast Audio Spectrogram Transformer
par: Naman, Anugunj, et autres
Publié: (2025)
par: Naman, Anugunj, et autres
Publié: (2025)
Audios Don't Lie: Multi-Frequency Channel Attention Mechanism for Audio Deepfake Detection
par: Feng, Yangguang
Publié: (2024)
par: Feng, Yangguang
Publié: (2024)
CatchPhrase: EXPrompt-Guided Encoder Adaptation for Audio-to-Image Generation
par: Oh, Hyunwoo, et autres
Publié: (2025)
par: Oh, Hyunwoo, et autres
Publié: (2025)
Post-Training Quantization for Audio Diffusion Transformers
par: Khandelwal, Tanmay, et autres
Publié: (2025)
par: Khandelwal, Tanmay, et autres
Publié: (2025)
Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection
par: Nam, Hyeonuk, et autres
Publié: (2025)
par: Nam, Hyeonuk, et autres
Publié: (2025)
PAM: Prompting Audio-Language Models for Audio Quality Assessment
par: Deshmukh, Soham, et autres
Publié: (2024)
par: Deshmukh, Soham, et autres
Publié: (2024)
Attention-weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied to Speech Emotion Recognition
par: Yang, Qingran, et autres
Publié: (2026)
par: Yang, Qingran, et autres
Publié: (2026)
Continuous Audio Language Models
par: Rouard, Simon, et autres
Publié: (2025)
par: Rouard, Simon, et autres
Publié: (2025)
Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention
par: Tao, Ruijie, et autres
Publié: (2024)
par: Tao, Ruijie, et autres
Publié: (2024)
Rethinking Speech Representation Aggregation in Speech Enhancement: A Phonetic Mutual Information Perspective
par: Han, Seungu, et autres
Publié: (2026)
par: Han, Seungu, et autres
Publié: (2026)
Continuous Learning of Transformer-based Audio Deepfake Detection
par: Le, Tuan Duy Nguyen, et autres
Publié: (2024)
par: Le, Tuan Duy Nguyen, et autres
Publié: (2024)
Complex Image-Generative Diffusion Transformer for Audio Denoising
par: Li, Junhui, et autres
Publié: (2024)
par: Li, Junhui, et autres
Publié: (2024)
Low-Complexity Acoustic Scene Classification Using Parallel Attention-Convolution Network
par: Li, Yanxiong, et autres
Publié: (2024)
par: Li, Yanxiong, et autres
Publié: (2024)
Documents similaires
-
The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models
par: Dinkel, Heinrich, et autres
Publié: (2026) -
Fx-Encoder++: Extracting Instrument-Wise Audio Effects Representations from Mixtures
par: Yeh, Yen-Tung, et autres
Publié: (2025) -
Enhancing Speech Large Language Models with Prompt-Aware Mixture of Audio Encoders
par: Shan, Weiqiao, et autres
Publié: (2025) -
The ICME 2025 Audio Encoder Capability Challenge
par: Zhang, Junbo, et autres
Publié: (2025) -
Multi-Level Attention Aggregation for Language-Agnostic Speaker Replication
par: Jeon, Yejin, et autres
Publié: (2024)