Outlier Reduction with Gated Attention for Improved Post-training Quantization in Large Sequence-to-sequence Speech Foundation Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wagner, Dominik, Baumann, Ilja, Riedhammer, Korbinian, Bocklet, Tobias |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition
par: Wagner, Dominik, et autres
Publié: (2025)
par: Wagner, Dominik, et autres
Publié: (2025)
Large Language Models for Dysfluency Detection in Stuttered Speech
par: Wagner, Dominik, et autres
Publié: (2024)
par: Wagner, Dominik, et autres
Publié: (2024)
Vocoder-Free Non-Parallel Conversion of Whispered Speech With Masked Cycle-Consistent Generative Adversarial Networks
par: Wagner, Dominik, et autres
Publié: (2023)
par: Wagner, Dominik, et autres
Publié: (2023)
Adapter-Based Multi-Agent AVSR Extension for Pre-Trained ASR Models
par: Simic, Christopher, et autres
Publié: (2025)
par: Simic, Christopher, et autres
Publié: (2025)
Detecting Dysfluencies in Stuttering Therapy Using wav2vec 2.0
par: Bayerl, Sebastian P., et autres
Publié: (2022)
par: Bayerl, Sebastian P., et autres
Publié: (2022)
Infusing Acoustic Pause Context into Text-Based Dementia Assessment
par: Braun, Franziska, et autres
Publié: (2024)
par: Braun, Franziska, et autres
Publié: (2024)
Optimized Self-supervised Training with BEST-RQ for Speech Recognition
par: Baumann, Ilja, et autres
Publié: (2025)
par: Baumann, Ilja, et autres
Publié: (2025)
A Survey of Music Generation in the Context of Interaction
par: Agchar, Ismael, et autres
Publié: (2024)
par: Agchar, Ismael, et autres
Publié: (2024)
FLASepformer: Efficient Speech Separation with Gated Focused Linear Attention Transformer
par: Wang, Haoxu, et autres
Publié: (2025)
par: Wang, Haoxu, et autres
Publié: (2025)
The PARLO Dementia Corpus: A German Multi-Center Resource for Alzheimer's Disease
par: Braun, Franziska, et autres
Publié: (2026)
par: Braun, Franziska, et autres
Publié: (2026)
A Perception-Based L2 Speech Intelligibility Indicator: Leveraging a Rater's Shadowing and Sequence-to-sequence Voice Conversion
par: Geng, Haopeng, et autres
Publié: (2025)
par: Geng, Haopeng, et autres
Publié: (2025)
Post-Training Quantization for Audio Diffusion Transformers
par: Khandelwal, Tanmay, et autres
Publié: (2025)
par: Khandelwal, Tanmay, et autres
Publié: (2025)
Pitfalls and Limits in Automatic Dementia Assessment
par: Braun, Franziska, et autres
Publié: (2025)
par: Braun, Franziska, et autres
Publié: (2025)
Improving Speech Emotion Recognition Through Cross Modal Attention Alignment and Balanced Stacking Model
par: Ueda, Lucas, et autres
Publié: (2025)
par: Ueda, Lucas, et autres
Publié: (2025)
Improving Streaming Speech Recognition With Time-Shifted Contextual Attention And Dynamic Right Context Masking
par: Le, Khanh, et autres
Publié: (2025)
par: Le, Khanh, et autres
Publié: (2025)
Addressing Index Collapse of Large-Codebook Speech Tokenizer with Dual-Decoding Product-Quantized Variational Auto-Encoder
par: Guo, Haohan, et autres
Publié: (2024)
par: Guo, Haohan, et autres
Publié: (2024)
USM-Lite: Quantization and Sparsity Aware Fine-tuning for Speech Recognition with Universal Speech Models
par: Ding, Shaojin, et autres
Publié: (2023)
par: Ding, Shaojin, et autres
Publié: (2023)
Vector Quantized Diffusion Model Based Speech Bandwidth Extension
par: Fang, Yuan, et autres
Publié: (2024)
par: Fang, Yuan, et autres
Publié: (2024)
Effective and Efficient Mixed Precision Quantization of Speech Foundation Models
par: Xu, Haoning, et autres
Publié: (2025)
par: Xu, Haoning, et autres
Publié: (2025)
Cross-Talk Speech Reduction, by Separation, for Separation
par: Wang, Zhong-Qiu, et autres
Publié: (2026)
par: Wang, Zhong-Qiu, et autres
Publié: (2026)
Using Speech Foundational Models in Loss Functions for Hearing Aid Speech Enhancement
par: Sutherland, Robert, et autres
Publié: (2024)
par: Sutherland, Robert, et autres
Publié: (2024)
Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration
par: Ku, Pin-Jui, et autres
Publié: (2024)
par: Ku, Pin-Jui, et autres
Publié: (2024)
On the Difficulty of Token-Level Modeling of Dysfluency and Fluency Shaping Artifacts
par: Gulzar, Kashaf, et autres
Publié: (2025)
par: Gulzar, Kashaf, et autres
Publié: (2025)
SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
par: Chen, Wenxi, et autres
Publié: (2025)
par: Chen, Wenxi, et autres
Publié: (2025)
Mamba in Speech: Towards an Alternative to Self-Attention
par: Zhang, Xiangyu, et autres
Publié: (2024)
par: Zhang, Xiangyu, et autres
Publié: (2024)
Analysing the Masked predictive coding training criterion for pre-training a Speech Representation Model
par: Yadav, Hemant, et autres
Publié: (2023)
par: Yadav, Hemant, et autres
Publié: (2023)
Prosody Labeling with Phoneme-BERT and Speech Foundation Models
par: Koriyama, Tomoki
Publié: (2025)
par: Koriyama, Tomoki
Publié: (2025)
ESC: Efficient Speech Coding with Cross-Scale Residual Vector Quantized Transformers
par: Gu, Yuzhe, et autres
Publié: (2024)
par: Gu, Yuzhe, et autres
Publié: (2024)
Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits
par: Feng, Tiantian, et autres
Publié: (2025)
par: Feng, Tiantian, et autres
Publié: (2025)
Speaker Disentanglement of Speech Pre-trained Model Based on Interpretability
par: Zhu, Xiaoxu, et autres
Publié: (2025)
par: Zhu, Xiaoxu, et autres
Publié: (2025)
Chunk Based Speech Pre-training with High Resolution Finite Scalar Quantization
par: Tang, Yun, et autres
Publié: (2025)
par: Tang, Yun, et autres
Publié: (2025)
Attention-Guided Adaptation for Code-Switching Speech Recognition
par: Aditya, Bobbi, et autres
Publié: (2023)
par: Aditya, Bobbi, et autres
Publié: (2023)
Reverse Attention for Lightweight Speech Enhancement on Edge Devices
par: Ojha, Shuubham, et autres
Publié: (2025)
par: Ojha, Shuubham, et autres
Publié: (2025)
Attention-Based Beamformer For Multi-Channel Speech Enhancement
par: Bai, Jinglin, et autres
Publié: (2024)
par: Bai, Jinglin, et autres
Publié: (2024)
Self-Supervised Speech Quality Assessment (S3QA): Leveraging Speech Foundation Models for a Scalable Speech Quality Metric
par: Ogg, Mattson, et autres
Publié: (2025)
par: Ogg, Mattson, et autres
Publié: (2025)
Neural Speech Coding for Real-time Communications using Constant Bitrate Scalar Quantization
par: Brendel, Andreas, et autres
Publié: (2024)
par: Brendel, Andreas, et autres
Publié: (2024)
Causal Speech Enhancement with Predicting Semantics based on Quantized Self-supervised Learning Features
par: Tsunoo, Emiru, et autres
Publié: (2024)
par: Tsunoo, Emiru, et autres
Publié: (2024)
FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications
par: Guo, Hao-Han, et autres
Publié: (2024)
par: Guo, Hao-Han, et autres
Publié: (2024)
Attention-weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied to Speech Emotion Recognition
par: Yang, Qingran, et autres
Publié: (2026)
par: Yang, Qingran, et autres
Publié: (2026)
Target Speech Extraction with Pre-trained Self-supervised Learning Models
par: Peng, Junyi, et autres
Publié: (2024)
par: Peng, Junyi, et autres
Publié: (2024)
Documents similaires
-
Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition
par: Wagner, Dominik, et autres
Publié: (2025) -
Large Language Models for Dysfluency Detection in Stuttered Speech
par: Wagner, Dominik, et autres
Publié: (2024) -
Vocoder-Free Non-Parallel Conversion of Whispered Speech With Masked Cycle-Consistent Generative Adversarial Networks
par: Wagner, Dominik, et autres
Publié: (2023) -
Adapter-Based Multi-Agent AVSR Extension for Pre-Trained ASR Models
par: Simic, Christopher, et autres
Publié: (2025) -
Detecting Dysfluencies in Stuttering Therapy Using wav2vec 2.0
par: Bayerl, Sebastian P., et autres
Publié: (2022)