Adapter-Based Multi-Agent AVSR Extension for Pre-Trained ASR Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Simic, Christopher, Riedhammer, Korbinian, Bocklet, Tobias |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Outlier Reduction with Gated Attention for Improved Post-training Quantization in Large Sequence-to-sequence Speech Foundation Models
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition
di: Wagner, Dominik, et al.
Pubblicazione: (2025)
di: Wagner, Dominik, et al.
Pubblicazione: (2025)
Large Language Models for Dysfluency Detection in Stuttered Speech
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
di: Wagner, Dominik, et al.
Pubblicazione: (2024)
Infusing Acoustic Pause Context into Text-Based Dementia Assessment
di: Braun, Franziska, et al.
Pubblicazione: (2024)
di: Braun, Franziska, et al.
Pubblicazione: (2024)
Efficient Adapter Tuning of Pre-trained Speech Models for Automatic Speaker Verification
di: Sang, Mufan, et al.
Pubblicazione: (2024)
di: Sang, Mufan, et al.
Pubblicazione: (2024)
Efficient Adapter Finetuning for Tail Languages in Streaming Multilingual ASR
di: Bai, Junwen, et al.
Pubblicazione: (2024)
di: Bai, Junwen, et al.
Pubblicazione: (2024)
CJST: CTC Compressor based Joint Speech and Text Training for Decoder-Only ASR
di: Zhou, Wei, et al.
Pubblicazione: (2024)
di: Zhou, Wei, et al.
Pubblicazione: (2024)
Comparative Study on Noise-Augmented Training and its Effect on Adversarial Robustness in ASR Systems
di: Pizzi, Karla, et al.
Pubblicazione: (2024)
di: Pizzi, Karla, et al.
Pubblicazione: (2024)
The PARLO Dementia Corpus: A German Multi-Center Resource for Alzheimer's Disease
di: Braun, Franziska, et al.
Pubblicazione: (2026)
di: Braun, Franziska, et al.
Pubblicazione: (2026)
A Survey of Music Generation in the Context of Interaction
di: Agchar, Ismael, et al.
Pubblicazione: (2024)
di: Agchar, Ismael, et al.
Pubblicazione: (2024)
Vocoder-Free Non-Parallel Conversion of Whispered Speech With Masked Cycle-Consistent Generative Adversarial Networks
di: Wagner, Dominik, et al.
Pubblicazione: (2023)
di: Wagner, Dominik, et al.
Pubblicazione: (2023)
Speech Diarization and ASR with GMM
di: Sharma, Aayush Kumar, et al.
Pubblicazione: (2023)
di: Sharma, Aayush Kumar, et al.
Pubblicazione: (2023)
Edge-ASR: Towards Low-Bit Quantization of Automatic Speech Recognition Models
di: Feng, Chen, et al.
Pubblicazione: (2025)
di: Feng, Chen, et al.
Pubblicazione: (2025)
Houston we have a Divergence: A Subgroup Performance Analysis of ASR Models
di: Koudounas, Alkis, et al.
Pubblicazione: (2024)
di: Koudounas, Alkis, et al.
Pubblicazione: (2024)
Evaluation of Speech Foundation Models for ASR on Child-Adult Conversations in Autism Diagnostic Sessions
di: Ashvin, Aditya, et al.
Pubblicazione: (2024)
di: Ashvin, Aditya, et al.
Pubblicazione: (2024)
Score-Based Training for Energy-Based TTS Models
di: Sun, Wanli, et al.
Pubblicazione: (2025)
di: Sun, Wanli, et al.
Pubblicazione: (2025)
On the Difficulty of Token-Level Modeling of Dysfluency and Fluency Shaping Artifacts
di: Gulzar, Kashaf, et al.
Pubblicazione: (2025)
di: Gulzar, Kashaf, et al.
Pubblicazione: (2025)
Towards Supervised Performance on Speaker Verification with Self-Supervised Learning by Leveraging Large-Scale ASR Models
di: Miara, Victor, et al.
Pubblicazione: (2024)
di: Miara, Victor, et al.
Pubblicazione: (2024)
OLMoASR: Open Models and Data for Training Robust Speech Recognition Models
di: Ngo, Huong, et al.
Pubblicazione: (2025)
di: Ngo, Huong, et al.
Pubblicazione: (2025)
Training Large ASR Encoders with Differential Privacy
di: Chauhan, Geeticka, et al.
Pubblicazione: (2024)
di: Chauhan, Geeticka, et al.
Pubblicazione: (2024)
Detecting Dysfluencies in Stuttering Therapy Using wav2vec 2.0
di: Bayerl, Sebastian P., et al.
Pubblicazione: (2022)
di: Bayerl, Sebastian P., et al.
Pubblicazione: (2022)
An Enhanced Audio Feature Tailored for Anomalous Sound Detection Based on Pre-trained Models
di: Zhong, Guirui, et al.
Pubblicazione: (2025)
di: Zhong, Guirui, et al.
Pubblicazione: (2025)
Mixture of Low-Rank Adapter Experts in Generalizable Audio Deepfake Detection
di: Laakkonen, Janne, et al.
Pubblicazione: (2025)
di: Laakkonen, Janne, et al.
Pubblicazione: (2025)
Breaking Down Power Barriers in On-Device Streaming ASR: Insights and Solutions
di: Li, Yang, et al.
Pubblicazione: (2024)
di: Li, Yang, et al.
Pubblicazione: (2024)
Blind Audio Bandwidth Extension: A Diffusion-Based Zero-Shot Approach
di: Moliner, Eloi, et al.
Pubblicazione: (2023)
di: Moliner, Eloi, et al.
Pubblicazione: (2023)
TeLeS: Temporal Lexeme Similarity Score to Estimate Confidence in End-to-End ASR
di: Ravi, Nagarathna, et al.
Pubblicazione: (2024)
di: Ravi, Nagarathna, et al.
Pubblicazione: (2024)
Pre-Trained Foundation Model representations to uncover Breathing patterns in Speech
di: Mitra, Vikramjit, et al.
Pubblicazione: (2024)
di: Mitra, Vikramjit, et al.
Pubblicazione: (2024)
Wav2code: Restore Clean Speech Representations via Codebook Lookup for Noise-Robust ASR
di: Hu, Yuchen, et al.
Pubblicazione: (2023)
di: Hu, Yuchen, et al.
Pubblicazione: (2023)
Continued Pretraining for Low-Resource Swahili ASR: Achieving State-of-the-Art Performance with Minimal Labeled Data
di: Mutisya, Hillary, et al.
Pubblicazione: (2026)
di: Mutisya, Hillary, et al.
Pubblicazione: (2026)
Leveraging Pre-Trained Models for Multimodal Class-Incremental Learning under Adaptive Fusion
di: Chen, Yukun, et al.
Pubblicazione: (2025)
di: Chen, Yukun, et al.
Pubblicazione: (2025)
Adversarial Training of Denoising Diffusion Model Using Dual Discriminators for High-Fidelity Multi-Speaker TTS
di: Ko, Myeongjin, et al.
Pubblicazione: (2023)
di: Ko, Myeongjin, et al.
Pubblicazione: (2023)
Pseudo Labels-based Neural Speech Enhancement for the AVSR Task in the MISP-Meeting Challenge
di: Luo, Longjie, et al.
Pubblicazione: (2025)
di: Luo, Longjie, et al.
Pubblicazione: (2025)
SC-MoE: Switch Conformer Mixture of Experts for Unified Streaming and Non-streaming Code-Switching ASR
di: Ye, Shuaishuai, et al.
Pubblicazione: (2024)
di: Ye, Shuaishuai, et al.
Pubblicazione: (2024)
Fast and Flexible Audio Bandwidth Extension via Vocos
di: Sharma, Yatharth
Pubblicazione: (2026)
di: Sharma, Yatharth
Pubblicazione: (2026)
Multi-modal Adversarial Training for Zero-Shot Voice Cloning
di: Janiczek, John, et al.
Pubblicazione: (2024)
di: Janiczek, John, et al.
Pubblicazione: (2024)
DCIM-AVSR : Efficient Audio-Visual Speech Recognition via Dual Conformer Interaction Module
di: Wang, Xinyu, et al.
Pubblicazione: (2024)
di: Wang, Xinyu, et al.
Pubblicazione: (2024)
Multi-Stage Music Source Restoration with BandSplit-RoFormer Separation and HiFi++ GAN
di: Morocutti, Tobias, et al.
Pubblicazione: (2026)
di: Morocutti, Tobias, et al.
Pubblicazione: (2026)
Enhancing Synthetic Training Data for Speech Commands: From ASR-Based Filtering to Domain Adaptation in SSL Latent Space
di: Quintas, Sebastião, et al.
Pubblicazione: (2024)
di: Quintas, Sebastião, et al.
Pubblicazione: (2024)
Training Articulatory Inversion Models for Interspeaker Consistency
di: McGhee, Charles, et al.
Pubblicazione: (2025)
di: McGhee, Charles, et al.
Pubblicazione: (2025)
Watermarking Training Data of Music Generation Models
di: Epple, Pascal, et al.
Pubblicazione: (2024)
di: Epple, Pascal, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Outlier Reduction with Gated Attention for Improved Post-training Quantization in Large Sequence-to-sequence Speech Foundation Models
di: Wagner, Dominik, et al.
Pubblicazione: (2024) -
Personalized Fine-Tuning with Controllable Synthetic Speech from LLM-Generated Transcripts for Dysarthric Speech Recognition
di: Wagner, Dominik, et al.
Pubblicazione: (2025) -
Large Language Models for Dysfluency Detection in Stuttered Speech
di: Wagner, Dominik, et al.
Pubblicazione: (2024) -
Infusing Acoustic Pause Context into Text-Based Dementia Assessment
di: Braun, Franziska, et al.
Pubblicazione: (2024) -
Efficient Adapter Tuning of Pre-trained Speech Models for Automatic Speaker Verification
di: Sang, Mufan, et al.
Pubblicazione: (2024)