Retrieval-Augmented Speech Recognition Approach for Domain Challenges
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shen, Peng, Lu, Xugang, Kawai, Hisashi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Temporal Order Preserved Optimal Transport-based Cross-modal Knowledge Transfer Learning for ASR
par: Lu, Xugang, et autres
Publié: (2024)
par: Lu, Xugang, et autres
Publié: (2024)
SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
par: Sun, Chunyu, et autres
Publié: (2025)
par: Sun, Chunyu, et autres
Publié: (2025)
Speaker-Distinguishable CTC: Learning Speaker Distinction Using CTC for Multi-Talker Speech Recognition
par: Sakuma, Asahi, et autres
Publié: (2025)
par: Sakuma, Asahi, et autres
Publié: (2025)
Transliterated Zero-Shot Domain Adaptation for Automatic Speech Recognition
par: Zhu, Han, et autres
Publié: (2024)
par: Zhu, Han, et autres
Publié: (2024)
Improving Accented Speech Recognition using Data Augmentation based on Unsupervised Text-to-Speech Synthesis
par: Do, Cong-Thanh, et autres
Publié: (2024)
par: Do, Cong-Thanh, et autres
Publié: (2024)
Joint Automatic Speech Recognition And Structure Learning For Better Speech Understanding
par: Hu, Jiliang, et autres
Publié: (2025)
par: Hu, Jiliang, et autres
Publié: (2025)
Contextualized Automatic Speech Recognition with Dynamic Vocabulary
par: Sudo, Yui, et autres
Publié: (2024)
par: Sudo, Yui, et autres
Publié: (2024)
Automatic Speech Recognition for African Low-Resource Languages: Challenges and Future Directions
par: Imam, Sukairaj Hafiz, et autres
Publié: (2025)
par: Imam, Sukairaj Hafiz, et autres
Publié: (2025)
OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
From Tens of Hours to Tens of Thousands: Scaling Back-Translation for Speech Recognition
par: Wang, Tianduo, et autres
Publié: (2025)
par: Wang, Tianduo, et autres
Publié: (2025)
Unveiling Biases while Embracing Sustainability: Assessing the Dual Challenges of Automatic Speech Recognition Systems
par: Kulkarni, Ajinkya, et autres
Publié: (2025)
par: Kulkarni, Ajinkya, et autres
Publié: (2025)
Dynamic Data Pruning for Automatic Speech Recognition
par: Xiao, Qiao, et autres
Publié: (2024)
par: Xiao, Qiao, et autres
Publié: (2024)
Contextualized End-to-end Automatic Speech Recognition with Intermediate Biasing Loss
par: Shakeel, Muhammad, et autres
Publié: (2024)
par: Shakeel, Muhammad, et autres
Publié: (2024)
Benchmarking Japanese Speech Recognition on ASR-LLM Setups with Multi-Pass Augmented Generative Error Correction
par: Ko, Yuka, et autres
Publié: (2024)
par: Ko, Yuka, et autres
Publié: (2024)
Pinyin Regularization in Error Correction for Chinese Speech Recognition with Large Language Models
par: Tang, Zhiyuan, et autres
Publié: (2024)
par: Tang, Zhiyuan, et autres
Publié: (2024)
Automatic Speech Recognition for Hindi
par: Saha, Anish, et autres
Publié: (2024)
par: Saha, Anish, et autres
Publié: (2024)
DYNAC: Dynamic Vocabulary based Non-Autoregressive Contextualization for Speech Recognition
par: Sudo, Yui, et autres
Publié: (2025)
par: Sudo, Yui, et autres
Publié: (2025)
Speech Recognition Rescoring with Large Speech-Text Foundation Models
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2024)
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2024)
Recent Trends in Distant Conversational Speech Recognition: A Review of CHiME-7 and 8 DASR Challenges
par: Cornell, Samuele, et autres
Publié: (2025)
par: Cornell, Samuele, et autres
Publié: (2025)
Acoustic to Articulatory Inversion of Speech; Data Driven Approaches, Challenges, Applications, and Future Scope
par: Pillai, Leena G, et autres
Publié: (2025)
par: Pillai, Leena G, et autres
Publié: (2025)
Contextualized Automatic Speech Recognition with Attention-Based Bias Phrase Boosted Beam Search
par: Sudo, Yui, et autres
Publié: (2024)
par: Sudo, Yui, et autres
Publié: (2024)
Joint Optimization of Streaming and Non-Streaming Automatic Speech Recognition with Multi-Decoder and Knowledge Distillation
par: Shakeel, Muhammad, et autres
Publié: (2024)
par: Shakeel, Muhammad, et autres
Publié: (2024)
Conversational Speech Recognition by Learning Audio-textual Cross-modal Contextual Representation
par: Wei, Kun, et autres
Publié: (2023)
par: Wei, Kun, et autres
Publié: (2023)
Swedish Whispers; Leveraging a Massive Speech Corpus for Swedish Speech Recognition
par: Vesterbacka, Leonora, et autres
Publié: (2025)
par: Vesterbacka, Leonora, et autres
Publié: (2025)
Inappropriate Pause Detection In Dysarthric Speech Using Large-Scale Speech Recognition
par: Lee, Jeehyun, et autres
Publié: (2024)
par: Lee, Jeehyun, et autres
Publié: (2024)
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
par: Wang, Yujin, et autres
Publié: (2022)
par: Wang, Yujin, et autres
Publié: (2022)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
par: Cornell, Samuele, et autres
Publié: (2024)
par: Cornell, Samuele, et autres
Publié: (2024)
On the Contribution of Lexical Features to Speech Emotion Recognition
par: Combei, David
Publié: (2025)
par: Combei, David
Publié: (2025)
Unimodal Aggregation for CTC-based Speech Recognition
par: Fang, Ying, et autres
Publié: (2023)
par: Fang, Ying, et autres
Publié: (2023)
Continual Adaptation for Pacific Indigenous Speech Recognition
par: Xiao, Yang, et autres
Publié: (2026)
par: Xiao, Yang, et autres
Publié: (2026)
Dialectal Coverage And Generalization in Arabic Speech Recognition
par: Djanibekov, Amirbek, et autres
Publié: (2024)
par: Djanibekov, Amirbek, et autres
Publié: (2024)
Speech Recognition Transformers: Topological-lingualism Perspective
par: Singh, Shruti, et autres
Publié: (2024)
par: Singh, Shruti, et autres
Publié: (2024)
Mitigating Subgroup Disparities in Multi-Label Speech Emotion Recognition: A Pseudo-Labeling and Unsupervised Learning Approach
par: Lin, Yi-Cheng, et autres
Publié: (2025)
par: Lin, Yi-Cheng, et autres
Publié: (2025)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
par: Lin, Hsi-Che, et autres
Publié: (2024)
par: Lin, Hsi-Che, et autres
Publié: (2024)
Enhancing Indonesian Automatic Speech Recognition: Evaluating Multilingual Models with Diverse Speech Variabilities
par: Adila, Aulia, et autres
Publié: (2024)
par: Adila, Aulia, et autres
Publié: (2024)
SMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition
par: Hsu, Ming-Hao, et autres
Publié: (2024)
par: Hsu, Ming-Hao, et autres
Publié: (2024)
MSLM-S2ST: A Multitask Speech Language Model for Textless Speech-to-Speech Translation with Speaker Style Preservation
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
An Empirical Study of Speech Language Models for Prompt-Conditioned Speech Synthesis
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
Weight Factorization and Centralization for Continual Learning in Speech Recognition
par: Ugan, Enes Yavuz, et autres
Publié: (2025)
par: Ugan, Enes Yavuz, et autres
Publié: (2025)
Benchmarking Automatic Speech Recognition Models for African Languages
par: Nahabwe, Alvin, et autres
Publié: (2025)
par: Nahabwe, Alvin, et autres
Publié: (2025)
Documents similaires
-
Temporal Order Preserved Optimal Transport-based Cross-modal Knowledge Transfer Learning for ASR
par: Lu, Xugang, et autres
Publié: (2024) -
SEAL: Speech Embedding Alignment Learning for Speech Large Language Model with Retrieval-Augmented Generation
par: Sun, Chunyu, et autres
Publié: (2025) -
Speaker-Distinguishable CTC: Learning Speaker Distinction Using CTC for Multi-Talker Speech Recognition
par: Sakuma, Asahi, et autres
Publié: (2025) -
Transliterated Zero-Shot Domain Adaptation for Automatic Speech Recognition
par: Zhu, Han, et autres
Publié: (2024) -
Improving Accented Speech Recognition using Data Augmentation based on Unsupervised Text-to-Speech Synthesis
par: Do, Cong-Thanh, et autres
Publié: (2024)