Task Oriented Dialogue as a Catalyst for Self-Supervised Automatic Speech Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chan, David M., Ghosh, Shalini, Tulsiani, Hitesh, Rastrow, Ariya, Hoffmeister, Björn |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
An Efficient Self-Learning Framework For Interactive Spoken Dialog Systems
par: Tulsiani, Hitesh, et autres
Publié: (2024)
par: Tulsiani, Hitesh, et autres
Publié: (2024)
CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing
par: Lu, Yen-Ju, et autres
Publié: (2024)
par: Lu, Yen-Ju, et autres
Publié: (2024)
Speech Recognition Rescoring with Large Speech-Text Foundation Models
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2024)
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2024)
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
par: Wang, Yujin, et autres
Publié: (2022)
par: Wang, Yujin, et autres
Publié: (2022)
Two-pass Endpoint Detection for Speech Recognition
par: Raju, Anirudh, et autres
Publié: (2024)
par: Raju, Anirudh, et autres
Publié: (2024)
Streaming Speech-to-Confusion Network Speech Recognition
par: Filimonov, Denis, et autres
Publié: (2023)
par: Filimonov, Denis, et autres
Publié: (2023)
Multimodal Attention Merging for Improved Speech Recognition and Audio Event Classification
par: Sundar, Anirudh S., et autres
Publié: (2023)
par: Sundar, Anirudh S., et autres
Publié: (2023)
Leveraging Self-Supervised Models for Automatic Whispered Speech Recognition
par: Farhadipour, Aref, et autres
Publié: (2024)
par: Farhadipour, Aref, et autres
Publié: (2024)
Multi-Modal Retrieval For Large Language Model Based Speech Recognition
par: Kolehmainen, Jari, et autres
Publié: (2024)
par: Kolehmainen, Jari, et autres
Publié: (2024)
Generative Speech Recognition Error Correction with Large Language Models and Task-Activating Prompting
par: Yang, Chao-Han Huck, et autres
Publié: (2023)
par: Yang, Chao-Han Huck, et autres
Publié: (2023)
Automatic Speech Recognition for Hindi
par: Saha, Anish, et autres
Publié: (2024)
par: Saha, Anish, et autres
Publié: (2024)
Transducers with Pronunciation-aware Embeddings for Automatic Speech Recognition
par: Xu, Hainan, et autres
Publié: (2024)
par: Xu, Hainan, et autres
Publié: (2024)
Regularizing Learnable Feature Extraction for Automatic Speech Recognition
par: Vieting, Peter, et autres
Publié: (2025)
par: Vieting, Peter, et autres
Publié: (2025)
Pitch Accent Detection improves Pretrained Automatic Speech Recognition
par: Sasu, David, et autres
Publié: (2025)
par: Sasu, David, et autres
Publié: (2025)
SSHR: Leveraging Self-supervised Hierarchical Representations for Multilingual Automatic Speech Recognition
par: Xue, Hongfei, et autres
Publié: (2023)
par: Xue, Hongfei, et autres
Publié: (2023)
On the Problem of Text-To-Speech Model Selection for Synthetic Data Generation in Automatic Speech Recognition
par: Rossenbach, Nick, et autres
Publié: (2024)
par: Rossenbach, Nick, et autres
Publié: (2024)
Interface Design for Self-Supervised Speech Models
par: Shih, Yi-Jen, et autres
Publié: (2024)
par: Shih, Yi-Jen, et autres
Publié: (2024)
BiRQ: Bi-Level Self-Labeling Random Quantization for Self-Supervised Speech Recognition
par: Jiang, Liuyuan, et autres
Publié: (2025)
par: Jiang, Liuyuan, et autres
Publié: (2025)
Dynamic Data Pruning for Automatic Speech Recognition
par: Xiao, Qiao, et autres
Publié: (2024)
par: Xiao, Qiao, et autres
Publié: (2024)
Contextualized Automatic Speech Recognition with Dynamic Vocabulary
par: Sudo, Yui, et autres
Publié: (2024)
par: Sudo, Yui, et autres
Publié: (2024)
Joint Automatic Speech Recognition And Structure Learning For Better Speech Understanding
par: Hu, Jiliang, et autres
Publié: (2025)
par: Hu, Jiliang, et autres
Publié: (2025)
Property Neurons in Self-Supervised Speech Transformers
par: Lin, Tzu-Quan, et autres
Publié: (2024)
par: Lin, Tzu-Quan, et autres
Publié: (2024)
Benchmarking Automatic Speech Recognition Models for African Languages
par: Nahabwe, Alvin, et autres
Publié: (2025)
par: Nahabwe, Alvin, et autres
Publié: (2025)
Exploration of Adapter for Noise Robust Automatic Speech Recognition
par: Shi, Hao, et autres
Publié: (2024)
par: Shi, Hao, et autres
Publié: (2024)
Exploring Gender Disparities in Automatic Speech Recognition Technology
par: ElGhazaly, Hend, et autres
Publié: (2025)
par: ElGhazaly, Hend, et autres
Publié: (2025)
Automatic Speech Recognition for Biomedical Data in Bengali Language
par: Kabir, Shariar, et autres
Publié: (2024)
par: Kabir, Shariar, et autres
Publié: (2024)
On the Effect of Purely Synthetic Training Data for Different Automatic Speech Recognition Architectures
par: Hilmes, Benedikt, et autres
Publié: (2024)
par: Hilmes, Benedikt, et autres
Publié: (2024)
Clinical BERTScore: An Improved Measure of Automatic Speech Recognition Performance in Clinical Settings
par: Shor, Joel, et autres
Publié: (2023)
par: Shor, Joel, et autres
Publié: (2023)
Multilingual Zero Resource Speech Recognition Base on Self-Supervise Pre-Trained Acoustic Models
par: Wang, Haoyu, et autres
Publié: (2022)
par: Wang, Haoyu, et autres
Publié: (2022)
CS-Dialogue: A 104-Hour Dataset of Spontaneous Mandarin-English Code-Switching Dialogues for Speech Recognition
par: Zhou, Jiaming, et autres
Publié: (2025)
par: Zhou, Jiaming, et autres
Publié: (2025)
Evaluating Automatic Speech Recognition Systems for Korean Meteorological Experts
par: Park, ChaeHun, et autres
Publié: (2024)
par: Park, ChaeHun, et autres
Publié: (2024)
Convolutional Variational Autoencoders for Spectrogram Compression in Automatic Speech Recognition
par: Iakovenko, Olga, et autres
Publié: (2024)
par: Iakovenko, Olga, et autres
Publié: (2024)
Supporting SENCOTEN Language Documentation Efforts with Automatic Speech Recognition
par: Geng, Mengzhe, et autres
Publié: (2025)
par: Geng, Mengzhe, et autres
Publié: (2025)
Transliterated Zero-Shot Domain Adaptation for Automatic Speech Recognition
par: Zhu, Han, et autres
Publié: (2024)
par: Zhu, Han, et autres
Publié: (2024)
Word Level Timestamp Generation for Automatic Speech Recognition and Translation
par: Hu, Ke, et autres
Publié: (2025)
par: Hu, Ke, et autres
Publié: (2025)
Contextualized Automatic Speech Recognition with Dynamic Vocabulary Prediction and Activation
par: Lin, Zhennan, et autres
Publié: (2025)
par: Lin, Zhennan, et autres
Publié: (2025)
UCorrect: An Unsupervised Framework for Automatic Speech Recognition Error Correction
par: Guo, Jiaxin, et autres
Publié: (2024)
par: Guo, Jiaxin, et autres
Publié: (2024)
Self-Supervised Speech Models Encode Phonetic Context via Position-dependent Orthogonal Subspaces
par: Choi, Kwanghee, et autres
Publié: (2026)
par: Choi, Kwanghee, et autres
Publié: (2026)
Enhancing Indonesian Automatic Speech Recognition: Evaluating Multilingual Models with Diverse Speech Variabilities
par: Adila, Aulia, et autres
Publié: (2024)
par: Adila, Aulia, et autres
Publié: (2024)
SMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition
par: Hsu, Ming-Hao, et autres
Publié: (2024)
par: Hsu, Ming-Hao, et autres
Publié: (2024)
Documents similaires
-
An Efficient Self-Learning Framework For Interactive Spoken Dialog Systems
par: Tulsiani, Hitesh, et autres
Publié: (2024) -
CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing
par: Lu, Yen-Ju, et autres
Publié: (2024) -
Speech Recognition Rescoring with Large Speech-Text Foundation Models
par: Shivakumar, Prashanth Gurunath, et autres
Publié: (2024) -
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
par: Wang, Yujin, et autres
Publié: (2022) -
Two-pass Endpoint Detection for Speech Recognition
par: Raju, Anirudh, et autres
Publié: (2024)