Children's Speech Recognition through Discrete Token Enhancement
Fuente:
arXiv
Guardado en:
| Autores principales: | Sukhadia, Vrunda N., Chowdhury, Shammur Absar |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HARNESS: Lightweight Distilled Arabic Speech Foundation Models
por: Sukhadia, Vrunda N., et al.
Publicado: (2026)
por: Sukhadia, Vrunda N., et al.
Publicado: (2026)
Speech Representation Analysis based on Inter- and Intra-Model Similarities
por: Kheir, Yassine El, et al.
Publicado: (2024)
por: Kheir, Yassine El, et al.
Publicado: (2024)
Frontend Token Enhancement for Token-Based Speech Recognition
por: Ashihara, Takanori, et al.
Publicado: (2026)
por: Ashihara, Takanori, et al.
Publicado: (2026)
CAFE A Novel Code switching Dataset for Algerian Dialect French and English
por: Lachemat, Houssam Eddine-Othman, et al.
Publicado: (2024)
por: Lachemat, Houssam Eddine-Othman, et al.
Publicado: (2024)
Benchmarking Prosody Encoding in Discrete Speech Tokens
por: Onda, Kentaro, et al.
Publicado: (2025)
por: Onda, Kentaro, et al.
Publicado: (2025)
Rethinking Discrete Speech Representation Tokens for Accent Generation
por: Zhong, Jinzuomu, et al.
Publicado: (2026)
por: Zhong, Jinzuomu, et al.
Publicado: (2026)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
por: Zhang, Xin, et al.
Publicado: (2023)
por: Zhang, Xin, et al.
Publicado: (2023)
From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models
por: Ersoy, Asım, et al.
Publicado: (2025)
por: Ersoy, Asım, et al.
Publicado: (2025)
Hypothesis Clustering and Merging: Novel MultiTalker Speech Recognition with Speaker Tokens
por: Kashiwagi, Yosuke, et al.
Publicado: (2024)
por: Kashiwagi, Yosuke, et al.
Publicado: (2024)
A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models
por: Wang, Dingdong, et al.
Publicado: (2024)
por: Wang, Dingdong, et al.
Publicado: (2024)
Continuous Speech Tokenizer in Text To Speech
por: Li, Yixing, et al.
Publicado: (2024)
por: Li, Yixing, et al.
Publicado: (2024)
Kid-Whisper: Towards Bridging the Performance Gap in Automatic Speech Recognition for Children VS. Adults
por: Attia, Ahmed Adel, et al.
Publicado: (2023)
por: Attia, Ahmed Adel, et al.
Publicado: (2023)
Exploring SSL Discrete Tokens for Multilingual ASR
por: Cui, Mingyu, et al.
Publicado: (2024)
por: Cui, Mingyu, et al.
Publicado: (2024)
Exploring the Benefits of Tokenization of Discrete Acoustic Units
por: Dekel, Avihu, et al.
Publicado: (2024)
por: Dekel, Avihu, et al.
Publicado: (2024)
STAB: Speech Tokenizer Assessment Benchmark
por: Vashishth, Shikhar, et al.
Publicado: (2024)
por: Vashishth, Shikhar, et al.
Publicado: (2024)
Next Tokens Denoising for Speech Synthesis
por: Liu, Yanqing, et al.
Publicado: (2025)
por: Liu, Yanqing, et al.
Publicado: (2025)
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
por: Wang, Huimeng, et al.
Publicado: (2025)
por: Wang, Huimeng, et al.
Publicado: (2025)
Compact Speech Translation Models via Discrete Speech Units Pretraining
por: Lam, Tsz Kin, et al.
Publicado: (2024)
por: Lam, Tsz Kin, et al.
Publicado: (2024)
LAST: Language Model Aware Speech Tokenization
por: Turetzky, Arnon, et al.
Publicado: (2024)
por: Turetzky, Arnon, et al.
Publicado: (2024)
Factorized RVQ-GAN For Disentangled Speech Tokenization
por: Khurana, Sameer, et al.
Publicado: (2025)
por: Khurana, Sameer, et al.
Publicado: (2025)
Automatic Speech Recognition for Hindi
por: Saha, Anish, et al.
Publicado: (2024)
por: Saha, Anish, et al.
Publicado: (2024)
Exploring the Effect of Segmentation and Vocabulary Size on Speech Tokenization for Speech Language Models
por: Kando, Shunsuke, et al.
Publicado: (2025)
por: Kando, Shunsuke, et al.
Publicado: (2025)
Speech Recognition Rescoring with Large Speech-Text Foundation Models
por: Shivakumar, Prashanth Gurunath, et al.
Publicado: (2024)
por: Shivakumar, Prashanth Gurunath, et al.
Publicado: (2024)
Confidence-based Filtering for Speech Dataset Curation with Generative Speech Enhancement Using Discrete Tokens
por: Yamauchi, Kazuki, et al.
Publicado: (2026)
por: Yamauchi, Kazuki, et al.
Publicado: (2026)
Representing Speech Through Autoregressive Prediction of Cochlear Tokens
por: Tuckute, Greta, et al.
Publicado: (2025)
por: Tuckute, Greta, et al.
Publicado: (2025)
Crossmodal ASR Error Correction with Discrete Speech Units
por: Li, Yuanchao, et al.
Publicado: (2024)
por: Li, Yuanchao, et al.
Publicado: (2024)
Universal Robust Speech Adaptation for Cross-Domain Speech Recognition and Enhancement
por: Wang, Chien-Chun, et al.
Publicado: (2026)
por: Wang, Chien-Chun, et al.
Publicado: (2026)
Position-invariant Fine-tuning of Speech Enhancement Models with Self-supervised Speech Representations
por: Meghanani, Amit, et al.
Publicado: (2026)
por: Meghanani, Amit, et al.
Publicado: (2026)
Psychoacoustic Challenges Of Speech Enhancement On VoIP Platforms
por: Konan, Joseph, et al.
Publicado: (2023)
por: Konan, Joseph, et al.
Publicado: (2023)
Joint Automatic Speech Recognition And Structure Learning For Better Speech Understanding
por: Hu, Jiliang, et al.
Publicado: (2025)
por: Hu, Jiliang, et al.
Publicado: (2025)
Inappropriate Pause Detection In Dysarthric Speech Using Large-Scale Speech Recognition
por: Lee, Jeehyun, et al.
Publicado: (2024)
por: Lee, Jeehyun, et al.
Publicado: (2024)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
por: Cornell, Samuele, et al.
Publicado: (2024)
por: Cornell, Samuele, et al.
Publicado: (2024)
Swedish Whispers; Leveraging a Massive Speech Corpus for Swedish Speech Recognition
por: Vesterbacka, Leonora, et al.
Publicado: (2025)
por: Vesterbacka, Leonora, et al.
Publicado: (2025)
Exploring Effective Distillation of Self-Supervised Speech Models for Automatic Speech Recognition
por: Wang, Yujin, et al.
Publicado: (2022)
por: Wang, Yujin, et al.
Publicado: (2022)
Dynamic Data Pruning for Automatic Speech Recognition
por: Xiao, Qiao, et al.
Publicado: (2024)
por: Xiao, Qiao, et al.
Publicado: (2024)
Contextualized Automatic Speech Recognition with Dynamic Vocabulary
por: Sudo, Yui, et al.
Publicado: (2024)
por: Sudo, Yui, et al.
Publicado: (2024)
Dialectal Coverage And Generalization in Arabic Speech Recognition
por: Djanibekov, Amirbek, et al.
Publicado: (2024)
por: Djanibekov, Amirbek, et al.
Publicado: (2024)
Speech Recognition Transformers: Topological-lingualism Perspective
por: Singh, Shruti, et al.
Publicado: (2024)
por: Singh, Shruti, et al.
Publicado: (2024)
On the Contribution of Lexical Features to Speech Emotion Recognition
por: Combei, David
Publicado: (2025)
por: Combei, David
Publicado: (2025)
Unimodal Aggregation for CTC-based Speech Recognition
por: Fang, Ying, et al.
Publicado: (2023)
por: Fang, Ying, et al.
Publicado: (2023)
Ejemplares similares
-
HARNESS: Lightweight Distilled Arabic Speech Foundation Models
por: Sukhadia, Vrunda N., et al.
Publicado: (2026) -
Speech Representation Analysis based on Inter- and Intra-Model Similarities
por: Kheir, Yassine El, et al.
Publicado: (2024) -
Frontend Token Enhancement for Token-Based Speech Recognition
por: Ashihara, Takanori, et al.
Publicado: (2026) -
CAFE A Novel Code switching Dataset for Algerian Dialect French and English
por: Lachemat, Houssam Eddine-Othman, et al.
Publicado: (2024) -
Benchmarking Prosody Encoding in Discrete Speech Tokens
por: Onda, Kentaro, et al.
Publicado: (2025)