Comparing Unsupervised and Supervised Semantic Speech Tokens: A Case Study of Child ASR
Fuente:
arXiv
Salvato in:
| Autori principali: | Shi, Mohan, Shankar, Natarajan Balaji, Zhang, Kaiyuan, Wang, Zilai, Alwan, Abeer |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CHSER: A Dataset and Case Study on Generative Speech Error Correction for Child ASR
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2025)
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2025)
Mind the Shift: Using Delta SSL Embeddings to Enhance Child ASR
di: Wang, Zilai, et al.
Pubblicazione: (2026)
di: Wang, Zilai, et al.
Pubblicazione: (2026)
STACodec: Semantic Token Assignment for Balancing Acoustic Fidelity and Semantic Information in Audio Codecs
di: Zhang, Kaiyuan, et al.
Pubblicazione: (2026)
di: Zhang, Kaiyuan, et al.
Pubblicazione: (2026)
Selective Attention Merging for low resource tasks: A case study of Child ASR
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2025)
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2025)
Benchmarking Children's ASR with Supervised and Self-supervised Speech Foundation Models
di: Fan, Ruchao, et al.
Pubblicazione: (2024)
di: Fan, Ruchao, et al.
Pubblicazione: (2024)
SOA: Reducing Domain Mismatch in SSL Pipeline by Speech Only Adaptation for Low Resource ASR
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2024)
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2024)
UniEnc-CASSNAT: An Encoder-only Non-autoregressive ASR for Speech SSL Models
di: Fan, Ruchao, et al.
Pubblicazione: (2024)
di: Fan, Ruchao, et al.
Pubblicazione: (2024)
An Age-Agnostic System for Robust Speaker Verification
di: Zheng, Jiusi, et al.
Pubblicazione: (2025)
di: Zheng, Jiusi, et al.
Pubblicazione: (2025)
G-IFT: A Gated Linear Unit adapter with Iterative Fine-Tuning for Low-Resource Children's Speaker Verification
di: Shetty, Vishwas M., et al.
Pubblicazione: (2025)
di: Shetty, Vishwas M., et al.
Pubblicazione: (2025)
Train Short, Infer Long: Speech-LLM Enables Zero-Shot Streamable Joint ASR and Diarization on Long Audio
di: Shi, Mohan, et al.
Pubblicazione: (2025)
di: Shi, Mohan, et al.
Pubblicazione: (2025)
Textless Streaming Speech-to-Speech Translation using Semantic Speech Tokens
di: Zhao, Jinzheng, et al.
Pubblicazione: (2024)
di: Zhao, Jinzheng, et al.
Pubblicazione: (2024)
Mixture to Beamformed Mixture: Leveraging Beamformed Mixture as Weak-Supervision for Speech Enhancement and Noise-Robust ASR
di: Wang, Zhong-Qiu, et al.
Pubblicazione: (2025)
di: Wang, Zhong-Qiu, et al.
Pubblicazione: (2025)
Comparative Analysis of ASR Methods for Speech Deepfake Detection
di: Salvi, Davide, et al.
Pubblicazione: (2024)
di: Salvi, Davide, et al.
Pubblicazione: (2024)
Enhancing Age-Related Robustness in Children Speaker Verification
di: Shetty, Vishwas M., et al.
Pubblicazione: (2025)
di: Shetty, Vishwas M., et al.
Pubblicazione: (2025)
Enhanced Reverberation as Supervision for Unsupervised Speech Separation
di: Saijo, Kohei, et al.
Pubblicazione: (2024)
di: Saijo, Kohei, et al.
Pubblicazione: (2024)
Discrete Tokens Exhibit Interlanguage Speech Intelligibility Benefit: an Analytical Study Towards Accent-robust ASR Only with Native Speech Data
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs
di: Eren, Eray, et al.
Pubblicazione: (2025)
di: Eren, Eray, et al.
Pubblicazione: (2025)
A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models
di: Wang, Dingdong, et al.
Pubblicazione: (2024)
di: Wang, Dingdong, et al.
Pubblicazione: (2024)
SuperM2M: Supervised and Mixture-to-Mixture Co-Learning for Speech Enhancement and Noise-Robust ASR
di: Wang, Zhong-Qiu
Pubblicazione: (2024)
di: Wang, Zhong-Qiu
Pubblicazione: (2024)
ASR for Affective Speech: Investigating Impact of Emotion and Speech Generative Strategy
di: Wu, Ya-Tse, et al.
Pubblicazione: (2026)
di: Wu, Ya-Tse, et al.
Pubblicazione: (2026)
Consistency Based Unsupervised Self-training For ASR Personalisation
di: Zhang, Jisi, et al.
Pubblicazione: (2024)
di: Zhang, Jisi, et al.
Pubblicazione: (2024)
A Low-Complexity Speech Codec Using Parametric Dithering for ASR
di: Murray, Ellison, et al.
Pubblicazione: (2025)
di: Murray, Ellison, et al.
Pubblicazione: (2025)
XLSR-Transducer: Streaming ASR for Self-Supervised Pretrained Models
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
di: Kumar, Shashi, et al.
Pubblicazione: (2024)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
di: Bai, Ye, et al.
Pubblicazione: (2024)
di: Bai, Ye, et al.
Pubblicazione: (2024)
Towards a Single ASR Model That Generalizes to Disordered Speech
di: Tobin, Jimmy, et al.
Pubblicazione: (2024)
di: Tobin, Jimmy, et al.
Pubblicazione: (2024)
Speech Emotion Recognition with ASR Integration
di: Li, Yuanchao
Pubblicazione: (2026)
di: Li, Yuanchao
Pubblicazione: (2026)
Long-Context Modeling Networks for Monaural Speech Enhancement: A Comparative Study
di: Zhang, Qiquan, et al.
Pubblicazione: (2025)
di: Zhang, Qiquan, et al.
Pubblicazione: (2025)
FairASR: Fair Audio Contrastive Learning for Automatic Speech Recognition
di: Kim, Jongsuk, et al.
Pubblicazione: (2025)
di: Kim, Jongsuk, et al.
Pubblicazione: (2025)
MSDA: Combining Pseudo-labeling and Self-Supervision for Unsupervised Domain Adaptation in ASR
di: Damianos, Dimitrios, et al.
Pubblicazione: (2025)
di: Damianos, Dimitrios, et al.
Pubblicazione: (2025)
Phonemes vs. Projectors: An Investigation of Speech-Language Interfaces for LLM-based ASR
di: Li, Ziwei, et al.
Pubblicazione: (2026)
di: Li, Ziwei, et al.
Pubblicazione: (2026)
Evaluation of Speech Foundation Models for ASR on Child-Adult Conversations in Autism Diagnostic Sessions
di: Ashvin, Aditya, et al.
Pubblicazione: (2024)
di: Ashvin, Aditya, et al.
Pubblicazione: (2024)
A Bottom-up Framework with Language-universal Speech Attribute Modeling for Syllable-based ASR
di: Yen, Hao, et al.
Pubblicazione: (2025)
di: Yen, Hao, et al.
Pubblicazione: (2025)
BR-ASR: Efficient and Scalable Bias Retrieval Framework for Contextual Biasing ASR in Speech LLM
di: Gong, Xun, et al.
Pubblicazione: (2025)
di: Gong, Xun, et al.
Pubblicazione: (2025)
Utterance-Level Methods for Identifying Reliable ASR-Output for Child Speech
di: Lathouwers, Gus, et al.
Pubblicazione: (2026)
di: Lathouwers, Gus, et al.
Pubblicazione: (2026)
Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation
di: Liu, Wenrui, et al.
Pubblicazione: (2025)
di: Liu, Wenrui, et al.
Pubblicazione: (2025)
DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation
di: Male, Prabash Reddy, et al.
Pubblicazione: (2025)
di: Male, Prabash Reddy, et al.
Pubblicazione: (2025)
End-to-End Joint ASR and Speaker Role Diarization with Child-Adult Interactions
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
di: Xu, Anfeng, et al.
Pubblicazione: (2026)
A Comprehensive Study on the Effectiveness of ASR Representations for Noise-Robust Speech Emotion Recognition
di: Shi, Xiaohan, et al.
Pubblicazione: (2023)
di: Shi, Xiaohan, et al.
Pubblicazione: (2023)
Semantic-Emotional Resonance Embedding: A Semi-Supervised Paradigm for Cross-Lingual Speech Emotion Recognition
di: Zhao, Ya, et al.
Pubblicazione: (2026)
di: Zhao, Ya, et al.
Pubblicazione: (2026)
ARTT: Augmented Reverberant-Target Training for Unsupervised Monaural Speech Dereverberation
di: Song, Siqi, et al.
Pubblicazione: (2026)
di: Song, Siqi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
CHSER: A Dataset and Case Study on Generative Speech Error Correction for Child ASR
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2025) -
Mind the Shift: Using Delta SSL Embeddings to Enhance Child ASR
di: Wang, Zilai, et al.
Pubblicazione: (2026) -
STACodec: Semantic Token Assignment for Balancing Acoustic Fidelity and Semantic Information in Audio Codecs
di: Zhang, Kaiyuan, et al.
Pubblicazione: (2026) -
Selective Attention Merging for low resource tasks: A case study of Child ASR
di: Shankar, Natarajan Balaji, et al.
Pubblicazione: (2025) -
Benchmarking Children's ASR with Supervised and Self-supervised Speech Foundation Models
di: Fan, Ruchao, et al.
Pubblicazione: (2024)