Multilingual Speech Recognition Using Discrete Tokens with a Two-step Training Strategy
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Zehan, Yang, Yan, Li, Xueqing, Kang, Jian, Zhang, Xiao-Lei, Li, Jie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Bridging the Gap between Continuous and Informative Discrete Representations by Random Product Quantization
por: Li, Xueqing, et al.
Publicado: (2025)
por: Li, Xueqing, et al.
Publicado: (2025)
EmoSSLSphere: Multilingual Emotional Speech Synthesis with Spherical Vectors and Discrete Speech Tokens
por: Park, Joonyong, et al.
Publicado: (2025)
por: Park, Joonyong, et al.
Publicado: (2025)
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
por: Wang, Huimeng, et al.
Publicado: (2025)
por: Wang, Huimeng, et al.
Publicado: (2025)
SELM: Speech Enhancement Using Discrete Tokens and Language Models
por: Wang, Ziqian, et al.
Publicado: (2023)
por: Wang, Ziqian, et al.
Publicado: (2023)
Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models
por: Li, Longhao, et al.
Publicado: (2026)
por: Li, Longhao, et al.
Publicado: (2026)
Fusion of Discrete Representations and Self-Augmented Representations for Multilingual Automatic Speech Recognition
por: Wang, Shih-heng, et al.
Publicado: (2024)
por: Wang, Shih-heng, et al.
Publicado: (2024)
High Fidelity Text-to-Speech Via Discrete Tokens Using Token Transducer and Group Masked Language Model
por: Lee, Joun Yeop, et al.
Publicado: (2024)
por: Lee, Joun Yeop, et al.
Publicado: (2024)
Leveraging LLM and Self-Supervised Training Models for Speech Recognition in Chinese Dialects: A Comparative Analysis
por: Xu, Tianyi, et al.
Publicado: (2025)
por: Xu, Tianyi, et al.
Publicado: (2025)
Streaming Decoder-Only Automatic Speech Recognition with Discrete Speech Units: A Pilot Study
por: Chen, Peikun, et al.
Publicado: (2024)
por: Chen, Peikun, et al.
Publicado: (2024)
Exploring SSL Discrete Tokens for Multilingual ASR
por: Cui, Mingyu, et al.
Publicado: (2024)
por: Cui, Mingyu, et al.
Publicado: (2024)
BoSS: Beyond-Semantic Speech
por: Wang, Qing, et al.
Publicado: (2025)
por: Wang, Qing, et al.
Publicado: (2025)
Children's Speech Recognition through Discrete Token Enhancement
por: Sukhadia, Vrunda N., et al.
Publicado: (2024)
por: Sukhadia, Vrunda N., et al.
Publicado: (2024)
Discrete Diffusion for Generative Modeling of Text-Aligned Speech Tokens
por: Ku, Pin-Jui, et al.
Publicado: (2025)
por: Ku, Pin-Jui, et al.
Publicado: (2025)
Confidence-based Filtering for Speech Dataset Curation with Generative Speech Enhancement Using Discrete Tokens
por: Yamauchi, Kazuki, et al.
Publicado: (2026)
por: Yamauchi, Kazuki, et al.
Publicado: (2026)
A Composite Predictive-Generative Approach to Monaural Universal Speech Enhancement
por: Zhang, Jie, et al.
Publicado: (2025)
por: Zhang, Jie, et al.
Publicado: (2025)
GOAT-TTS: Expressive and Realistic Speech Generation via A Dual-Branch LLM
por: Song, Yaodong, et al.
Publicado: (2025)
por: Song, Yaodong, et al.
Publicado: (2025)
Acoustic BPE for Speech Generation with Discrete Tokens
por: Shen, Feiyu, et al.
Publicado: (2023)
por: Shen, Feiyu, et al.
Publicado: (2023)
Low Bitrate High-Quality RVQGAN-based Discrete Speech Tokenizer
por: Shechtman, Slava, et al.
Publicado: (2024)
por: Shechtman, Slava, et al.
Publicado: (2024)
Lessons Learnt: Revisit Key Training Strategies for Effective Speech Emotion Recognition in the Wild
por: Tzeng, Jing-Tong, et al.
Publicado: (2025)
por: Tzeng, Jing-Tong, et al.
Publicado: (2025)
Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems
por: Cui, Mingyu, et al.
Publicado: (2025)
por: Cui, Mingyu, et al.
Publicado: (2025)
Selective Invocation for Multilingual ASR: A Cost-effective Approach Adapting to Speech Recognition Difficulty
por: Xue, Hongfei, et al.
Publicado: (2025)
por: Xue, Hongfei, et al.
Publicado: (2025)
Benchmarking Large Pretrained Multilingual Models on Québec French Speech Recognition
por: Serrand, Coralie, et al.
Publicado: (2025)
por: Serrand, Coralie, et al.
Publicado: (2025)
Enhancing Fully Formatted End-to-End Speech Recognition with Knowledge Distillation via Multi-Codebook Vector Quantization
por: You, Jian, et al.
Publicado: (2025)
por: You, Jian, et al.
Publicado: (2025)
Efficient Training for Multilingual Visual Speech Recognition: Pre-training with Discretized Visual Speech Representation
por: Kim, Minsu, et al.
Publicado: (2024)
por: Kim, Minsu, et al.
Publicado: (2024)
Prosody as Supervision: Bridging the Non-Verbal--Verbal for Multilingual Speech Emotion Recognition
por: Girish, et al.
Publicado: (2026)
por: Girish, et al.
Publicado: (2026)
Bridging the Modality Gap: Softly Discretizing Audio Representation for LLM-based Automatic Speech Recognition
por: Yang, Mu, et al.
Publicado: (2025)
por: Yang, Mu, et al.
Publicado: (2025)
Identifying and Calibrating Overconfidence in Noisy Speech Recognition
por: Huo, Mingyue, et al.
Publicado: (2025)
por: Huo, Mingyue, et al.
Publicado: (2025)
Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation
por: Liu, Wenrui, et al.
Publicado: (2025)
por: Liu, Wenrui, et al.
Publicado: (2025)
Continuous Speech Tokenizer in Text To Speech
por: Li, Yixing, et al.
Publicado: (2024)
por: Li, Yixing, et al.
Publicado: (2024)
Speech Emotion Recognition with ASR Integration
por: Li, Yuanchao
Publicado: (2026)
por: Li, Yuanchao
Publicado: (2026)
SSHR: Leveraging Self-supervised Hierarchical Representations for Multilingual Automatic Speech Recognition
por: Xue, Hongfei, et al.
Publicado: (2023)
por: Xue, Hongfei, et al.
Publicado: (2023)
Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data
por: Bai, Qibing, et al.
Publicado: (2025)
por: Bai, Qibing, et al.
Publicado: (2025)
Multi-Scale Temporal Transformer For Speech Emotion Recognition
por: Li, Zhipeng, et al.
Publicado: (2024)
por: Li, Zhipeng, et al.
Publicado: (2024)
Evaluating Text-to-Speech Synthesis from a Large Discrete Token-based Speech Language Model
por: Wang, Siyang, et al.
Publicado: (2024)
por: Wang, Siyang, et al.
Publicado: (2024)
Adapting Speech Foundation Models for Unified Multimodal Speech Recognition with Large Language Models
por: Zhang, Jing-Xuan, et al.
Publicado: (2025)
por: Zhang, Jing-Xuan, et al.
Publicado: (2025)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
por: Zhang, Xin, et al.
Publicado: (2023)
por: Zhang, Xin, et al.
Publicado: (2023)
Recent Advances in Discrete Speech Tokens: A Review
por: Guo, Yiwei, et al.
Publicado: (2025)
por: Guo, Yiwei, et al.
Publicado: (2025)
Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS
por: Aronowitz, Hagai, et al.
Publicado: (2026)
por: Aronowitz, Hagai, et al.
Publicado: (2026)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
por: Pan, Yu, et al.
Publicado: (2025)
por: Pan, Yu, et al.
Publicado: (2025)
Rare Word Recognition and Translation Without Fine-Tuning via Task Vector in Speech Models
por: Jing, Ruihao, et al.
Publicado: (2025)
por: Jing, Ruihao, et al.
Publicado: (2025)
Ejemplares similares
-
Bridging the Gap between Continuous and Informative Discrete Representations by Random Product Quantization
por: Li, Xueqing, et al.
Publicado: (2025) -
EmoSSLSphere: Multilingual Emotional Speech Synthesis with Spherical Vectors and Discrete Speech Tokens
por: Park, Joonyong, et al.
Publicado: (2025) -
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
por: Wang, Huimeng, et al.
Publicado: (2025) -
SELM: Speech Enhancement Using Discrete Tokens and Language Models
por: Wang, Ziqian, et al.
Publicado: (2023) -
Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models
por: Li, Longhao, et al.
Publicado: (2026)