Aligning Speech to Languages to Enhance Code-switching Speech Recognition
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Hexin, Zhang, Xiangyu, Zhang, Haoyang, Garcia, Leibny Paola, Khong, Andy W. H., Chng, Eng Siong, Watanabe, Shinji |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Code-switching Speech Recognition Under the Lens: Model- and Data-Centric Perspectives
por: Liu, Hexin, et al.
Publicado: (2025)
por: Liu, Hexin, et al.
Publicado: (2025)
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
por: Peng, Yizhou, et al.
Publicado: (2025)
por: Peng, Yizhou, et al.
Publicado: (2025)
Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model
por: Zhang, Xiangyu, et al.
Publicado: (2024)
por: Zhang, Xiangyu, et al.
Publicado: (2024)
Improving Code-Switching Speech Recognition with TTS Data Augmentation
por: Yeo, Yue Heng, et al.
Publicado: (2026)
por: Yeo, Yue Heng, et al.
Publicado: (2026)
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
por: Yao, Jixun, et al.
Publicado: (2025)
por: Yao, Jixun, et al.
Publicado: (2025)
Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English
por: Zhang, Haoyang, et al.
Publicado: (2025)
por: Zhang, Haoyang, et al.
Publicado: (2025)
LlamaPartialSpoof: An LLM-Driven Fake Speech Dataset Simulating Disinformation Generation
por: Luong, Hieu-Thi, et al.
Publicado: (2024)
por: Luong, Hieu-Thi, et al.
Publicado: (2024)
DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action
por: Zhang, Haoyang, et al.
Publicado: (2026)
por: Zhang, Haoyang, et al.
Publicado: (2026)
EASY: Emotion-aware Speaker Anonymization via Factorized Distillation
por: Yao, Jixun, et al.
Publicado: (2025)
por: Yao, Jixun, et al.
Publicado: (2025)
Speech Separation using Neural Audio Codecs with Embedding Loss
por: Yip, Jia Qi, et al.
Publicado: (2024)
por: Yip, Jia Qi, et al.
Publicado: (2024)
UniArray: Unified Spectral-Spatial Modeling for Array-Geometry-Agnostic Speech Separation
por: Chen, Weiguang, et al.
Publicado: (2025)
por: Chen, Weiguang, et al.
Publicado: (2025)
Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs
por: Yuhang, Yang, et al.
Publicado: (2024)
por: Yuhang, Yang, et al.
Publicado: (2024)
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
Noise-Aware Speech Separation with Contrastive Learning
por: Zhang, Zizheng, et al.
Publicado: (2023)
por: Zhang, Zizheng, et al.
Publicado: (2023)
Aligning Generative Speech Enhancement with Perceptual Feedback
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback
por: Chen, Chen, et al.
Publicado: (2024)
por: Chen, Chen, et al.
Publicado: (2024)
Summary on The Multilingual Conversational Speech Language Model Challenge: Datasets, Tasks, Baselines, and Methods
por: Mu, Bingshen, et al.
Publicado: (2025)
por: Mu, Bingshen, et al.
Publicado: (2025)
SpeechT-RAG: Reliable Depression Detection in LLMs with Retrieval-Augmented Generation Using Speech Timing Information
por: Zhang, Xiangyu, et al.
Publicado: (2025)
por: Zhang, Xiangyu, et al.
Publicado: (2025)
Dataset-Distillation Generative Model for Speech Emotion Recognition
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2024)
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2024)
Robust Zero-Shot Text-to-Speech Synthesis with Reverse Inference Optimization
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech
por: Li, Yuxin, et al.
Publicado: (2025)
por: Li, Yuxin, et al.
Publicado: (2025)
Robust Localization of Partially Fake Speech: Metrics and Out-of-Domain Evaluation
por: Luong, Hieu-Thi, et al.
Publicado: (2025)
por: Luong, Hieu-Thi, et al.
Publicado: (2025)
End-to-End Speech Recognition with Pre-trained Masked Language Model
por: Higuchi, Yosuke, et al.
Publicado: (2024)
por: Higuchi, Yosuke, et al.
Publicado: (2024)
Wav2code: Restore Clean Speech Representations via Codebook Lookup for Noise-Robust ASR
por: Hu, Yuchen, et al.
Publicado: (2023)
por: Hu, Yuchen, et al.
Publicado: (2023)
Noise-aware Speech Enhancement using Diffusion Probabilistic Model
por: Hu, Yuchen, et al.
Publicado: (2023)
por: Hu, Yuchen, et al.
Publicado: (2023)
Towards Audio Codec-based Speech Separation
por: Yip, Jia Qi, et al.
Publicado: (2024)
por: Yip, Jia Qi, et al.
Publicado: (2024)
From KAN to GR-KAN: Advancing Speech Enhancement with KAN-Based Methodology
por: Li, Haoyang, et al.
Publicado: (2024)
por: Li, Haoyang, et al.
Publicado: (2024)
NTU Speechlab LLM-Based Multilingual ASR System for Interspeech MLC-SLM Challenge 2025
por: Peng, Yizhou, et al.
Publicado: (2025)
por: Peng, Yizhou, et al.
Publicado: (2025)
Long-Context Modeling Networks for Monaural Speech Enhancement: A Comparative Study
por: Zhang, Qiquan, et al.
Publicado: (2025)
por: Zhang, Qiquan, et al.
Publicado: (2025)
Selective State Space Model for Monaural Speech Enhancement
por: Chen, Moran, et al.
Publicado: (2024)
por: Chen, Moran, et al.
Publicado: (2024)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
por: Cornell, Samuele, et al.
Publicado: (2024)
por: Cornell, Samuele, et al.
Publicado: (2024)
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
por: Chen, Chen, et al.
Publicado: (2025)
por: Chen, Chen, et al.
Publicado: (2025)
Reasoning Beyond Majority Vote: An Explainable SpeechLM Framework for Speech Emotion Recognition
por: Su, Bo-Hao, et al.
Publicado: (2025)
por: Su, Bo-Hao, et al.
Publicado: (2025)
Stream-Voice-Anon: Enhancing Utility of Real-Time Speaker Anonymization via Neural Audio Codec and Language Models
por: Kuzmin, Nikita, et al.
Publicado: (2026)
por: Kuzmin, Nikita, et al.
Publicado: (2026)
HENT-SRT: Hierarchical Efficient Neural Transducer with Self-Distillation for Joint Speech Recognition and Translation
por: Hussein, Amir, et al.
Publicado: (2025)
por: Hussein, Amir, et al.
Publicado: (2025)
Zero-shot Context Biasing with Trie-based Decoding using Synthetic Multi-Pronunciation
por: Liu, Changsong, et al.
Publicado: (2025)
por: Liu, Changsong, et al.
Publicado: (2025)
Neural Blind Source Separation and Diarization for Distant Speech Recognition
por: Bando, Yoshiaki, et al.
Publicado: (2024)
por: Bando, Yoshiaki, et al.
Publicado: (2024)
Universal Speech Content Factorization
por: Xinyuan, Henry Li, et al.
Publicado: (2026)
por: Xinyuan, Henry Li, et al.
Publicado: (2026)
OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification
por: Peng, Yifan, et al.
Publicado: (2024)
por: Peng, Yifan, et al.
Publicado: (2024)
ShiftySpeech: A Large-Scale Synthetic Speech Dataset with Distribution Shifts
por: Garg, Ashi, et al.
Publicado: (2025)
por: Garg, Ashi, et al.
Publicado: (2025)
Ejemplares similares
-
Code-switching Speech Recognition Under the Lens: Model- and Data-Centric Perspectives
por: Liu, Hexin, et al.
Publicado: (2025) -
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
por: Peng, Yizhou, et al.
Publicado: (2025) -
Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model
por: Zhang, Xiangyu, et al.
Publicado: (2024) -
Improving Code-Switching Speech Recognition with TTS Data Augmentation
por: Yeo, Yue Heng, et al.
Publicado: (2026) -
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
por: Yao, Jixun, et al.
Publicado: (2025)