Explainable Disentanglement on Discrete Speech Representations for Noise-Robust ASR
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gopal, Shreyas, Anshul, Ashutosh, Li, Haoyang, Yeo, Yue Heng, Liu, Hexin, Chng, Eng Siong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Language-Aware Distillation for Multilingual Instruction-Following Speech LLMs with ASR-Only Supervision
par: Gopal, Shreyas, et autres
Publié: (2026)
par: Gopal, Shreyas, et autres
Publié: (2026)
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
par: Peng, Yizhou, et autres
Publié: (2025)
par: Peng, Yizhou, et autres
Publié: (2025)
Next-Frame Feature Prediction for Multimodal Deepfake Detection and Temporal Localization
par: Anshul, Ashutosh, et autres
Publié: (2025)
par: Anshul, Ashutosh, et autres
Publié: (2025)
Improving Code-Switching Speech Recognition with TTS Data Augmentation
par: Yeo, Yue Heng, et autres
Publié: (2026)
par: Yeo, Yue Heng, et autres
Publié: (2026)
Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs
par: Yuhang, Yang, et autres
Publié: (2024)
par: Yuhang, Yang, et autres
Publié: (2024)
DepFlow: Disentangled Speech Generation to Mitigate Semantic Bias in Depression Detection
par: Li, Yuxin, et autres
Publié: (2026)
par: Li, Yuxin, et autres
Publié: (2026)
NTU Speechlab LLM-Based Multilingual ASR System for Interspeech MLC-SLM Challenge 2025
par: Peng, Yizhou, et autres
Publié: (2025)
par: Peng, Yizhou, et autres
Publié: (2025)
Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech
par: Li, Yuxin, et autres
Publié: (2025)
par: Li, Yuxin, et autres
Publié: (2025)
Speechless: Speech Instruction Training Without Speech for Low Resource Languages
par: Dao, Alan, et autres
Publié: (2025)
par: Dao, Alan, et autres
Publié: (2025)
Noro: Noise-Robust One-shot Voice Conversion with Hidden Speaker Representation Learning
par: He, Haorui, et autres
Publié: (2024)
par: He, Haorui, et autres
Publié: (2024)
Wav2code: Restore Clean Speech Representations via Codebook Lookup for Noise-Robust ASR
par: Hu, Yuchen, et autres
Publié: (2023)
par: Hu, Yuchen, et autres
Publié: (2023)
Continual Learning Optimizations for Auto-regressive Decoder of Multilingual ASR systems
par: Kwok, Chin Yuen, et autres
Publié: (2024)
par: Kwok, Chin Yuen, et autres
Publié: (2024)
Robust Zero-Shot Text-to-Speech Synthesis with Reverse Inference Optimization
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
Zero-shot Context Biasing with Trie-based Decoding using Synthetic Multi-Pronunciation
par: Liu, Changsong, et autres
Publié: (2025)
par: Liu, Changsong, et autres
Publié: (2025)
Punctuation Restoration for Singaporean Spoken Languages: English, Malay, and Mandarin
par: Rao, Abhinav, et autres
Publié: (2022)
par: Rao, Abhinav, et autres
Publié: (2022)
Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English
par: Zhang, Haoyang, et autres
Publié: (2025)
par: Zhang, Haoyang, et autres
Publié: (2025)
Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models
par: Wu, Donghang, et autres
Publié: (2025)
par: Wu, Donghang, et autres
Publié: (2025)
Improving Synthetic Data Training for Contextual Biasing Models with a Keyword-Aware Cost Function
par: Kwok, Chin Yuen, et autres
Publié: (2025)
par: Kwok, Chin Yuen, et autres
Publié: (2025)
Continual Learning with Embedding Layer Surgery and Task-wise Beam Search using Whisper
par: Kwok, Chin Yuen, et autres
Publié: (2025)
par: Kwok, Chin Yuen, et autres
Publié: (2025)
Chronological Thinking in Full-Duplex Spoken Dialogue Language Models
par: Wu, Donghang, et autres
Publié: (2025)
par: Wu, Donghang, et autres
Publié: (2025)
Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback
par: Chen, Chen, et autres
Publié: (2024)
par: Chen, Chen, et autres
Publié: (2024)
A Comprehensive Study on the Effectiveness of ASR Representations for Noise-Robust Speech Emotion Recognition
par: Shi, Xiaohan, et autres
Publié: (2023)
par: Shi, Xiaohan, et autres
Publié: (2023)
Large Language Models are Efficient Learners of Noise-Robust Speech Recognition
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
DiaSynth: Synthetic Dialogue Generation Framework for Low Resource Dialogue Applications
par: Suresh, Sathya Krishnan, et autres
Publié: (2024)
par: Suresh, Sathya Krishnan, et autres
Publié: (2024)
Listen Again and Choose the Right Answer: A New Paradigm for Automatic Speech Recognition with Large Language Models
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
Code-switching Speech Recognition Under the Lens: Model- and Data-Centric Perspectives
par: Liu, Hexin, et autres
Publié: (2025)
par: Liu, Hexin, et autres
Publié: (2025)
Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models
par: Peng, Yizhou, et autres
Publié: (2025)
par: Peng, Yizhou, et autres
Publié: (2025)
CS-Sum: A Benchmark for Code-Switching Dialogue Summarization and the Limits of Large Language Models
par: Suresh, Sathya Krishnan, et autres
Publié: (2025)
par: Suresh, Sathya Krishnan, et autres
Publié: (2025)
Large Language Models Meet Contrastive Learning: Zero-Shot Emotion Recognition Across Languages
par: Zou, Heqing, et autres
Publié: (2025)
par: Zou, Heqing, et autres
Publié: (2025)
Training-Free Intelligibility-Guided Observation Addition for Noisy ASR
par: Li, Haoyang, et autres
Publié: (2026)
par: Li, Haoyang, et autres
Publié: (2026)
EASY: Emotion-aware Speaker Anonymization via Factorized Distillation
par: Yao, Jixun, et autres
Publié: (2025)
par: Yao, Jixun, et autres
Publié: (2025)
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations
par: Dhawan, Kunal, et autres
Publié: (2024)
par: Dhawan, Kunal, et autres
Publié: (2024)
Aligning Speech to Languages to Enhance Code-switching Speech Recognition
par: Liu, Hexin, et autres
Publié: (2024)
par: Liu, Hexin, et autres
Publié: (2024)
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
GenTranslate: Large Language Models are Generative Multilingual Speech and Machine Translators
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
Proactive for Uncertainty: Cause-Aware Error Diagnosis and Interactive Clarification for Spoken Dialogue Systems
par: Peng, Yizhou, et autres
Publié: (2026)
par: Peng, Yizhou, et autres
Publié: (2026)
Audio Large Language Models Can Be Descriptive Speech Quality Evaluators
par: Chen, Chen, et autres
Publié: (2025)
par: Chen, Chen, et autres
Publié: (2025)
GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
Crossmodal ASR Error Correction with Discrete Speech Units
par: Li, Yuanchao, et autres
Publié: (2024)
par: Li, Yuanchao, et autres
Publié: (2024)
Documents similaires
-
Language-Aware Distillation for Multilingual Instruction-Following Speech LLMs with ASR-Only Supervision
par: Gopal, Shreyas, et autres
Publié: (2026) -
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
par: Peng, Yizhou, et autres
Publié: (2025) -
Next-Frame Feature Prediction for Multimodal Deepfake Detection and Temporal Localization
par: Anshul, Ashutosh, et autres
Publié: (2025) -
Improving Code-Switching Speech Recognition with TTS Data Augmentation
par: Yeo, Yue Heng, et autres
Publié: (2026) -
Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs
par: Yuhang, Yang, et autres
Publié: (2024)