Semi-supervised Learning for Code-Switching ASR with Large Language Model Filter
Fuente:
arXiv
Salvato in:
| Autori principali: | Xi, Yu, Ding, Wen, Yu, Kai, Lai, Junjie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Romanization Encoding For Multilingual ASR
di: Ding, Wen, et al.
Pubblicazione: (2024)
di: Ding, Wen, et al.
Pubblicazione: (2024)
Align-Consistency: Improving Non-autoregressive and Semi-supervised ASR with Consistency Regularization
di: Huang, Wanting, et al.
Pubblicazione: (2026)
di: Huang, Wanting, et al.
Pubblicazione: (2026)
Better Semi-supervised Learning for Multi-domain ASR Through Incremental Retraining and Data Filtering
di: Carofilis, Andres, et al.
Pubblicazione: (2025)
di: Carofilis, Andres, et al.
Pubblicazione: (2025)
MOSA: Mixtures of Simple Adapters Outperform Monolithic Approaches in LLM-based Multilingual ASR
di: Li, Junjie, et al.
Pubblicazione: (2025)
di: Li, Junjie, et al.
Pubblicazione: (2025)
TC-BiMamba: Trans-Chunk bidirectionally within BiMamba for unified streaming and non-streaming ASR
di: She, Qingshun, et al.
Pubblicazione: (2026)
di: She, Qingshun, et al.
Pubblicazione: (2026)
DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models
di: Li, Li, et al.
Pubblicazione: (2026)
di: Li, Li, et al.
Pubblicazione: (2026)
Doctor or Patient? Synergizing Diarization and ASR for Code-Switched Hinglish Medical Conditions Extraction
di: Baroudi, Séverin, et al.
Pubblicazione: (2026)
di: Baroudi, Séverin, et al.
Pubblicazione: (2026)
LESS: Large Language Model Enhanced Semi-Supervised Learning for Speech Foundational Models Using in-the-wild Data
di: Ding, Wen, et al.
Pubblicazione: (2025)
di: Ding, Wen, et al.
Pubblicazione: (2025)
AsyncSwitch: Asynchronous Text-Speech Adaptation for Code-Switched ASR
di: Nguyen, Tuan, et al.
Pubblicazione: (2025)
di: Nguyen, Tuan, et al.
Pubblicazione: (2025)
A Survey on Speech Large Language Models for Understanding
di: Peng, Jing, et al.
Pubblicazione: (2024)
di: Peng, Jing, et al.
Pubblicazione: (2024)
Advancing Multi-talker ASR Performance with Large Language Models
di: Shi, Mohan, et al.
Pubblicazione: (2024)
di: Shi, Mohan, et al.
Pubblicazione: (2024)
Optimizing ASR for Catalan-Spanish Code-Switching: A Comparative Analysis of Methodologies
di: Mena, Carlos, et al.
Pubblicazione: (2025)
di: Mena, Carlos, et al.
Pubblicazione: (2025)
FairASR: Fair Audio Contrastive Learning for Automatic Speech Recognition
di: Kim, Jongsuk, et al.
Pubblicazione: (2025)
di: Kim, Jongsuk, et al.
Pubblicazione: (2025)
Masked Self-distilled Transducer-based Keyword Spotting with Semi-autoregressive Decoding
di: Xi, Yu, et al.
Pubblicazione: (2025)
di: Xi, Yu, et al.
Pubblicazione: (2025)
Contextual Biasing for LLM-Based ASR with Hotword Retrieval and Reinforcement Learning
di: Kong, YuXiang, et al.
Pubblicazione: (2025)
di: Kong, YuXiang, et al.
Pubblicazione: (2025)
Investigating Zero-Shot Generalizability on Mandarin-English Code-Switched ASR and Speech-to-text Translation of Recent Foundation Models with Self-Supervision and Weak Supervision
di: Yang, Chih-Kai, et al.
Pubblicazione: (2023)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2023)
TASU: Text-Only Alignment for Speech Understanding
di: Peng, Jing, et al.
Pubblicazione: (2025)
di: Peng, Jing, et al.
Pubblicazione: (2025)
Boosting Code-Switching ASR with Mixture of Experts Enhanced Speech-Conditioned LLM
di: Zhang, Fengrun, et al.
Pubblicazione: (2024)
di: Zhang, Fengrun, et al.
Pubblicazione: (2024)
NTC-KWS: Noise-aware CTC for Robust Keyword Spotting
di: Xi, Yu, et al.
Pubblicazione: (2024)
di: Xi, Yu, et al.
Pubblicazione: (2024)
SC-MoE: Switch Conformer Mixture of Experts for Unified Streaming and Non-streaming Code-Switching ASR
di: Ye, Shuaishuai, et al.
Pubblicazione: (2024)
di: Ye, Shuaishuai, et al.
Pubblicazione: (2024)
Multi-Channel Multi-Speaker ASR Using Target Speaker's Solo Segment
di: Shao, Yiwen, et al.
Pubblicazione: (2024)
di: Shao, Yiwen, et al.
Pubblicazione: (2024)
CAMEL: Cross-Attention Enhanced Mixture-of-Experts and Language Bias for Code-Switching Speech Recognition
di: Wang, He, et al.
Pubblicazione: (2024)
di: Wang, He, et al.
Pubblicazione: (2024)
UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
di: Guan, Wenhao, et al.
Pubblicazione: (2025)
di: Guan, Wenhao, et al.
Pubblicazione: (2025)
Inverse-Hessian Regularization for Continual Learning in ASR
di: Eeckt, Steven Vander, et al.
Pubblicazione: (2026)
di: Eeckt, Steven Vander, et al.
Pubblicazione: (2026)
Neural Directed Speech Enhancement with Dual Microphone Array in High Noise Scenario
di: Wen, Wen, et al.
Pubblicazione: (2024)
di: Wen, Wen, et al.
Pubblicazione: (2024)
Boosting Multi-Speaker Expressive Speech Synthesis with Semi-supervised Contrastive Learning
di: Zhu, Xinfa, et al.
Pubblicazione: (2023)
di: Zhu, Xinfa, et al.
Pubblicazione: (2023)
All-in-One ASR: Unifying Encoder-Decoder Models of CTC, Attention, and Transducer in Dual-Mode ASR
di: Moriya, Takafumi, et al.
Pubblicazione: (2025)
di: Moriya, Takafumi, et al.
Pubblicazione: (2025)
Large Language Models based ASR Error Correction for Child Conversations
di: Xu, Anfeng, et al.
Pubblicazione: (2025)
di: Xu, Anfeng, et al.
Pubblicazione: (2025)
ASR-EC Benchmark: Evaluating Large Language Models on Chinese ASR Error Correction
di: Wei, Victor Junqiu, et al.
Pubblicazione: (2024)
di: Wei, Victor Junqiu, et al.
Pubblicazione: (2024)
Robust ASR Error Correction with Conservative Data Filtering
di: Udagawa, Takuma, et al.
Pubblicazione: (2024)
di: Udagawa, Takuma, et al.
Pubblicazione: (2024)
A Bottom-up Framework with Language-universal Speech Attribute Modeling for Syllable-based ASR
di: Yen, Hao, et al.
Pubblicazione: (2025)
di: Yen, Hao, et al.
Pubblicazione: (2025)
Contextual Biasing for Streaming ASR via CTC-based Word Spotting
di: Tsai, Kai-Chen, et al.
Pubblicazione: (2026)
di: Tsai, Kai-Chen, et al.
Pubblicazione: (2026)
ASR Error Correction using Large Language Models
di: Ma, Rao, et al.
Pubblicazione: (2024)
di: Ma, Rao, et al.
Pubblicazione: (2024)
Efficient Scaling for LLM-based ASR
di: Mu, Bingshen, et al.
Pubblicazione: (2025)
di: Mu, Bingshen, et al.
Pubblicazione: (2025)
End-to-end Acoustic-linguistic Emotion and Intent Recognition Enhanced by Semi-supervised Learning
di: Ren, Zhao, et al.
Pubblicazione: (2025)
di: Ren, Zhao, et al.
Pubblicazione: (2025)
Contrastive Learning With Audio Discrimination For Customizable Keyword Spotting In Continuous Speech
di: Xi, Yu, et al.
Pubblicazione: (2024)
di: Xi, Yu, et al.
Pubblicazione: (2024)
Context and System Fusion in Post-ASR Emotion Recognition with Large Language Models
di: Stepachev, Pavel, et al.
Pubblicazione: (2024)
di: Stepachev, Pavel, et al.
Pubblicazione: (2024)
Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition
di: Hu, Shujie, et al.
Pubblicazione: (2024)
di: Hu, Shujie, et al.
Pubblicazione: (2024)
Benchmarking Children's ASR with Supervised and Self-supervised Speech Foundation Models
di: Fan, Ruchao, et al.
Pubblicazione: (2024)
di: Fan, Ruchao, et al.
Pubblicazione: (2024)
NeuRO: An Application for Code-Switched Autism Detection in Children
di: Akhtar, Mohd Mujtaba, et al.
Pubblicazione: (2024)
di: Akhtar, Mohd Mujtaba, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Romanization Encoding For Multilingual ASR
di: Ding, Wen, et al.
Pubblicazione: (2024) -
Align-Consistency: Improving Non-autoregressive and Semi-supervised ASR with Consistency Regularization
di: Huang, Wanting, et al.
Pubblicazione: (2026) -
Better Semi-supervised Learning for Multi-domain ASR Through Incremental Retraining and Data Filtering
di: Carofilis, Andres, et al.
Pubblicazione: (2025) -
MOSA: Mixtures of Simple Adapters Outperform Monolithic Approaches in LLM-based Multilingual ASR
di: Li, Junjie, et al.
Pubblicazione: (2025) -
TC-BiMamba: Trans-Chunk bidirectionally within BiMamba for unified streaming and non-streaming ASR
di: She, Qingshun, et al.
Pubblicazione: (2026)