JCAPT: A Joint Modeling Approach for CAPT
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Tzu-Hsuan, He, Yue-Yang, Chen, Berlin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
An Effective Mixture-Of-Experts Approach For Code-Switching Speech Recognition Leveraging Encoder Disentanglement
di: Yang, Tzu-Ting, et al.
Pubblicazione: (2024)
di: Yang, Tzu-Ting, et al.
Pubblicazione: (2024)
Probing the Hidden Talent of ASR Foundation Models for L2 English Oral Assessment
di: Chao, Fu-An, et al.
Pubblicazione: (2025)
di: Chao, Fu-An, et al.
Pubblicazione: (2025)
Optimizing Automatic Speech Assessment: W-RankSim Regularization and Hybrid Feature Fusion Strategies
di: Wu, Chung-Wen, et al.
Pubblicazione: (2024)
di: Wu, Chung-Wen, et al.
Pubblicazione: (2024)
WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling
di: Yang, Guanrou, et al.
Pubblicazione: (2026)
di: Yang, Guanrou, et al.
Pubblicazione: (2026)
An Effective Context-Balanced Adaptation Approach for Long-Tailed Speech Recognition
di: Wang, Yi-Cheng, et al.
Pubblicazione: (2024)
di: Wang, Yi-Cheng, et al.
Pubblicazione: (2024)
TG-ASR: Translation-Guided Learning with Parallel Gated Cross Attention for Low-Resource Automatic Speech Recognition
di: Yang, Cheng-Yeh, et al.
Pubblicazione: (2026)
di: Yang, Cheng-Yeh, et al.
Pubblicazione: (2026)
Efficient Dialect-Aware Modeling and Conditioning for Low-Resource Taiwanese Hakka Speech Processing
di: Peng, An-Ci, et al.
Pubblicazione: (2026)
di: Peng, An-Ci, et al.
Pubblicazione: (2026)
Effective Noise-aware Data Simulation for Domain-adaptive Speech Enhancement Leveraging Dynamic Stochastic Perturbation
di: Wang, Chien-Chun, et al.
Pubblicazione: (2024)
di: Wang, Chien-Chun, et al.
Pubblicazione: (2024)
EmoVoice: LLM-based Emotional Text-To-Speech Model with Freestyle Text Prompting
di: Yang, Guanrou, et al.
Pubblicazione: (2025)
di: Yang, Guanrou, et al.
Pubblicazione: (2025)
Channel-Aware Domain-Adaptive Generative Adversarial Network for Robust Speech Recognition
di: Wang, Chien-Chun, et al.
Pubblicazione: (2024)
di: Wang, Chien-Chun, et al.
Pubblicazione: (2024)
TacoLM: GaTed Attention Equipped Codec Language Model are Efficient Zero-Shot Text to Speech Synthesizers
di: Song, Yakun, et al.
Pubblicazione: (2024)
di: Song, Yakun, et al.
Pubblicazione: (2024)
Towards Efficient and Multifaceted Computer-assisted Pronunciation Training Leveraging Hierarchical Selective State Space Model and Decoupled Cross-entropy Loss
di: Chao, Fu-An, et al.
Pubblicazione: (2025)
di: Chao, Fu-An, et al.
Pubblicazione: (2025)
An Effective Automated Speaking Assessment Approach to Mitigating Data Scarcity and Imbalanced Distribution
di: Lo, Tien-Hong, et al.
Pubblicazione: (2024)
di: Lo, Tien-Hong, et al.
Pubblicazione: (2024)
SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
USAT: A Universal Speaker-Adaptive Text-to-Speech Approach
di: Wang, Wenbin, et al.
Pubblicazione: (2024)
di: Wang, Wenbin, et al.
Pubblicazione: (2024)
Ming-UniAudio: Speech LLM for Joint Understanding, Generation and Editing with Unified Representation
di: Yan, Canxiang, et al.
Pubblicazione: (2025)
di: Yan, Canxiang, et al.
Pubblicazione: (2025)
PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects
di: Yang, Sicheng, et al.
Pubblicazione: (2026)
di: Yang, Sicheng, et al.
Pubblicazione: (2026)
Pronunciation-Lexicon Free Training for Phoneme-based Crosslingual ASR via Joint Stochastic Approximation
di: Yusuyin, Saierdaer, et al.
Pubblicazione: (2025)
di: Yusuyin, Saierdaer, et al.
Pubblicazione: (2025)
FastAdaSP: Multitask-Adapted Efficient Inference for Large Speech Language Model
di: Lu, Yichen, et al.
Pubblicazione: (2024)
di: Lu, Yichen, et al.
Pubblicazione: (2024)
Investigating Safety Vulnerabilities of Large Audio-Language Models Under Speaker Emotional Variations
di: Feng, Bo-Han, et al.
Pubblicazione: (2025)
di: Feng, Bo-Han, et al.
Pubblicazione: (2025)
Get Large Language Models Ready to Speak: A Late-fusion Approach for Speech Generation
di: Shen, Maohao, et al.
Pubblicazione: (2024)
di: Shen, Maohao, et al.
Pubblicazione: (2024)
CTC-Assisted LLM-Based Contextual ASR
di: Yang, Guanrou, et al.
Pubblicazione: (2024)
di: Yang, Guanrou, et al.
Pubblicazione: (2024)
K-Function: Joint Pronunciation Transcription and Feedback for Evaluating Kids Language Function
di: Li, Shuhe, et al.
Pubblicazione: (2025)
di: Li, Shuhe, et al.
Pubblicazione: (2025)
MuFFIN: Multifaceted Pronunciation Feedback Model with Interactive Hierarchical Neural Modeling
di: Yan, Bi-Cheng, et al.
Pubblicazione: (2025)
di: Yan, Bi-Cheng, et al.
Pubblicazione: (2025)
LoRA-Whisper: Parameter-Efficient and Extensible Multilingual ASR
di: Song, Zheshu, et al.
Pubblicazione: (2024)
di: Song, Zheshu, et al.
Pubblicazione: (2024)
Enhancing Low-Resource ASR through Versatile TTS: Bridging the Data Gap
di: Yang, Guanrou, et al.
Pubblicazione: (2024)
di: Yang, Guanrou, et al.
Pubblicazione: (2024)
Jointly Fine-Tuning "BERT-like" Self Supervised Models to Improve Multimodal Speech Emotion Recognition
di: Siriwardhana, Shamane, et al.
Pubblicazione: (2020)
di: Siriwardhana, Shamane, et al.
Pubblicazione: (2020)
Audio-Aware Large Language Models as Judges for Speaking Styles
di: Chiang, Cheng-Han, et al.
Pubblicazione: (2025)
di: Chiang, Cheng-Han, et al.
Pubblicazione: (2025)
Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models
di: Zhang, He, et al.
Pubblicazione: (2025)
di: Zhang, He, et al.
Pubblicazione: (2025)
An Embarrassingly Simple Approach for LLM with Strong ASR Capacity
di: Ma, Ziyang, et al.
Pubblicazione: (2024)
di: Ma, Ziyang, et al.
Pubblicazione: (2024)
TiCo: Time-Controllable Spoken Dialogue Model
di: Chang, Kai-Wei, et al.
Pubblicazione: (2026)
di: Chang, Kai-Wei, et al.
Pubblicazione: (2026)
SPBA: Utilizing Speech Large Language Model for Backdoor Attacks on Speech Classification Models
di: Yao, Wenhan, et al.
Pubblicazione: (2025)
di: Yao, Wenhan, et al.
Pubblicazione: (2025)
Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models
di: Ieong, Lok-Lam, et al.
Pubblicazione: (2026)
di: Ieong, Lok-Lam, et al.
Pubblicazione: (2026)
Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models
di: Wang, Qiongqiong, et al.
Pubblicazione: (2025)
di: Wang, Qiongqiong, et al.
Pubblicazione: (2025)
AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2025)
Game-Time: Evaluating Temporal Dynamics in Spoken Language Models
di: Chang, Kai-Wei, et al.
Pubblicazione: (2025)
di: Chang, Kai-Wei, et al.
Pubblicazione: (2025)
An Approach to Simultaneous Acquisition of Real-Time MRI Video, EEG, and Surface EMG for Articulatory, Brain, and Muscle Activity During Speech Production
di: Lee, Jihwan, et al.
Pubblicazione: (2026)
di: Lee, Jihwan, et al.
Pubblicazione: (2026)
A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario
di: Song, Zheshu, et al.
Pubblicazione: (2024)
di: Song, Zheshu, et al.
Pubblicazione: (2024)
Unifying Model and Layer Fusion for Speech Foundation Models
di: Shih, Yi-Jen, et al.
Pubblicazione: (2025)
di: Shih, Yi-Jen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
An Effective Mixture-Of-Experts Approach For Code-Switching Speech Recognition Leveraging Encoder Disentanglement
di: Yang, Tzu-Ting, et al.
Pubblicazione: (2024) -
Probing the Hidden Talent of ASR Foundation Models for L2 English Oral Assessment
di: Chao, Fu-An, et al.
Pubblicazione: (2025) -
Optimizing Automatic Speech Assessment: W-RankSim Regularization and Hybrid Feature Fusion Strategies
di: Wu, Chung-Wen, et al.
Pubblicazione: (2024) -
WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling
di: Yang, Guanrou, et al.
Pubblicazione: (2026) -
An Effective Context-Balanced Adaptation Approach for Long-Tailed Speech Recognition
di: Wang, Yi-Cheng, et al.
Pubblicazione: (2024)