CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Jiajun, Sawada, Naoki, Miyazaki, Koichi, Toda, Tomoki |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding
di: He, Jiajun, et al.
Pubblicazione: (2025)
di: He, Jiajun, et al.
Pubblicazione: (2025)
A Comprehensive Study on the Effectiveness of ASR Representations for Noise-Robust Speech Emotion Recognition
di: Shi, Xiaohan, et al.
Pubblicazione: (2023)
di: Shi, Xiaohan, et al.
Pubblicazione: (2023)
Eigenvoice Synthesis based on Model Editing for Speaker Generation
di: Murata, Masato, et al.
Pubblicazione: (2025)
di: Murata, Masato, et al.
Pubblicazione: (2025)
PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation
di: He, Jiajun, et al.
Pubblicazione: (2025)
di: He, Jiajun, et al.
Pubblicazione: (2025)
Serialized Output Prompting for Large Language Model-based Multi-Talker Speech Recognition
di: Shi, Hao, et al.
Pubblicazione: (2025)
di: Shi, Hao, et al.
Pubblicazione: (2025)
Large Language Model Can Transcribe Speech in Multi-Talker Scenarios with Versatile Instructions
di: Meng, Lingwei, et al.
Pubblicazione: (2024)
di: Meng, Lingwei, et al.
Pubblicazione: (2024)
Cross-Speaker Encoding Network for Multi-Talker Speech Recognition
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
Alignment-Free Training for Transducer-based Multi-Talker ASR
di: Moriya, Takafumi, et al.
Pubblicazione: (2024)
di: Moriya, Takafumi, et al.
Pubblicazione: (2024)
SPBA: Utilizing Speech Large Language Model for Backdoor Attacks on Speech Classification Models
di: Yao, Wenhan, et al.
Pubblicazione: (2025)
di: Yao, Wenhan, et al.
Pubblicazione: (2025)
Streaming Speaker Change Detection and Gender Classification for Transducer-Based Multi-Talker Speech Translation
di: Wang, Peidong, et al.
Pubblicazione: (2025)
di: Wang, Peidong, et al.
Pubblicazione: (2025)
Scaling Multi-Talker ASR with Speaker-Agnostic Activity Streams
di: He, Xiluo, et al.
Pubblicazione: (2025)
di: He, Xiluo, et al.
Pubblicazione: (2025)
MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction
di: He, Jiajun, et al.
Pubblicazione: (2024)
di: He, Jiajun, et al.
Pubblicazione: (2024)
An Attribute Interpolation Method in Speech Synthesis by Model Merging
di: Murata, Masato, et al.
Pubblicazione: (2024)
di: Murata, Masato, et al.
Pubblicazione: (2024)
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining
di: Zhuo, Jianheng, et al.
Pubblicazione: (2025)
di: Zhuo, Jianheng, et al.
Pubblicazione: (2025)
SUTA-LM: Bridging Test-Time Adaptation and Language Model Rescoring for Robust ASR
di: Huang, Wei-Ping, et al.
Pubblicazione: (2025)
di: Huang, Wei-Ping, et al.
Pubblicazione: (2025)
Efficient Adaptation of Multilingual Models for Japanese ASR
di: Bajo, Mark, et al.
Pubblicazione: (2024)
di: Bajo, Mark, et al.
Pubblicazione: (2024)
Two-stage Framework for Robust Speech Emotion Recognition Using Target Speaker Extraction in Human Speech Noise Conditions
di: Mi, Jinyi, et al.
Pubblicazione: (2024)
di: Mi, Jinyi, et al.
Pubblicazione: (2024)
Language-Aware Prompt Tuning for Parameter-Efficient Seamless Language Expansion in Multilingual ASR
di: Yang, Hongli, et al.
Pubblicazione: (2025)
di: Yang, Hongli, et al.
Pubblicazione: (2025)
Speaker-agnostic Emotion Vector for Cross-speaker Emotion Intensity Control
di: Murata, Masato, et al.
Pubblicazione: (2025)
di: Murata, Masato, et al.
Pubblicazione: (2025)
WavLLM: Towards Robust and Adaptive Speech Large Language Model
di: Hu, Shujie, et al.
Pubblicazione: (2024)
di: Hu, Shujie, et al.
Pubblicazione: (2024)
A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario
di: Song, Zheshu, et al.
Pubblicazione: (2024)
di: Song, Zheshu, et al.
Pubblicazione: (2024)
Fun-ASR Technical Report
di: An, Keyu, et al.
Pubblicazione: (2025)
di: An, Keyu, et al.
Pubblicazione: (2025)
An Embarrassingly Simple Approach for LLM with Strong ASR Capacity
di: Ma, Ziyang, et al.
Pubblicazione: (2024)
di: Ma, Ziyang, et al.
Pubblicazione: (2024)
Adaptability of ASR Models on Low-Resource Language: A Comparative Study of Whisper and Wav2Vec-BERT on Bangla
di: Ridoy, Md Sazzadul Islam, et al.
Pubblicazione: (2025)
di: Ridoy, Md Sazzadul Islam, et al.
Pubblicazione: (2025)
Boosting Code-Switching ASR with Mixture of Experts Enhanced Speech-Conditioned LLM
di: Zhang, Fengrun, et al.
Pubblicazione: (2024)
di: Zhang, Fengrun, et al.
Pubblicazione: (2024)
Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition
di: Hu, Shujie, et al.
Pubblicazione: (2024)
di: Hu, Shujie, et al.
Pubblicazione: (2024)
Articulation-Informed ASR: Integrating Articulatory Features into ASR via Auxiliary Speech Inversion and Cross-Attention Fusion
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2025)
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2025)
Empowering Whisper as a Joint Multi-Talker and Target-Talker Speech Recognition System
di: Meng, Lingwei, et al.
Pubblicazione: (2024)
di: Meng, Lingwei, et al.
Pubblicazione: (2024)
OpenS2S: Advancing Fully Open-Source End-to-End Empathetic Large Speech Language Model
di: Wang, Chen, et al.
Pubblicazione: (2025)
di: Wang, Chen, et al.
Pubblicazione: (2025)
SA-SOT: Speaker-Aware Serialized Output Training for Multi-Talker ASR
di: Fan, Zhiyun, et al.
Pubblicazione: (2024)
di: Fan, Zhiyun, et al.
Pubblicazione: (2024)
Elevating Robust Multi-Talker ASR by Decoupling Speaker Separation and Speech Recognition
di: Yang, Yufeng, et al.
Pubblicazione: (2025)
di: Yang, Yufeng, et al.
Pubblicazione: (2025)
MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
di: Yang, Chih-Kai, et al.
Pubblicazione: (2026)
di: Yang, Chih-Kai, et al.
Pubblicazione: (2026)
CALM: Joint Contextual Acoustic-Linguistic Modeling for Personalization of Multi-Speaker ASR
di: Shakeel, Muhammad, et al.
Pubblicazione: (2026)
di: Shakeel, Muhammad, et al.
Pubblicazione: (2026)
Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
di: Cui, Mingyu, et al.
Pubblicazione: (2024)
Incorporating Talker Identity Aids With Improving Speech Recognition in Adversarial Environments
di: Alavilli, Sagarika, et al.
Pubblicazione: (2024)
di: Alavilli, Sagarika, et al.
Pubblicazione: (2024)
Samba-ASR: State-Of-The-Art Speech Recognition Leveraging Structured State-Space Models
di: Shakhadri, Syed Abdul Gaffar, et al.
Pubblicazione: (2025)
di: Shakhadri, Syed Abdul Gaffar, et al.
Pubblicazione: (2025)
Weak Supervision Techniques towards Enhanced ASR Models in Industry-level CRM Systems
di: Wang, Zhongsheng, et al.
Pubblicazione: (2025)
di: Wang, Zhongsheng, et al.
Pubblicazione: (2025)
Probing the Hidden Talent of ASR Foundation Models for L2 English Oral Assessment
di: Chao, Fu-An, et al.
Pubblicazione: (2025)
di: Chao, Fu-An, et al.
Pubblicazione: (2025)
LibriheavyMix: A 20,000-Hour Dataset for Single-Channel Reverberant Multi-Talker Speech Separation, ASR and Speaker Diarization
di: Jin, Zengrui, et al.
Pubblicazione: (2024)
di: Jin, Zengrui, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding
di: He, Jiajun, et al.
Pubblicazione: (2025) -
A Comprehensive Study on the Effectiveness of ASR Representations for Noise-Robust Speech Emotion Recognition
di: Shi, Xiaohan, et al.
Pubblicazione: (2023) -
Eigenvoice Synthesis based on Model Editing for Speaker Generation
di: Murata, Masato, et al.
Pubblicazione: (2025) -
PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation
di: He, Jiajun, et al.
Pubblicazione: (2025) -
Serialized Output Prompting for Large Language Model-based Multi-Talker Speech Recognition
di: Shi, Hao, et al.
Pubblicazione: (2025)