CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Jiajun, Sawada, Naoki, Miyazaki, Koichi, Toda, Tomoki |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding
par: He, Jiajun, et autres
Publié: (2025)
par: He, Jiajun, et autres
Publié: (2025)
A Comprehensive Study on the Effectiveness of ASR Representations for Noise-Robust Speech Emotion Recognition
par: Shi, Xiaohan, et autres
Publié: (2023)
par: Shi, Xiaohan, et autres
Publié: (2023)
Eigenvoice Synthesis based on Model Editing for Speaker Generation
par: Murata, Masato, et autres
Publié: (2025)
par: Murata, Masato, et autres
Publié: (2025)
PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation
par: He, Jiajun, et autres
Publié: (2025)
par: He, Jiajun, et autres
Publié: (2025)
Serialized Output Prompting for Large Language Model-based Multi-Talker Speech Recognition
par: Shi, Hao, et autres
Publié: (2025)
par: Shi, Hao, et autres
Publié: (2025)
Large Language Model Can Transcribe Speech in Multi-Talker Scenarios with Versatile Instructions
par: Meng, Lingwei, et autres
Publié: (2024)
par: Meng, Lingwei, et autres
Publié: (2024)
Cross-Speaker Encoding Network for Multi-Talker Speech Recognition
par: Kang, Jiawen, et autres
Publié: (2024)
par: Kang, Jiawen, et autres
Publié: (2024)
Alignment-Free Training for Transducer-based Multi-Talker ASR
par: Moriya, Takafumi, et autres
Publié: (2024)
par: Moriya, Takafumi, et autres
Publié: (2024)
SPBA: Utilizing Speech Large Language Model for Backdoor Attacks on Speech Classification Models
par: Yao, Wenhan, et autres
Publié: (2025)
par: Yao, Wenhan, et autres
Publié: (2025)
Streaming Speaker Change Detection and Gender Classification for Transducer-Based Multi-Talker Speech Translation
par: Wang, Peidong, et autres
Publié: (2025)
par: Wang, Peidong, et autres
Publié: (2025)
Scaling Multi-Talker ASR with Speaker-Agnostic Activity Streams
par: He, Xiluo, et autres
Publié: (2025)
par: He, Xiluo, et autres
Publié: (2025)
MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction
par: He, Jiajun, et autres
Publié: (2024)
par: He, Jiajun, et autres
Publié: (2024)
An Attribute Interpolation Method in Speech Synthesis by Model Merging
par: Murata, Masato, et autres
Publié: (2024)
par: Murata, Masato, et autres
Publié: (2024)
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
par: Kang, Jiawen, et autres
Publié: (2024)
par: Kang, Jiawen, et autres
Publié: (2024)
VietASR: Achieving Industry-level Vietnamese ASR with 50-hour labeled data and Large-Scale Speech Pretraining
par: Zhuo, Jianheng, et autres
Publié: (2025)
par: Zhuo, Jianheng, et autres
Publié: (2025)
SUTA-LM: Bridging Test-Time Adaptation and Language Model Rescoring for Robust ASR
par: Huang, Wei-Ping, et autres
Publié: (2025)
par: Huang, Wei-Ping, et autres
Publié: (2025)
Efficient Adaptation of Multilingual Models for Japanese ASR
par: Bajo, Mark, et autres
Publié: (2024)
par: Bajo, Mark, et autres
Publié: (2024)
Two-stage Framework for Robust Speech Emotion Recognition Using Target Speaker Extraction in Human Speech Noise Conditions
par: Mi, Jinyi, et autres
Publié: (2024)
par: Mi, Jinyi, et autres
Publié: (2024)
Language-Aware Prompt Tuning for Parameter-Efficient Seamless Language Expansion in Multilingual ASR
par: Yang, Hongli, et autres
Publié: (2025)
par: Yang, Hongli, et autres
Publié: (2025)
Speaker-agnostic Emotion Vector for Cross-speaker Emotion Intensity Control
par: Murata, Masato, et autres
Publié: (2025)
par: Murata, Masato, et autres
Publié: (2025)
WavLLM: Towards Robust and Adaptive Speech Large Language Model
par: Hu, Shujie, et autres
Publié: (2024)
par: Hu, Shujie, et autres
Publié: (2024)
A Comparative Study of LLM-based ASR and Whisper in Low Resource and Code Switching Scenario
par: Song, Zheshu, et autres
Publié: (2024)
par: Song, Zheshu, et autres
Publié: (2024)
Fun-ASR Technical Report
par: An, Keyu, et autres
Publié: (2025)
par: An, Keyu, et autres
Publié: (2025)
An Embarrassingly Simple Approach for LLM with Strong ASR Capacity
par: Ma, Ziyang, et autres
Publié: (2024)
par: Ma, Ziyang, et autres
Publié: (2024)
Adaptability of ASR Models on Low-Resource Language: A Comparative Study of Whisper and Wav2Vec-BERT on Bangla
par: Ridoy, Md Sazzadul Islam, et autres
Publié: (2025)
par: Ridoy, Md Sazzadul Islam, et autres
Publié: (2025)
Boosting Code-Switching ASR with Mixture of Experts Enhanced Speech-Conditioned LLM
par: Zhang, Fengrun, et autres
Publié: (2024)
par: Zhang, Fengrun, et autres
Publié: (2024)
Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition
par: Hu, Shujie, et autres
Publié: (2024)
par: Hu, Shujie, et autres
Publié: (2024)
Articulation-Informed ASR: Integrating Articulatory Features into ASR via Auxiliary Speech Inversion and Cross-Attention Fusion
par: Attia, Ahmed Adel, et autres
Publié: (2025)
par: Attia, Ahmed Adel, et autres
Publié: (2025)
Empowering Whisper as a Joint Multi-Talker and Target-Talker Speech Recognition System
par: Meng, Lingwei, et autres
Publié: (2024)
par: Meng, Lingwei, et autres
Publié: (2024)
OpenS2S: Advancing Fully Open-Source End-to-End Empathetic Large Speech Language Model
par: Wang, Chen, et autres
Publié: (2025)
par: Wang, Chen, et autres
Publié: (2025)
SA-SOT: Speaker-Aware Serialized Output Training for Multi-Talker ASR
par: Fan, Zhiyun, et autres
Publié: (2024)
par: Fan, Zhiyun, et autres
Publié: (2024)
Elevating Robust Multi-Talker ASR by Decoupling Speaker Separation and Speech Recognition
par: Yang, Yufeng, et autres
Publié: (2025)
par: Yang, Yufeng, et autres
Publié: (2025)
MUGEN: Evaluating and Improving Multi-audio Understanding of Large Audio-Language Models
par: Yang, Chih-Kai, et autres
Publié: (2026)
par: Yang, Chih-Kai, et autres
Publié: (2026)
CALM: Joint Contextual Acoustic-Linguistic Modeling for Personalization of Multi-Speaker ASR
par: Shakeel, Muhammad, et autres
Publié: (2026)
par: Shakeel, Muhammad, et autres
Publié: (2026)
Exploring SSL Discrete Speech Features for Zipformer-based Contextual ASR
par: Cui, Mingyu, et autres
Publié: (2024)
par: Cui, Mingyu, et autres
Publié: (2024)
Incorporating Talker Identity Aids With Improving Speech Recognition in Adversarial Environments
par: Alavilli, Sagarika, et autres
Publié: (2024)
par: Alavilli, Sagarika, et autres
Publié: (2024)
Samba-ASR: State-Of-The-Art Speech Recognition Leveraging Structured State-Space Models
par: Shakhadri, Syed Abdul Gaffar, et autres
Publié: (2025)
par: Shakhadri, Syed Abdul Gaffar, et autres
Publié: (2025)
Weak Supervision Techniques towards Enhanced ASR Models in Industry-level CRM Systems
par: Wang, Zhongsheng, et autres
Publié: (2025)
par: Wang, Zhongsheng, et autres
Publié: (2025)
Probing the Hidden Talent of ASR Foundation Models for L2 English Oral Assessment
par: Chao, Fu-An, et autres
Publié: (2025)
par: Chao, Fu-An, et autres
Publié: (2025)
LibriheavyMix: A 20,000-Hour Dataset for Single-Channel Reverberant Multi-Talker Speech Separation, ASR and Speaker Diarization
par: Jin, Zengrui, et autres
Publié: (2024)
par: Jin, Zengrui, et autres
Publié: (2024)
Documents similaires
-
PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding
par: He, Jiajun, et autres
Publié: (2025) -
A Comprehensive Study on the Effectiveness of ASR Representations for Noise-Robust Speech Emotion Recognition
par: Shi, Xiaohan, et autres
Publié: (2023) -
Eigenvoice Synthesis based on Model Editing for Speaker Generation
par: Murata, Masato, et autres
Publié: (2025) -
PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation
par: He, Jiajun, et autres
Publié: (2025) -
Serialized Output Prompting for Large Language Model-based Multi-Talker Speech Recognition
par: Shi, Hao, et autres
Publié: (2025)