MMGER: Multi-modal and Multi-granularity Generative Error Correction with LLM for Joint Accent and Speech Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mu, Bingshen, Li, Yangze, Shao, Qijie, Wei, Kun, Wan, Xucheng, Zheng, Naijun, Zhou, Huan, Xie, Lei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Mixture of LoRA Experts with Multi-Modal and Multi-Granularity LLM Generative Error Correction for Accented Speech Recognition
par: Mu, Bingshen, et autres
Publié: (2025)
par: Mu, Bingshen, et autres
Publié: (2025)
HDMoLE: Mixture of LoRA Experts with Hierarchical Routing and Dynamic Thresholds for Fine-Tuning LLM-based ASR Models
par: Mu, Bingshen, et autres
Publié: (2024)
par: Mu, Bingshen, et autres
Publié: (2024)
CAMEL: Cross-Attention Enhanced Mixture-of-Experts and Language Bias for Code-Switching Speech Recognition
par: Wang, He, et autres
Publié: (2024)
par: Wang, He, et autres
Publié: (2024)
dLLM-ASR: A Faster Diffusion LLM-based Framework for Speech Recognition
par: Tian, Wenjie, et autres
Publié: (2026)
par: Tian, Wenjie, et autres
Publié: (2026)
Efficient Scaling for LLM-based ASR
par: Mu, Bingshen, et autres
Publié: (2025)
par: Mu, Bingshen, et autres
Publié: (2025)
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
par: Zhou, Xuehao, et autres
Publié: (2024)
par: Zhou, Xuehao, et autres
Publié: (2024)
LLM-ForcedAligner: A Non-Autoregressive and Accurate LLM-Based Forced Aligner for Multilingual and Long-Form Speech
par: Mu, Bingshen, et autres
Publié: (2026)
par: Mu, Bingshen, et autres
Publié: (2026)
SCDiar: a streaming diarization system based on speaker change detection and speech recognition
par: Zheng, Naijun, et autres
Publié: (2025)
par: Zheng, Naijun, et autres
Publié: (2025)
An efficient text augmentation approach for contextualized Mandarin speech recognition
par: Zheng, Naijun, et autres
Publié: (2024)
par: Zheng, Naijun, et autres
Publié: (2024)
DQ-Data2vec: Decoupling Quantization for Multilingual Speech Recognition
par: Shao, Qijie, et autres
Publié: (2025)
par: Shao, Qijie, et autres
Publié: (2025)
MacST: Multi-Accent Speech Synthesis via Text Transliteration for Accent Conversion
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages
par: Shao, Mingchen, et autres
Publié: (2025)
par: Shao, Mingchen, et autres
Publié: (2025)
XCB: an effective contextual biasing approach to bias cross-lingual phrases in speech recognition
par: Wan, Xucheng, et autres
Publié: (2024)
par: Wan, Xucheng, et autres
Publié: (2024)
Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning
par: Tian, Wenjie, et autres
Publié: (2026)
par: Tian, Wenjie, et autres
Publié: (2026)
Ideal-LLM: Integrating Dual Encoders and Language-Adapted LLM for Multilingual Speech-to-Text
par: Xue, Hongfei, et autres
Publié: (2024)
par: Xue, Hongfei, et autres
Publié: (2024)
Unveiling the Potential of LLM-Based ASR on Chinese Open-Source Datasets
par: Geng, Xuelong, et autres
Publié: (2024)
par: Geng, Xuelong, et autres
Publié: (2024)
A Transcription Prompt-based Efficient Audio Large Language Model for Robust Speech Recognition
par: Li, Yangze, et autres
Publié: (2024)
par: Li, Yangze, et autres
Publié: (2024)
Investigation of Deep Neural Network Acoustic Modelling Approaches for Low Resource Accented Mandarin Speech Recognition
par: Xie, Xurong, et autres
Publié: (2022)
par: Xie, Xurong, et autres
Publié: (2022)
Weakly Supervised Data Refinement and Flexible Sequence Compression for Efficient Thai LLM-based ASR
par: Shao, Mingchen, et autres
Publié: (2025)
par: Shao, Mingchen, et autres
Publié: (2025)
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora
par: Nespoli, Francesco, et autres
Publié: (2024)
par: Nespoli, Francesco, et autres
Publié: (2024)
Retrieval Augmented Correction of Named Entity Speech Recognition Errors
par: Pusateri, Ernest, et autres
Publié: (2024)
par: Pusateri, Ernest, et autres
Publié: (2024)
Benchmarking Japanese Speech Recognition on ASR-LLM Setups with Multi-Pass Augmented Generative Error Correction
par: Ko, Yuka, et autres
Publié: (2024)
par: Ko, Yuka, et autres
Publié: (2024)
Semantic-Aware Interruption Detection in Spoken Dialogue Systems: Benchmark, Metric, and Model
par: Xia, Kangxiang, et autres
Publié: (2026)
par: Xia, Kangxiang, et autres
Publié: (2026)
Clustering and Mining Accented Speech for Inclusive and Fair Speech Recognition
par: Kim, Jaeyoung, et autres
Publié: (2024)
par: Kim, Jaeyoung, et autres
Publié: (2024)
SSHR: Leveraging Self-supervised Hierarchical Representations for Multilingual Automatic Speech Recognition
par: Xue, Hongfei, et autres
Publié: (2023)
par: Xue, Hongfei, et autres
Publié: (2023)
Summary on The Multilingual Conversational Speech Language Model Challenge: Datasets, Tasks, Baselines, and Methods
par: Mu, Bingshen, et autres
Publié: (2025)
par: Mu, Bingshen, et autres
Publié: (2025)
WenetSpeech-Wu: Datasets, Benchmarks, and Models for a Unified Chinese Wu Dialect Speech Processing Ecosystem
par: Wang, Chengyou, et autres
Publié: (2026)
par: Wang, Chengyou, et autres
Publié: (2026)
Unsupervised Accent Adaptation Through Masked Language Model Correction Of Discrete Self-Supervised Speech Units
par: Poncelet, Jakob, et autres
Publié: (2023)
par: Poncelet, Jakob, et autres
Publié: (2023)
SpeechAccentLLM: A Unified Framework for Foreign Accent Conversion and Text to Speech
par: Cheng, Zhuangfei, et autres
Publié: (2025)
par: Cheng, Zhuangfei, et autres
Publié: (2025)
Multi-modal Speech Enhancement with Limited Electromyography Channels
par: Feng, Fuyuan, et autres
Publié: (2025)
par: Feng, Fuyuan, et autres
Publié: (2025)
EmoTech: A Multi-modal Speech Emotion Recognition Using Multi-source Low-level Information with Hybrid Recurrent Network
par: Avro, Shamin Bin Habib, et autres
Publié: (2025)
par: Avro, Shamin Bin Habib, et autres
Publié: (2025)
Qifusion-Net: Layer-adapted Stream/Non-stream Model for End-to-End Multi-Accent Speech Recognition
par: Chen, Jinming, et autres
Publié: (2024)
par: Chen, Jinming, et autres
Publié: (2024)
Pitch Accent Detection improves Pretrained Automatic Speech Recognition
par: Sasu, David, et autres
Publié: (2025)
par: Sasu, David, et autres
Publié: (2025)
CodecMOS-Accent: A MOS Benchmark of Resynthesized and TTS Speech from Neural Codecs Across English Accents
par: Huang, Wen-Chin, et autres
Publié: (2026)
par: Huang, Wen-Chin, et autres
Publié: (2026)
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
par: Dai, Yuhang, et autres
Publié: (2025)
par: Dai, Yuhang, et autres
Publié: (2025)
Adapting Automatic Speech Recognition for Accented Air Traffic Control Communications
par: Wee, Marcus Yu Zhe, et autres
Publié: (2025)
par: Wee, Marcus Yu Zhe, et autres
Publié: (2025)
Accent Conversion in Text-To-Speech Using Multi-Level VAE and Adversarial Training
par: Melechovsky, Jan, et autres
Publié: (2024)
par: Melechovsky, Jan, et autres
Publié: (2024)
E-chat: Emotion-sensitive Spoken Dialogue System with Large Language Models
par: Xue, Hongfei, et autres
Publié: (2023)
par: Xue, Hongfei, et autres
Publié: (2023)
Conversational Speech Recognition by Learning Audio-textual Cross-modal Contextual Representation
par: Wei, Kun, et autres
Publié: (2023)
par: Wei, Kun, et autres
Publié: (2023)
Empowering Communication: Speech Technology for Indian and Western Accents through AI-powered Speech Synthesis
par: R, Vinotha, et autres
Publié: (2024)
par: R, Vinotha, et autres
Publié: (2024)
Documents similaires
-
Mixture of LoRA Experts with Multi-Modal and Multi-Granularity LLM Generative Error Correction for Accented Speech Recognition
par: Mu, Bingshen, et autres
Publié: (2025) -
HDMoLE: Mixture of LoRA Experts with Hierarchical Routing and Dynamic Thresholds for Fine-Tuning LLM-based ASR Models
par: Mu, Bingshen, et autres
Publié: (2024) -
CAMEL: Cross-Attention Enhanced Mixture-of-Experts and Language Bias for Code-Switching Speech Recognition
par: Wang, He, et autres
Publié: (2024) -
dLLM-ASR: A Faster Diffusion LLM-based Framework for Speech Recognition
par: Tian, Wenjie, et autres
Publié: (2026) -
Efficient Scaling for LLM-based ASR
par: Mu, Bingshen, et autres
Publié: (2025)