A Unified Speech LLM for Diarization and Speech Recognition in Multilingual Conversations
Fuente:
arXiv
Salvato in:
| Autori principali: | Saengthong, Phurich, Jiaramaneepinit, Boonnithi, Li, Sheng, Okumura, Manabu, Shinozaki, Takahiro |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Deep Generic Representations for Domain-Generalized Anomalous Sound Detection
di: Saengthong, Phurich, et al.
Pubblicazione: (2024)
di: Saengthong, Phurich, et al.
Pubblicazione: (2024)
Active Learning with Task Adaptation Pre-training for Speech Emotion Recognition
di: Li, Dongyuan, et al.
Pubblicazione: (2024)
di: Li, Dongyuan, et al.
Pubblicazione: (2024)
Efficient Streaming LLM for Speech Recognition
di: Jia, Junteng, et al.
Pubblicazione: (2024)
di: Jia, Junteng, et al.
Pubblicazione: (2024)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
di: Ma, Ziyang, et al.
Pubblicazione: (2023)
di: Ma, Ziyang, et al.
Pubblicazione: (2023)
Emotional Text-To-Speech Based on Mutual-Information-Guided Emotion-Timbre Disentanglement
di: Yang, Jianing, et al.
Pubblicazione: (2025)
di: Yang, Jianing, et al.
Pubblicazione: (2025)
SpeechComposer: Unifying Multiple Speech Tasks with Prompt Composition
di: Wu, Yihan, et al.
Pubblicazione: (2024)
di: Wu, Yihan, et al.
Pubblicazione: (2024)
Speech ReaLLM -- Real-time Streaming Speech Recognition with Multimodal LLMs by Teaching the Flow of Time
di: Seide, Frank, et al.
Pubblicazione: (2024)
di: Seide, Frank, et al.
Pubblicazione: (2024)
Open ASR Leaderboard: Towards Reproducible and Transparent Multilingual and Long-Form Speech Recognition Evaluation
di: Srivastav, Vaibhav, et al.
Pubblicazione: (2025)
di: Srivastav, Vaibhav, et al.
Pubblicazione: (2025)
Efficient Compression of Multitask Multilingual Speech Models
di: Ferraz, Thomas Palmeira
Pubblicazione: (2024)
di: Ferraz, Thomas Palmeira
Pubblicazione: (2024)
Toward Conversational Hungarian Speech Recognition: Introducing the BEA-Large and BEA-Dialogue Datasets
di: Gedeon, Máté, et al.
Pubblicazione: (2025)
di: Gedeon, Máté, et al.
Pubblicazione: (2025)
Unifying Speech Recognition, Synthesis and Conversion with Autoregressive Transformers
di: Cai, Runyuan, et al.
Pubblicazione: (2026)
di: Cai, Runyuan, et al.
Pubblicazione: (2026)
EmoBox: Multilingual Multi-corpus Speech Emotion Recognition Toolkit and Benchmark
di: Ma, Ziyang, et al.
Pubblicazione: (2024)
di: Ma, Ziyang, et al.
Pubblicazione: (2024)
Adapting Whisper for Parameter-efficient Code-Switching Speech Recognition via Soft Prompt Tuning
di: Yang, Hongli, et al.
Pubblicazione: (2025)
di: Yang, Hongli, et al.
Pubblicazione: (2025)
The TEA-ASLP System for Multilingual Conversational Speech Recognition and Speech Diarization in MLC-SLM 2025 Challenge
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
di: Xue, Hongfei, et al.
Pubblicazione: (2025)
Adapting Foundation Speech Recognition Models to Impaired Speech: A Semantic Re-chaining Approach for Personalization of German Speech
di: Pokel, Niclas, et al.
Pubblicazione: (2025)
di: Pokel, Niclas, et al.
Pubblicazione: (2025)
Ming-UniAudio: Speech LLM for Joint Understanding, Generation and Editing with Unified Representation
di: Yan, Canxiang, et al.
Pubblicazione: (2025)
di: Yan, Canxiang, et al.
Pubblicazione: (2025)
KidSpeak: A General Multi-purpose LLM for Kids' Speech Recognition and Screening
di: Sharma, Rohan, et al.
Pubblicazione: (2025)
di: Sharma, Rohan, et al.
Pubblicazione: (2025)
Luganda Speech Intent Recognition for IoT Applications
di: Katumba, Andrew, et al.
Pubblicazione: (2024)
di: Katumba, Andrew, et al.
Pubblicazione: (2024)
Dual Information Speech Language Models for Emotional Conversations
di: Wang, Chun, et al.
Pubblicazione: (2025)
di: Wang, Chun, et al.
Pubblicazione: (2025)
FLEURS-R: A Restored Multilingual Speech Corpus for Generation Tasks
di: Ma, Min, et al.
Pubblicazione: (2024)
di: Ma, Min, et al.
Pubblicazione: (2024)
Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition
di: Kocour, Martin, et al.
Pubblicazione: (2025)
di: Kocour, Martin, et al.
Pubblicazione: (2025)
TransVIP: Speech to Speech Translation System with Voice and Isochrony Preservation
di: Le, Chenyang, et al.
Pubblicazione: (2024)
di: Le, Chenyang, et al.
Pubblicazione: (2024)
Regularized Federated Learning for Privacy-Preserving Dysarthric and Elderly Speech Recognition
di: Zhong, Tao, et al.
Pubblicazione: (2025)
di: Zhong, Tao, et al.
Pubblicazione: (2025)
Improved Contextual Recognition In Automatic Speech Recognition Systems By Semantic Lattice Rescoring
di: Sudarshan, Ankitha, et al.
Pubblicazione: (2023)
di: Sudarshan, Ankitha, et al.
Pubblicazione: (2023)
VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs
di: Zhang, Hezhao, et al.
Pubblicazione: (2026)
di: Zhang, Hezhao, et al.
Pubblicazione: (2026)
An Effective Context-Balanced Adaptation Approach for Long-Tailed Speech Recognition
di: Wang, Yi-Cheng, et al.
Pubblicazione: (2024)
di: Wang, Yi-Cheng, et al.
Pubblicazione: (2024)
SimClass: A Classroom Speech Dataset Generated via Game Engine Simulation For Automatic Speech Recognition Research
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2025)
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2025)
Cross-Speaker Encoding Network for Multi-Talker Speech Recognition
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
Benchmarking Automatic Speech Recognition for Indian Languages in Agricultural Contexts
di: S, Chandrashekar M, et al.
Pubblicazione: (2026)
di: S, Chandrashekar M, et al.
Pubblicazione: (2026)
DiariST: Streaming Speech Translation with Speaker Diarization
di: Yang, Mu, et al.
Pubblicazione: (2023)
di: Yang, Mu, et al.
Pubblicazione: (2023)
Cross-lingual Embedding Clustering for Hierarchical Softmax in Low-Resource Multilingual Speech Recognition
di: Yang, Zhengdong, et al.
Pubblicazione: (2025)
di: Yang, Zhengdong, et al.
Pubblicazione: (2025)
StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task Learning
di: Zhang, Shaolei, et al.
Pubblicazione: (2024)
di: Zhang, Shaolei, et al.
Pubblicazione: (2024)
The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition
di: Gao, Ming, et al.
Pubblicazione: (2025)
di: Gao, Ming, et al.
Pubblicazione: (2025)
Channel-Aware Domain-Adaptive Generative Adversarial Network for Robust Speech Recognition
di: Wang, Chien-Chun, et al.
Pubblicazione: (2024)
di: Wang, Chien-Chun, et al.
Pubblicazione: (2024)
STTATTS: Unified Speech-To-Text And Text-To-Speech Model
di: Toyin, Hawau Olamide, et al.
Pubblicazione: (2024)
di: Toyin, Hawau Olamide, et al.
Pubblicazione: (2024)
TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment
di: Kim, Taesoo, et al.
Pubblicazione: (2025)
di: Kim, Taesoo, et al.
Pubblicazione: (2025)
Improving Child Speech Recognition and Reading Mistake Detection by Using Prompts
di: Gao, Lingyun, et al.
Pubblicazione: (2025)
di: Gao, Lingyun, et al.
Pubblicazione: (2025)
RAG-Boost: Retrieval-Augmented Generation Enhanced LLM-based Speech Recognition
di: Wang, Pengcheng, et al.
Pubblicazione: (2025)
di: Wang, Pengcheng, et al.
Pubblicazione: (2025)
Indonesian-English Code-Switching Speech Synthesizer Utilizing Multilingual STEN-TTS and Bert LID
di: Handoyo, Ahmad Alfani, et al.
Pubblicazione: (2024)
di: Handoyo, Ahmad Alfani, et al.
Pubblicazione: (2024)
Seamless Dysfluent Speech Text Alignment for Disordered Speech Analysis
di: Ye, Zongli, et al.
Pubblicazione: (2025)
di: Ye, Zongli, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Deep Generic Representations for Domain-Generalized Anomalous Sound Detection
di: Saengthong, Phurich, et al.
Pubblicazione: (2024) -
Active Learning with Task Adaptation Pre-training for Speech Emotion Recognition
di: Li, Dongyuan, et al.
Pubblicazione: (2024) -
Efficient Streaming LLM for Speech Recognition
di: Jia, Junteng, et al.
Pubblicazione: (2024) -
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
di: Ma, Ziyang, et al.
Pubblicazione: (2023) -
Emotional Text-To-Speech Based on Mutual-Information-Guided Emotion-Timbre Disentanglement
di: Yang, Jianing, et al.
Pubblicazione: (2025)