Streaming Speaker Change Detection and Gender Classification for Transducer-Based Multi-Talker Speech Translation
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Peidong, Kanda, Naoyuki, Xue, Jian, Li, Jinyu, Wang, Xiaofei, Subramanian, Aswin Shanmugam, Chen, Junkun, Sivasankaran, Sunit, Xiao, Xiong, Zhao, Yong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DiariST: Streaming Speech Translation with Speaker Diarization
por: Yang, Mu, et al.
Publicado: (2023)
por: Yang, Mu, et al.
Publicado: (2023)
Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios
por: Subramanian, Aswin Shanmugam, et al.
Publicado: (2025)
por: Subramanian, Aswin Shanmugam, et al.
Publicado: (2025)
Soft Language Identification for Language-Agnostic Many-to-One End-to-End Speech Translation
por: Wang, Peidong, et al.
Publicado: (2024)
por: Wang, Peidong, et al.
Publicado: (2024)
PHRASED: Phrase Dictionary Biasing for Speech Translation
por: Wang, Peidong, et al.
Publicado: (2025)
por: Wang, Peidong, et al.
Publicado: (2025)
TS-SEP: Joint Diarization and Separation Conditioned on Estimated Speaker Embeddings
por: Boeddeker, Christoph, et al.
Publicado: (2023)
por: Boeddeker, Christoph, et al.
Publicado: (2023)
Scaling Multi-Talker ASR with Speaker-Agnostic Activity Streams
por: He, Xiluo, et al.
Publicado: (2025)
por: He, Xiluo, et al.
Publicado: (2025)
Profile-Error-Tolerant Target-Speaker Voice Activity Detection
por: Wang, Dongmei, et al.
Publicado: (2023)
por: Wang, Dongmei, et al.
Publicado: (2023)
Elevating Robust Multi-Talker ASR by Decoupling Speaker Separation and Speech Recognition
por: Yang, Yufeng, et al.
Publicado: (2025)
por: Yang, Yufeng, et al.
Publicado: (2025)
Length Aware Speech Translation for Video Dubbing
por: Chadha, Harveen Singh, et al.
Publicado: (2025)
por: Chadha, Harveen Singh, et al.
Publicado: (2025)
Multichannel Long-Term Streaming Neural Speech Enhancement for Static and Moving Speakers
por: Quan, Changsheng, et al.
Publicado: (2024)
por: Quan, Changsheng, et al.
Publicado: (2024)
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
por: Kang, Jiawen, et al.
Publicado: (2024)
por: Kang, Jiawen, et al.
Publicado: (2024)
Target word activity detector: An approach to obtain ASR word boundaries without lexicon
por: Sivasankaran, Sunit, et al.
Publicado: (2024)
por: Sivasankaran, Sunit, et al.
Publicado: (2024)
Advanced Long-Content Speech Recognition With Factorized Neural Transducer
por: Gong, Xun, et al.
Publicado: (2024)
por: Gong, Xun, et al.
Publicado: (2024)
Speaker-Distinguishable CTC: Learning Speaker Distinction Using CTC for Multi-Talker Speech Recognition
por: Sakuma, Asahi, et al.
Publicado: (2025)
por: Sakuma, Asahi, et al.
Publicado: (2025)
Hypothesis Clustering and Merging: Novel MultiTalker Speech Recognition with Speaker Tokens
por: Kashiwagi, Yosuke, et al.
Publicado: (2024)
por: Kashiwagi, Yosuke, et al.
Publicado: (2024)
Alignment-Free Training for Transducer-based Multi-Talker ASR
por: Moriya, Takafumi, et al.
Publicado: (2024)
por: Moriya, Takafumi, et al.
Publicado: (2024)
SA-SOT: Speaker-Aware Serialized Output Training for Multi-Talker ASR
por: Fan, Zhiyun, et al.
Publicado: (2024)
por: Fan, Zhiyun, et al.
Publicado: (2024)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
por: Li, Jiaqi, et al.
Publicado: (2024)
por: Li, Jiaqi, et al.
Publicado: (2024)
Emotion Neural Transducer for Fine-Grained Speech Emotion Recognition
por: Shen, Siyuan, et al.
Publicado: (2024)
por: Shen, Siyuan, et al.
Publicado: (2024)
Empowering Whisper as a Joint Multi-Talker and Target-Talker Speech Recognition System
por: Meng, Lingwei, et al.
Publicado: (2024)
por: Meng, Lingwei, et al.
Publicado: (2024)
Cross-Speaker Encoding Network for Multi-Talker Speech Recognition
por: Kang, Jiawen, et al.
Publicado: (2024)
por: Kang, Jiawen, et al.
Publicado: (2024)
SpeechX: Neural Codec Language Model as a Versatile Speech Transformer
por: Wang, Xiaofei, et al.
Publicado: (2023)
por: Wang, Xiaofei, et al.
Publicado: (2023)
Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis
por: Hu, Yifan, et al.
Publicado: (2025)
por: Hu, Yifan, et al.
Publicado: (2025)
Streaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering
por: Medennikov, Ivan, et al.
Publicado: (2025)
por: Medennikov, Ivan, et al.
Publicado: (2025)
VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech
por: Du, Chenpeng, et al.
Publicado: (2024)
por: Du, Chenpeng, et al.
Publicado: (2024)
LibriheavyMix: A 20,000-Hour Dataset for Single-Channel Reverberant Multi-Talker Speech Separation, ASR and Speaker Diarization
por: Jin, Zengrui, et al.
Publicado: (2024)
por: Jin, Zengrui, et al.
Publicado: (2024)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
por: Fu, Ruibo, et al.
Publicado: (2024)
por: Fu, Ruibo, et al.
Publicado: (2024)
CUSIDE-T: Chunking, Simulating Future and Decoding for Transducer based Streaming ASR
por: Zhao, Wenbo, et al.
Publicado: (2024)
por: Zhao, Wenbo, et al.
Publicado: (2024)
SecureSpeech: Prompt-based Speaker and Content Protection
por: Hui, Belinda Soh Hui, et al.
Publicado: (2025)
por: Hui, Belinda Soh Hui, et al.
Publicado: (2025)
Preserving Speaker Information in Direct Speech-to-Speech Translation with Non-Autoregressive Generation and Pretraining
por: Zhou, Rui, et al.
Publicado: (2024)
por: Zhou, Rui, et al.
Publicado: (2024)
Summary of the NOTSOFAR-1 Challenge: Highlights and Learnings
por: Abramovski, Igor, et al.
Publicado: (2025)
por: Abramovski, Igor, et al.
Publicado: (2025)
Enhancing Speaker-Independent Dysarthric Speech Severity Classification with DSSCNet and Cross-Corpus Adaptation
por: Roy, Arnab Kumar, et al.
Publicado: (2025)
por: Roy, Arnab Kumar, et al.
Publicado: (2025)
FastTalker: Jointly Generating Speech and Conversational Gestures from Text
por: Guo, Zixin, et al.
Publicado: (2024)
por: Guo, Zixin, et al.
Publicado: (2024)
Disentangling Dual-Encoder Masked Autoencoder for Respiratory Sound Classification
por: Wei, Peidong, et al.
Publicado: (2025)
por: Wei, Peidong, et al.
Publicado: (2025)
Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction
por: Dai, Wang, et al.
Publicado: (2025)
por: Dai, Wang, et al.
Publicado: (2025)
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
por: Park, Nohil, et al.
Publicado: (2024)
por: Park, Nohil, et al.
Publicado: (2024)
Attractor-Based Speech Separation of Multiple Utterances by Unknown Number of Speakers
por: Wang, Yuzhu, et al.
Publicado: (2025)
por: Wang, Yuzhu, et al.
Publicado: (2025)
Beyond Speaker Identity: Text Guided Target Speech Extraction
por: Huo, Mingyue, et al.
Publicado: (2025)
por: Huo, Mingyue, et al.
Publicado: (2025)
DialoSpeech: Dual-Speaker Dialogue Generation with LLM and Flow Matching
por: Xie, Hanke, et al.
Publicado: (2025)
por: Xie, Hanke, et al.
Publicado: (2025)
MSLM-S2ST: A Multitask Speech Language Model for Textless Speech-to-Speech Translation with Speaker Style Preservation
por: Peng, Yifan, et al.
Publicado: (2024)
por: Peng, Yifan, et al.
Publicado: (2024)
Ejemplares similares
-
DiariST: Streaming Speech Translation with Speaker Diarization
por: Yang, Mu, et al.
Publicado: (2023) -
Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios
por: Subramanian, Aswin Shanmugam, et al.
Publicado: (2025) -
Soft Language Identification for Language-Agnostic Many-to-One End-to-End Speech Translation
por: Wang, Peidong, et al.
Publicado: (2024) -
PHRASED: Phrase Dictionary Biasing for Speech Translation
por: Wang, Peidong, et al.
Publicado: (2025) -
TS-SEP: Joint Diarization and Separation Conditioned on Estimated Speaker Embeddings
por: Boeddeker, Christoph, et al.
Publicado: (2023)