META-CAT: Speaker-Informed Speech Embeddings via Meta Information Concatenation for Multi-talker ASR
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Jinhan, Wang, Weiqing, Dhawan, Kunal, Park, Taejin, Kim, Myungjong, Medennikov, Ivan, Huang, He, Koluguri, Nithin, Balam, Jagadeesh, Ginsburg, Boris |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Speaker Targeting via Self-Speaker Adaptation for Multi-talker ASR
par: Wang, Weiqing, et autres
Publié: (2025)
par: Wang, Weiqing, et autres
Publié: (2025)
Streaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering
par: Medennikov, Ivan, et autres
Publié: (2025)
par: Medennikov, Ivan, et autres
Publié: (2025)
Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems
par: Park, Taejin, et autres
Publié: (2024)
par: Park, Taejin, et autres
Publié: (2024)
Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR
par: Wang, Weiqing, et autres
Publié: (2024)
par: Wang, Weiqing, et autres
Publié: (2024)
NEST: Self-supervised Fast Conformer as All-purpose Seasoning to Speech Processing Tasks
par: Huang, He, et autres
Publié: (2024)
par: Huang, He, et autres
Publié: (2024)
Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations
par: Dhawan, Kunal, et autres
Publié: (2024)
par: Dhawan, Kunal, et autres
Publié: (2024)
Training and Inference Efficiency of Encoder-Decoder Speech Models
par: Żelasko, Piotr, et autres
Publié: (2025)
par: Żelasko, Piotr, et autres
Publié: (2025)
SPGISpeech 2.0: Transcribed multi-speaker financial audio for speaker-tagged transcription
par: Grossman, Raymond, et autres
Publié: (2025)
par: Grossman, Raymond, et autres
Publié: (2025)
Longer is (Not Necessarily) Stronger: Punctuated Long-Sequence Training for Enhanced Speech Recognition and Translation
par: Koluguri, Nithin Rao, et autres
Publié: (2024)
par: Koluguri, Nithin Rao, et autres
Publié: (2024)
Flexible Multichannel Speech Enhancement for Noise-Robust Frontend
par: Jukić, Ante, et autres
Publié: (2024)
par: Jukić, Ante, et autres
Publié: (2024)
Canary-1B-v2 & Parakeet-TDT-0.6B-v3: Efficient and High-Performance Models for Multilingual ASR and AST
par: Sekoyan, Monica, et autres
Publié: (2025)
par: Sekoyan, Monica, et autres
Publié: (2025)
Spectral Codecs: Improving Non-Autoregressive Speech Synthesis with Spectrogram-Based Audio Codecs
par: Langman, Ryan, et autres
Publié: (2024)
par: Langman, Ryan, et autres
Publié: (2024)
Schrödinger Bridge for Generative Speech Enhancement
par: Jukić, Ante, et autres
Publié: (2024)
par: Jukić, Ante, et autres
Publié: (2024)
Less is More: Accurate Speech Recognition & Translation without Web-Scale Data
par: Puvvada, Krishna C., et autres
Publié: (2024)
par: Puvvada, Krishna C., et autres
Publié: (2024)
BESTOW: Efficient and Streamable Speech Language Model with the Best of Two Worlds in GPT and T5
par: Chen, Zhehuai, et autres
Publié: (2024)
par: Chen, Zhehuai, et autres
Publié: (2024)
Word Level Timestamp Generation for Automatic Speech Recognition and Translation
par: Hu, Ke, et autres
Publié: (2025)
par: Hu, Ke, et autres
Publié: (2025)
Stateful Conformer with Cache-based Inference for Streaming Automatic Speech Recognition
par: Noroozi, Vahid, et autres
Publié: (2023)
par: Noroozi, Vahid, et autres
Publié: (2023)
VoiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech-Text Supervised Fine-Tuning
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
Granary: Speech Recognition and Translation Dataset in 25 European Languages
par: Koluguri, Nithin Rao, et autres
Publié: (2025)
par: Koluguri, Nithin Rao, et autres
Publié: (2025)
Instruction Data Generation and Unsupervised Adaptation for Speech Language Models
par: Noroozi, Vahid, et autres
Publié: (2024)
par: Noroozi, Vahid, et autres
Publié: (2024)
Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer
par: Burchi, Maxime, et autres
Publié: (2024)
par: Burchi, Maxime, et autres
Publié: (2024)
Mind the Gap: Impact of Synthetic Conversational Data on Multi-Talker ASR and Speaker Diarization
par: Polok, Alexander, et autres
Publié: (2026)
par: Polok, Alexander, et autres
Publié: (2026)
Large Language Model Based Generative Error Correction: A Challenge and Baselines for Speech Recognition, Speaker Tagging, and Emotion Recognition
par: Yang, Chao-Han Huck, et autres
Publié: (2024)
par: Yang, Chao-Han Huck, et autres
Publié: (2024)
Advancing Multi-talker ASR Performance with Large Language Models
par: Shi, Mohan, et autres
Publié: (2024)
par: Shi, Mohan, et autres
Publié: (2024)
SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model
par: Hu, Ke, et autres
Publié: (2025)
par: Hu, Ke, et autres
Publié: (2025)
DeSTA2: Developing Instruction-Following Speech Language Model Without Speech Instruction-Tuning Data
par: Lu, Ke-Han, et autres
Publié: (2024)
par: Lu, Ke-Han, et autres
Publié: (2024)
Text-aware Speech Separation for Multi-talker Keyword Spotting
par: Li, Haoyu, et autres
Publié: (2024)
par: Li, Haoyu, et autres
Publié: (2024)
Open ASR Leaderboard: Towards Reproducible and Transparent Multilingual and Long-Form Speech Recognition Evaluation
par: Srivastav, Vaibhav, et autres
Publié: (2025)
par: Srivastav, Vaibhav, et autres
Publié: (2025)
Elevating Robust Multi-Talker ASR by Decoupling Speaker Separation and Speech Recognition
par: Yang, Yufeng, et autres
Publié: (2025)
par: Yang, Yufeng, et autres
Publié: (2025)
Transducers with Pronunciation-aware Embeddings for Automatic Speech Recognition
par: Xu, Hainan, et autres
Publié: (2024)
par: Xu, Hainan, et autres
Publié: (2024)
Word Error Rate Definitions and Algorithms for Long-Form Multi-talker Speech Recognition
par: von Neumann, Thilo, et autres
Publié: (2025)
par: von Neumann, Thilo, et autres
Publié: (2025)
MSU-Bench: Towards Understanding the Conversational Multi-talker Scenarios
par: Wang, Shuai, et autres
Publié: (2025)
par: Wang, Shuai, et autres
Publié: (2025)
EMMeTT: Efficient Multimodal Machine Translation Training
par: Żelasko, Piotr, et autres
Publié: (2024)
par: Żelasko, Piotr, et autres
Publié: (2024)
Romanization Encoding For Multilingual ASR
par: Ding, Wen, et autres
Publié: (2024)
par: Ding, Wen, et autres
Publié: (2024)
Target Speaker ASR with Whisper
par: Polok, Alexander, et autres
Publié: (2024)
par: Polok, Alexander, et autres
Publié: (2024)
Multi-Channel Multi-Speaker ASR Using Target Speaker's Solo Segment
par: Shao, Yiwen, et autres
Publié: (2024)
par: Shao, Yiwen, et autres
Publié: (2024)
Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR
par: Ma, Hao, et autres
Publié: (2025)
par: Ma, Hao, et autres
Publié: (2025)
Speaker-Smoothed kNN Speaker Adaptation for End-to-End ASR
par: Li, Shaojun, et autres
Publié: (2024)
par: Li, Shaojun, et autres
Publié: (2024)
What Does the Speaker Embedding Encode?
par: Wang, Shuai, et autres
Publié: (2025)
par: Wang, Shuai, et autres
Publié: (2025)
Listening to Multi-talker Conversations: Modular and End-to-end Perspectives
par: Raj, Desh
Publié: (2024)
par: Raj, Desh
Publié: (2024)
Documents similaires
-
Speaker Targeting via Self-Speaker Adaptation for Multi-talker ASR
par: Wang, Weiqing, et autres
Publié: (2025) -
Streaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering
par: Medennikov, Ivan, et autres
Publié: (2025) -
Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems
par: Park, Taejin, et autres
Publié: (2024) -
Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR
par: Wang, Weiqing, et autres
Publié: (2024) -
NEST: Self-supervised Fast Conformer as All-purpose Seasoning to Speech Processing Tasks
par: Huang, He, et autres
Publié: (2024)