Frontend Token Enhancement for Token-Based Speech Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ashihara, Takanori, Horiguchi, Shota, Matsuura, Kohei, Ochiai, Tsubasa, Delcroix, Marc |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Investigation of Speaker Representation for Target-Speaker Speech Processing
par: Ashihara, Takanori, et autres
Publié: (2024)
par: Ashihara, Takanori, et autres
Publié: (2024)
Alignment-Free Training for Transducer-based Multi-Talker ASR
par: Moriya, Takafumi, et autres
Publié: (2024)
par: Moriya, Takafumi, et autres
Publié: (2024)
TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models
par: Peng, Junyi, et autres
Publié: (2025)
par: Peng, Junyi, et autres
Publié: (2025)
What Do Self-Supervised Speech and Speaker Models Learn? New Findings From a Cross Model Layer-Wise Analysis
par: Ashihara, Takanori, et autres
Publié: (2024)
par: Ashihara, Takanori, et autres
Publié: (2024)
Generic Speech Enhancement with Self-Supervised Representation Space Loss
par: Sato, Hiroshi, et autres
Publié: (2025)
par: Sato, Hiroshi, et autres
Publié: (2025)
SpeechGLUE: How Well Can Self-Supervised Speech Models Capture Linguistic Knowledge?
par: Ashihara, Takanori, et autres
Publié: (2023)
par: Ashihara, Takanori, et autres
Publié: (2023)
Can We Really Repurpose Multi-Speaker ASR Corpus for Speaker Diarization?
par: Horiguchi, Shota, et autres
Publié: (2025)
par: Horiguchi, Shota, et autres
Publié: (2025)
Mitigating Non-Target Speaker Bias in Guided Speaker Embedding
par: Horiguchi, Shota, et autres
Publié: (2025)
par: Horiguchi, Shota, et autres
Publié: (2025)
Probing Self-supervised Learning Models with Target Speech Extraction
par: Peng, Junyi, et autres
Publié: (2024)
par: Peng, Junyi, et autres
Publié: (2024)
Lightweight Zero-shot Text-to-Speech with Mixture of Adapters
par: Fujita, Kenichi, et autres
Publié: (2024)
par: Fujita, Kenichi, et autres
Publié: (2024)
SpeakerBeam-SS: Real-time Target Speaker Extraction with Lightweight Conv-TasNet and State Space Modeling
par: Sato, Hiroshi, et autres
Publié: (2024)
par: Sato, Hiroshi, et autres
Publié: (2024)
Rethinking Processing Distortions: Disentangling the Impact of Speech Enhancement Errors on Speech Recognition Performance
par: Ochiai, Tsubasa, et autres
Publié: (2024)
par: Ochiai, Tsubasa, et autres
Publié: (2024)
Recursive Attentive Pooling for Extracting Speaker Embeddings from Multi-Speaker Recordings
par: Horiguchi, Shota, et autres
Publié: (2024)
par: Horiguchi, Shota, et autres
Publié: (2024)
Guided Speaker Embedding
par: Horiguchi, Shota, et autres
Publié: (2024)
par: Horiguchi, Shota, et autres
Publié: (2024)
Children's Speech Recognition through Discrete Token Enhancement
par: Sukhadia, Vrunda N., et autres
Publié: (2024)
par: Sukhadia, Vrunda N., et autres
Publié: (2024)
Microphone Array Signal Processing and Deep Learning for Speech Enhancement
par: Haeb-Umbach, Reinhold, et autres
Publié: (2025)
par: Haeb-Umbach, Reinhold, et autres
Publié: (2025)
Boosting Hybrid Autoregressive Transducer-based ASR with Internal Acoustic Model Training and Dual Blank Thresholding
par: Moriya, Takafumi, et autres
Publié: (2024)
par: Moriya, Takafumi, et autres
Publié: (2024)
Sentence-wise Speech Summarization: Task, Datasets, and End-to-End Modeling with LM Knowledge Distillation
par: Matsuura, Kohei, et autres
Publié: (2024)
par: Matsuura, Kohei, et autres
Publié: (2024)
Target Speech Extraction with Pre-trained Self-supervised Learning Models
par: Peng, Junyi, et autres
Publié: (2024)
par: Peng, Junyi, et autres
Publié: (2024)
Pretraining Multi-Speaker Identification for Neural Speaker Diarization
par: Horiguchi, Shota, et autres
Publié: (2025)
par: Horiguchi, Shota, et autres
Publié: (2025)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
par: Zhang, Xin, et autres
Publié: (2023)
par: Zhang, Xin, et autres
Publié: (2023)
Noise-robust zero-shot text-to-speech synthesis conditioned on self-supervised speech-representation model with adapters
par: Fujita, Kenichi, et autres
Publié: (2024)
par: Fujita, Kenichi, et autres
Publié: (2024)
Continuous Speech Tokenizer in Text To Speech
par: Li, Yixing, et autres
Publié: (2024)
par: Li, Yixing, et autres
Publié: (2024)
Array Geometry-Robust Attention-Based Neural Beamformer for Moving Speakers
par: Tammen, Marvin, et autres
Publié: (2024)
par: Tammen, Marvin, et autres
Publié: (2024)
Hypothesis Clustering and Merging: Novel MultiTalker Speech Recognition with Speaker Tokens
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
par: Kashiwagi, Yosuke, et autres
Publié: (2024)
STAB: Speech Tokenizer Assessment Benchmark
par: Vashishth, Shikhar, et autres
Publié: (2024)
par: Vashishth, Shikhar, et autres
Publié: (2024)
Next Tokens Denoising for Speech Synthesis
par: Liu, Yanqing, et autres
Publié: (2025)
par: Liu, Yanqing, et autres
Publié: (2025)
Factorized RVQ-GAN For Disentangled Speech Tokenization
par: Khurana, Sameer, et autres
Publié: (2025)
par: Khurana, Sameer, et autres
Publié: (2025)
Benchmarking Prosody Encoding in Discrete Speech Tokens
par: Onda, Kentaro, et autres
Publié: (2025)
par: Onda, Kentaro, et autres
Publié: (2025)
LAST: Language Model Aware Speech Tokenization
par: Turetzky, Arnon, et autres
Publié: (2024)
par: Turetzky, Arnon, et autres
Publié: (2024)
Applying LLMs for Rescoring N-best ASR Hypotheses of Casual Conversations: Effects of Domain Adaptation and Context Carry-over
par: Ogawa, Atsunori, et autres
Publié: (2024)
par: Ogawa, Atsunori, et autres
Publié: (2024)
Rethinking Discrete Speech Representation Tokens for Accent Generation
par: Zhong, Jinzuomu, et autres
Publié: (2026)
par: Zhong, Jinzuomu, et autres
Publié: (2026)
Factor-Conditioned Speaking-Style Captioning
par: Ando, Atsushi, et autres
Publié: (2024)
par: Ando, Atsushi, et autres
Publié: (2024)
Representing Speech Through Autoregressive Prediction of Cochlear Tokens
par: Tuckute, Greta, et autres
Publié: (2025)
par: Tuckute, Greta, et autres
Publié: (2025)
Mamba-based Segmentation Model for Speaker Diarization
par: Plaquet, Alexis, et autres
Publié: (2024)
par: Plaquet, Alexis, et autres
Publié: (2024)
Exploring the Effect of Segmentation and Vocabulary Size on Speech Tokenization for Speech Language Models
par: Kando, Shunsuke, et autres
Publié: (2025)
par: Kando, Shunsuke, et autres
Publié: (2025)
Interaural time difference loss for binaural target sound extraction
par: Hernandez-Olivan, Carlos, et autres
Publié: (2024)
par: Hernandez-Olivan, Carlos, et autres
Publié: (2024)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
par: Tseng, Liang-Hsuan, et autres
Publié: (2025)
par: Tseng, Liang-Hsuan, et autres
Publié: (2025)
FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
SoundBeam meets M2D: Target Sound Extraction with Audio Foundation Model
par: Hernandez-Olivan, Carlos, et autres
Publié: (2024)
par: Hernandez-Olivan, Carlos, et autres
Publié: (2024)
Documents similaires
-
Investigation of Speaker Representation for Target-Speaker Speech Processing
par: Ashihara, Takanori, et autres
Publié: (2024) -
Alignment-Free Training for Transducer-based Multi-Talker ASR
par: Moriya, Takafumi, et autres
Publié: (2024) -
TS-SUPERB: A Target Speech Processing Benchmark for Speech Self-Supervised Learning Models
par: Peng, Junyi, et autres
Publié: (2025) -
What Do Self-Supervised Speech and Speaker Models Learn? New Findings From a Cross Model Layer-Wise Analysis
par: Ashihara, Takanori, et autres
Publié: (2024) -
Generic Speech Enhancement with Self-Supervised Representation Space Loss
par: Sato, Hiroshi, et autres
Publié: (2025)