Improving Transducer-Based Spoken Language Understanding with Self-Conditioned CTC and Knowledge Transfer
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sunder, Vishal, Fosler-Lussier, Eric |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Fast Context-Biasing for CTC and Transducer ASR models with CTC-based Word Spotter
par: Andrusenko, Andrei, et autres
Publié: (2024)
par: Andrusenko, Andrei, et autres
Publié: (2024)
Analyzing the Importance of Blank for CTC-Based Knowledge Distillation
par: Hilmes, Benedikt, et autres
Publié: (2025)
par: Hilmes, Benedikt, et autres
Publié: (2025)
Music on the Move
par: Fosler-Lussier, Danielle
Publié: (2020)
par: Fosler-Lussier, Danielle
Publié: (2020)
Improving Neural Diarization through Speaker Attribute Attractors and Local Dependency Modeling
par: Palzer, David, et autres
Publié: (2025)
par: Palzer, David, et autres
Publié: (2025)
Improving Speech Recognition Error Prediction for Modern and Off-the-shelf Speech Recognizers
par: Serai, Prashant, et autres
Publié: (2024)
par: Serai, Prashant, et autres
Publié: (2024)
Spoken Language Understanding on Unseen Tasks With In-Context Learning
par: Agrawal, Neeraj, et autres
Publié: (2025)
par: Agrawal, Neeraj, et autres
Publié: (2025)
Privacy-Preserving End-to-End Spoken Language Understanding
par: Wang, Yinggui, et autres
Publié: (2024)
par: Wang, Yinggui, et autres
Publié: (2024)
CR-CTC: Consistency regularization on CTC for improved speech recognition
par: Yao, Zengwei, et autres
Publié: (2024)
par: Yao, Zengwei, et autres
Publié: (2024)
A Non-autoregressive Model for Joint STT and TTS
par: Sunder, Vishal, et autres
Publié: (2025)
par: Sunder, Vishal, et autres
Publié: (2025)
On Optimizing Multimodal Jailbreaks for Spoken Language Models
par: Krishnan, Aravind, et autres
Publié: (2026)
par: Krishnan, Aravind, et autres
Publié: (2026)
End-to-End Diarization utilizing Attractor Deep Clustering
par: Palzer, David, et autres
Publié: (2025)
par: Palzer, David, et autres
Publié: (2025)
Aligner-Encoders: Self-Attention Transformers Can Be Self-Transducers
par: Stooke, Adam, et autres
Publié: (2025)
par: Stooke, Adam, et autres
Publié: (2025)
In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions
par: Fan, Xulin, et autres
Publié: (2026)
par: Fan, Xulin, et autres
Publié: (2026)
Guiding Frame-Level CTC Alignments Using Self-knowledge Distillation
par: Kim, Eungbeom, et autres
Publié: (2024)
par: Kim, Eungbeom, et autres
Publié: (2024)
A Multi-Aspect Framework for Counter Narrative Evaluation using Large Language Models
par: Jones, Jaylen, et autres
Publié: (2024)
par: Jones, Jaylen, et autres
Publié: (2024)
Understanding Knowledge Transferability for Transfer Learning: A Survey
par: Wang, Haohua, et autres
Publié: (2025)
par: Wang, Haohua, et autres
Publié: (2025)
Transformers as Transducers
par: Strobl, Lena, et autres
Publié: (2024)
par: Strobl, Lena, et autres
Publié: (2024)
Label-Context-Dependent Internal Language Model Estimation for CTC
par: Yang, Zijian, et autres
Publié: (2025)
par: Yang, Zijian, et autres
Publié: (2025)
"KAN you hear me?" Exploring Kolmogorov-Arnold Networks for Spoken Language Understanding
par: Koudounas, Alkis, et autres
Publié: (2025)
par: Koudounas, Alkis, et autres
Publié: (2025)
CTC-DRO: Robust Optimization for Reducing Language Disparities in Speech Recognition
par: Bartelds, Martijn, et autres
Publié: (2025)
par: Bartelds, Martijn, et autres
Publié: (2025)
FlexCTC: GPU-powered CTC Beam Decoding With Advanced Contextual Abilities
par: Grigoryan, Lilit, et autres
Publié: (2025)
par: Grigoryan, Lilit, et autres
Publié: (2025)
The Magic Correlations: Understanding Knowledge Transfer from Pretraining to Supervised Fine-Tuning
par: Fan, Simin, et autres
Publié: (2026)
par: Fan, Simin, et autres
Publié: (2026)
Improving Hospital Risk Prediction with Knowledge-Augmented Multimodal EHR Modeling
par: Datta, Rituparna, et autres
Publié: (2025)
par: Datta, Rituparna, et autres
Publié: (2025)
Transduce: learning transduction grammars for string transformation
par: Frydman, Francis, et autres
Publié: (2023)
par: Frydman, Francis, et autres
Publié: (2023)
Cross-Representation Knowledge Transfer for Improved Sequential Recommendations
par: Gimranov, Artur, et autres
Publié: (2026)
par: Gimranov, Artur, et autres
Publié: (2026)
Enabling Asymmetric Knowledge Transfer in Multi-Task Learning with Self-Auxiliaries
par: Graffeuille, Olivier, et autres
Publié: (2024)
par: Graffeuille, Olivier, et autres
Publié: (2024)
Focused Discriminative Training For Streaming CTC-Trained Automatic Speech Recognition Models
par: Haider, Adnan, et autres
Publié: (2024)
par: Haider, Adnan, et autres
Publié: (2024)
A Variational Framework for Improving Naturalness in Generative Spoken Language Models
par: Chen, Li-Wei, et autres
Publié: (2025)
par: Chen, Li-Wei, et autres
Publié: (2025)
HAINAN: Fast and Accurate Transducer for Hybrid-Autoregressive ASR
par: Xu, Hainan, et autres
Publié: (2024)
par: Xu, Hainan, et autres
Publié: (2024)
Transfer of Structural Knowledge from Synthetic Languages
par: Budnikov, Mikhail, et autres
Publié: (2025)
par: Budnikov, Mikhail, et autres
Publié: (2025)
Exploring Fine-Tuning of Large Audio Language Models for Spoken Language Understanding under Limited Speech Data
par: Choi, Youngwon, et autres
Publié: (2025)
par: Choi, Youngwon, et autres
Publié: (2025)
SelfFed: Self-Supervised Federated Learning for Data Heterogeneity and Label Scarcity in Medical Images
par: Khowaja, Sunder Ali, et autres
Publié: (2023)
par: Khowaja, Sunder Ali, et autres
Publié: (2023)
Do LLM Decoders Listen Fairly? Benchmarking How Language Model Priors Shape Bias in Speech Recognition
par: Ginjala, Srishti, et autres
Publié: (2026)
par: Ginjala, Srishti, et autres
Publié: (2026)
Evaluating Spoken Language as a Biomarker for Automated Screening of Cognitive Impairment
par: Lima, Maria R., et autres
Publié: (2025)
par: Lima, Maria R., et autres
Publié: (2025)
Scaling Properties of Continuous Diffusion Spoken Language Models
par: Ramapuram, Jason, et autres
Publié: (2026)
par: Ramapuram, Jason, et autres
Publié: (2026)
Aligning Pre-trained Models for Spoken Language Translation
par: Sedláček, Šimon, et autres
Publié: (2024)
par: Sedláček, Šimon, et autres
Publié: (2024)
Chunk-wise Attention Transducers for Fast and Accurate Streaming Speech-to-Text
par: Xu, Hainan, et autres
Publié: (2026)
par: Xu, Hainan, et autres
Publié: (2026)
Noise May Contain Transferable Knowledge: Understanding Semi-supervised Heterogeneous Domain Adaptation from an Empirical Perspective
par: Yao, Yuan, et autres
Publié: (2025)
par: Yao, Yuan, et autres
Publié: (2025)
Understanding Task Transfer in Vision-Language Models
par: Sachdeva, Bhuvan, et autres
Publié: (2025)
par: Sachdeva, Bhuvan, et autres
Publié: (2025)
Multi-blank Transducers for Speech Recognition
par: Xu, Hainan, et autres
Publié: (2022)
par: Xu, Hainan, et autres
Publié: (2022)
Documents similaires
-
Fast Context-Biasing for CTC and Transducer ASR models with CTC-based Word Spotter
par: Andrusenko, Andrei, et autres
Publié: (2024) -
Analyzing the Importance of Blank for CTC-Based Knowledge Distillation
par: Hilmes, Benedikt, et autres
Publié: (2025) -
Music on the Move
par: Fosler-Lussier, Danielle
Publié: (2020) -
Improving Neural Diarization through Speaker Attribute Attractors and Local Dependency Modeling
par: Palzer, David, et autres
Publié: (2025) -
Improving Speech Recognition Error Prediction for Modern and Off-the-shelf Speech Recognizers
par: Serai, Prashant, et autres
Publié: (2024)