Less Peaky and More Accurate CTC Forced Alignment by Label Priors
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Ruizhe, Zhang, Xiaohui, Ni, Zhaoheng, Sun, Li, Hira, Moto, Hwang, Jeff, Manohar, Vimal, Pratap, Vineel, Wiesner, Matthew, Watanabe, Shinji, Povey, Daniel, Khudanpur, Sanjeev |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Improving Neural Biasing for Contextual Speech Recognition by Early Context Injection and Text Perturbation
par: Huang, Ruizhe, et autres
Publié: (2024)
par: Huang, Ruizhe, et autres
Publié: (2024)
Acoustic modeling for Overlapping Speech Recognition: JHU Chime-5 Challenge System
par: Manohar, Vimal, et autres
Publié: (2024)
par: Manohar, Vimal, et autres
Publié: (2024)
Improving Multilingual ASR in the Wild Using Simple N-best Re-ranking
par: Yan, Brian, et autres
Publié: (2024)
par: Yan, Brian, et autres
Publié: (2024)
HENT-SRT: Hierarchical Efficient Neural Transducer with Self-Distillation for Joint Speech Recognition and Translation
par: Hussein, Amir, et autres
Publié: (2025)
par: Hussein, Amir, et autres
Publié: (2025)
On Speaker Attribution with SURT
par: Raj, Desh, et autres
Publié: (2024)
par: Raj, Desh, et autres
Publié: (2024)
WST: Weakly Supervised Transducer for Automatic Speech Recognition
par: Gao, Dongji, et autres
Publié: (2025)
par: Gao, Dongji, et autres
Publié: (2025)
LV-CTC: Non-autoregressive ASR with CTC and latent variable models
par: Fujita, Yuya, et autres
Publié: (2024)
par: Fujita, Yuya, et autres
Publié: (2024)
Can LLMs Help Localize Fake Words in Partially Fake Speech?
par: Zhang, Lin, et autres
Publié: (2026)
par: Zhang, Lin, et autres
Publié: (2026)
Enhancing Code-Switching ASR Leveraging Non-Peaky CTC Loss and Deep Language Posterior Injection
par: Yang, Tzu-Ting, et autres
Publié: (2024)
par: Yang, Tzu-Ting, et autres
Publié: (2024)
Building Corpora for Single-Channel Speech Separation Across Multiple Domains
par: Maciejewski, Matthew, et autres
Publié: (2018)
par: Maciejewski, Matthew, et autres
Publié: (2018)
Scaling A Simple Approach to Zero-Shot Speech Recognition
par: Zhao, Jinming, et autres
Publié: (2024)
par: Zhao, Jinming, et autres
Publié: (2024)
Less is More: Data Curation Matters in Scaling Speech Enhancement
par: Li, Chenda, et autres
Publié: (2025)
par: Li, Chenda, et autres
Publié: (2025)
CR-CTC: Consistency regularization on CTC for improved speech recognition
par: Yao, Zengwei, et autres
Publié: (2024)
par: Yao, Zengwei, et autres
Publié: (2024)
Unsupervised Speech Enhancement using Data-defined Priors
par: Klement, Dominik, et autres
Publié: (2025)
par: Klement, Dominik, et autres
Publié: (2025)
Multi-Channel Multi-Speaker ASR Using Target Speaker's Solo Segment
par: Shao, Yiwen, et autres
Publié: (2024)
par: Shao, Yiwen, et autres
Publié: (2024)
Target Speaker ASR with Whisper
par: Polok, Alexander, et autres
Publié: (2024)
par: Polok, Alexander, et autres
Publié: (2024)
Modeling Overlapped Speech with Shuffles
par: Wiesner, Matthew, et autres
Publié: (2026)
par: Wiesner, Matthew, et autres
Publié: (2026)
Associativity-Peakiness Metric for Contingency Tables
par: Zirkind, Naomi E., et autres
Publié: (2026)
par: Zirkind, Naomi E., et autres
Publié: (2026)
Decoder-only Architecture for Speech Recognition with CTC Prompts and Text Data Augmentation
par: Tsunoo, Emiru, et autres
Publié: (2023)
par: Tsunoo, Emiru, et autres
Publié: (2023)
OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification
par: Peng, Yifan, et autres
Publié: (2024)
par: Peng, Yifan, et autres
Publié: (2024)
Clean Label Attacks against SLU Systems
par: Xinyuan, Henry Li, et autres
Publié: (2024)
par: Xinyuan, Henry Li, et autres
Publié: (2024)
SE-DiCoW: Self-Enrolled Diarization-Conditioned Whisper
par: Polok, Alexander, et autres
Publié: (2026)
par: Polok, Alexander, et autres
Publié: (2026)
Effects of Speaker Count, Duration, and Accent Diversity on Zero-Shot Accent Robustness in Low-Resource ASR
par: Yong, Zheng-Xin, et autres
Publié: (2025)
par: Yong, Zheng-Xin, et autres
Publié: (2025)
Joint Beam Search Integrating CTC, Attention, and Transducer Decoders
par: Sudo, Yui, et autres
Publié: (2024)
par: Sudo, Yui, et autres
Publié: (2024)
Improving Multilingual Speech Models on ML-SUPERB 2.0: Fine-tuning with Data Augmentation and LID-Aware CTC
par: Wang, Qingzheng, et autres
Publié: (2025)
par: Wang, Qingzheng, et autres
Publié: (2025)
kNN-CTC: Enhancing ASR via Retrieval of CTC Pseudo Labels
par: Zhou, Jiaming, et autres
Publié: (2023)
par: Zhou, Jiaming, et autres
Publié: (2023)
FeruzaSpeech: A 60 Hour Uzbek Read Speech Corpus with Punctuation, Casing, and Context
par: Povey, Anna, et autres
Publié: (2024)
par: Povey, Anna, et autres
Publié: (2024)
The Paradox Of Just-in-Time Liquidity in Decentralized Exchanges: More Providers Can Sometimes Mean Less Liquidity
par: Capponi, Agostino, et autres
Publié: (2023)
par: Capponi, Agostino, et autres
Publié: (2023)
SpatialEmb: Extract and Encode Spatial Information for 1-Stage Multi-channel Multi-speaker ASR on Arbitrary Microphone Arrays
par: Shao, Yiwen, et autres
Publié: (2026)
par: Shao, Yiwen, et autres
Publié: (2026)
The Gauss-Markov Adjunction Provides Categorical Semantics of Residuals in Supervised Learning
par: Kamiura, Moto
Publié: (2025)
par: Kamiura, Moto
Publié: (2025)
Less is More: Label-Guided Summarization of Procedural and Instructional Videos
par: Rajpal, Shreya, et autres
Publié: (2026)
par: Rajpal, Shreya, et autres
Publié: (2026)
Autonomous Agents and Policy Compliance: A Framework for Reasoning About Penalties
par: Tummala, Vineel, et autres
Publié: (2025)
par: Tummala, Vineel, et autres
Publié: (2025)
Doing Less for More: Consumer Search and Undertreatment in Credence Service Markets
par: Xu, Xiaoyan, et autres
Publié: (2025)
par: Xu, Xiaoyan, et autres
Publié: (2025)
Escape the Language Prior: Mitigating Late-Stage Modality Collapse in Audio Reasoning via Modality-Aware Policy Optimization
par: Xiao, Cihan, et autres
Publié: (2026)
par: Xiao, Cihan, et autres
Publié: (2026)
Less is More: Pseudo-Label Filtering for Continual Test-Time Adaptation
par: Tan, Jiayao, et autres
Publié: (2024)
par: Tan, Jiayao, et autres
Publié: (2024)
Less is More: Accurate Speech Recognition & Translation without Web-Scale Data
par: Puvvada, Krishna C., et autres
Publié: (2024)
par: Puvvada, Krishna C., et autres
Publié: (2024)
Less Is More: Fast and Accurate Reasoning with Cross-Head Unified Sparse Attention
par: Yang, Lijie, et autres
Publié: (2025)
par: Yang, Lijie, et autres
Publié: (2025)
Label-Context-Dependent Internal Language Model Estimation for CTC
par: Yang, Zijian, et autres
Publié: (2025)
par: Yang, Zijian, et autres
Publié: (2025)
LightBeam: An Accurate and Memory-Efficient CTC Decoder for Speech Neuroprostheses
par: Feghhi, Ebrahim, et autres
Publié: (2026)
par: Feghhi, Ebrahim, et autres
Publié: (2026)
Elementos de derecho / Efraín Moto Salazar, José Miguel Moto
par: Moto Salazar, Efraín
Publié: (2019)
par: Moto Salazar, Efraín
Publié: (2019)
Documents similaires
-
Improving Neural Biasing for Contextual Speech Recognition by Early Context Injection and Text Perturbation
par: Huang, Ruizhe, et autres
Publié: (2024) -
Acoustic modeling for Overlapping Speech Recognition: JHU Chime-5 Challenge System
par: Manohar, Vimal, et autres
Publié: (2024) -
Improving Multilingual ASR in the Wild Using Simple N-best Re-ranking
par: Yan, Brian, et autres
Publié: (2024) -
HENT-SRT: Hierarchical Efficient Neural Transducer with Self-Distillation for Joint Speech Recognition and Translation
par: Hussein, Amir, et autres
Publié: (2025) -
On Speaker Attribution with SURT
par: Raj, Desh, et autres
Publié: (2024)