HAINAN: Fast and Accurate Transducer for Hybrid-Autoregressive ASR
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Hainan, Bartley, Travis M., Bataev, Vladimir, Ginsburg, Boris |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Chunk-wise Attention Transducers for Fast and Accurate Streaming Speech-to-Text
par: Xu, Hainan, et autres
Publié: (2026)
par: Xu, Hainan, et autres
Publié: (2026)
Pushing the Limits of Beam Search Decoding for Transducer-based ASR models
par: Grigoryan, Lilit, et autres
Publié: (2025)
par: Grigoryan, Lilit, et autres
Publié: (2025)
Label-Looping: Highly Efficient Decoding for Transducers
par: Bataev, Vladimir, et autres
Publié: (2024)
par: Bataev, Vladimir, et autres
Publié: (2024)
Fast Context-Biasing for CTC and Transducer ASR models with CTC-based Word Spotter
par: Andrusenko, Andrei, et autres
Publié: (2024)
par: Andrusenko, Andrei, et autres
Publié: (2024)
WIND: Accelerated RNN-T Decoding with Windowed Inference for Non-blank Detection
par: Xu, Hainan, et autres
Publié: (2025)
par: Xu, Hainan, et autres
Publié: (2025)
Transducers with Pronunciation-aware Embeddings for Automatic Speech Recognition
par: Xu, Hainan, et autres
Publié: (2024)
par: Xu, Hainan, et autres
Publié: (2024)
Multi-blank Transducers for Speech Recognition
par: Xu, Hainan, et autres
Publié: (2022)
par: Xu, Hainan, et autres
Publié: (2022)
RNN-Transducer-based Losses for Speech Recognition on Noisy Targets
par: Bataev, Vladimir
Publié: (2025)
par: Bataev, Vladimir
Publié: (2025)
Text-only domain adaptation for end-to-end ASR using integrated text-to-mel-spectrogram generator
par: Bataev, Vladimir, et autres
Publié: (2023)
par: Bataev, Vladimir, et autres
Publié: (2023)
Speed of Light Exact Greedy Decoding for RNN-T Speech Recognition Models on GPU
par: Galvez, Daniel, et autres
Publié: (2024)
par: Galvez, Daniel, et autres
Publié: (2024)
NGPU-LM: GPU-Accelerated N-Gram Language Model for Context-Biasing in Greedy ASR Decoding
par: Bataev, Vladimir, et autres
Publié: (2025)
par: Bataev, Vladimir, et autres
Publié: (2025)
Reducing the Offline-Streaming Gap for Unified ASR Transducer with Consistency Regularization
par: Andrusenko, Andrei, et autres
Publié: (2026)
par: Andrusenko, Andrei, et autres
Publié: (2026)
FlexCTC: GPU-powered CTC Beam Decoding With Advanced Contextual Abilities
par: Grigoryan, Lilit, et autres
Publié: (2025)
par: Grigoryan, Lilit, et autres
Publié: (2025)
TurboBias: Universal ASR Context-Biasing powered by GPU-accelerated Phrase-Boosting Tree
par: Andrusenko, Andrei, et autres
Publié: (2025)
par: Andrusenko, Andrei, et autres
Publié: (2025)
TTS-Transducer: End-to-End Speech Synthesis with Neural Transducer
par: Bataev, Vladimir, et autres
Publié: (2025)
par: Bataev, Vladimir, et autres
Publié: (2025)
Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations
par: Dhawan, Kunal, et autres
Publié: (2024)
par: Dhawan, Kunal, et autres
Publié: (2024)
Romanization Encoding For Multilingual ASR
par: Ding, Wen, et autres
Publié: (2024)
par: Ding, Wen, et autres
Publié: (2024)
Longer is (Not Necessarily) Stronger: Punctuated Long-Sequence Training for Enhanced Speech Recognition and Translation
par: Koluguri, Nithin Rao, et autres
Publié: (2024)
par: Koluguri, Nithin Rao, et autres
Publié: (2024)
TDT-KWS: Fast And Accurate Keyword Spotting Using Token-and-duration Transducer
par: Xi, Yu, et autres
Publié: (2024)
par: Xi, Yu, et autres
Publié: (2024)
Star Attention: Efficient LLM Inference over Long Sequences
par: Acharya, Shantanu, et autres
Publié: (2024)
par: Acharya, Shantanu, et autres
Publié: (2024)
Fast and Interpretable Autoregressive Estimation with Neural Network Backpropagation
par: Lucena, Anaísa, et autres
Publié: (2026)
par: Lucena, Anaísa, et autres
Publié: (2026)
Transformers as Transducers
par: Strobl, Lena, et autres
Publié: (2024)
par: Strobl, Lena, et autres
Publié: (2024)
Fast and Accurate Probing of In-Training LLMs' Downstream Performances
par: Liu, Zhichen, et autres
Publié: (2026)
par: Liu, Zhichen, et autres
Publié: (2026)
Fast Graph Generation via Autoregressive Noisy Filtration Modeling
par: Krimmel, Markus, et autres
Publié: (2025)
par: Krimmel, Markus, et autres
Publié: (2025)
Transduce: learning transduction grammars for string transformation
par: Frydman, Francis, et autres
Publié: (2023)
par: Frydman, Francis, et autres
Publié: (2023)
nGPT: Normalized Transformer with Representation Learning on the Hypersphere
par: Loshchilov, Ilya, et autres
Publié: (2024)
par: Loshchilov, Ilya, et autres
Publié: (2024)
Fast, Accurate and Interpretable Graph Classification with Topological Kernels
par: Wesołowski, Adam, et autres
Publié: (2025)
par: Wesołowski, Adam, et autres
Publié: (2025)
Retrieval from Within: An Intrinsic Capability of Attention-Based Models
par: Hoffer, Elad, et autres
Publié: (2026)
par: Hoffer, Elad, et autres
Publié: (2026)
Normalized Architectures are Natively 4-Bit
par: Fishman, Maxim, et autres
Publié: (2026)
par: Fishman, Maxim, et autres
Publié: (2026)
Workspace Optimization: How to Train Your Agent
par: Sarafian, Elad, et autres
Publié: (2026)
par: Sarafian, Elad, et autres
Publié: (2026)
Rock the KASBA: Blazingly Fast and Accurate Time Series Clustering
par: Holder, Christopher, et autres
Publié: (2024)
par: Holder, Christopher, et autres
Publié: (2024)
FASP: Fast and Accurate Structured Pruning of Large Language Models
par: Hu, Hanyu, et autres
Publié: (2025)
par: Hu, Hanyu, et autres
Publié: (2025)
Asynchronous Sharpness-Aware Minimization For Fast and Accurate Deep Learning
par: Jo, Junhyuk, et autres
Publié: (2025)
par: Jo, Junhyuk, et autres
Publié: (2025)
Fast Autoregressive Models for Continuous Latent Generation
par: Hang, Tiankai, et autres
Publié: (2025)
par: Hang, Tiankai, et autres
Publié: (2025)
Generalizable, Fast, and Accurate DeepQSPR with fastprop
par: Burns, Jackson, et autres
Publié: (2024)
par: Burns, Jackson, et autres
Publié: (2024)
Canary-1B-v2 & Parakeet-TDT-0.6B-v3: Efficient and High-Performance Models for Multilingual ASR and AST
par: Sekoyan, Monica, et autres
Publié: (2025)
par: Sekoyan, Monica, et autres
Publié: (2025)
Towards Model-Agnostic Posterior Approximation for Fast and Accurate Variational Autoencoders
par: Yacoby, Yaniv, et autres
Publié: (2024)
par: Yacoby, Yaniv, et autres
Publié: (2024)
Delta Attention: Fast and Accurate Sparse Attention Inference by Delta Correction
par: Willette, Jeffrey, et autres
Publié: (2025)
par: Willette, Jeffrey, et autres
Publié: (2025)
Fast and Accurate Graph Learning for Huge Data via Minipatch Ensembles
par: Yao, Tianyi, et autres
Publié: (2021)
par: Yao, Tianyi, et autres
Publié: (2021)
Parameter Importance-Driven Continual Learning for Foundation Models
par: Wang, Lingxiang, et autres
Publié: (2025)
par: Wang, Lingxiang, et autres
Publié: (2025)
Documents similaires
-
Chunk-wise Attention Transducers for Fast and Accurate Streaming Speech-to-Text
par: Xu, Hainan, et autres
Publié: (2026) -
Pushing the Limits of Beam Search Decoding for Transducer-based ASR models
par: Grigoryan, Lilit, et autres
Publié: (2025) -
Label-Looping: Highly Efficient Decoding for Transducers
par: Bataev, Vladimir, et autres
Publié: (2024) -
Fast Context-Biasing for CTC and Transducer ASR models with CTC-based Word Spotter
par: Andrusenko, Andrei, et autres
Publié: (2024) -
WIND: Accelerated RNN-T Decoding with Windowed Inference for Non-blank Detection
par: Xu, Hainan, et autres
Publié: (2025)