A Calculus-Based Framework for Determining Vocabulary Size in End-to-End ASR
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Kopparapu, Sunil Kumar |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A cost minimization approach to fix the vocabulary size in a tokenizer for an End-to-End ASR system
par: Kopparapu, Sunil Kumar, et autres
Publié: (2024)
par: Kopparapu, Sunil Kumar, et autres
Publié: (2024)
Probing Human Articulatory Constraints in End-to-End TTS with Reverse and Mismatched Speech-Text Directions
par: Khadse, Parth, et autres
Publié: (2026)
par: Khadse, Parth, et autres
Publié: (2026)
Streaming Bilingual End-to-End ASR model using Attention over Multiple Softmax
par: Patil, Aditya, et autres
Publié: (2024)
par: Patil, Aditya, et autres
Publié: (2024)
Alternating Weak Triphone/BPE Alignment Supervision from Hybrid Model Improves End-to-End ASR
par: Jiang, Jintao, et autres
Publié: (2024)
par: Jiang, Jintao, et autres
Publié: (2024)
End-to-End Speech-to-Text Translation: A Survey
par: Sethiya, Nivedita, et autres
Publié: (2023)
par: Sethiya, Nivedita, et autres
Publié: (2023)
Improving noisy student training for low-resource languages in End-to-End ASR using CycleGAN and inter-domain losses
par: Li, Chia-Yu, et autres
Publié: (2024)
par: Li, Chia-Yu, et autres
Publié: (2024)
Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction
par: Li, Tianpeng, et autres
Publié: (2025)
par: Li, Tianpeng, et autres
Publié: (2025)
End-to-end Joint Punctuated and Normalized ASR with a Limited Amount of Punctuated Training Data
par: Cui, Can, et autres
Publié: (2023)
par: Cui, Can, et autres
Publié: (2023)
End-to-End Simultaneous Dysarthric Speech Reconstruction with Frame-Level Adaptor and Multiple Wait-k Knowledge Distillation
par: Wu, Minghui, et autres
Publié: (2026)
par: Wu, Minghui, et autres
Publié: (2026)
Reflecting Twice before Speaking with Empathy: Self-Reflective Alternating Inference for Empathy-Aware End-to-End Spoken Dialogue
par: Jia, Yuhang, et autres
Publié: (2026)
par: Jia, Yuhang, et autres
Publié: (2026)
Enhanced ASR Robustness to Packet Loss with a Front-End Adaptation Network
par: Dissen, Yehoshua, et autres
Publié: (2024)
par: Dissen, Yehoshua, et autres
Publié: (2024)
Representation Purification for End-to-End Speech Translation
par: Zhang, Chengwei, et autres
Publié: (2024)
par: Zhang, Chengwei, et autres
Publié: (2024)
Song Data Cleansing for End-to-End Neural Singer Diarization Using Neural Analysis and Synthesis Framework
par: Munakata, Hokuto, et autres
Publié: (2024)
par: Munakata, Hokuto, et autres
Publié: (2024)
Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking
par: Vendrame, Katia, et autres
Publié: (2025)
par: Vendrame, Katia, et autres
Publié: (2025)
A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Speech Translation
par: Ma, Zhengrui, et autres
Publié: (2024)
par: Ma, Zhengrui, et autres
Publié: (2024)
An End-to-End Speech Summarization Using Large Language Model
par: Shang, Hengchao, et autres
Publié: (2024)
par: Shang, Hengchao, et autres
Publié: (2024)
An investigation of phrase break prediction in an End-to-End TTS system
par: Vadapalli, Anandaswarup
Publié: (2023)
par: Vadapalli, Anandaswarup
Publié: (2023)
Towards Building an End-to-End Multilingual Automatic Lyrics Transcription Model
par: Huang, Jiawen, et autres
Publié: (2024)
par: Huang, Jiawen, et autres
Publié: (2024)
Scaling and Prompting for Improved End-to-End Spoken Grammatical Error Correction
par: Qian, Mengjie, et autres
Publié: (2025)
par: Qian, Mengjie, et autres
Publié: (2025)
Joint Training And Decoding for Multilingual End-to-End Simultaneous Speech Translation
par: Huang, Wuwei, et autres
Publié: (2025)
par: Huang, Wuwei, et autres
Publié: (2025)
Code-Switching in End-to-End Automatic Speech Recognition: A Systematic Literature Review
par: Agro, Maha Tufail, et autres
Publié: (2025)
par: Agro, Maha Tufail, et autres
Publié: (2025)
Towards an End-to-End Framework for Invasive Brain Signal Decoding with Large Language Models
par: Feng, Sheng, et autres
Publié: (2024)
par: Feng, Sheng, et autres
Publié: (2024)
SAGE-LD: Towards Scalable and Generalizable End-to-End Language Diarization via Simulated Data Augmentation
par: Lee, Sangmin, et autres
Publié: (2025)
par: Lee, Sangmin, et autres
Publié: (2025)
Acoustically Precise Hesitation Tagging Is Essential for End-to-End Verbatim Transcription Systems
par: Lin, Jhen-Ke, et autres
Publié: (2025)
par: Lin, Jhen-Ke, et autres
Publié: (2025)
PRoDeliberation: Parallel Robust Deliberation for End-to-End Spoken Language Understanding
par: Le, Trang, et autres
Publié: (2024)
par: Le, Trang, et autres
Publié: (2024)
Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition
par: Kocour, Martin, et autres
Publié: (2025)
par: Kocour, Martin, et autres
Publié: (2025)
Leveraging Synthetic Audio Data for End-to-End Low-Resource Speech Translation
par: Moslem, Yasmin
Publié: (2024)
par: Moslem, Yasmin
Publié: (2024)
CantoASR: Prosody-Aware ASR-LALM Collaboration for Low-Resource Cantonese
par: Chen, Dazhong, et autres
Publié: (2025)
par: Chen, Dazhong, et autres
Publié: (2025)
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
par: Arora, Siddhant, et autres
Publié: (2025)
par: Arora, Siddhant, et autres
Publié: (2025)
GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot
par: Zeng, Aohan, et autres
Publié: (2024)
par: Zeng, Aohan, et autres
Publié: (2024)
Soft Language Identification for Language-Agnostic Many-to-One End-to-End Speech Translation
par: Wang, Peidong, et autres
Publié: (2024)
par: Wang, Peidong, et autres
Publié: (2024)
VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models
par: Cui, Wenqian, et autres
Publié: (2025)
par: Cui, Wenqian, et autres
Publié: (2025)
Post-decoder Biasing for End-to-End Speech Recognition of Multi-turn Medical Interview
par: Liu, Heyang, et autres
Publié: (2024)
par: Liu, Heyang, et autres
Publié: (2024)
Beyond Binary: Multiclass Paraphasia Detection with Generative Pretrained Transformers and End-to-End Models
par: Perez, Matthew, et autres
Publié: (2024)
par: Perez, Matthew, et autres
Publié: (2024)
End-to-End Spoken Grammatical Error Correction
par: Qian, Mengjie, et autres
Publié: (2025)
par: Qian, Mengjie, et autres
Publié: (2025)
M-CIF: Multi-Scale Alignment For CIF-Based Non-Autoregressive ASR
par: Mao, Ruixiang, et autres
Publié: (2025)
par: Mao, Ruixiang, et autres
Publié: (2025)
AdaST: Dynamically Adapting Encoder States in the Decoder for End-to-End Speech-to-Text Translation
par: Huang, Wuwei, et autres
Publié: (2025)
par: Huang, Wuwei, et autres
Publié: (2025)
Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model
par: Huang, Ailin, et autres
Publié: (2025)
par: Huang, Ailin, et autres
Publié: (2025)
Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios
par: Subramanian, Aswin Shanmugam, et autres
Publié: (2025)
par: Subramanian, Aswin Shanmugam, et autres
Publié: (2025)
SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition
par: Hirano, Yuta, et autres
Publié: (2025)
par: Hirano, Yuta, et autres
Publié: (2025)
Documents similaires
-
A cost minimization approach to fix the vocabulary size in a tokenizer for an End-to-End ASR system
par: Kopparapu, Sunil Kumar, et autres
Publié: (2024) -
Probing Human Articulatory Constraints in End-to-End TTS with Reverse and Mismatched Speech-Text Directions
par: Khadse, Parth, et autres
Publié: (2026) -
Streaming Bilingual End-to-End ASR model using Attention over Multiple Softmax
par: Patil, Aditya, et autres
Publié: (2024) -
Alternating Weak Triphone/BPE Alignment Supervision from Hybrid Model Improves End-to-End ASR
par: Jiang, Jintao, et autres
Publié: (2024) -
End-to-End Speech-to-Text Translation: A Survey
par: Sethiya, Nivedita, et autres
Publié: (2023)