Acoustically Precise Hesitation Tagging Is Essential for End-to-End Verbatim Transcription Systems
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Jhen-Ke, Lu, Hao-Chien, Wang, Chung-Chun, Lin, Hong-Yun, Chen, Berlin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Novel Data Augmentation Approach for Automatic Speaking Assessment on Opinion Expressions
por: Wang, Chung-Chun, et al.
Publicado: (2025)
por: Wang, Chung-Chun, et al.
Publicado: (2025)
Advancing Automated Speaking Assessment Leveraging Multifaceted Relevance and Grammar Information
por: Lu, Hao-Chien, et al.
Publicado: (2025)
por: Lu, Hao-Chien, et al.
Publicado: (2025)
The NTNU System at the S&I Challenge 2025 SLA Open Track
por: Lin, Hong-Yun, et al.
Publicado: (2025)
por: Lin, Hong-Yun, et al.
Publicado: (2025)
Towards Building an End-to-End Multilingual Automatic Lyrics Transcription Model
por: Huang, Jiawen, et al.
Publicado: (2024)
por: Huang, Jiawen, et al.
Publicado: (2024)
An End-to-End Speech Summarization Using Large Language Model
por: Shang, Hengchao, et al.
Publicado: (2024)
por: Shang, Hengchao, et al.
Publicado: (2024)
Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction
por: Li, Tianpeng, et al.
Publicado: (2025)
por: Li, Tianpeng, et al.
Publicado: (2025)
audio2chart: End to End Audio Transcription into playable Guitar Hero charts
por: Tripodi, Riccardo
Publicado: (2025)
por: Tripodi, Riccardo
Publicado: (2025)
Chain-of-Thought Reasoning in Streaming Full-Duplex End-to-End Spoken Dialogue Systems
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
Representation Purification for End-to-End Speech Translation
por: Zhang, Chengwei, et al.
Publicado: (2024)
por: Zhang, Chengwei, et al.
Publicado: (2024)
End-to-End Speech-to-Text Translation: A Survey
por: Sethiya, Nivedita, et al.
Publicado: (2023)
por: Sethiya, Nivedita, et al.
Publicado: (2023)
IKFST: IOO and KOO Algorithms for Accelerated and Precise WFST-based End-to-End Automatic Speech Recognition
por: Zhuang, Zhuoran, et al.
Publicado: (2026)
por: Zhuang, Zhuoran, et al.
Publicado: (2026)
An investigation of phrase break prediction in an End-to-End TTS system
por: Vadapalli, Anandaswarup
Publicado: (2023)
por: Vadapalli, Anandaswarup
Publicado: (2023)
Joint Transcription of Acoustic Guitar Strumming Directions and Chords
por: Murgul, Sebastian, et al.
Publicado: (2025)
por: Murgul, Sebastian, et al.
Publicado: (2025)
Scaling and Prompting for Improved End-to-End Spoken Grammatical Error Correction
por: Qian, Mengjie, et al.
Publicado: (2025)
por: Qian, Mengjie, et al.
Publicado: (2025)
Joint Training And Decoding for Multilingual End-to-End Simultaneous Speech Translation
por: Huang, Wuwei, et al.
Publicado: (2025)
por: Huang, Wuwei, et al.
Publicado: (2025)
Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model
por: Huang, Ailin, et al.
Publicado: (2025)
por: Huang, Ailin, et al.
Publicado: (2025)
Differentiable Time-Varying Linear Prediction in the Context of End-to-End Analysis-by-Synthesis
por: Yu, Chin-Yun, et al.
Publicado: (2024)
por: Yu, Chin-Yun, et al.
Publicado: (2024)
PRoDeliberation: Parallel Robust Deliberation for End-to-End Spoken Language Understanding
por: Le, Trang, et al.
Publicado: (2024)
por: Le, Trang, et al.
Publicado: (2024)
Adapting Diarization-Conditioned Whisper for End-to-End Multi-Talker Speech Recognition
por: Kocour, Martin, et al.
Publicado: (2025)
por: Kocour, Martin, et al.
Publicado: (2025)
Leveraging Synthetic Audio Data for End-to-End Low-Resource Speech Translation
por: Moslem, Yasmin
Publicado: (2024)
por: Moslem, Yasmin
Publicado: (2024)
Streaming Bilingual End-to-End ASR model using Attention over Multiple Softmax
por: Patil, Aditya, et al.
Publicado: (2024)
por: Patil, Aditya, et al.
Publicado: (2024)
GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot
por: Zeng, Aohan, et al.
Publicado: (2024)
por: Zeng, Aohan, et al.
Publicado: (2024)
Code-Switching in End-to-End Automatic Speech Recognition: A Systematic Literature Review
por: Agro, Maha Tufail, et al.
Publicado: (2025)
por: Agro, Maha Tufail, et al.
Publicado: (2025)
Soft Language Identification for Language-Agnostic Many-to-One End-to-End Speech Translation
por: Wang, Peidong, et al.
Publicado: (2024)
por: Wang, Peidong, et al.
Publicado: (2024)
VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models
por: Cui, Wenqian, et al.
Publicado: (2025)
por: Cui, Wenqian, et al.
Publicado: (2025)
Post-decoder Biasing for End-to-End Speech Recognition of Multi-turn Medical Interview
por: Liu, Heyang, et al.
Publicado: (2024)
por: Liu, Heyang, et al.
Publicado: (2024)
Beyond Binary: Multiclass Paraphasia Detection with Generative Pretrained Transformers and End-to-End Models
por: Perez, Matthew, et al.
Publicado: (2024)
por: Perez, Matthew, et al.
Publicado: (2024)
Exploring Procedural Data Generation for Automatic Acoustic Guitar Fingerpicking Transcription
por: Murgul, Sebastian, et al.
Publicado: (2025)
por: Murgul, Sebastian, et al.
Publicado: (2025)
AdaST: Dynamically Adapting Encoder States in the Decoder for End-to-End Speech-to-Text Translation
por: Huang, Wuwei, et al.
Publicado: (2025)
por: Huang, Wuwei, et al.
Publicado: (2025)
Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking
por: Vendrame, Katia, et al.
Publicado: (2025)
por: Vendrame, Katia, et al.
Publicado: (2025)
Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios
por: Subramanian, Aswin Shanmugam, et al.
Publicado: (2025)
por: Subramanian, Aswin Shanmugam, et al.
Publicado: (2025)
SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition
por: Hirano, Yuta, et al.
Publicado: (2025)
por: Hirano, Yuta, et al.
Publicado: (2025)
SpeechDPR: End-to-End Spoken Passage Retrieval for Open-Domain Spoken Question Answering
por: Lin, Chyi-Jiunn, et al.
Publicado: (2024)
por: Lin, Chyi-Jiunn, et al.
Publicado: (2024)
Do End-to-End Neural Diarization Attractors Need to Encode Speaker Characteristic Information?
por: Zhang, Lin, et al.
Publicado: (2024)
por: Zhang, Lin, et al.
Publicado: (2024)
Neural Scoring: A Refreshed End-to-End Approach for Speaker Recognition in Complex Conditions
por: Lin, Wan, et al.
Publicado: (2024)
por: Lin, Wan, et al.
Publicado: (2024)
A cost minimization approach to fix the vocabulary size in a tokenizer for an End-to-End ASR system
por: Kopparapu, Sunil Kumar, et al.
Publicado: (2024)
por: Kopparapu, Sunil Kumar, et al.
Publicado: (2024)
Song Data Cleansing for End-to-End Neural Singer Diarization Using Neural Analysis and Synthesis Framework
por: Munakata, Hokuto, et al.
Publicado: (2024)
por: Munakata, Hokuto, et al.
Publicado: (2024)
SAFE-QAQ: End-to-End Slow-Thinking Audio-Text Fraud Detection via Reinforcement Learning
por: Wang, Peidong, et al.
Publicado: (2026)
por: Wang, Peidong, et al.
Publicado: (2026)
Harnessing the Zero-Shot Power of Instruction-Tuned Large Language Model in End-to-End Speech Recognition
por: Higuchi, Yosuke, et al.
Publicado: (2023)
por: Higuchi, Yosuke, et al.
Publicado: (2023)
Alternating Weak Triphone/BPE Alignment Supervision from Hybrid Model Improves End-to-End ASR
por: Jiang, Jintao, et al.
Publicado: (2024)
por: Jiang, Jintao, et al.
Publicado: (2024)
Ejemplares similares
-
A Novel Data Augmentation Approach for Automatic Speaking Assessment on Opinion Expressions
por: Wang, Chung-Chun, et al.
Publicado: (2025) -
Advancing Automated Speaking Assessment Leveraging Multifaceted Relevance and Grammar Information
por: Lu, Hao-Chien, et al.
Publicado: (2025) -
The NTNU System at the S&I Challenge 2025 SLA Open Track
por: Lin, Hong-Yun, et al.
Publicado: (2025) -
Towards Building an End-to-End Multilingual Automatic Lyrics Transcription Model
por: Huang, Jiawen, et al.
Publicado: (2024) -
An End-to-End Speech Summarization Using Large Language Model
por: Shang, Hengchao, et al.
Publicado: (2024)