Speculative End-Turn Detector for Efficient Speech Chatbot Assistant
Fuente:
arXiv
Guardado en:
| Autores principales: | Ok, Hyunjong, Yoo, Suho, Lee, Jaeho |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Imagine to Hear: Auditory Knowledge Generation can be an Effective Assistant for Language Models
por: Yoo, Suho, et al.
Publicado: (2025)
por: Yoo, Suho, et al.
Publicado: (2025)
AudioBERT: Audio Knowledge Augmented Language Model
por: Ok, Hyunjong, et al.
Publicado: (2024)
por: Ok, Hyunjong, et al.
Publicado: (2024)
S2Cap: A Benchmark and a Baseline for Singing Style Captioning
por: Ok, Hyunjong, et al.
Publicado: (2024)
por: Ok, Hyunjong, et al.
Publicado: (2024)
AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing?
por: Ok, Hyunjong, et al.
Publicado: (2025)
por: Ok, Hyunjong, et al.
Publicado: (2025)
BanglaDialecto: An End-to-End AI-Powered Regional Speech Standardization
por: Samin, Md. Nazmus Sadat, et al.
Publicado: (2024)
por: Samin, Md. Nazmus Sadat, et al.
Publicado: (2024)
Towards End-to-End Training of Automatic Speech Recognition for Nigerian Pidgin
por: Rufai, Amina Mardiyyah, et al.
Publicado: (2020)
por: Rufai, Amina Mardiyyah, et al.
Publicado: (2020)
FlashSpeech: Efficient Zero-Shot Speech Synthesis
por: Ye, Zhen, et al.
Publicado: (2024)
por: Ye, Zhen, et al.
Publicado: (2024)
An Investigation Into Explainable Audio Hate Speech Detection
por: An, Jinmyeong, et al.
Publicado: (2024)
por: An, Jinmyeong, et al.
Publicado: (2024)
Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models
por: Hsiao, Chi-Yuan, et al.
Publicado: (2025)
por: Hsiao, Chi-Yuan, et al.
Publicado: (2025)
QUADS: QUAntized Distillation Framework for Efficient Speech Language Understanding
por: Biswas, Subrata, et al.
Publicado: (2025)
por: Biswas, Subrata, et al.
Publicado: (2025)
Large Language Models are Efficient Learners of Noise-Robust Speech Recognition
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
ELP-Adapters: Parameter Efficient Adapter Tuning for Various Speech Processing Tasks
por: Inoue, Nakamasa, et al.
Publicado: (2024)
por: Inoue, Nakamasa, et al.
Publicado: (2024)
Turn-taking and Backchannel Prediction with Acoustic and Large Language Model Fusion
por: Wang, Jinhan, et al.
Publicado: (2024)
por: Wang, Jinhan, et al.
Publicado: (2024)
STTATTS: Unified Speech-To-Text And Text-To-Speech Model
por: Toyin, Hawau Olamide, et al.
Publicado: (2024)
por: Toyin, Hawau Olamide, et al.
Publicado: (2024)
Advancing Speech Understanding in Speech-Aware Language Models with GRPO
por: Elmakies, Avishai, et al.
Publicado: (2025)
por: Elmakies, Avishai, et al.
Publicado: (2025)
A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Speech Translation
por: Ma, Zhengrui, et al.
Publicado: (2024)
por: Ma, Zhengrui, et al.
Publicado: (2024)
Task Arithmetic can Mitigate Synthetic-to-Real Gap in Automatic Speech Recognition
por: Su, Hsuan, et al.
Publicado: (2024)
por: Su, Hsuan, et al.
Publicado: (2024)
VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild
por: Peng, Puyuan, et al.
Publicado: (2024)
por: Peng, Puyuan, et al.
Publicado: (2024)
Recent Advances in End-to-End Simultaneous Speech Translation
por: Liu, Xiaoqian, et al.
Publicado: (2024)
por: Liu, Xiaoqian, et al.
Publicado: (2024)
DiTTo-TTS: Diffusion Transformers for Scalable Text-to-Speech without Domain-Specific Factors
por: Lee, Keon, et al.
Publicado: (2024)
por: Lee, Keon, et al.
Publicado: (2024)
Unsupervised Speech Segmentation: A General Approach Using Speech Language Models
por: Elmakies, Avishai, et al.
Publicado: (2025)
por: Elmakies, Avishai, et al.
Publicado: (2025)
TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment
por: Kim, Taesoo, et al.
Publicado: (2025)
por: Kim, Taesoo, et al.
Publicado: (2025)
NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models
por: Ju, Zeqian, et al.
Publicado: (2024)
por: Ju, Zeqian, et al.
Publicado: (2024)
TTS-Transducer: End-to-End Speech Synthesis with Neural Transducer
por: Bataev, Vladimir, et al.
Publicado: (2025)
por: Bataev, Vladimir, et al.
Publicado: (2025)
Autoregressive Diffusion Transformer for Text-to-Speech Synthesis
por: Liu, Zhijun, et al.
Publicado: (2024)
por: Liu, Zhijun, et al.
Publicado: (2024)
Real-time Speech Summarization for Medical Conversations
por: Le-Duc, Khai, et al.
Publicado: (2024)
por: Le-Duc, Khai, et al.
Publicado: (2024)
Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio
por: He, Xinlu, et al.
Publicado: (2025)
por: He, Xinlu, et al.
Publicado: (2025)
Long-Form End-to-End Speech Translation via Latent Alignment Segmentation
por: Polák, Peter, et al.
Publicado: (2023)
por: Polák, Peter, et al.
Publicado: (2023)
Scaling Rich Style-Prompted Text-to-Speech Datasets
por: Diwan, Anuj, et al.
Publicado: (2025)
por: Diwan, Anuj, et al.
Publicado: (2025)
On the Role of Speech Data in Reducing Toxicity Detection Bias
por: Bell, Samuel J., et al.
Publicado: (2024)
por: Bell, Samuel J., et al.
Publicado: (2024)
RNN-Transducer-based Losses for Speech Recognition on Noisy Targets
por: Bataev, Vladimir
Publicado: (2025)
por: Bataev, Vladimir
Publicado: (2025)
DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation
por: Jia, Dongya, et al.
Publicado: (2025)
por: Jia, Dongya, et al.
Publicado: (2025)
Towards the Next Frontier in Speech Representation Learning Using Disentanglement
por: Krishna, Varun, et al.
Publicado: (2024)
por: Krishna, Varun, et al.
Publicado: (2024)
GTR-Voice: Articulatory Phonetics Informed Controllable Expressive Speech Synthesis
por: Li, Zehua Kcriss, et al.
Publicado: (2024)
por: Li, Zehua Kcriss, et al.
Publicado: (2024)
SEGAA: A Unified Approach to Predicting Age, Gender, and Emotion in Speech
por: R, Aron, et al.
Publicado: (2024)
por: R, Aron, et al.
Publicado: (2024)
Self-Taught Recognizer: Toward Unsupervised Adaptation for Speech Foundation Models
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
TokenChain: A Discrete Speech Chain via Semantic Token Modeling
por: Wang, Mingxuan, et al.
Publicado: (2025)
por: Wang, Mingxuan, et al.
Publicado: (2025)
Omni-Router: Sharing Routing Decisions in Sparse Mixture-of-Experts for Speech Recognition
por: Gu, Zijin, et al.
Publicado: (2025)
por: Gu, Zijin, et al.
Publicado: (2025)
Slamming: Training a Speech Language Model on One GPU in a Day
por: Maimon, Gallil, et al.
Publicado: (2025)
por: Maimon, Gallil, et al.
Publicado: (2025)
GenTranslate: Large Language Models are Generative Multilingual Speech and Machine Translators
por: Hu, Yuchen, et al.
Publicado: (2024)
por: Hu, Yuchen, et al.
Publicado: (2024)
Ejemplares similares
-
Imagine to Hear: Auditory Knowledge Generation can be an Effective Assistant for Language Models
por: Yoo, Suho, et al.
Publicado: (2025) -
AudioBERT: Audio Knowledge Augmented Language Model
por: Ok, Hyunjong, et al.
Publicado: (2024) -
S2Cap: A Benchmark and a Baseline for Singing Style Captioning
por: Ok, Hyunjong, et al.
Publicado: (2024) -
AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing?
por: Ok, Hyunjong, et al.
Publicado: (2025) -
BanglaDialecto: An End-to-End AI-Powered Regional Speech Standardization
por: Samin, Md. Nazmus Sadat, et al.
Publicado: (2024)