Turn-taking and Backchannel Prediction with Acoustic and Large Language Model Fusion
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Jinhan, Chen, Long, Khare, Aparna, Raju, Anirudh, Dheram, Pranav, He, Di, Wu, Minhua, Stolcke, Andreas, Ravichandran, Venkatesh |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cross-utterance ASR Rescoring with Graph-based Label Propagation
di: Tankasala, Srinath, et al.
Pubblicazione: (2023)
di: Tankasala, Srinath, et al.
Pubblicazione: (2023)
Toward Fairness in Speech Recognition: Discovery and mitigation of performance disparities
di: Dheram, Pranav, et al.
Pubblicazione: (2022)
di: Dheram, Pranav, et al.
Pubblicazione: (2022)
Two-pass Endpoint Detection for Speech Recognition
di: Raju, Anirudh, et al.
Pubblicazione: (2024)
di: Raju, Anirudh, et al.
Pubblicazione: (2024)
Improving fairness in speaker verification via Group-adapted Fusion Network
di: Shen, Hua, et al.
Pubblicazione: (2022)
di: Shen, Hua, et al.
Pubblicazione: (2022)
FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection
di: Wang, Chengyou, et al.
Pubblicazione: (2026)
di: Wang, Chengyou, et al.
Pubblicazione: (2026)
Multilingual Turn-taking Prediction Using Voice Activity Projection
di: Inoue, Koji, et al.
Pubblicazione: (2024)
di: Inoue, Koji, et al.
Pubblicazione: (2024)
Visual Cues Support Robust Turn-taking Prediction in Noise
di: Russell, Sam O'Connor, et al.
Pubblicazione: (2025)
di: Russell, Sam O'Connor, et al.
Pubblicazione: (2025)
Adaptive Endpointing with Deep Contextual Multi-armed Bandits
di: Min, Do June, et al.
Pubblicazione: (2023)
di: Min, Do June, et al.
Pubblicazione: (2023)
Learning When to Trust Which Teacher for Weakly Supervised ASR
di: Agrawal, Aakriti, et al.
Pubblicazione: (2023)
di: Agrawal, Aakriti, et al.
Pubblicazione: (2023)
Why Can't They Remember? Uncovering Representation and Retrieval Bottlenecks in Multi-Turn Acoustic Memory
di: Xiao, Yang, et al.
Pubblicazione: (2026)
di: Xiao, Yang, et al.
Pubblicazione: (2026)
Multimodal Attention Merging for Improved Speech Recognition and Audio Event Classification
di: Sundar, Anirudh S., et al.
Pubblicazione: (2023)
di: Sundar, Anirudh S., et al.
Pubblicazione: (2023)
Continuous-Token Diffusion for Speaker-Referenced TTS in Multimodal LLMs
di: He, Xinlu, et al.
Pubblicazione: (2025)
di: He, Xinlu, et al.
Pubblicazione: (2025)
Reducing Geographic Disparities in Automatic Speech Recognition via Elastic Weight Consolidation
di: Trinh, Viet Anh, et al.
Pubblicazione: (2022)
di: Trinh, Viet Anh, et al.
Pubblicazione: (2022)
Adversarial Reweighting for Speaker Verification Fairness
di: Jin, Minho, et al.
Pubblicazione: (2022)
di: Jin, Minho, et al.
Pubblicazione: (2022)
Data-driven Joint Detection and Localization of Acoustic Reflectors
di: Bicer, H. Nazim, et al.
Pubblicazione: (2024)
di: Bicer, H. Nazim, et al.
Pubblicazione: (2024)
Room Impulse Response as a Prompt for Acoustic Echo Cancellation
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
Abusive Speech Detection in Indic Languages Using Acoustic Features
di: Spiesberger, Anika A., et al.
Pubblicazione: (2024)
di: Spiesberger, Anika A., et al.
Pubblicazione: (2024)
PROCTER: PROnunciation-aware ConTextual adaptER for personalized speech recognition in neural transducers
di: Pandey, Rahul, et al.
Pubblicazione: (2023)
di: Pandey, Rahul, et al.
Pubblicazione: (2023)
SAMOS: A Neural MOS Prediction Model Leveraging Semantic Representations and Acoustic Features
di: Shi, Yu-Fei, et al.
Pubblicazione: (2024)
di: Shi, Yu-Fei, et al.
Pubblicazione: (2024)
Streaming Sortformer: Speaker Cache-Based Online Speaker Diarization with Arrival-Time Ordering
di: Medennikov, Ivan, et al.
Pubblicazione: (2025)
di: Medennikov, Ivan, et al.
Pubblicazione: (2025)
Evaluation of Virtual Acoustic Environments with Different Acoustic Level of Detail
di: Fichna, Stefan, et al.
Pubblicazione: (2023)
di: Fichna, Stefan, et al.
Pubblicazione: (2023)
Post-Training Embedding Alignment for Decoupling Enrollment and Runtime Speaker Recognition Models
di: Gao, Chenyang, et al.
Pubblicazione: (2024)
di: Gao, Chenyang, et al.
Pubblicazione: (2024)
Real-time and Continuous Turn-taking Prediction Using Voice Activity Projection
di: Inoue, Koji, et al.
Pubblicazione: (2024)
di: Inoue, Koji, et al.
Pubblicazione: (2024)
LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues
di: Ivry, Amir, et al.
Pubblicazione: (2026)
di: Ivry, Amir, et al.
Pubblicazione: (2026)
ParaLBench: A Large-Scale Benchmark for Computational Paralinguistics over Acoustic Foundation Models
di: Zhang, Zixing, et al.
Pubblicazione: (2024)
di: Zhang, Zixing, et al.
Pubblicazione: (2024)
Low-Complexity Acoustic Scene Classification Using Parallel Attention-Convolution Network
di: Li, Yanxiong, et al.
Pubblicazione: (2024)
di: Li, Yanxiong, et al.
Pubblicazione: (2024)
From Human Speech to Ocean Signals: Transferring Speech Large Models for Underwater Acoustic Target Recognition
di: Huang, Mengcheng, et al.
Pubblicazione: (2026)
di: Huang, Mengcheng, et al.
Pubblicazione: (2026)
Speaker Targeting via Self-Speaker Adaptation for Multi-talker ASR
di: Wang, Weiqing, et al.
Pubblicazione: (2025)
di: Wang, Weiqing, et al.
Pubblicazione: (2025)
Prompt-Guided Turn-Taking Prediction
di: Inoue, Koji, et al.
Pubblicazione: (2025)
di: Inoue, Koji, et al.
Pubblicazione: (2025)
GAP-URGENet: A Generative-Predictive Fusion Framework for Universal Speech Enhancement
di: Rong, Xiaobin, et al.
Pubblicazione: (2026)
di: Rong, Xiaobin, et al.
Pubblicazione: (2026)
LPGNet: A Lightweight Network with Parallel Attention and Gated Fusion for Multimodal Emotion Recognition
di: He, Zhining, et al.
Pubblicazione: (2025)
di: He, Zhining, et al.
Pubblicazione: (2025)
META-CAT: Speaker-Informed Speech Embeddings via Meta Information Concatenation for Multi-talker ASR
di: Wang, Jinhan, et al.
Pubblicazione: (2024)
di: Wang, Jinhan, et al.
Pubblicazione: (2024)
Sound Field Synthesis with Acoustic Waves
di: Mansour, Mohamed F.
Pubblicazione: (2024)
di: Mansour, Mohamed F.
Pubblicazione: (2024)
Continual Learning for Acoustic Event Classification
di: Xiao, Yang
Pubblicazione: (2025)
di: Xiao, Yang
Pubblicazione: (2025)
Yeah, Un, Oh: Continuous and Real-time Backchannel Prediction with Fine-tuning of Voice Activity Projection
di: Inoue, Koji, et al.
Pubblicazione: (2024)
di: Inoue, Koji, et al.
Pubblicazione: (2024)
XANE: eXplainable Acoustic Neural Embeddings
di: Dumpala, Sri Harsha, et al.
Pubblicazione: (2024)
di: Dumpala, Sri Harsha, et al.
Pubblicazione: (2024)
Acoustic BPE for Speech Generation with Discrete Tokens
di: Shen, Feiyu, et al.
Pubblicazione: (2023)
di: Shen, Feiyu, et al.
Pubblicazione: (2023)
Neural Kalman Filters for Acoustic Echo Cancellation
di: Seidel, Ernst, et al.
Pubblicazione: (2025)
di: Seidel, Ernst, et al.
Pubblicazione: (2025)
HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement
di: Hussein, Amir, et al.
Pubblicazione: (2025)
di: Hussein, Amir, et al.
Pubblicazione: (2025)
Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation
di: Wu, Yusong, et al.
Pubblicazione: (2022)
di: Wu, Yusong, et al.
Pubblicazione: (2022)
Documenti analoghi
-
Cross-utterance ASR Rescoring with Graph-based Label Propagation
di: Tankasala, Srinath, et al.
Pubblicazione: (2023) -
Toward Fairness in Speech Recognition: Discovery and mitigation of performance disparities
di: Dheram, Pranav, et al.
Pubblicazione: (2022) -
Two-pass Endpoint Detection for Speech Recognition
di: Raju, Anirudh, et al.
Pubblicazione: (2024) -
Improving fairness in speaker verification via Group-adapted Fusion Network
di: Shen, Hua, et al.
Pubblicazione: (2022) -
FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection
di: Wang, Chengyou, et al.
Pubblicazione: (2026)