A Hierarchical End-of-Turn Model with Primary Speaker Segmentation for Real-Time Conversational AI
Fuente:
arXiv
Guardado en:
| Autores principales: | Helwani, Karim, Do, Hoang, Luan, James, Srinivasan, Sriram |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Sound Source Separation Using Latent Variational Block-Wise Disentanglement
por: Helwani, Karim, et al.
Publicado: (2024)
por: Helwani, Karim, et al.
Publicado: (2024)
Zero Shot Audio to Audio Emotion Transfer With Speaker Disentanglement
por: Dutta, Soumya, et al.
Publicado: (2024)
por: Dutta, Soumya, et al.
Publicado: (2024)
End-to-End Supervised Hierarchical Graph Clustering for Speaker Diarization
por: Singh, Prachi, et al.
Publicado: (2024)
por: Singh, Prachi, et al.
Publicado: (2024)
Time-Varying Audio Effect Modeling by End-to-End Adversarial Training
por: Bourdin, Yann, et al.
Publicado: (2025)
por: Bourdin, Yann, et al.
Publicado: (2025)
O-EENC-SD: Efficient Online End-to-End Neural Clustering for Speaker Diarization
por: Gruttadauria, Elio, et al.
Publicado: (2025)
por: Gruttadauria, Elio, et al.
Publicado: (2025)
A$^2$-LLM: An End-to-end Conversational Audio Avatar Large Language Model
por: Hu, Xiaolin, et al.
Publicado: (2026)
por: Hu, Xiaolin, et al.
Publicado: (2026)
Highly Efficient Real-Time Streaming and Fully On-Device Speaker Diarization with Multi-Stage Clustering
por: Wang, Quan, et al.
Publicado: (2022)
por: Wang, Quan, et al.
Publicado: (2022)
Brainprint-Modulated Target Speaker Extraction
por: Han, Qiushi, et al.
Publicado: (2025)
por: Han, Qiushi, et al.
Publicado: (2025)
StreamVC: Real-Time Low-Latency Voice Conversion
por: Yang, Yang, et al.
Publicado: (2024)
por: Yang, Yang, et al.
Publicado: (2024)
Adversarial Speaker Distillation for Countermeasure Model on Automatic Speaker Verification
por: Liao, Yen-Lun, et al.
Publicado: (2022)
por: Liao, Yen-Lun, et al.
Publicado: (2022)
Koopman Regularized Deep Speech Disentanglement for Speaker Verification
por: Chazaridis, Nikos, et al.
Publicado: (2026)
por: Chazaridis, Nikos, et al.
Publicado: (2026)
Assessing the Impact of Speaker Identity in Speech Spoofing Detection
por: Dao, Anh-Tuan, et al.
Publicado: (2026)
por: Dao, Anh-Tuan, et al.
Publicado: (2026)
Multi-Target Backdoor Attacks Against Speaker Recognition
por: Fortier, Alexandrine, et al.
Publicado: (2025)
por: Fortier, Alexandrine, et al.
Publicado: (2025)
End-to-End Efficiency in Keyword Spotting: A System-Level Approach for Embedded Microcontrollers
por: Bartoli, Pietro, et al.
Publicado: (2025)
por: Bartoli, Pietro, et al.
Publicado: (2025)
SEAL: Speaker Error Correction using Acoustic-conditioned Large Language Models
por: Kumar, Anurag, et al.
Publicado: (2025)
por: Kumar, Anurag, et al.
Publicado: (2025)
End-to-End Integration of Speech Separation and Voice Activity Detection for Low-Latency Diarization of Telephone Conversations
por: Morrone, Giovanni, et al.
Publicado: (2023)
por: Morrone, Giovanni, et al.
Publicado: (2023)
End-to-end Piano Performance-MIDI to Score Conversion with Transformers
por: Beyer, Tim, et al.
Publicado: (2024)
por: Beyer, Tim, et al.
Publicado: (2024)
FunnelNet: An End-to-End Deep Learning Framework to Monitor Digital Heart Murmur in Real-Time
por: Jobayer, Md, et al.
Publicado: (2024)
por: Jobayer, Md, et al.
Publicado: (2024)
Text-Dependent Speaker Verification (TdSV) Challenge 2024: Team Naive System Report
por: Rostami, Amir Mohammad, et al.
Publicado: (2026)
por: Rostami, Amir Mohammad, et al.
Publicado: (2026)
Language Modelling for Speaker Diarization in Telephonic Interviews
por: India, Miquel, et al.
Publicado: (2025)
por: India, Miquel, et al.
Publicado: (2025)
HiSSNet: Sound Event Detection and Speaker Identification via Hierarchical Prototypical Networks for Low-Resource Headphones
por: Shashaank, N, et al.
Publicado: (2023)
por: Shashaank, N, et al.
Publicado: (2023)
HiddenSpeaker: Generate Imperceptible Unlearnable Audios for Speaker Verification System
por: Zhang, Zhisheng, et al.
Publicado: (2024)
por: Zhang, Zhisheng, et al.
Publicado: (2024)
BabyHuBERT: Multilingual Self-Supervised Learning for Segmenting Speakers in Child-Centered Long-Form Recordings
por: Charlot, Théo, et al.
Publicado: (2025)
por: Charlot, Théo, et al.
Publicado: (2025)
DC-Spin: A Speaker-invariant Speech Tokenizer for Spoken Language Models
por: Chang, Heng-Jui, et al.
Publicado: (2024)
por: Chang, Heng-Jui, et al.
Publicado: (2024)
DiarizationLM: Speaker Diarization Post-Processing with Large Language Models
por: Wang, Quan, et al.
Publicado: (2024)
por: Wang, Quan, et al.
Publicado: (2024)
TSELM: Target Speaker Extraction using Discrete Tokens and Language Models
por: Tang, Beilong, et al.
Publicado: (2024)
por: Tang, Beilong, et al.
Publicado: (2024)
Speculative End-Turn Detector for Efficient Speech Chatbot Assistant
por: Ok, Hyunjong, et al.
Publicado: (2025)
por: Ok, Hyunjong, et al.
Publicado: (2025)
Whispy: Adapting STT Whisper Models to Real-Time Environments
por: Bevilacqua, Antonio, et al.
Publicado: (2024)
por: Bevilacqua, Antonio, et al.
Publicado: (2024)
Post-Training Embedding Alignment for Decoupling Enrollment and Runtime Speaker Recognition Models
por: Gao, Chenyang, et al.
Publicado: (2024)
por: Gao, Chenyang, et al.
Publicado: (2024)
Efficient Adapter Tuning of Pre-trained Speech Models for Automatic Speaker Verification
por: Sang, Mufan, et al.
Publicado: (2024)
por: Sang, Mufan, et al.
Publicado: (2024)
AutoSchA: Automatic Hierarchical Music Representations via Multi-Relational Node Isolation
por: Ni-Hahn, Stephen, et al.
Publicado: (2025)
por: Ni-Hahn, Stephen, et al.
Publicado: (2025)
SVSNet+: Enhancing Speaker Voice Similarity Assessment Models with Representations from Speech Foundation Models
por: Yin, Chun, et al.
Publicado: (2024)
por: Yin, Chun, et al.
Publicado: (2024)
SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction
por: Agrawal, Saurabh, et al.
Publicado: (2025)
por: Agrawal, Saurabh, et al.
Publicado: (2025)
Self-Supervised Learning for Speaker Recognition: A study and review
por: Lepage, Theo, et al.
Publicado: (2026)
por: Lepage, Theo, et al.
Publicado: (2026)
Leveraging Prediction Entropy for Automatic Prompt Weighting in Zero-Shot Audio-Language Classification
por: Khoury, Karim El, et al.
Publicado: (2026)
por: Khoury, Karim El, et al.
Publicado: (2026)
SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning
por: Nam, KiHyun, et al.
Publicado: (2026)
por: Nam, KiHyun, et al.
Publicado: (2026)
USM-SCD: Multilingual Speaker Change Detection Based on Large Pretrained Foundation Models
por: Zhao, Guanlong, et al.
Publicado: (2023)
por: Zhao, Guanlong, et al.
Publicado: (2023)
Adversarial Data Augmentation for Robust Speaker Verification
por: Zhou, Zhenyu, et al.
Publicado: (2024)
por: Zhou, Zhenyu, et al.
Publicado: (2024)
Investigating Confidence Estimation Measures for Speaker Diarization
por: Chowdhury, Anurag, et al.
Publicado: (2024)
por: Chowdhury, Anurag, et al.
Publicado: (2024)
Multi-Stage Speaker Diarization for Noisy Classrooms
por: Khan, Ali Sartaz, et al.
Publicado: (2025)
por: Khan, Ali Sartaz, et al.
Publicado: (2025)
Ejemplares similares
-
Sound Source Separation Using Latent Variational Block-Wise Disentanglement
por: Helwani, Karim, et al.
Publicado: (2024) -
Zero Shot Audio to Audio Emotion Transfer With Speaker Disentanglement
por: Dutta, Soumya, et al.
Publicado: (2024) -
End-to-End Supervised Hierarchical Graph Clustering for Speaker Diarization
por: Singh, Prachi, et al.
Publicado: (2024) -
Time-Varying Audio Effect Modeling by End-to-End Adversarial Training
por: Bourdin, Yann, et al.
Publicado: (2025) -
O-EENC-SD: Efficient Online End-to-End Neural Clustering for Speaker Diarization
por: Gruttadauria, Elio, et al.
Publicado: (2025)