"Dyadosyncrasy", Idiosyncrasy and Demographic Factors in Turn-Taking
Fuente:
arXiv
Guardado en:
| Autores principales: | Cavalcanti, Julio Cesar, Skantze, Gabriel |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multilingual Turn-taking Prediction Using Voice Activity Projection
por: Inoue, Koji, et al.
Publicado: (2024)
por: Inoue, Koji, et al.
Publicado: (2024)
Prompt-Guided Turn-Taking Prediction
por: Inoue, Koji, et al.
Publicado: (2025)
por: Inoue, Koji, et al.
Publicado: (2025)
Talking Turns: Benchmarking Audio Foundation Models on Turn-Taking Dynamics
por: Arora, Siddhant, et al.
Publicado: (2025)
por: Arora, Siddhant, et al.
Publicado: (2025)
Real-time and Continuous Turn-taking Prediction Using Voice Activity Projection
por: Inoue, Koji, et al.
Publicado: (2024)
por: Inoue, Koji, et al.
Publicado: (2024)
DualTurn: Learning Turn-Taking from Dual-Channel Generative Speech Pretraining
por: Rajaa, Shangeth
Publicado: (2026)
por: Rajaa, Shangeth
Publicado: (2026)
From Turn-Taking to Synchronous Dialogue: A Survey of Full-Duplex Spoken Language Models
por: Chen, Yuxuan, et al.
Publicado: (2025)
por: Chen, Yuxuan, et al.
Publicado: (2025)
Yeah, Un, Oh: Continuous and Real-time Backchannel Prediction with Fine-tuning of Voice Activity Projection
por: Inoue, Koji, et al.
Publicado: (2024)
por: Inoue, Koji, et al.
Publicado: (2024)
VoXtream: Full-Stream Text-to-Speech with Extremely Low Latency
por: Torgashov, Nikita, et al.
Publicado: (2025)
por: Torgashov, Nikita, et al.
Publicado: (2025)
VoXtream2: Full-stream TTS with dynamic speaking rate control
por: Torgashov, Nikita, et al.
Publicado: (2026)
por: Torgashov, Nikita, et al.
Publicado: (2026)
Lla-VAP: LSTM Ensemble of Llama and VAP for Turn-Taking Prediction
por: Jeon, Hyunbae, et al.
Publicado: (2024)
por: Jeon, Hyunbae, et al.
Publicado: (2024)
Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities
por: Lin, Guan-Ting, et al.
Publicado: (2025)
por: Lin, Guan-Ting, et al.
Publicado: (2025)
TurnGuide: Enhancing Meaningful Full Duplex Spoken Interactions via Dynamic Turn-Level Text-Speech Interleaving
por: Cui, Wenqian, et al.
Publicado: (2025)
por: Cui, Wenqian, et al.
Publicado: (2025)
Visual Cues Support Robust Turn-taking Prediction in Noise
por: Russell, Sam O'Connor, et al.
Publicado: (2025)
por: Russell, Sam O'Connor, et al.
Publicado: (2025)
DeepDialogue: A Multi-Turn Emotionally-Rich Spoken Dialogue Dataset
por: Koudounas, Alkis, et al.
Publicado: (2025)
por: Koudounas, Alkis, et al.
Publicado: (2025)
Bias in the Ear of the Listener: Assessing Sensitivity in Audio Language Models Across Linguistic, Demographic, and Positional Variations
por: Wei, Sheng-Lun, et al.
Publicado: (2026)
por: Wei, Sheng-Lun, et al.
Publicado: (2026)
Speaker-Reasoner: Scaling Interaction Turns and Reasoning Patterns for Timestamped Speaker-Attributed ASR
por: Lin, Zhennan, et al.
Publicado: (2026)
por: Lin, Zhennan, et al.
Publicado: (2026)
The Voice of Equity: A Systematic Evaluation of Bias Mitigation Techniques for Speech-Based Cognitive Impairment Detection Across Architectures and Demographics
por: Haghbin, Yasaman, et al.
Publicado: (2026)
por: Haghbin, Yasaman, et al.
Publicado: (2026)
Whisper Turns Stronger: Augmenting Wav2Vec 2.0 for Superior ASR in Low-Resource Languages
por: Anidjar, Or Haim, et al.
Publicado: (2024)
por: Anidjar, Or Haim, et al.
Publicado: (2024)
Explainable Speech Emotion Recognition: Weighted Attribute Fairness to Model Demographic Contributions to Social Bias
por: Ogunnubi, Tomisin, et al.
Publicado: (2026)
por: Ogunnubi, Tomisin, et al.
Publicado: (2026)
Factor-Conditioned Speaking-Style Captioning
por: Ando, Atsushi, et al.
Publicado: (2024)
por: Ando, Atsushi, et al.
Publicado: (2024)
Factorized RVQ-GAN For Disentangled Speech Tokenization
por: Khurana, Sameer, et al.
Publicado: (2025)
por: Khurana, Sameer, et al.
Publicado: (2025)
Weight Factorization and Centralization for Continual Learning in Speech Recognition
por: Ugan, Enes Yavuz, et al.
Publicado: (2025)
por: Ugan, Enes Yavuz, et al.
Publicado: (2025)
Incorporating Class-based Language Model for Named Entity Recognition in Factorized Neural Transducer
por: Wang, Peng, et al.
Publicado: (2023)
por: Wang, Peng, et al.
Publicado: (2023)
WhisperRT -- Turning Whisper into a Causal Streaming Model
por: Krichli, Tomer, et al.
Publicado: (2025)
por: Krichli, Tomer, et al.
Publicado: (2025)
Turn-taking annotation for quantitative and qualitative analyses of conversation
por: Kelterer, Anneliese, et al.
Publicado: (2025)
por: Kelterer, Anneliese, et al.
Publicado: (2025)
Beyond Turn-Based Interfaces: Synchronous LLMs as Full-Duplex Dialogue Agents
por: Veluri, Bandhav, et al.
Publicado: (2024)
por: Veluri, Bandhav, et al.
Publicado: (2024)
Sonos Voice Control Bias Assessment Dataset: A Methodology for Demographic Bias Assessment in Voice Assistants
por: Sekkat, Chloé, et al.
Publicado: (2024)
por: Sekkat, Chloé, et al.
Publicado: (2024)
MedVoiceBias: A Controlled Study of Audio LLM Behavior in Clinical Decision-Making
por: Tam, Zhi Rui, et al.
Publicado: (2025)
por: Tam, Zhi Rui, et al.
Publicado: (2025)
Speech-IFEval: Evaluating Instruction-Following and Quantifying Catastrophic Forgetting in Speech-Aware Language Models
por: Lu, Ke-Han, et al.
Publicado: (2025)
por: Lu, Ke-Han, et al.
Publicado: (2025)
Exploring Generative Error Correction for Dysarthric Speech Recognition
por: La Quatra, Moreno, et al.
Publicado: (2025)
por: La Quatra, Moreno, et al.
Publicado: (2025)
LinearVC: Linear transformations of self-supervised features through the lens of voice conversion
por: Kamper, Herman, et al.
Publicado: (2025)
por: Kamper, Herman, et al.
Publicado: (2025)
Automatically assessing oral narratives of Afrikaans and isiXhosa children
por: Louw, Retief, et al.
Publicado: (2025)
por: Louw, Retief, et al.
Publicado: (2025)
Optimizing ASR for Catalan-Spanish Code-Switching: A Comparative Analysis of Methodologies
por: Mena, Carlos, et al.
Publicado: (2025)
por: Mena, Carlos, et al.
Publicado: (2025)
Evaluating Speech-to-Text x LLM x Text-to-Speech Combinations for AI Interview Systems
por: Allbert, Rumi, et al.
Publicado: (2025)
por: Allbert, Rumi, et al.
Publicado: (2025)
TokenVerse++: Towards Flexible Multitask Learning with Dynamic Task Activation
por: Kumar, Shashi, et al.
Publicado: (2025)
por: Kumar, Shashi, et al.
Publicado: (2025)
ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models
por: Qian, Kaizhi, et al.
Publicado: (2025)
por: Qian, Kaizhi, et al.
Publicado: (2025)
SpeechCT-CLIP: Distilling Text-Image Knowledge to Speech for Voice-Native Multimodal CT Analysis
por: Buess, Lukas, et al.
Publicado: (2025)
por: Buess, Lukas, et al.
Publicado: (2025)
Lightweight Prompt Biasing for Contextualized End-to-End ASR Systems
por: Ren, Bo, et al.
Publicado: (2025)
por: Ren, Bo, et al.
Publicado: (2025)
Evaluating Emotion Recognition in Spoken Language Models on Emotionally Incongruent Speech
por: Corrêa, Pedro, et al.
Publicado: (2025)
por: Corrêa, Pedro, et al.
Publicado: (2025)
MVP: Multi-source Voice Pathology detection
por: Koudounas, Alkis, et al.
Publicado: (2025)
por: Koudounas, Alkis, et al.
Publicado: (2025)
Ejemplares similares
-
Multilingual Turn-taking Prediction Using Voice Activity Projection
por: Inoue, Koji, et al.
Publicado: (2024) -
Prompt-Guided Turn-Taking Prediction
por: Inoue, Koji, et al.
Publicado: (2025) -
Talking Turns: Benchmarking Audio Foundation Models on Turn-Taking Dynamics
por: Arora, Siddhant, et al.
Publicado: (2025) -
Real-time and Continuous Turn-taking Prediction Using Voice Activity Projection
por: Inoue, Koji, et al.
Publicado: (2024) -
DualTurn: Learning Turn-Taking from Dual-Channel Generative Speech Pretraining
por: Rajaa, Shangeth
Publicado: (2026)