A cross-talk robust multichannel VAD model for multiparty agent interactions trained using synthetic re-recordings
Fuente:
arXiv
Salvato in:
| Autori principali: | Han, Hyewon, Kumar, Naveen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ExSampling: a system for the real-time ensemble performance of field-recorded environmental sounds
di: Kobayashi, Atsuya, et al.
Pubblicazione: (2020)
di: Kobayashi, Atsuya, et al.
Pubblicazione: (2020)
I Know You're Listening: Adaptive Voice for HRI
di: Tuttösí, Paige
Pubblicazione: (2025)
di: Tuttösí, Paige
Pubblicazione: (2025)
Open vocabulary keyword spotting through transfer learning from speech synthesis
di: V, Kesavaraj, et al.
Pubblicazione: (2024)
di: V, Kesavaraj, et al.
Pubblicazione: (2024)
Interactive Sonification for Health and Energy using ChucK and Unity
di: Zhao, Yichun, et al.
Pubblicazione: (2024)
di: Zhao, Yichun, et al.
Pubblicazione: (2024)
NeckCare: Preventing Tech Neck using Hearable-based Multimodal Sensing
di: Chhaglani, Bhawana, et al.
Pubblicazione: (2024)
di: Chhaglani, Bhawana, et al.
Pubblicazione: (2024)
SingVisio: Visual Analytics of Diffusion Model for Singing Voice Conversion
di: Xue, Liumeng, et al.
Pubblicazione: (2024)
di: Xue, Liumeng, et al.
Pubblicazione: (2024)
InSerter: Speech Instruction Following with Unsupervised Interleaved Pre-training
di: Wang, Dingdong, et al.
Pubblicazione: (2025)
di: Wang, Dingdong, et al.
Pubblicazione: (2025)
NeuroIncept Decoder for High-Fidelity Speech Reconstruction from Neural Activity
di: Khanday, Owais Mujtaba, et al.
Pubblicazione: (2025)
di: Khanday, Owais Mujtaba, et al.
Pubblicazione: (2025)
Recreating Neural Activity During Speech Production with Language and Speech Model Embeddings
di: Khanday, Owais Mujtaba, et al.
Pubblicazione: (2025)
di: Khanday, Owais Mujtaba, et al.
Pubblicazione: (2025)
Sound2Hap: Learning Audio-to-Vibrotactile Haptic Generation from Human Ratings
di: Li, Yinan, et al.
Pubblicazione: (2026)
di: Li, Yinan, et al.
Pubblicazione: (2026)
A Mapping Strategy for Interacting with Latent Audio Synthesis Using Artistic Materials
di: Zheng, Shuoyang, et al.
Pubblicazione: (2024)
di: Zheng, Shuoyang, et al.
Pubblicazione: (2024)
Enhancing DMI Interactions by Integrating Haptic Feedback for Intricate Vibrato Technique
di: Piao, Ziyue, et al.
Pubblicazione: (2024)
di: Piao, Ziyue, et al.
Pubblicazione: (2024)
Towards Temporally Explainable Dysarthric Speech Clarity Assessment
di: Park, Seohyun, et al.
Pubblicazione: (2025)
di: Park, Seohyun, et al.
Pubblicazione: (2025)
A Near-Real-Time Processing Ego Speech Filtering Pipeline Designed for Speech Interruption During Human-Robot Interaction
di: Li, Yue, et al.
Pubblicazione: (2024)
di: Li, Yue, et al.
Pubblicazione: (2024)
USpeech: Ultrasound-Enhanced Speech with Minimal Human Effort via Cross-Modal Synthesis
di: Yu, Luca Jiang-Tao, et al.
Pubblicazione: (2024)
di: Yu, Luca Jiang-Tao, et al.
Pubblicazione: (2024)
Seeing Beyond Sound: Visualization and Abstraction in Audio Data Representation
di: Blum'e, Ashlae
Pubblicazione: (2025)
di: Blum'e, Ashlae
Pubblicazione: (2025)
Early Detection of Furniture-Infesting Wood-Boring Beetles Using CNN-LSTM Networks and MFCC-Based Acoustic Features
di: Manukalpa, J. M. Chan Sri, et al.
Pubblicazione: (2025)
di: Manukalpa, J. M. Chan Sri, et al.
Pubblicazione: (2025)
Interfacing with history: Curating with audio augmented objects
di: Cliffe, Laurence
Pubblicazione: (2024)
di: Cliffe, Laurence
Pubblicazione: (2024)
Transhuman Ansambl - Voice Beyond Language
di: Ivsic, Lucija, et al.
Pubblicazione: (2024)
di: Ivsic, Lucija, et al.
Pubblicazione: (2024)
How Private is Low-Frequency Speech Audio in the Wild? An Analysis of Verbal Intelligibility by Humans and Machines
di: Liu, Ailin, et al.
Pubblicazione: (2024)
di: Liu, Ailin, et al.
Pubblicazione: (2024)
Cervical Auscultation Machine Learning for Dysphagia Assessment
di: Chia, An An, et al.
Pubblicazione: (2024)
di: Chia, An An, et al.
Pubblicazione: (2024)
Adapting Whisper for Lightweight and Efficient Automatic Speech Recognition of Children for On-device Edge Applications
di: Dutta, Satwik, et al.
Pubblicazione: (2025)
di: Dutta, Satwik, et al.
Pubblicazione: (2025)
Real-time Generation of Various Types of Nodding for Avatar Attentive Listening System
di: Kato, Kazushi, et al.
Pubblicazione: (2025)
di: Kato, Kazushi, et al.
Pubblicazione: (2025)
BioSonix: Can Physics-Based Sonification Perceptualize Tissue Deformations From Tool Interactions?
di: Ruozzi, Veronica, et al.
Pubblicazione: (2025)
di: Ruozzi, Veronica, et al.
Pubblicazione: (2025)
Springboard, Roadblock or "Crutch"?: How Transgender Users Leverage Voice Changers for Gender Presentation in Social Virtual Reality
di: Povinelli, Kassie, et al.
Pubblicazione: (2024)
di: Povinelli, Kassie, et al.
Pubblicazione: (2024)
Evolving Performance Practices in Beethoven's Cello Sonatas: Tempo, Portamento, and Historical Interpretation of the First Movements
di: Sole, Ignasi
Pubblicazione: (2025)
di: Sole, Ignasi
Pubblicazione: (2025)
SCDiar: a streaming diarization system based on speaker change detection and speech recognition
di: Zheng, Naijun, et al.
Pubblicazione: (2025)
di: Zheng, Naijun, et al.
Pubblicazione: (2025)
Teach Me How to ImproVISe: Co-Designing an Augmented Piano Training System for Improvisation
di: Deja, Jordan Aiko, et al.
Pubblicazione: (2024)
di: Deja, Jordan Aiko, et al.
Pubblicazione: (2024)
The effect of self-motion and room familiarity on sound source localization in virtual environments
di: Isserstedt, Niklas, et al.
Pubblicazione: (2024)
di: Isserstedt, Niklas, et al.
Pubblicazione: (2024)
Hidden bawls, whispers, and yelps: can text be made to sound more than just its words?
di: Pataca, Caluã de Lacerda, et al.
Pubblicazione: (2022)
di: Pataca, Caluã de Lacerda, et al.
Pubblicazione: (2022)
Optimizing Dysarthria Wake-Up Word Spotting: An End-to-End Approach for SLT 2024 LRDWWS Challenge
di: Liu, Shuiyun, et al.
Pubblicazione: (2024)
di: Liu, Shuiyun, et al.
Pubblicazione: (2024)
SACM: SEEG-Audio Contrastive Matching for Chinese Speech Decoding
di: Wang, Hongbin, et al.
Pubblicazione: (2025)
di: Wang, Hongbin, et al.
Pubblicazione: (2025)
Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition
di: Chen, Youjun, et al.
Pubblicazione: (2025)
di: Chen, Youjun, et al.
Pubblicazione: (2025)
Beyond-Voice: Towards Continuous 3D Hand Pose Tracking on Commercial Home Assistant Devices
di: Li, Yin, et al.
Pubblicazione: (2023)
di: Li, Yin, et al.
Pubblicazione: (2023)
WSCoach: Wearable Real-time Auditory Feedback for Reducing Unwanted Words in Daily Communication
di: Youpeng, Zhang, et al.
Pubblicazione: (2025)
di: Youpeng, Zhang, et al.
Pubblicazione: (2025)
Low-latency auditory spatial attention detection based on spectro-spatial features from EEG
di: Cai, Siqi, et al.
Pubblicazione: (2021)
di: Cai, Siqi, et al.
Pubblicazione: (2021)
Collaboration Between Robots, Interfaces and Humans: Practice-Based and Audience Perspectives
di: Savery, Anna, et al.
Pubblicazione: (2024)
di: Savery, Anna, et al.
Pubblicazione: (2024)
A Framework for AI assisted Musical Devices
di: Civit, Miguel, et al.
Pubblicazione: (2024)
di: Civit, Miguel, et al.
Pubblicazione: (2024)
Coupling the Heart to Musical Machines
di: Easthope, Eric
Pubblicazione: (2025)
di: Easthope, Eric
Pubblicazione: (2025)
Directional Source Separation for Robust Speech Recognition on Smart Glasses
di: Feng, Tiantian, et al.
Pubblicazione: (2023)
di: Feng, Tiantian, et al.
Pubblicazione: (2023)
Documenti analoghi
-
ExSampling: a system for the real-time ensemble performance of field-recorded environmental sounds
di: Kobayashi, Atsuya, et al.
Pubblicazione: (2020) -
I Know You're Listening: Adaptive Voice for HRI
di: Tuttösí, Paige
Pubblicazione: (2025) -
Open vocabulary keyword spotting through transfer learning from speech synthesis
di: V, Kesavaraj, et al.
Pubblicazione: (2024) -
Interactive Sonification for Health and Energy using ChucK and Unity
di: Zhao, Yichun, et al.
Pubblicazione: (2024) -
NeckCare: Preventing Tech Neck using Hearable-based Multimodal Sensing
di: Chhaglani, Bhawana, et al.
Pubblicazione: (2024)