USpeech: Ultrasound-Enhanced Speech with Minimal Human Effort via Cross-Modal Synthesis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Luca Jiang-Tao, Zhao, Running, Ji, Sijie, Ngai, Edith C. H., Wu, Chenshu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Cross-Modal Approach to Silent Speech with LLM-Enhanced Recognition
par: Benster, Tyler, et autres
Publié: (2024)
par: Benster, Tyler, et autres
Publié: (2024)
A Near-Real-Time Processing Ego Speech Filtering Pipeline Designed for Speech Interruption During Human-Robot Interaction
par: Li, Yue, et autres
Publié: (2024)
par: Li, Yue, et autres
Publié: (2024)
Robust Dual-Modal Speech Keyword Spotting for XR Headsets
par: Cai, Zhuojiang, et autres
Publié: (2024)
par: Cai, Zhuojiang, et autres
Publié: (2024)
How Private is Low-Frequency Speech Audio in the Wild? An Analysis of Verbal Intelligibility by Humans and Machines
par: Liu, Ailin, et autres
Publié: (2024)
par: Liu, Ailin, et autres
Publié: (2024)
AVE Speech: A Comprehensive Multi-Modal Dataset for Speech Recognition Integrating Audio, Visual, and Electromyographic Signals
par: Zhou, Dongliang, et autres
Publié: (2025)
par: Zhou, Dongliang, et autres
Publié: (2025)
Recreating Neural Activity During Speech Production with Language and Speech Model Embeddings
par: Khanday, Owais Mujtaba, et autres
Publié: (2025)
par: Khanday, Owais Mujtaba, et autres
Publié: (2025)
Personalized Speech Emotion Recognition in Human-Robot Interaction using Vision Transformers
par: Mishra, Ruchik, et autres
Publié: (2024)
par: Mishra, Ruchik, et autres
Publié: (2024)
Towards Temporally Explainable Dysarthric Speech Clarity Assessment
par: Park, Seohyun, et autres
Publié: (2025)
par: Park, Seohyun, et autres
Publié: (2025)
SACM: SEEG-Audio Contrastive Matching for Chinese Speech Decoding
par: Wang, Hongbin, et autres
Publié: (2025)
par: Wang, Hongbin, et autres
Publié: (2025)
Directional Source Separation for Robust Speech Recognition on Smart Glasses
par: Feng, Tiantian, et autres
Publié: (2023)
par: Feng, Tiantian, et autres
Publié: (2023)
VoiceX: A Text-To-Speech Framework for Custom Voices
par: Mertes, Silvan, et autres
Publié: (2024)
par: Mertes, Silvan, et autres
Publié: (2024)
Psychophysiology-aided Perceptually Fluent Speech Analysis of Children Who Stutter
par: Xiao, Yi, et autres
Publié: (2022)
par: Xiao, Yi, et autres
Publié: (2022)
Speech vs. Transcript: Does It Matter for Human Annotators in Speech Summarization?
par: Sharma, Roshan, et autres
Publié: (2024)
par: Sharma, Roshan, et autres
Publié: (2024)
NeuroIncept Decoder for High-Fidelity Speech Reconstruction from Neural Activity
par: Khanday, Owais Mujtaba, et autres
Publié: (2025)
par: Khanday, Owais Mujtaba, et autres
Publié: (2025)
Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition
par: Chen, Youjun, et autres
Publié: (2025)
par: Chen, Youjun, et autres
Publié: (2025)
Using Confidence Scores to Improve Eyes-free Detection of Speech Recognition Errors
par: Nowrin, Sadia, et autres
Publié: (2024)
par: Nowrin, Sadia, et autres
Publié: (2024)
DESAMO: A Device for Elder-Friendly Smart Homes Powered by Embedded LLM with Audio Modality
par: Choi, Youngwon, et autres
Publié: (2025)
par: Choi, Youngwon, et autres
Publié: (2025)
Adapting Whisper for Lightweight and Efficient Automatic Speech Recognition of Children for On-device Edge Applications
par: Dutta, Satwik, et autres
Publié: (2025)
par: Dutta, Satwik, et autres
Publié: (2025)
Improving Multimodal Emotion Recognition by Leveraging Acoustic Adaptation and Visual Alignment
par: Zhao, Zhixian, et autres
Publié: (2024)
par: Zhao, Zhixian, et autres
Publié: (2024)
Human Feedback Driven Dynamic Speech Emotion Recognition
par: Fedorov, Ilya, et autres
Publié: (2025)
par: Fedorov, Ilya, et autres
Publié: (2025)
ASE: Practical Acoustic Speed Estimation Beyond Doppler via Sound Diffusion Field
par: Lyu, Sheng, et autres
Publié: (2024)
par: Lyu, Sheng, et autres
Publié: (2024)
CardioLive: Empowering Video Streaming with Online Cardiac Monitoring
par: Lyu, Sheng, et autres
Publié: (2025)
par: Lyu, Sheng, et autres
Publié: (2025)
Collaboration Between Robots, Interfaces and Humans: Practice-Based and Audience Perspectives
par: Savery, Anna, et autres
Publié: (2024)
par: Savery, Anna, et autres
Publié: (2024)
A Mapping Strategy for Interacting with Latent Audio Synthesis Using Artistic Materials
par: Zheng, Shuoyang, et autres
Publié: (2024)
par: Zheng, Shuoyang, et autres
Publié: (2024)
Sound-Based Recognition of Touch Gestures and Emotions for Enhanced Human-Robot Interaction
par: Hou, Yuanbo, et autres
Publié: (2024)
par: Hou, Yuanbo, et autres
Publié: (2024)
Sound2Hap: Learning Audio-to-Vibrotactile Haptic Generation from Human Ratings
par: Li, Yinan, et autres
Publié: (2026)
par: Li, Yinan, et autres
Publié: (2026)
Enhancing DMI Interactions by Integrating Haptic Feedback for Intricate Vibrato Technique
par: Piao, Ziyue, et autres
Publié: (2024)
par: Piao, Ziyue, et autres
Publié: (2024)
Interactive Sonification for Health and Energy using ChucK and Unity
par: Zhao, Yichun, et autres
Publié: (2024)
par: Zhao, Yichun, et autres
Publié: (2024)
Springboard, Roadblock or "Crutch"?: How Transgender Users Leverage Voice Changers for Gender Presentation in Social Virtual Reality
par: Povinelli, Kassie, et autres
Publié: (2024)
par: Povinelli, Kassie, et autres
Publié: (2024)
Real-Time Word-Level Temporal Segmentation in Streaming Speech Recognition
par: Nishida, Naoto, et autres
Publié: (2025)
par: Nishida, Naoto, et autres
Publié: (2025)
Cross-Lingual Speech Emotion Recognition: Humans vs. Self-Supervised Models
par: Han, Zhichen, et autres
Publié: (2024)
par: Han, Zhichen, et autres
Publié: (2024)
InSerter: Speech Instruction Following with Unsupervised Interleaved Pre-training
par: Wang, Dingdong, et autres
Publié: (2025)
par: Wang, Dingdong, et autres
Publié: (2025)
WSCoach: Wearable Real-time Auditory Feedback for Reducing Unwanted Words in Daily Communication
par: Youpeng, Zhang, et autres
Publié: (2025)
par: Youpeng, Zhang, et autres
Publié: (2025)
ListenNet: A Lightweight Spatio-Temporal Enhancement Nested Network for Auditory Attention Detection
par: Fan, Cunhang, et autres
Publié: (2025)
par: Fan, Cunhang, et autres
Publié: (2025)
MHANet: Multi-scale Hybrid Attention Network for Auditory Attention Detection
par: Li, Lu, et autres
Publié: (2025)
par: Li, Lu, et autres
Publié: (2025)
OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios
par: Cheng, Xize, et autres
Publié: (2025)
par: Cheng, Xize, et autres
Publié: (2025)
Assessing the Viability of Wave Field Synthesis in VR-Based Cognitive Research
par: Kahl, Benjamin
Publié: (2025)
par: Kahl, Benjamin
Publié: (2025)
Detecting COPD Through Speech Analysis: A Dataset of Danish Speech and Machine Learning Approach
par: Sankey-Olsen, Cuno, et autres
Publié: (2025)
par: Sankey-Olsen, Cuno, et autres
Publié: (2025)
Sound Judgment: Properties of Consequential Sounds Affecting Human-Perception of Robots
par: Allen, Aimee, et autres
Publié: (2025)
par: Allen, Aimee, et autres
Publié: (2025)
STAA-Net: A Sparse and Transferable Adversarial Attack for Speech Emotion Recognition
par: Chang, Yi, et autres
Publié: (2024)
par: Chang, Yi, et autres
Publié: (2024)
Documents similaires
-
A Cross-Modal Approach to Silent Speech with LLM-Enhanced Recognition
par: Benster, Tyler, et autres
Publié: (2024) -
A Near-Real-Time Processing Ego Speech Filtering Pipeline Designed for Speech Interruption During Human-Robot Interaction
par: Li, Yue, et autres
Publié: (2024) -
Robust Dual-Modal Speech Keyword Spotting for XR Headsets
par: Cai, Zhuojiang, et autres
Publié: (2024) -
How Private is Low-Frequency Speech Audio in the Wild? An Analysis of Verbal Intelligibility by Humans and Machines
par: Liu, Ailin, et autres
Publié: (2024) -
AVE Speech: A Comprehensive Multi-Modal Dataset for Speech Recognition Integrating Audio, Visual, and Electromyographic Signals
par: Zhou, Dongliang, et autres
Publié: (2025)