Towards EMG-to-Speech with a Necklace Form Factor
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Peter, Kaveh, Ryan, Nautiyal, Raghav, Zhang, Christine, Guo, Albert, Kachinthaya, Anvitha, Mishra, Tavish, Yu, Bohan, Black, Alan W, Muller, Rikky, Anumanchipalli, Gopala Krishna |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Scaling Spoken Language Models with Syllabic Speech Tokenization
par: Lee, Nicholas, et autres
Publié: (2025)
par: Lee, Nicholas, et autres
Publié: (2025)
Self-Supervised Models of Speech Infer Universal Articulatory Kinematics
par: Cho, Cheol Jun, et autres
Publié: (2023)
par: Cho, Cheol Jun, et autres
Publié: (2023)
Deep Speech Synthesis from Multimodal Articulatory Representations
par: Wu, Peter, et autres
Publié: (2024)
par: Wu, Peter, et autres
Publié: (2024)
Speech World Model: Causal State-Action Planning with Explicit Reasoning for Speech
par: Zhou, Xuanru, et autres
Publié: (2025)
par: Zhou, Xuanru, et autres
Publié: (2025)
Sylber 2.0: A Universal Syllable Embedding
par: Cho, Cheol Jun, et autres
Publié: (2026)
par: Cho, Cheol Jun, et autres
Publié: (2026)
Towards Hierarchical Spoken Language Dysfluency Modeling
par: Lian, Jiachen, et autres
Publié: (2024)
par: Lian, Jiachen, et autres
Publié: (2024)
Speech After Gender: A Trans-Feminine Perspective on Next Steps for Speech Science and Technology
par: Netzorg, Robin, et autres
Publié: (2024)
par: Netzorg, Robin, et autres
Publié: (2024)
Sylber: Syllabic Embedding Representation of Speech from Raw Audio
par: Cho, Cheol Jun, et autres
Publié: (2024)
par: Cho, Cheol Jun, et autres
Publié: (2024)
SD-HuBERT: Sentence-Level Self-Distillation Induces Syllabic Organization in HuBERT
par: Cho, Cheol Jun, et autres
Publié: (2023)
par: Cho, Cheol Jun, et autres
Publié: (2023)
Fast, High-Quality and Parameter-Efficient Articulatory Synthesis using Differentiable DSP
par: Liu, Yisi, et autres
Publié: (2024)
par: Liu, Yisi, et autres
Publié: (2024)
RT-VC: Real-Time Zero-Shot Voice Conversion with Speech Articulatory Coding
par: Liu, Yisi, et autres
Publié: (2025)
par: Liu, Yisi, et autres
Publié: (2025)
SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies
par: Lian, Jiachen, et autres
Publié: (2024)
par: Lian, Jiachen, et autres
Publié: (2024)
Teaching Machines to Speak Using Articulatory Control
par: Anand, Akshay, et autres
Publié: (2025)
par: Anand, Akshay, et autres
Publié: (2025)
Audio Texture Manipulation by Exemplar-Based Analogy
par: Cheng, Kan Jen, et autres
Publié: (2025)
par: Cheng, Kan Jen, et autres
Publié: (2025)
Coding Speech through Vocal Tract Kinematics
par: Cho, Cheol Jun, et autres
Publié: (2024)
par: Cho, Cheol Jun, et autres
Publié: (2024)
Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE
par: Lian, Jiachen, et autres
Publié: (2022)
par: Lian, Jiachen, et autres
Publié: (2022)
Multimodal Segmentation for Vocal Tract Modeling
par: Jain, Rishi, et autres
Publié: (2024)
par: Jain, Rishi, et autres
Publié: (2024)
SSDM: Scalable Speech Dysfluency Modeling
par: Lian, Jiachen, et autres
Publié: (2024)
par: Lian, Jiachen, et autres
Publié: (2024)
Confidence-Based Self-Training for EMG-to-Speech: Leveraging Synthetic EMG for Robust Modeling
par: Chen, Xiaodan, et autres
Publié: (2025)
par: Chen, Xiaodan, et autres
Publié: (2025)
HuPER: A Human-Inspired Framework for Phonetic Perception
par: Guo, Chenxu, et autres
Publié: (2026)
par: Guo, Chenxu, et autres
Publié: (2026)
YOLO-Stutter: End-to-end Region-Wise Speech Dysfluency Detection
par: Zhou, Xuanru, et autres
Publié: (2024)
par: Zhou, Xuanru, et autres
Publié: (2024)
Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities
par: Lin, Guan-Ting, et autres
Publié: (2025)
par: Lin, Guan-Ting, et autres
Publié: (2025)
Analysis and Evaluation of Synthetic Data Generation in Speech Dysfluency Detection
par: Zhang, Jinming, et autres
Publié: (2025)
par: Zhang, Jinming, et autres
Publié: (2025)
Fairness of Automatic Speech Recognition in Cleft Lip and Palate Speech
par: Bhattacharjee, Susmita, et autres
Publié: (2025)
par: Bhattacharjee, Susmita, et autres
Publié: (2025)
Time and Tokens: Benchmarking End-to-End Speech Dysfluency Detection
par: Zhou, Xuanru, et autres
Publié: (2024)
par: Zhou, Xuanru, et autres
Publié: (2024)
Articulatory Feature Prediction from Surface EMG during Speech Production
par: Lee, Jihwan, et autres
Publié: (2025)
par: Lee, Jihwan, et autres
Publié: (2025)
Affect Decoding in Phonated and Silent Speech Production from Surface EMG
par: Pistrosch, Simon, et autres
Publié: (2026)
par: Pistrosch, Simon, et autres
Publié: (2026)
Dysfluent WFST: A Framework for Zero-Shot Speech Dysfluency Transcription and Detection
par: Guo, Chenxu, et autres
Publié: (2025)
par: Guo, Chenxu, et autres
Publié: (2025)
DiariZen Explained: A Tutorial for the Open Source State-of-the-Art Speaker Diarization Pipeline
par: Raghav, Nikhil
Publié: (2026)
par: Raghav, Nikhil
Publié: (2026)
Efficient Long-Form Speech Recognition for General Speech In-Context Learning
par: Yen, Hao, et autres
Publié: (2024)
par: Yen, Hao, et autres
Publié: (2024)
Towards Explainable Spoofed Speech Attribution and Detection:a Probabilistic Approach for Characterizing Speech Synthesizer Components
par: Mishra, Jagabandhu, et autres
Publié: (2025)
par: Mishra, Jagabandhu, et autres
Publié: (2025)
Advancing Zero-Shot Open-Set Speech Deepfake Source Tracing
par: Chhibber, Manasi, et autres
Publié: (2025)
par: Chhibber, Manasi, et autres
Publié: (2025)
LLMs and Speech: Integration vs. Combination
par: Schmitt, Robin, et autres
Publié: (2026)
par: Schmitt, Robin, et autres
Publié: (2026)
Word Error Rate Definitions and Algorithms for Long-Form Multi-talker Speech Recognition
par: von Neumann, Thilo, et autres
Publié: (2025)
par: von Neumann, Thilo, et autres
Publié: (2025)
Long-Form Speech Generation with Spoken Language Models
par: Park, Se Jin, et autres
Publié: (2024)
par: Park, Se Jin, et autres
Publié: (2024)
HASS: Hierarchical Simulation of Logopenic Aphasic Speech for Scalable PPA Detection
par: Li, Harrison, et autres
Publié: (2026)
par: Li, Harrison, et autres
Publié: (2026)
SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue
par: Li, Ruiqi, et autres
Publié: (2026)
par: Li, Ruiqi, et autres
Publié: (2026)
MahaTTS: A Unified Framework for Multilingual Text-to-Speech Synthesis
par: Singh, Jaskaran, et autres
Publié: (2025)
par: Singh, Jaskaran, et autres
Publié: (2025)
CodecSlime: Temporal Redundancy Compression of Neural Speech Codec via Dynamic Frame Rate
par: Wang, Hankun, et autres
Publié: (2025)
par: Wang, Hankun, et autres
Publié: (2025)
A Survey on Speech Large Language Models for Understanding
par: Peng, Jing, et autres
Publié: (2024)
par: Peng, Jing, et autres
Publié: (2024)
Documents similaires
-
Scaling Spoken Language Models with Syllabic Speech Tokenization
par: Lee, Nicholas, et autres
Publié: (2025) -
Self-Supervised Models of Speech Infer Universal Articulatory Kinematics
par: Cho, Cheol Jun, et autres
Publié: (2023) -
Deep Speech Synthesis from Multimodal Articulatory Representations
par: Wu, Peter, et autres
Publié: (2024) -
Speech World Model: Causal State-Action Planning with Explicit Reasoning for Speech
par: Zhou, Xuanru, et autres
Publié: (2025) -
Sylber 2.0: A Universal Syllable Embedding
par: Cho, Cheol Jun, et autres
Publié: (2026)