Towards EMG-to-Speech with a Necklace Form Factor
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Peter, Kaveh, Ryan, Nautiyal, Raghav, Zhang, Christine, Guo, Albert, Kachinthaya, Anvitha, Mishra, Tavish, Yu, Bohan, Black, Alan W, Muller, Rikky, Anumanchipalli, Gopala Krishna |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Scaling Spoken Language Models with Syllabic Speech Tokenization
por: Lee, Nicholas, et al.
Publicado: (2025)
por: Lee, Nicholas, et al.
Publicado: (2025)
Self-Supervised Models of Speech Infer Universal Articulatory Kinematics
por: Cho, Cheol Jun, et al.
Publicado: (2023)
por: Cho, Cheol Jun, et al.
Publicado: (2023)
Deep Speech Synthesis from Multimodal Articulatory Representations
por: Wu, Peter, et al.
Publicado: (2024)
por: Wu, Peter, et al.
Publicado: (2024)
Speech World Model: Causal State-Action Planning with Explicit Reasoning for Speech
por: Zhou, Xuanru, et al.
Publicado: (2025)
por: Zhou, Xuanru, et al.
Publicado: (2025)
Sylber 2.0: A Universal Syllable Embedding
por: Cho, Cheol Jun, et al.
Publicado: (2026)
por: Cho, Cheol Jun, et al.
Publicado: (2026)
Towards Hierarchical Spoken Language Dysfluency Modeling
por: Lian, Jiachen, et al.
Publicado: (2024)
por: Lian, Jiachen, et al.
Publicado: (2024)
Speech After Gender: A Trans-Feminine Perspective on Next Steps for Speech Science and Technology
por: Netzorg, Robin, et al.
Publicado: (2024)
por: Netzorg, Robin, et al.
Publicado: (2024)
Sylber: Syllabic Embedding Representation of Speech from Raw Audio
por: Cho, Cheol Jun, et al.
Publicado: (2024)
por: Cho, Cheol Jun, et al.
Publicado: (2024)
SD-HuBERT: Sentence-Level Self-Distillation Induces Syllabic Organization in HuBERT
por: Cho, Cheol Jun, et al.
Publicado: (2023)
por: Cho, Cheol Jun, et al.
Publicado: (2023)
Fast, High-Quality and Parameter-Efficient Articulatory Synthesis using Differentiable DSP
por: Liu, Yisi, et al.
Publicado: (2024)
por: Liu, Yisi, et al.
Publicado: (2024)
RT-VC: Real-Time Zero-Shot Voice Conversion with Speech Articulatory Coding
por: Liu, Yisi, et al.
Publicado: (2025)
por: Liu, Yisi, et al.
Publicado: (2025)
SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies
por: Lian, Jiachen, et al.
Publicado: (2024)
por: Lian, Jiachen, et al.
Publicado: (2024)
Teaching Machines to Speak Using Articulatory Control
por: Anand, Akshay, et al.
Publicado: (2025)
por: Anand, Akshay, et al.
Publicado: (2025)
Audio Texture Manipulation by Exemplar-Based Analogy
por: Cheng, Kan Jen, et al.
Publicado: (2025)
por: Cheng, Kan Jen, et al.
Publicado: (2025)
Coding Speech through Vocal Tract Kinematics
por: Cho, Cheol Jun, et al.
Publicado: (2024)
por: Cho, Cheol Jun, et al.
Publicado: (2024)
Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE
por: Lian, Jiachen, et al.
Publicado: (2022)
por: Lian, Jiachen, et al.
Publicado: (2022)
Multimodal Segmentation for Vocal Tract Modeling
por: Jain, Rishi, et al.
Publicado: (2024)
por: Jain, Rishi, et al.
Publicado: (2024)
SSDM: Scalable Speech Dysfluency Modeling
por: Lian, Jiachen, et al.
Publicado: (2024)
por: Lian, Jiachen, et al.
Publicado: (2024)
Confidence-Based Self-Training for EMG-to-Speech: Leveraging Synthetic EMG for Robust Modeling
por: Chen, Xiaodan, et al.
Publicado: (2025)
por: Chen, Xiaodan, et al.
Publicado: (2025)
HuPER: A Human-Inspired Framework for Phonetic Perception
por: Guo, Chenxu, et al.
Publicado: (2026)
por: Guo, Chenxu, et al.
Publicado: (2026)
YOLO-Stutter: End-to-end Region-Wise Speech Dysfluency Detection
por: Zhou, Xuanru, et al.
Publicado: (2024)
por: Zhou, Xuanru, et al.
Publicado: (2024)
Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities
por: Lin, Guan-Ting, et al.
Publicado: (2025)
por: Lin, Guan-Ting, et al.
Publicado: (2025)
Analysis and Evaluation of Synthetic Data Generation in Speech Dysfluency Detection
por: Zhang, Jinming, et al.
Publicado: (2025)
por: Zhang, Jinming, et al.
Publicado: (2025)
Fairness of Automatic Speech Recognition in Cleft Lip and Palate Speech
por: Bhattacharjee, Susmita, et al.
Publicado: (2025)
por: Bhattacharjee, Susmita, et al.
Publicado: (2025)
Time and Tokens: Benchmarking End-to-End Speech Dysfluency Detection
por: Zhou, Xuanru, et al.
Publicado: (2024)
por: Zhou, Xuanru, et al.
Publicado: (2024)
Articulatory Feature Prediction from Surface EMG during Speech Production
por: Lee, Jihwan, et al.
Publicado: (2025)
por: Lee, Jihwan, et al.
Publicado: (2025)
Affect Decoding in Phonated and Silent Speech Production from Surface EMG
por: Pistrosch, Simon, et al.
Publicado: (2026)
por: Pistrosch, Simon, et al.
Publicado: (2026)
Dysfluent WFST: A Framework for Zero-Shot Speech Dysfluency Transcription and Detection
por: Guo, Chenxu, et al.
Publicado: (2025)
por: Guo, Chenxu, et al.
Publicado: (2025)
DiariZen Explained: A Tutorial for the Open Source State-of-the-Art Speaker Diarization Pipeline
por: Raghav, Nikhil
Publicado: (2026)
por: Raghav, Nikhil
Publicado: (2026)
Efficient Long-Form Speech Recognition for General Speech In-Context Learning
por: Yen, Hao, et al.
Publicado: (2024)
por: Yen, Hao, et al.
Publicado: (2024)
Towards Explainable Spoofed Speech Attribution and Detection:a Probabilistic Approach for Characterizing Speech Synthesizer Components
por: Mishra, Jagabandhu, et al.
Publicado: (2025)
por: Mishra, Jagabandhu, et al.
Publicado: (2025)
Advancing Zero-Shot Open-Set Speech Deepfake Source Tracing
por: Chhibber, Manasi, et al.
Publicado: (2025)
por: Chhibber, Manasi, et al.
Publicado: (2025)
LLMs and Speech: Integration vs. Combination
por: Schmitt, Robin, et al.
Publicado: (2026)
por: Schmitt, Robin, et al.
Publicado: (2026)
Word Error Rate Definitions and Algorithms for Long-Form Multi-talker Speech Recognition
por: von Neumann, Thilo, et al.
Publicado: (2025)
por: von Neumann, Thilo, et al.
Publicado: (2025)
Long-Form Speech Generation with Spoken Language Models
por: Park, Se Jin, et al.
Publicado: (2024)
por: Park, Se Jin, et al.
Publicado: (2024)
HASS: Hierarchical Simulation of Logopenic Aphasic Speech for Scalable PPA Detection
por: Li, Harrison, et al.
Publicado: (2026)
por: Li, Harrison, et al.
Publicado: (2026)
SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue
por: Li, Ruiqi, et al.
Publicado: (2026)
por: Li, Ruiqi, et al.
Publicado: (2026)
MahaTTS: A Unified Framework for Multilingual Text-to-Speech Synthesis
por: Singh, Jaskaran, et al.
Publicado: (2025)
por: Singh, Jaskaran, et al.
Publicado: (2025)
CodecSlime: Temporal Redundancy Compression of Neural Speech Codec via Dynamic Frame Rate
por: Wang, Hankun, et al.
Publicado: (2025)
por: Wang, Hankun, et al.
Publicado: (2025)
A Survey on Speech Large Language Models for Understanding
por: Peng, Jing, et al.
Publicado: (2024)
por: Peng, Jing, et al.
Publicado: (2024)
Ejemplares similares
-
Scaling Spoken Language Models with Syllabic Speech Tokenization
por: Lee, Nicholas, et al.
Publicado: (2025) -
Self-Supervised Models of Speech Infer Universal Articulatory Kinematics
por: Cho, Cheol Jun, et al.
Publicado: (2023) -
Deep Speech Synthesis from Multimodal Articulatory Representations
por: Wu, Peter, et al.
Publicado: (2024) -
Speech World Model: Causal State-Action Planning with Explicit Reasoning for Speech
por: Zhou, Xuanru, et al.
Publicado: (2025) -
Sylber 2.0: A Universal Syllable Embedding
por: Cho, Cheol Jun, et al.
Publicado: (2026)