Speech World Model: Causal State-Action Planning with Explicit Reasoning for Speech
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Xuanru, Lian, Jiachen, Hong, Henry, Yang, Xinyi, Anumanchipalli, Gopala |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards Hierarchical Spoken Language Dysfluency Modeling
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
SSDM: Scalable Speech Dysfluency Modeling
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
di: Lian, Jiachen, et al.
Pubblicazione: (2024)
Teaching Machines to Speak Using Articulatory Control
di: Anand, Akshay, et al.
Pubblicazione: (2025)
di: Anand, Akshay, et al.
Pubblicazione: (2025)
Analysis and Evaluation of Synthetic Data Generation in Speech Dysfluency Detection
di: Zhang, Jinming, et al.
Pubblicazione: (2025)
di: Zhang, Jinming, et al.
Pubblicazione: (2025)
Scaling Spoken Language Models with Syllabic Speech Tokenization
di: Lee, Nicholas, et al.
Pubblicazione: (2025)
di: Lee, Nicholas, et al.
Pubblicazione: (2025)
Time and Tokens: Benchmarking End-to-End Speech Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
Self-Supervised Models of Speech Infer Universal Articulatory Kinematics
di: Cho, Cheol Jun, et al.
Pubblicazione: (2023)
di: Cho, Cheol Jun, et al.
Pubblicazione: (2023)
YOLO-Stutter: End-to-end Region-Wise Speech Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
Dysfluent WFST: A Framework for Zero-Shot Speech Dysfluency Transcription and Detection
di: Guo, Chenxu, et al.
Pubblicazione: (2025)
di: Guo, Chenxu, et al.
Pubblicazione: (2025)
RT-VC: Real-Time Zero-Shot Voice Conversion with Speech Articulatory Coding
di: Liu, Yisi, et al.
Pubblicazione: (2025)
di: Liu, Yisi, et al.
Pubblicazione: (2025)
Speech After Gender: A Trans-Feminine Perspective on Next Steps for Speech Science and Technology
di: Netzorg, Robin, et al.
Pubblicazione: (2024)
di: Netzorg, Robin, et al.
Pubblicazione: (2024)
Seamless Dysfluent Speech Text Alignment for Disordered Speech Analysis
di: Ye, Zongli, et al.
Pubblicazione: (2025)
di: Ye, Zongli, et al.
Pubblicazione: (2025)
Towards EMG-to-Speech with a Necklace Form Factor
di: Wu, Peter, et al.
Pubblicazione: (2024)
di: Wu, Peter, et al.
Pubblicazione: (2024)
Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE
di: Lian, Jiachen, et al.
Pubblicazione: (2022)
di: Lian, Jiachen, et al.
Pubblicazione: (2022)
Deep Speech Synthesis from Multimodal Articulatory Representations
di: Wu, Peter, et al.
Pubblicazione: (2024)
di: Wu, Peter, et al.
Pubblicazione: (2024)
Towards Accurate Phonetic Error Detection Through Phoneme Similarity Modeling
di: Zhou, Xuanru, et al.
Pubblicazione: (2025)
di: Zhou, Xuanru, et al.
Pubblicazione: (2025)
HuPER: A Human-Inspired Framework for Phonetic Perception
di: Guo, Chenxu, et al.
Pubblicazione: (2026)
di: Guo, Chenxu, et al.
Pubblicazione: (2026)
Coding Speech through Vocal Tract Kinematics
di: Cho, Cheol Jun, et al.
Pubblicazione: (2024)
di: Cho, Cheol Jun, et al.
Pubblicazione: (2024)
Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities
di: Lin, Guan-Ting, et al.
Pubblicazione: (2025)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2025)
Sylber: Syllabic Embedding Representation of Speech from Raw Audio
di: Cho, Cheol Jun, et al.
Pubblicazione: (2024)
di: Cho, Cheol Jun, et al.
Pubblicazione: (2024)
EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Spoken Dialogue Systems
di: Liu, Jingwen, et al.
Pubblicazione: (2025)
di: Liu, Jingwen, et al.
Pubblicazione: (2025)
HASS: Hierarchical Simulation of Logopenic Aphasic Speech for Scalable PPA Detection
di: Li, Harrison, et al.
Pubblicazione: (2026)
di: Li, Harrison, et al.
Pubblicazione: (2026)
Audio Texture Manipulation by Exemplar-Based Analogy
di: Cheng, Kan Jen, et al.
Pubblicazione: (2025)
di: Cheng, Kan Jen, et al.
Pubblicazione: (2025)
Stutter-Solver: End-to-end Multi-lingual Dysfluency Detection
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
di: Zhou, Xuanru, et al.
Pubblicazione: (2024)
Full-Duplex-Bench v1.5: Evaluating Overlap Handling for Full-Duplex Speech Models
di: Lin, Guan-Ting, et al.
Pubblicazione: (2025)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2025)
Speech-Omni-Lite: Portable Speech Interfaces for Vision-Language Models
di: Tao, Dehua, et al.
Pubblicazione: (2026)
di: Tao, Dehua, et al.
Pubblicazione: (2026)
Exploiting Foundation Models and Speech Enhancement for Parkinson's Disease Detection from Speech in Real-World Operative Conditions
di: La Quatra, Moreno, et al.
Pubblicazione: (2024)
di: La Quatra, Moreno, et al.
Pubblicazione: (2024)
LCS-CTC: Leveraging Soft Alignments to Enhance Phonetic Transcription Robustness
di: Ye, Zongli, et al.
Pubblicazione: (2025)
di: Ye, Zongli, et al.
Pubblicazione: (2025)
Reasoning Beyond Majority Vote: An Explainable SpeechLM Framework for Speech Emotion Recognition
di: Su, Bo-Hao, et al.
Pubblicazione: (2025)
di: Su, Bo-Hao, et al.
Pubblicazione: (2025)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
di: Sang, Wendi, et al.
Pubblicazione: (2025)
di: Sang, Wendi, et al.
Pubblicazione: (2025)
Selective State Space Model for Monaural Speech Enhancement
di: Chen, Moran, et al.
Pubblicazione: (2024)
di: Chen, Moran, et al.
Pubblicazione: (2024)
Explicit Estimation of Magnitude and Phase Spectra in Parallel for High-Quality Speech Enhancement
di: Lu, Ye-Xin, et al.
Pubblicazione: (2023)
di: Lu, Ye-Xin, et al.
Pubblicazione: (2023)
Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation
di: Liu, Wenrui, et al.
Pubblicazione: (2025)
di: Liu, Wenrui, et al.
Pubblicazione: (2025)
Speech-Mamba: Long-Context Speech Recognition with Selective State Spaces Models
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
di: Gao, Xiaoxue, et al.
Pubblicazione: (2024)
SpeechMLC: Speech Multi-label Classification
di: Kim, Miseul, et al.
Pubblicazione: (2025)
di: Kim, Miseul, et al.
Pubblicazione: (2025)
DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action
di: Zhang, Haoyang, et al.
Pubblicazione: (2026)
di: Zhang, Haoyang, et al.
Pubblicazione: (2026)
Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis
di: Yang, Yifan, et al.
Pubblicazione: (2024)
di: Yang, Yifan, et al.
Pubblicazione: (2024)
Sylber 2.0: A Universal Syllable Embedding
di: Cho, Cheol Jun, et al.
Pubblicazione: (2026)
di: Cho, Cheol Jun, et al.
Pubblicazione: (2026)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
di: Yang, Qian, et al.
Pubblicazione: (2024)
di: Yang, Qian, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Towards Hierarchical Spoken Language Dysfluency Modeling
di: Lian, Jiachen, et al.
Pubblicazione: (2024) -
SSDM 2.0: Time-Accurate Speech Rich Transcription with Non-Fluencies
di: Lian, Jiachen, et al.
Pubblicazione: (2024) -
SSDM: Scalable Speech Dysfluency Modeling
di: Lian, Jiachen, et al.
Pubblicazione: (2024) -
Teaching Machines to Speak Using Articulatory Control
di: Anand, Akshay, et al.
Pubblicazione: (2025) -
Analysis and Evaluation of Synthetic Data Generation in Speech Dysfluency Detection
di: Zhang, Jinming, et al.
Pubblicazione: (2025)