MiSTR: Multi-Modal iEEG-to-Speech Synthesis with Transformer-Based Prosody Prediction and Neural Phase Reconstruction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Al-Radhi, Mohammed Salah, Németh, Géza, Gerazov, Branislav |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Brain-to-Speech: Prosody Feature Engineering and Transformer-Based Reconstruction
par: Al-Radhi, Mohammed Salah, et autres
Publié: (2026)
par: Al-Radhi, Mohammed Salah, et autres
Publié: (2026)
Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling
par: Jiang, Yuepeng, et autres
Publié: (2024)
par: Jiang, Yuepeng, et autres
Publié: (2024)
Prosody-Guided Harmonic Attention for Phase-Coherent Neural Vocoding in the Complex Spectrum
par: Al-Radhi, Mohammed Salah, et autres
Publié: (2026)
par: Al-Radhi, Mohammed Salah, et autres
Publié: (2026)
DiffProsody: Diffusion-based Latent Prosody Generation for Expressive Speech Synthesis with Prosody Conditional Adversarial Training
par: Oh, Hyung-Seok, et autres
Publié: (2023)
par: Oh, Hyung-Seok, et autres
Publié: (2023)
Phone-Level Prosody Modelling with GMM-Based MDN for Diverse and Controllable Speech Synthesis
par: Du, Chenpeng, et autres
Publié: (2021)
par: Du, Chenpeng, et autres
Publié: (2021)
Prosody Labeling with Phoneme-BERT and Speech Foundation Models
par: Koriyama, Tomoki
Publié: (2025)
par: Koriyama, Tomoki
Publié: (2025)
ProsodyFM: Unsupervised Phrasing and Intonation Control for Intelligible Speech Synthesis
par: He, Xiangheng, et autres
Publié: (2024)
par: He, Xiangheng, et autres
Publié: (2024)
Arabic ASR on the SADA Large-Scale Arabic Speech Corpus with Transformer-Based Models
par: Gerazov, Branislav, et autres
Publié: (2025)
par: Gerazov, Branislav, et autres
Publié: (2025)
Combining Masked Language Modeling and Cross-Modal Contrastive Learning for Prosody-Aware TTS
par: Borodin, Kirill, et autres
Publié: (2026)
par: Borodin, Kirill, et autres
Publié: (2026)
Benchmarking Prosody Encoding in Discrete Speech Tokens
par: Onda, Kentaro, et autres
Publié: (2025)
par: Onda, Kentaro, et autres
Publié: (2025)
Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting
par: Han, Wooseok, et autres
Publié: (2024)
par: Han, Wooseok, et autres
Publié: (2024)
Objective Evaluation of Prosody and Intelligibility in Speech Synthesis via Conditional Prediction of Discrete Tokens
par: Ulgen, Ismail Rasim, et autres
Publié: (2025)
par: Ulgen, Ismail Rasim, et autres
Publié: (2025)
Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM
par: Cui, Wenqian, et autres
Publié: (2026)
par: Cui, Wenqian, et autres
Publié: (2026)
Distinguishing Neural Speech Synthesis Models Through Fingerprints in Speech Waveforms
par: Zhang, Chu Yuan, et autres
Publié: (2023)
par: Zhang, Chu Yuan, et autres
Publié: (2023)
An Explicit Consistency-Preserving Loss Function for Phase Reconstruction and Speech Enhancement
par: Ku, Pin-Jui, et autres
Publié: (2024)
par: Ku, Pin-Jui, et autres
Publié: (2024)
Speech is More Than Words: Do Speech-to-Text Translation Systems Leverage Prosody?
par: Tsiamas, Ioannis, et autres
Publié: (2024)
par: Tsiamas, Ioannis, et autres
Publié: (2024)
Balalaika: Data-Centric, Prosody-Aware Annotation Pipeline for Russian Speech
par: Borodin, Kirill, et autres
Publié: (2025)
par: Borodin, Kirill, et autres
Publié: (2025)
Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction
par: Chen, Xueyuan, et autres
Publié: (2024)
par: Chen, Xueyuan, et autres
Publié: (2024)
Less Forgetting for Better Generalization: Exploring Continual-learning Fine-tuning Methods for Speech Self-supervised Representations
par: Zaiem, Salah, et autres
Publié: (2024)
par: Zaiem, Salah, et autres
Publié: (2024)
AutoProsody: A Prosodic Feature Extraction Tool for Indian Languages
par: Thinakaran, Preethi, et autres
Publié: (2025)
par: Thinakaran, Preethi, et autres
Publié: (2025)
Central Kurdish Text-to-Speech Synthesis with Novel End-to-End Transformer Training
par: Ahmad, Hawraz A., et autres
Publié: (2024)
par: Ahmad, Hawraz A., et autres
Publié: (2024)
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
par: Jung, Jaemin, et autres
Publié: (2024)
par: Jung, Jaemin, et autres
Publié: (2024)
Geometry-Constrained EEG Channel Selection for Brain-Assisted Speech Enhancement
par: Zuo, Keying, et autres
Publié: (2024)
par: Zuo, Keying, et autres
Publié: (2024)
Prosody Analysis of Audiobooks
par: Pethe, Charuta, et autres
Publié: (2023)
par: Pethe, Charuta, et autres
Publié: (2023)
Low-Latency Neural Speech Phase Prediction based on Parallel Estimation Architecture and Anti-Wrapping Losses for Speech Generation Tasks
par: Ai, Yang, et autres
Publié: (2024)
par: Ai, Yang, et autres
Publié: (2024)
Phase-Retrieval-Based Physics-Informed Neural Networks For Acoustic Magnitude Field Reconstruction
par: Schrader, Karl, et autres
Publié: (2026)
par: Schrader, Karl, et autres
Publié: (2026)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
par: Yang, Qian, et autres
Publié: (2024)
par: Yang, Qian, et autres
Publié: (2024)
HuLA: Prosody-Aware Anti-Spoofing with Multi-Task Learning for Expressive and Emotional Synthetic Speech
par: Mahapatra, Aurosweta, et autres
Publié: (2025)
par: Mahapatra, Aurosweta, et autres
Publié: (2025)
FluentEditor2: Text-based Speech Editing by Modeling Multi-Scale Acoustic and Prosody Consistency
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Neural2Speech: A Transfer Learning Framework for Neural-Driven Speech Reconstruction
par: Li, Jiawei, et autres
Publié: (2023)
par: Li, Jiawei, et autres
Publié: (2023)
Neural Vocoders as Speech Enhancers
par: Li, Andong, et autres
Publié: (2025)
par: Li, Andong, et autres
Publié: (2025)
Personalized Neural Speech Codec
par: Jang, Inseon, et autres
Publié: (2024)
par: Jang, Inseon, et autres
Publié: (2024)
A Neural Speech Codec for Noise Robust Speech Coding
par: Huang, Jiayi, et autres
Publié: (2023)
par: Huang, Jiayi, et autres
Publié: (2023)
Parallel Synthesis for Autoregressive Speech Generation
par: Hsu, Po-chun, et autres
Publié: (2022)
par: Hsu, Po-chun, et autres
Publié: (2022)
Disentangling the Prosody and Semantic Information with Pre-trained Model for In-Context Learning based Zero-Shot Voice Conversion
par: Chen, Zhengyang, et autres
Publié: (2024)
par: Chen, Zhengyang, et autres
Publié: (2024)
HALL-E: Hierarchical Neural Codec Language Model for Minute-Long Zero-Shot Text-to-Speech Synthesis
par: Nishimura, Yuto, et autres
Publié: (2024)
par: Nishimura, Yuto, et autres
Publié: (2024)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
par: Chen, Weidong, et autres
Publié: (2025)
par: Chen, Weidong, et autres
Publié: (2025)
ToneUnit: A Speech Discretization Approach for Tonal Language Speech Synthesis
par: Tao, Dehua, et autres
Publié: (2024)
par: Tao, Dehua, et autres
Publié: (2024)
Multi-Modal Automatic Prosody Annotation with Contrastive Pretraining of SSWP
par: Zhong, Jinzuomu, et autres
Publié: (2023)
par: Zhong, Jinzuomu, et autres
Publié: (2023)
Accelerating Diffusion Transformer-Based Text-to-Speech with Transformer Layer Caching
par: Sakpiboonchit, Siratish
Publié: (2025)
par: Sakpiboonchit, Siratish
Publié: (2025)
Documents similaires
-
Brain-to-Speech: Prosody Feature Engineering and Transformer-Based Reconstruction
par: Al-Radhi, Mohammed Salah, et autres
Publié: (2026) -
Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling
par: Jiang, Yuepeng, et autres
Publié: (2024) -
Prosody-Guided Harmonic Attention for Phase-Coherent Neural Vocoding in the Complex Spectrum
par: Al-Radhi, Mohammed Salah, et autres
Publié: (2026) -
DiffProsody: Diffusion-based Latent Prosody Generation for Expressive Speech Synthesis with Prosody Conditional Adversarial Training
par: Oh, Hyung-Seok, et autres
Publié: (2023) -
Phone-Level Prosody Modelling with GMM-Based MDN for Diverse and Controllable Speech Synthesis
par: Du, Chenpeng, et autres
Publié: (2021)