RAF: Relativistic Adversarial Feedback For Universal Speech Synthesis
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Lee, Yongjoon, Choi, Jung-Woo |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SEMamba++: A General Speech Restoration Framework Leveraging Global, Local, and Periodic Spectral Patterns
von: Lee, Yongjoon, et al.
Veröffentlicht: (2026)
von: Lee, Yongjoon, et al.
Veröffentlicht: (2026)
Wave-U-Mamba: An End-To-End Framework For High-Quality And Efficient Speech Super Resolution
von: Lee, Yongjoon, et al.
Veröffentlicht: (2024)
von: Lee, Yongjoon, et al.
Veröffentlicht: (2024)
DeFT-Mamba: Universal Multichannel Sound Separation and Polyphonic Audio Classification
von: Lee, Dongheon, et al.
Veröffentlicht: (2024)
von: Lee, Dongheon, et al.
Veröffentlicht: (2024)
DISPATCH: Distilling Selective Patches for Speech Enhancement
von: Kim, Dohwan, et al.
Veröffentlicht: (2025)
von: Kim, Dohwan, et al.
Veröffentlicht: (2025)
Speech-Declipping Transformer with Complex Spectrogram and Learnerble Temporal Features
von: Kwon, Younghoo, et al.
Veröffentlicht: (2024)
von: Kwon, Younghoo, et al.
Veröffentlicht: (2024)
DeepASA: An Object-Oriented Multi-Purpose Network for Auditory Scene Analysis
von: Lee, Dongheon, et al.
Veröffentlicht: (2025)
von: Lee, Dongheon, et al.
Veröffentlicht: (2025)
Inter-channel Conv-TasNet for multichannel speech enhancement
von: Lee, Dongheon, et al.
Veröffentlicht: (2021)
von: Lee, Dongheon, et al.
Veröffentlicht: (2021)
3D Room Geometry Inference from Multichannel Room Impulse Response using Deep Neural Network
von: Yeon, Inmo, et al.
Veröffentlicht: (2024)
von: Yeon, Inmo, et al.
Veröffentlicht: (2024)
Adversarial Multi-Task Learning for Disentangling Timbre and Pitch in Singing Voice Synthesis
von: Kim, Tae-Woo, et al.
Veröffentlicht: (2022)
von: Kim, Tae-Woo, et al.
Veröffentlicht: (2022)
Few-step Adversarial Schrödinger Bridge for Generative Speech Enhancement
von: Han, Seungu, et al.
Veröffentlicht: (2025)
von: Han, Seungu, et al.
Veröffentlicht: (2025)
EchoScan: Scanning Complex Room Geometries via Acoustic Echoes
von: Yeon, Inmo, et al.
Veröffentlicht: (2023)
von: Yeon, Inmo, et al.
Veröffentlicht: (2023)
Multichannel-to-Multichannel Target Sound Extraction Using Direction and Timestamp Clues
von: Choi, Dayun, et al.
Veröffentlicht: (2024)
von: Choi, Dayun, et al.
Veröffentlicht: (2024)
SoundCompass: Navigating Target Sound Extraction With Effective Directional Clue Integration In Complex Acoustic Scenes
von: Choi, Dayun, et al.
Veröffentlicht: (2025)
von: Choi, Dayun, et al.
Veröffentlicht: (2025)
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
von: Jung, Jaemin, et al.
Veröffentlicht: (2024)
von: Jung, Jaemin, et al.
Veröffentlicht: (2024)
Parallel Synthesis for Autoregressive Speech Generation
von: Hsu, Po-chun, et al.
Veröffentlicht: (2022)
von: Hsu, Po-chun, et al.
Veröffentlicht: (2022)
Adversarial speech for voice privacy protection from Personalized Speech generation
von: Chen, Shihao, et al.
Veröffentlicht: (2024)
von: Chen, Shihao, et al.
Veröffentlicht: (2024)
ToneUnit: A Speech Discretization Approach for Tonal Language Speech Synthesis
von: Tao, Dehua, et al.
Veröffentlicht: (2024)
von: Tao, Dehua, et al.
Veröffentlicht: (2024)
RGI-Net: 3D Room Geometry Inference from Room Impulse Responses With Hidden First-Order Reflections
von: Yeon, Inmo, et al.
Veröffentlicht: (2023)
von: Yeon, Inmo, et al.
Veröffentlicht: (2023)
Reference-free Adversarial Sex Obfuscation in Speech
von: Qu, Yangyang, et al.
Veröffentlicht: (2025)
von: Qu, Yangyang, et al.
Veröffentlicht: (2025)
Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation
von: Deng, Yimin, et al.
Veröffentlicht: (2024)
von: Deng, Yimin, et al.
Veröffentlicht: (2024)
A Novel Deep Learning Framework for Efficient Multichannel Acoustic Feedback Control
von: Wu, Yuan-Kuei, et al.
Veröffentlicht: (2025)
von: Wu, Yuan-Kuei, et al.
Veröffentlicht: (2025)
String Sound Synthesizer on GPU-accelerated Finite Difference Scheme
von: Lee, Jin Woo, et al.
Veröffentlicht: (2023)
von: Lee, Jin Woo, et al.
Veröffentlicht: (2023)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
von: Jung, Chaeyoung, et al.
Veröffentlicht: (2024)
von: Jung, Chaeyoung, et al.
Veröffentlicht: (2024)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
von: Yang, Qian, et al.
Veröffentlicht: (2024)
von: Yang, Qian, et al.
Veröffentlicht: (2024)
Universal Speech Content Factorization
von: Xinyuan, Henry Li, et al.
Veröffentlicht: (2026)
von: Xinyuan, Henry Li, et al.
Veröffentlicht: (2026)
DiffProsody: Diffusion-based Latent Prosody Generation for Expressive Speech Synthesis with Prosody Conditional Adversarial Training
von: Oh, Hyung-Seok, et al.
Veröffentlicht: (2023)
von: Oh, Hyung-Seok, et al.
Veröffentlicht: (2023)
DualSpeech: Enhancing Speaker-Fidelity and Text-Intelligibility Through Dual Classifier-Free Guidance
von: Yang, Jinhyeok, et al.
Veröffentlicht: (2024)
von: Yang, Jinhyeok, et al.
Veröffentlicht: (2024)
Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback
von: Chen, Chen, et al.
Veröffentlicht: (2024)
von: Chen, Chen, et al.
Veröffentlicht: (2024)
JenGAN: Stacked Shifted Filters in GAN-Based Speech Synthesis
von: Cho, Hyunjae, et al.
Veröffentlicht: (2024)
von: Cho, Hyunjae, et al.
Veröffentlicht: (2024)
DurIAN-E 2: Duration Informed Attention Network with Adaptive Variational Autoencoder and Adversarial Learning for Expressive Text-to-Speech Synthesis
von: Gu, Yu, et al.
Veröffentlicht: (2024)
von: Gu, Yu, et al.
Veröffentlicht: (2024)
Interventional Speech Noise Injection for ASR Generalizable Spoken Language Understanding
von: Jung, Yeonjoon, et al.
Veröffentlicht: (2024)
von: Jung, Yeonjoon, et al.
Veröffentlicht: (2024)
Distinguishing Neural Speech Synthesis Models Through Fingerprints in Speech Waveforms
von: Zhang, Chu Yuan, et al.
Veröffentlicht: (2023)
von: Zhang, Chu Yuan, et al.
Veröffentlicht: (2023)
Universal Acoustic Adversarial Attacks for Flexible Control of Speech-LLMs
von: Ma, Rao, et al.
Veröffentlicht: (2025)
von: Ma, Rao, et al.
Veröffentlicht: (2025)
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
von: Park, Nohil, et al.
Veröffentlicht: (2024)
von: Park, Nohil, et al.
Veröffentlicht: (2024)
Improving Robustness of Diffusion-Based Zero-Shot Speech Synthesis via Stable Formant Generation
von: Han, Changjin, et al.
Veröffentlicht: (2024)
von: Han, Changjin, et al.
Veröffentlicht: (2024)
Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
von: Nguyen, Tan Dat, et al.
Veröffentlicht: (2024)
von: Nguyen, Tan Dat, et al.
Veröffentlicht: (2024)
Rethinking Speech Representation Aggregation in Speech Enhancement: A Phonetic Mutual Information Perspective
von: Han, Seungu, et al.
Veröffentlicht: (2026)
von: Han, Seungu, et al.
Veröffentlicht: (2026)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
von: Chen, Weidong, et al.
Veröffentlicht: (2025)
von: Chen, Weidong, et al.
Veröffentlicht: (2025)
Hierarchical Control of Emotion Rendering in Speech Synthesis
von: Inoue, Sho, et al.
Veröffentlicht: (2024)
von: Inoue, Sho, et al.
Veröffentlicht: (2024)
Differentiable Modal Synthesis for Physical Modeling of Planar String Sound and Motion Simulation
von: Lee, Jin Woo, et al.
Veröffentlicht: (2024)
von: Lee, Jin Woo, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
SEMamba++: A General Speech Restoration Framework Leveraging Global, Local, and Periodic Spectral Patterns
von: Lee, Yongjoon, et al.
Veröffentlicht: (2026) -
Wave-U-Mamba: An End-To-End Framework For High-Quality And Efficient Speech Super Resolution
von: Lee, Yongjoon, et al.
Veröffentlicht: (2024) -
DeFT-Mamba: Universal Multichannel Sound Separation and Polyphonic Audio Classification
von: Lee, Dongheon, et al.
Veröffentlicht: (2024) -
DISPATCH: Distilling Selective Patches for Speech Enhancement
von: Kim, Dohwan, et al.
Veröffentlicht: (2025) -
Speech-Declipping Transformer with Complex Spectrogram and Learnerble Temporal Features
von: Kwon, Younghoo, et al.
Veröffentlicht: (2024)