RAF: Relativistic Adversarial Feedback For Universal Speech Synthesis
Fuente:
arXiv
Guardado en:
| Autores principales: | Lee, Yongjoon, Choi, Jung-Woo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SEMamba++: A General Speech Restoration Framework Leveraging Global, Local, and Periodic Spectral Patterns
por: Lee, Yongjoon, et al.
Publicado: (2026)
por: Lee, Yongjoon, et al.
Publicado: (2026)
DeFT-Mamba: Universal Multichannel Sound Separation and Polyphonic Audio Classification
por: Lee, Dongheon, et al.
Publicado: (2024)
por: Lee, Dongheon, et al.
Publicado: (2024)
DISPATCH: Distilling Selective Patches for Speech Enhancement
por: Kim, Dohwan, et al.
Publicado: (2025)
por: Kim, Dohwan, et al.
Publicado: (2025)
Wave-U-Mamba: An End-To-End Framework For High-Quality And Efficient Speech Super Resolution
por: Lee, Yongjoon, et al.
Publicado: (2024)
por: Lee, Yongjoon, et al.
Publicado: (2024)
Speech-Declipping Transformer with Complex Spectrogram and Learnerble Temporal Features
por: Kwon, Younghoo, et al.
Publicado: (2024)
por: Kwon, Younghoo, et al.
Publicado: (2024)
DeepASA: An Object-Oriented Multi-Purpose Network for Auditory Scene Analysis
por: Lee, Dongheon, et al.
Publicado: (2025)
por: Lee, Dongheon, et al.
Publicado: (2025)
Inter-channel Conv-TasNet for multichannel speech enhancement
por: Lee, Dongheon, et al.
Publicado: (2021)
por: Lee, Dongheon, et al.
Publicado: (2021)
Adversarial Multi-Task Learning for Disentangling Timbre and Pitch in Singing Voice Synthesis
por: Kim, Tae-Woo, et al.
Publicado: (2022)
por: Kim, Tae-Woo, et al.
Publicado: (2022)
3D Room Geometry Inference from Multichannel Room Impulse Response using Deep Neural Network
por: Yeon, Inmo, et al.
Publicado: (2024)
por: Yeon, Inmo, et al.
Publicado: (2024)
Few-step Adversarial Schrödinger Bridge for Generative Speech Enhancement
por: Han, Seungu, et al.
Publicado: (2025)
por: Han, Seungu, et al.
Publicado: (2025)
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
por: Jung, Jaemin, et al.
Publicado: (2024)
por: Jung, Jaemin, et al.
Publicado: (2024)
Parallel Synthesis for Autoregressive Speech Generation
por: Hsu, Po-chun, et al.
Publicado: (2022)
por: Hsu, Po-chun, et al.
Publicado: (2022)
Adversarial speech for voice privacy protection from Personalized Speech generation
por: Chen, Shihao, et al.
Publicado: (2024)
por: Chen, Shihao, et al.
Publicado: (2024)
ToneUnit: A Speech Discretization Approach for Tonal Language Speech Synthesis
por: Tao, Dehua, et al.
Publicado: (2024)
por: Tao, Dehua, et al.
Publicado: (2024)
EchoScan: Scanning Complex Room Geometries via Acoustic Echoes
por: Yeon, Inmo, et al.
Publicado: (2023)
por: Yeon, Inmo, et al.
Publicado: (2023)
Multichannel-to-Multichannel Target Sound Extraction Using Direction and Timestamp Clues
por: Choi, Dayun, et al.
Publicado: (2024)
por: Choi, Dayun, et al.
Publicado: (2024)
SoundCompass: Navigating Target Sound Extraction With Effective Directional Clue Integration In Complex Acoustic Scenes
por: Choi, Dayun, et al.
Publicado: (2025)
por: Choi, Dayun, et al.
Publicado: (2025)
Reference-free Adversarial Sex Obfuscation in Speech
por: Qu, Yangyang, et al.
Publicado: (2025)
por: Qu, Yangyang, et al.
Publicado: (2025)
Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation
por: Deng, Yimin, et al.
Publicado: (2024)
por: Deng, Yimin, et al.
Publicado: (2024)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
por: Yang, Qian, et al.
Publicado: (2024)
por: Yang, Qian, et al.
Publicado: (2024)
A Novel Deep Learning Framework for Efficient Multichannel Acoustic Feedback Control
por: Wu, Yuan-Kuei, et al.
Publicado: (2025)
por: Wu, Yuan-Kuei, et al.
Publicado: (2025)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
por: Jung, Chaeyoung, et al.
Publicado: (2024)
por: Jung, Chaeyoung, et al.
Publicado: (2024)
Universal Speech Content Factorization
por: Xinyuan, Henry Li, et al.
Publicado: (2026)
por: Xinyuan, Henry Li, et al.
Publicado: (2026)
DurIAN-E 2: Duration Informed Attention Network with Adaptive Variational Autoencoder and Adversarial Learning for Expressive Text-to-Speech Synthesis
por: Gu, Yu, et al.
Publicado: (2024)
por: Gu, Yu, et al.
Publicado: (2024)
RGI-Net: 3D Room Geometry Inference from Room Impulse Responses With Hidden First-Order Reflections
por: Yeon, Inmo, et al.
Publicado: (2023)
por: Yeon, Inmo, et al.
Publicado: (2023)
Distinguishing Neural Speech Synthesis Models Through Fingerprints in Speech Waveforms
por: Zhang, Chu Yuan, et al.
Publicado: (2023)
por: Zhang, Chu Yuan, et al.
Publicado: (2023)
DualSpeech: Enhancing Speaker-Fidelity and Text-Intelligibility Through Dual Classifier-Free Guidance
por: Yang, Jinhyeok, et al.
Publicado: (2024)
por: Yang, Jinhyeok, et al.
Publicado: (2024)
Improving Robustness of Diffusion-Based Zero-Shot Speech Synthesis via Stable Formant Generation
por: Han, Changjin, et al.
Publicado: (2024)
por: Han, Changjin, et al.
Publicado: (2024)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
por: Chen, Weidong, et al.
Publicado: (2025)
por: Chen, Weidong, et al.
Publicado: (2025)
Rethinking Speech Representation Aggregation in Speech Enhancement: A Phonetic Mutual Information Perspective
por: Han, Seungu, et al.
Publicado: (2026)
por: Han, Seungu, et al.
Publicado: (2026)
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
por: Park, Nohil, et al.
Publicado: (2024)
por: Park, Nohil, et al.
Publicado: (2024)
Hierarchical Control of Emotion Rendering in Speech Synthesis
por: Inoue, Sho, et al.
Publicado: (2024)
por: Inoue, Sho, et al.
Publicado: (2024)
DiffProsody: Diffusion-based Latent Prosody Generation for Expressive Speech Synthesis with Prosody Conditional Adversarial Training
por: Oh, Hyung-Seok, et al.
Publicado: (2023)
por: Oh, Hyung-Seok, et al.
Publicado: (2023)
Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis
por: Leung, Wing-Zin, et al.
Publicado: (2024)
por: Leung, Wing-Zin, et al.
Publicado: (2024)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
por: Liao, Shijia, et al.
Publicado: (2024)
por: Liao, Shijia, et al.
Publicado: (2024)
Universal Speech Enhancement with Regression and Generative Mamba
por: Chao, Rong, et al.
Publicado: (2025)
por: Chao, Rong, et al.
Publicado: (2025)
Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback
por: Chen, Chen, et al.
Publicado: (2024)
por: Chen, Chen, et al.
Publicado: (2024)
String Sound Synthesizer on GPU-accelerated Finite Difference Scheme
por: Lee, Jin Woo, et al.
Publicado: (2023)
por: Lee, Jin Woo, et al.
Publicado: (2023)
CodecFake: Enhancing Anti-Spoofing Models Against Deepfake Audios from Codec-Based Speech Synthesis Systems
por: Wu, Haibin, et al.
Publicado: (2024)
por: Wu, Haibin, et al.
Publicado: (2024)
Empowering Communication: Speech Technology for Indian and Western Accents through AI-powered Speech Synthesis
por: R, Vinotha, et al.
Publicado: (2024)
por: R, Vinotha, et al.
Publicado: (2024)
Ejemplares similares
-
SEMamba++: A General Speech Restoration Framework Leveraging Global, Local, and Periodic Spectral Patterns
por: Lee, Yongjoon, et al.
Publicado: (2026) -
DeFT-Mamba: Universal Multichannel Sound Separation and Polyphonic Audio Classification
por: Lee, Dongheon, et al.
Publicado: (2024) -
DISPATCH: Distilling Selective Patches for Speech Enhancement
por: Kim, Dohwan, et al.
Publicado: (2025) -
Wave-U-Mamba: An End-To-End Framework For High-Quality And Efficient Speech Super Resolution
por: Lee, Yongjoon, et al.
Publicado: (2024) -
Speech-Declipping Transformer with Complex Spectrogram and Learnerble Temporal Features
por: Kwon, Younghoo, et al.
Publicado: (2024)