UNMIXX: Untangling Highly Correlated Singing Voices Mixtures
Fuente:
arXiv
Salvato in:
| Autori principali: | Jung, Jihoo, Kim, Ji-Hoon, Kwak, Doyeop, Lee, Junwon, Nam, Juhan, Chung, Joon Son |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
EDNet: A Versatile Speech Enhancement Framework with Gating Mamba Mechanism and Phase Shift-Invariant Training
di: Kwak, Doyeop, et al.
Pubblicazione: (2025)
di: Kwak, Doyeop, et al.
Pubblicazione: (2025)
LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
di: Jung, Chaeyoung, et al.
Pubblicazione: (2024)
di: Jung, Chaeyoung, et al.
Pubblicazione: (2024)
CONMOD: Controllable Neural Frame-based Modulation Effects
di: Lee, Gyubin, et al.
Pubblicazione: (2024)
di: Lee, Gyubin, et al.
Pubblicazione: (2024)
T-FOLEY: A Controllable Waveform-Domain Diffusion Model for Temporal-Event-Guided Foley Sound Synthesis
di: Chung, Yoonjin, et al.
Pubblicazione: (2024)
di: Chung, Yoonjin, et al.
Pubblicazione: (2024)
Adversarial Multi-Task Learning for Disentangling Timbre and Pitch in Singing Voice Synthesis
di: Kim, Tae-Woo, et al.
Pubblicazione: (2022)
di: Kim, Tae-Woo, et al.
Pubblicazione: (2022)
AdaptVC: High Quality Voice Conversion with Adaptive Learning
di: Kim, Jaehun, et al.
Pubblicazione: (2025)
di: Kim, Jaehun, et al.
Pubblicazione: (2025)
VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis
di: Jung, Jaemin, et al.
Pubblicazione: (2024)
di: Jung, Jaemin, et al.
Pubblicazione: (2024)
From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2025)
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2025)
Let There Be Sound: Reconstructing High Quality Speech from Silent Videos
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2023)
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2023)
InstructSing: High-Fidelity Singing Voice Generation via Instructing Yourself
di: Zeng, Chang, et al.
Pubblicazione: (2024)
di: Zeng, Chang, et al.
Pubblicazione: (2024)
SPADE: Structured Pruning and Adaptive Distillation for Efficient LLM-TTS
di: Nguyen, Tan Dat, et al.
Pubblicazione: (2025)
di: Nguyen, Tan Dat, et al.
Pubblicazione: (2025)
Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
Disentangled Representation Learning for Environment-agnostic Speaker Recognition
di: Nam, KiHyun, et al.
Pubblicazione: (2024)
di: Nam, KiHyun, et al.
Pubblicazione: (2024)
LP-CFM: Perceptual Invariance-Aware Conditional Flow Matching for Speech Modeling
di: Kwak, Doyeop, et al.
Pubblicazione: (2025)
di: Kwak, Doyeop, et al.
Pubblicazione: (2025)
Singing Voice Graph Modeling for SingFake Detection
di: Chen, Xuanjun, et al.
Pubblicazione: (2024)
di: Chen, Xuanjun, et al.
Pubblicazione: (2024)
SingIt! Singer Voice Transformation
di: Eliav, Amit, et al.
Pubblicazione: (2024)
di: Eliav, Amit, et al.
Pubblicazione: (2024)
Probing Cross-modal Information Hubs in Audio-Visual LLMs
di: Jung, Jihoo, et al.
Pubblicazione: (2026)
di: Jung, Jihoo, et al.
Pubblicazione: (2026)
TokSing: Singing Voice Synthesis based on Discrete Tokens
di: Wu, Yuning, et al.
Pubblicazione: (2024)
di: Wu, Yuning, et al.
Pubblicazione: (2024)
FlashSR: One-step Versatile Audio Super-resolution via Diffusion Distillation
di: Im, Jaekwon, et al.
Pubblicazione: (2025)
di: Im, Jaekwon, et al.
Pubblicazione: (2025)
DIFFRENT: A Diffusion Model for Recording Environment Transfer of Speech
di: Im, Jaekwon, et al.
Pubblicazione: (2024)
di: Im, Jaekwon, et al.
Pubblicazione: (2024)
Neural Concatenative Singing Voice Conversion: Rethinking Concatenation-Based Approach for One-Shot Singing Voice Conversion
di: Sha, Binzhu, et al.
Pubblicazione: (2023)
di: Sha, Binzhu, et al.
Pubblicazione: (2023)
SingMOS: An extensive Open-Source Singing Voice Dataset for MOS Prediction
di: Tang, Yuxun, et al.
Pubblicazione: (2024)
di: Tang, Yuxun, et al.
Pubblicazione: (2024)
SingVERSE: A Diverse, Real-World Benchmark for Singing Voice Enhancement
di: Jiang, Shaohan, et al.
Pubblicazione: (2025)
di: Jiang, Shaohan, et al.
Pubblicazione: (2025)
Self-Supervised Singing Voice Pre-Training towards Speech-to-Singing Conversion
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
CounterFlow: A Two-Phase Inference-Time Sampling for Counterfactual Video Foley Generation
di: Lee, Gyubin, et al.
Pubblicazione: (2026)
di: Lee, Gyubin, et al.
Pubblicazione: (2026)
Hear What Matters! Text-conditioned Selective Video-to-Audio Generation
di: Lee, Junwon, et al.
Pubblicazione: (2025)
di: Lee, Junwon, et al.
Pubblicazione: (2025)
Period Singer: Integrating Periodic and Aperiodic Variational Autoencoders for Natural-Sounding End-to-End Singing Voice Synthesis
di: Kim, Taewoo, et al.
Pubblicazione: (2024)
di: Kim, Taewoo, et al.
Pubblicazione: (2024)
MuSE-SVS: Multi-Singer Emotional Singing Voice Synthesizer that Controls Emotional Intensity
di: Kim, Sungjae, et al.
Pubblicazione: (2022)
di: Kim, Sungjae, et al.
Pubblicazione: (2022)
Robust Singing Voice Transcription Serves Synthesis
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
Singing Voice Data Scaling-up: An Introduction to ACE-Opencpop and ACE-KiSing
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
di: Shi, Jiatong, et al.
Pubblicazione: (2024)
SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset
di: Gu, Yicheng, et al.
Pubblicazione: (2025)
di: Gu, Yicheng, et al.
Pubblicazione: (2025)
Everyone-Can-Sing: Zero-Shot Singing Voice Synthesis and Conversion with Speech Reference
di: Dai, Shuqi, et al.
Pubblicazione: (2025)
di: Dai, Shuqi, et al.
Pubblicazione: (2025)
VibE-SVC: Vibrato Extraction with High-frequency F0 Contour for Singing Voice Conversion
di: Choi, Joon-Seung, et al.
Pubblicazione: (2025)
di: Choi, Joon-Seung, et al.
Pubblicazione: (2025)
CONTUNER: Singing Voice Beautifying with Pitch and Expressiveness Condition
di: Wang, Jianzong, et al.
Pubblicazione: (2024)
di: Wang, Jianzong, et al.
Pubblicazione: (2024)
KAD: No More FAD! An Effective and Efficient Evaluation Metric for Audio Generation
di: Chung, Yoonjin, et al.
Pubblicazione: (2025)
di: Chung, Yoonjin, et al.
Pubblicazione: (2025)
Zero-Shot Duet Singing Voices Separation with Diffusion Models
di: Yu, Chin-Yun, et al.
Pubblicazione: (2023)
di: Yu, Chin-Yun, et al.
Pubblicazione: (2023)
Video-Foley: Two-Stage Video-To-Sound Generation via Temporal Event Condition For Foley Sound
di: Lee, Junwon, et al.
Pubblicazione: (2024)
di: Lee, Junwon, et al.
Pubblicazione: (2024)
Musical Word Embedding for Music Tagging and Retrieval
di: Doh, SeungHeon, et al.
Pubblicazione: (2024)
di: Doh, SeungHeon, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
di: Kwak, Doyeop, et al.
Pubblicazione: (2026) -
EDNet: A Versatile Speech Enhancement Framework with Gating Mamba Mechanism and Phase Shift-Invariant Training
di: Kwak, Doyeop, et al.
Pubblicazione: (2025) -
LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition
di: Kwak, Doyeop, et al.
Pubblicazione: (2026) -
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
di: Jung, Chaeyoung, et al.
Pubblicazione: (2024) -
CONMOD: Controllable Neural Frame-based Modulation Effects
di: Lee, Gyubin, et al.
Pubblicazione: (2024)