AnyEnhance: A Unified Generative Model with Prompt-Guidance and Self-Critic for Voice Enhancement
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Junan, Yang, Jing, Fang, Zihao, Wang, Yuancheng, Zhang, Zehua, Wang, Zhuo, Fan, Fan, Wu, Zhizheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SingVERSE: A Diverse, Real-World Benchmark for Singing Voice Enhancement
por: Jiang, Shaohan, et al.
Publicado: (2025)
por: Jiang, Shaohan, et al.
Publicado: (2025)
Multi-Metric Preference Alignment for Generative Speech Restoration
por: Zhang, Junan, et al.
Publicado: (2025)
por: Zhang, Junan, et al.
Publicado: (2025)
SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset
por: Gu, Yicheng, et al.
Publicado: (2025)
por: Gu, Yicheng, et al.
Publicado: (2025)
Leveraging Diverse Semantic-based Audio Pretrained Models for Singing Voice Conversion
por: Zhang, Xueyao, et al.
Publicado: (2023)
por: Zhang, Xueyao, et al.
Publicado: (2023)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
por: Wang, Yuancheng, et al.
Publicado: (2025)
por: Wang, Yuancheng, et al.
Publicado: (2025)
Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment
por: Zhang, Xueyao, et al.
Publicado: (2025)
por: Zhang, Xueyao, et al.
Publicado: (2025)
Metis: A Foundation Speech Generation Model with Masked Generative Pre-training
por: Wang, Yuancheng, et al.
Publicado: (2025)
por: Wang, Yuancheng, et al.
Publicado: (2025)
LDM-SVC: Latent Diffusion Model Based Zero-Shot Any-to-Any Singing Voice Conversion with Singer Guidance
por: Chen, Shihao, et al.
Publicado: (2024)
por: Chen, Shihao, et al.
Publicado: (2024)
DualCodec: A Low-Frame-Rate, Semantically-Enhanced Neural Audio Codec for Speech Generation
por: Li, Jiaqi, et al.
Publicado: (2025)
por: Li, Jiaqi, et al.
Publicado: (2025)
Amphion: An Open-Source Audio, Music and Speech Generation Toolkit
por: Zhang, Xueyao, et al.
Publicado: (2023)
por: Zhang, Xueyao, et al.
Publicado: (2023)
OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2026)
por: Wang, Zhichao, et al.
Publicado: (2026)
Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features
por: Chen, Wei, et al.
Publicado: (2025)
por: Chen, Wei, et al.
Publicado: (2025)
The CCF AATC 2025 Speech Restoration Challenge: A Retrospective
por: Zhang, Junan, et al.
Publicado: (2025)
por: Zhang, Junan, et al.
Publicado: (2025)
Noro: Noise-Robust One-shot Voice Conversion with Hidden Speaker Representation Learning
por: He, Haorui, et al.
Publicado: (2024)
por: He, Haorui, et al.
Publicado: (2024)
Enhancing Polyglot Voices by Leveraging Cross-Lingual Fine-Tuning in Any-to-One Voice Conversion
por: Ruggiero, Giuseppe, et al.
Publicado: (2024)
por: Ruggiero, Giuseppe, et al.
Publicado: (2024)
WhispEar: A Bi-directional Framework for Scaling Whispered Speech Conversion via Pseudo-Parallel Whisper Generation
por: Fang, Zihao, et al.
Publicado: (2026)
por: Fang, Zihao, et al.
Publicado: (2026)
Overview of the Amphion Toolkit (v0.2)
por: Li, Jiaqi, et al.
Publicado: (2025)
por: Li, Jiaqi, et al.
Publicado: (2025)
Aliasing-Free Neural Audio Synthesis
por: Gu, Yicheng, et al.
Publicado: (2025)
por: Gu, Yicheng, et al.
Publicado: (2025)
Revolutionizing Personalized Voice Synthesis: The Journey towards Emotional and Individual Authenticity with DIVSE (Dynamic Individual Voice Synthesis Engine)
por: Shi, Fan
Publicado: (2023)
por: Shi, Fan
Publicado: (2023)
VoiceGrad: Non-Parallel Any-to-Many Voice Conversion with Annealed Langevin Dynamics
por: Kameoka, Hirokazu, et al.
Publicado: (2020)
por: Kameoka, Hirokazu, et al.
Publicado: (2020)
Improvement Speaker Similarity for Zero-Shot Any-to-Any Voice Conversion of Whispered and Regular Speech
por: Avdeeva, Anastasia, et al.
Publicado: (2024)
por: Avdeeva, Anastasia, et al.
Publicado: (2024)
O_O-VC: Synthetic Data-Driven One-to-One Alignment for Any-to-Any Voice Conversion
por: Tu, Huu Tuong, et al.
Publicado: (2025)
por: Tu, Huu Tuong, et al.
Publicado: (2025)
An Extensive Analysis of the Singing Voice Conversion Challenge 2025 Evaluation Results
por: Violeta, Lester Phillip, et al.
Publicado: (2025)
por: Violeta, Lester Phillip, et al.
Publicado: (2025)
EAD-VC: Enhancing Speech Auto-Disentanglement for Voice Conversion with IFUB Estimator and Joint Text-Guided Consistent Learning
por: Liang, Ziqi, et al.
Publicado: (2024)
por: Liang, Ziqi, et al.
Publicado: (2024)
HybridVC: Efficient Voice Style Conversion with Text and Audio Prompts
por: Niu, Xinlei, et al.
Publicado: (2024)
por: Niu, Xinlei, et al.
Publicado: (2024)
$\text{M}^3\text{PDB}$: A Multimodal, Multi-Label, Multilingual Prompt Database for Speech Generation
por: Zhu, Boyu, et al.
Publicado: (2025)
por: Zhu, Boyu, et al.
Publicado: (2025)
VoiceBridge: General Speech Restoration with One-step Latent Bridge Models
por: Zhang, Chi, et al.
Publicado: (2025)
por: Zhang, Chi, et al.
Publicado: (2025)
Diffusion-based Generative Modeling with Discriminative Guidance for Streamable Speech Enhancement
por: Li, Chenda, et al.
Publicado: (2024)
por: Li, Chenda, et al.
Publicado: (2024)
CONTUNER: Singing Voice Beautifying with Pitch and Expressiveness Condition
por: Wang, Jianzong, et al.
Publicado: (2024)
por: Wang, Jianzong, et al.
Publicado: (2024)
YingMusic-Singer-Plus: Controllable Singing Voice Synthesis with Flexible Lyric Manipulation and Annotation-free Melody Guidance
por: Hao, Chunbo, et al.
Publicado: (2026)
por: Hao, Chunbo, et al.
Publicado: (2026)
Geneses: Unified Generative Speech Enhancement and Separation
por: Asai, Kohei, et al.
Publicado: (2026)
por: Asai, Kohei, et al.
Publicado: (2026)
Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement
por: Zhang, Xueyao, et al.
Publicado: (2025)
por: Zhang, Xueyao, et al.
Publicado: (2025)
Bridge-SR: Schrödinger Bridge for Efficient SR
por: Li, Chang, et al.
Publicado: (2025)
por: Li, Chang, et al.
Publicado: (2025)
GAP-URGENet: A Generative-Predictive Fusion Framework for Universal Speech Enhancement
por: Rong, Xiaobin, et al.
Publicado: (2026)
por: Rong, Xiaobin, et al.
Publicado: (2026)
Plugin Speech Enhancement: A Universal Speech Enhancement Framework Inspired by Dynamic Neural Network
por: Chen, Yanan, et al.
Publicado: (2024)
por: Chen, Yanan, et al.
Publicado: (2024)
Auden-Voice: General-Purpose Voice Encoder for Speech and Language Understanding
por: Huo, Mingyue, et al.
Publicado: (2025)
por: Huo, Mingyue, et al.
Publicado: (2025)
SingVisio: Visual Analytics of Diffusion Model for Singing Voice Conversion
por: Xue, Liumeng, et al.
Publicado: (2024)
por: Xue, Liumeng, et al.
Publicado: (2024)
Amplifying Artifacts with Speech Enhancement in Voice Anti-spoofing
por: Trachu, Thanapat, et al.
Publicado: (2025)
por: Trachu, Thanapat, et al.
Publicado: (2025)
Controlling your Attributes in Voice
por: Li, Xuyuan, et al.
Publicado: (2025)
por: Li, Xuyuan, et al.
Publicado: (2025)
DeepASMR: LLM-Based Zero-Shot ASMR Speech Generation for Anyone of Any Voice
por: Zhang, Leying, et al.
Publicado: (2026)
por: Zhang, Leying, et al.
Publicado: (2026)
Ejemplares similares
-
SingVERSE: A Diverse, Real-World Benchmark for Singing Voice Enhancement
por: Jiang, Shaohan, et al.
Publicado: (2025) -
Multi-Metric Preference Alignment for Generative Speech Restoration
por: Zhang, Junan, et al.
Publicado: (2025) -
SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset
por: Gu, Yicheng, et al.
Publicado: (2025) -
Leveraging Diverse Semantic-based Audio Pretrained Models for Singing Voice Conversion
por: Zhang, Xueyao, et al.
Publicado: (2023) -
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
por: Wang, Yuancheng, et al.
Publicado: (2025)