The NPU-HWC System for the ISCSLP 2024 Inspirational and Convincing Audio Generation Challenge
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Dake, Yao, Jixun, Zhu, Xinfa, Xia, Kangxiang, Guo, Zhao, Zhang, Ziyu, Wang, Yao, Liu, Jie, Xie, Lei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech
par: Xia, Kangxiang, et autres
Publié: (2025)
par: Xia, Kangxiang, et autres
Publié: (2025)
KALL-E:Autoregressive Speech Synthesis with Next-Distribution Prediction
par: Xia, Kangxiang, et autres
Publié: (2024)
par: Xia, Kangxiang, et autres
Publié: (2024)
StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding
par: Guo, Dake, et autres
Publié: (2025)
par: Guo, Dake, et autres
Publié: (2025)
NPU-NTU System for Voice Privacy 2024 Challenge
par: Yao, Jixun, et autres
Publié: (2024)
par: Yao, Jixun, et autres
Publié: (2024)
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
par: Zhu, Xinfa, et autres
Publié: (2025)
par: Zhu, Xinfa, et autres
Publié: (2025)
ICAGC 2024: Inspirational and Convincing Audio Generation Challenge 2024
par: Fu, Ruibo, et autres
Publié: (2024)
par: Fu, Ruibo, et autres
Publié: (2024)
U-SAM: An audio language Model for Unified Speech, Audio, and Music Understanding
par: Wang, Ziqian, et autres
Publié: (2025)
par: Wang, Ziqian, et autres
Publié: (2025)
Semantic-Aware Interruption Detection in Spoken Dialogue Systems: Benchmark, Metric, and Model
par: Xia, Kangxiang, et autres
Publié: (2026)
par: Xia, Kangxiang, et autres
Publié: (2026)
DialoSpeech: Dual-Speaker Dialogue Generation with LLM and Flow Matching
par: Xie, Hanke, et autres
Publié: (2025)
par: Xie, Hanke, et autres
Publié: (2025)
The ICASSP 2026 Automatic Song Aesthetics Evaluation Challenge
par: Ma, Guobin, et autres
Publié: (2026)
par: Ma, Guobin, et autres
Publié: (2026)
EASY: Emotion-aware Speaker Anonymization via Factorized Distillation
par: Yao, Jixun, et autres
Publié: (2025)
par: Yao, Jixun, et autres
Publié: (2025)
Drop the beat! Freestyler for Accompaniment Conditioned Rapping Voice Generation
par: Ning, Ziqian, et autres
Publié: (2024)
par: Ning, Ziqian, et autres
Publié: (2024)
DiffAttack: Diffusion-based Timbre-reserved Adversarial Attack in Speaker Identification
par: Wang, Qing, et autres
Publié: (2025)
par: Wang, Qing, et autres
Publié: (2025)
NTU-NPU System for Voice Privacy 2024 Challenge
par: Kuzmin, Nikita, et autres
Publié: (2024)
par: Kuzmin, Nikita, et autres
Publié: (2024)
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
par: Yao, Jixun, et autres
Publié: (2025)
par: Yao, Jixun, et autres
Publié: (2025)
The NPU-ASLP-LiAuto System Description for Visual Speech Recognition in CNVSRC 2023
par: Wang, He, et autres
Publié: (2024)
par: Wang, He, et autres
Publié: (2024)
DualVC 2: Dynamic Masked Convolution for Unified Streaming and Non-Streaming Voice Conversion
par: Ning, Ziqian, et autres
Publié: (2023)
par: Ning, Ziqian, et autres
Publié: (2023)
MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
par: Ma, Guobin, et autres
Publié: (2025)
par: Ma, Guobin, et autres
Publié: (2025)
DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
par: Tian, Wenjie, et autres
Publié: (2025)
par: Tian, Wenjie, et autres
Publié: (2025)
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
par: Yao, Jixun, et autres
Publié: (2024)
par: Yao, Jixun, et autres
Publié: (2024)
Llasa+: Free Lunch for Accelerated and Streaming Llama-Based Speech Synthesis
par: Tian, Wenjie, et autres
Publié: (2025)
par: Tian, Wenjie, et autres
Publié: (2025)
Boosting Multi-Speaker Expressive Speech Synthesis with Semi-supervised Contrastive Learning
par: Zhu, Xinfa, et autres
Publié: (2023)
par: Zhu, Xinfa, et autres
Publié: (2023)
The ISCSLP 2024 Conversational Voice Clone (CoVoC) Challenge: Tasks, Results and Findings
par: Xia, Kangxiang, et autres
Publié: (2024)
par: Xia, Kangxiang, et autres
Publié: (2024)
Accent-VITS:accent transfer for end-to-end TTS
par: Ma, Linhan, et autres
Publié: (2023)
par: Ma, Linhan, et autres
Publié: (2023)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
par: Pan, Yu, et autres
Publié: (2025)
par: Pan, Yu, et autres
Publié: (2025)
SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis
par: Guo, Haohan, et autres
Publié: (2024)
par: Guo, Haohan, et autres
Publié: (2024)
SponTTS: modeling and transferring spontaneous style for TTS
par: Li, Hanzhao, et autres
Publié: (2023)
par: Li, Hanzhao, et autres
Publié: (2023)
CoDiff-VC: A Codec-Assisted Diffusion Model for Zero-shot Voice Conversion
par: Li, Yuke, et autres
Publié: (2024)
par: Li, Yuke, et autres
Publié: (2024)
DiffRhythm+: Controllable and Flexible Full-Length Song Generation with Preference Optimization
par: Chen, Huakang, et autres
Publié: (2025)
par: Chen, Huakang, et autres
Publié: (2025)
Fine-grained Preference Optimization Improves Zero-shot Text-to-Speech
par: Yao, Jixun, et autres
Publié: (2025)
par: Yao, Jixun, et autres
Publié: (2025)
ZSVC: Zero-shot Style Voice Conversion with Disentangled Latent Diffusion Models and Adversarial Training
par: Zhu, Xinfa, et autres
Publié: (2025)
par: Zhu, Xinfa, et autres
Publié: (2025)
Zero-Shot Voice Conversion via Content-Aware Timbre Ensemble and Conditional Flow Matching
par: Pan, Yu, et autres
Publié: (2024)
par: Pan, Yu, et autres
Publié: (2024)
The ICASSP 2024 Audio Deep Packet Loss Concealment Challenge
par: Diener, Lorenz, et autres
Publié: (2024)
par: Diener, Lorenz, et autres
Publié: (2024)
Weakly Supervised Data Refinement and Flexible Sequence Compression for Efficient Thai LLM-based ASR
par: Shao, Mingchen, et autres
Publié: (2025)
par: Shao, Mingchen, et autres
Publié: (2025)
Vec-Tok-VC+: Residual-enhanced Robust Zero-shot Voice Conversion with Progressive Constraints in a Dual-mode Training Strategy
par: Ma, Linhan, et autres
Publié: (2024)
par: Ma, Linhan, et autres
Publié: (2024)
SemanticAudio: Audio Generation and Editing in Semantic Space
par: Dai, Zheqi, et autres
Publié: (2026)
par: Dai, Zheqi, et autres
Publié: (2026)
DiveSound: LLM-Assisted Automatic Taxonomy Construction for Diverse Audio Generation
par: Li, Baihan, et autres
Publié: (2024)
par: Li, Baihan, et autres
Publié: (2024)
PodEval: A Multimodal Evaluation Framework for Podcast Audio Generation
par: Xiao, Yujia, et autres
Publié: (2025)
par: Xiao, Yujia, et autres
Publié: (2025)
ASAudio: A Survey of Advanced Spatial Audio Research
par: Zhu, Zhiyuan, et autres
Publié: (2025)
par: Zhu, Zhiyuan, et autres
Publié: (2025)
MMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence
par: Kumar, Sonal, et autres
Publié: (2025)
par: Kumar, Sonal, et autres
Publié: (2025)
Documents similaires
-
MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech
par: Xia, Kangxiang, et autres
Publié: (2025) -
KALL-E:Autoregressive Speech Synthesis with Next-Distribution Prediction
par: Xia, Kangxiang, et autres
Publié: (2024) -
StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding
par: Guo, Dake, et autres
Publié: (2025) -
NPU-NTU System for Voice Privacy 2024 Challenge
par: Yao, Jixun, et autres
Publié: (2024) -
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
par: Zhu, Xinfa, et autres
Publié: (2025)