NPU-NTU System for Voice Privacy 2024 Challenge
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yao, Jixun, Kuzmin, Nikita, Wang, Qing, Guo, Pengcheng, Ning, Ziqian, Guo, Dake, Lee, Kong Aik, Chng, Eng-Siong, Xie, Lei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
NTU-NPU System for Voice Privacy 2024 Challenge
par: Kuzmin, Nikita, et autres
Publié: (2024)
par: Kuzmin, Nikita, et autres
Publié: (2024)
StreamVoiceAnon+: Emotion-Preserving Streaming Speaker Anonymization via Frame-Level Acoustic Distillation
par: Kuzmin, Nikita, et autres
Publié: (2026)
par: Kuzmin, Nikita, et autres
Publié: (2026)
Stream-Voice-Anon: Enhancing Utility of Real-Time Speaker Anonymization via Neural Audio Codec and Language Models
par: Kuzmin, Nikita, et autres
Publié: (2026)
par: Kuzmin, Nikita, et autres
Publié: (2026)
EASY: Emotion-aware Speaker Anonymization via Factorized Distillation
par: Yao, Jixun, et autres
Publié: (2025)
par: Yao, Jixun, et autres
Publié: (2025)
Distinctive and Natural Speaker Anonymization via Singular Value Transformation-assisted Matrix
par: Yao, Jixun, et autres
Publié: (2024)
par: Yao, Jixun, et autres
Publié: (2024)
The NPU-HWC System for the ISCSLP 2024 Inspirational and Convincing Audio Generation Challenge
par: Guo, Dake, et autres
Publié: (2024)
par: Guo, Dake, et autres
Publié: (2024)
MUSA: Multi-lingual Speaker Anonymization via Serial Disentanglement
par: Yao, Jixun, et autres
Publié: (2024)
par: Yao, Jixun, et autres
Publié: (2024)
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
par: Yao, Jixun, et autres
Publié: (2025)
par: Yao, Jixun, et autres
Publié: (2025)
NTU Speechlab LLM-Based Multilingual ASR System for Interspeech MLC-SLM Challenge 2025
par: Peng, Yizhou, et autres
Publié: (2025)
par: Peng, Yizhou, et autres
Publié: (2025)
DualVC 3: Leveraging Language Model Generated Pseudo Context for End-to-end Low Latency Streaming Voice Conversion
par: Ning, Ziqian, et autres
Publié: (2024)
par: Ning, Ziqian, et autres
Publié: (2024)
MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
par: Ma, Guobin, et autres
Publié: (2025)
par: Ma, Guobin, et autres
Publié: (2025)
Privacy-Preserving End-to-End Full-Duplex Speech Dialogue Models
par: Kuzmin, Nikita, et autres
Publié: (2026)
par: Kuzmin, Nikita, et autres
Publié: (2026)
DualVC 2: Dynamic Masked Convolution for Unified Streaming and Non-Streaming Voice Conversion
par: Ning, Ziqian, et autres
Publié: (2023)
par: Ning, Ziqian, et autres
Publié: (2023)
Room Impulse Responses help attackers to evade Deep Fake Detection
par: Luong, Hieu-Thi, et autres
Publié: (2024)
par: Luong, Hieu-Thi, et autres
Publié: (2024)
Robust Localization of Partially Fake Speech: Metrics and Out-of-Domain Evaluation
par: Luong, Hieu-Thi, et autres
Publié: (2025)
par: Luong, Hieu-Thi, et autres
Publié: (2025)
LlamaPartialSpoof: An LLM-Driven Fake Speech Dataset Simulating Disinformation Generation
par: Luong, Hieu-Thi, et autres
Publié: (2024)
par: Luong, Hieu-Thi, et autres
Publié: (2024)
StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding
par: Guo, Dake, et autres
Publié: (2025)
par: Guo, Dake, et autres
Publié: (2025)
Emphasized Non-Target Speaker Knowledge in Knowledge Distillation for Automatic Speaker Verification
par: Truong, Duc-Tuan, et autres
Publié: (2023)
par: Truong, Duc-Tuan, et autres
Publié: (2023)
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
par: Yao, Jixun, et autres
Publié: (2024)
par: Yao, Jixun, et autres
Publié: (2024)
Drop the beat! Freestyler for Accompaniment Conditioned Rapping Voice Generation
par: Ning, Ziqian, et autres
Publié: (2024)
par: Ning, Ziqian, et autres
Publié: (2024)
SynthVC: Leveraging Synthetic Data for End-to-End Low Latency Streaming Voice Conversion
par: Guo, Zhao, et autres
Publié: (2025)
par: Guo, Zhao, et autres
Publié: (2025)
Summary on The Multilingual Conversational Speech Language Model Challenge: Datasets, Tasks, Baselines, and Methods
par: Mu, Bingshen, et autres
Publié: (2025)
par: Mu, Bingshen, et autres
Publié: (2025)
DiffAttack: Diffusion-based Timbre-reserved Adversarial Attack in Speaker Identification
par: Wang, Qing, et autres
Publié: (2025)
par: Wang, Qing, et autres
Publié: (2025)
Multi-Stage Face-Voice Association Learning with Keynote Speaker Diarization
par: Tao, Ruijie, et autres
Publié: (2024)
par: Tao, Ruijie, et autres
Publié: (2024)
Zero-shot Context Biasing with Trie-based Decoding using Synthetic Multi-Pronunciation
par: Liu, Changsong, et autres
Publié: (2025)
par: Liu, Changsong, et autres
Publié: (2025)
Bi-directional Context-Enhanced Speech Large Language Models for Multilingual Conversational ASR
par: Peng, Yizhou, et autres
Publié: (2025)
par: Peng, Yizhou, et autres
Publié: (2025)
On the Generation and Removal of Speaker Adversarial Perturbation for Voice-Privacy Protection
par: Guo, Chenyang, et autres
Publié: (2024)
par: Guo, Chenyang, et autres
Publié: (2024)
Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection
par: Truong, Duc-Tuan, et autres
Publié: (2024)
par: Truong, Duc-Tuan, et autres
Publié: (2024)
The NPU-ASLP-LiAuto System Description for Visual Speech Recognition in CNVSRC 2023
par: Wang, He, et autres
Publié: (2024)
par: Wang, He, et autres
Publié: (2024)
Analysis of Speaker Verification Performance Trade-offs with Neural Audio Codec Transmission
par: Thakur, Nirmalya Mallick, et autres
Publié: (2025)
par: Thakur, Nirmalya Mallick, et autres
Publié: (2025)
REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers
par: Jiang, Yuepeng, et autres
Publié: (2025)
par: Jiang, Yuepeng, et autres
Publié: (2025)
DiffRhythm: Blazingly Fast and Embarrassingly Simple End-to-End Full-Length Song Generation with Latent Diffusion
par: Ning, Ziqian, et autres
Publié: (2025)
par: Ning, Ziqian, et autres
Publié: (2025)
Speech Separation using Neural Audio Codecs with Embedding Loss
par: Yip, Jia Qi, et autres
Publié: (2024)
par: Yip, Jia Qi, et autres
Publié: (2024)
ICMC-ASR: The ICASSP 2024 In-Car Multi-Channel Automatic Speech Recognition Challenge
par: Wang, He, et autres
Publié: (2024)
par: Wang, He, et autres
Publié: (2024)
VoiceSculptor: Your Voice, Designed By You
par: Hu, Jingbin, et autres
Publié: (2026)
par: Hu, Jingbin, et autres
Publié: (2026)
Fine-grained Preference Optimization Improves Zero-shot Text-to-Speech
par: Yao, Jixun, et autres
Publié: (2025)
par: Yao, Jixun, et autres
Publié: (2025)
UniArray: Unified Spectral-Spatial Modeling for Array-Geometry-Agnostic Speech Separation
par: Chen, Weiguang, et autres
Publié: (2025)
par: Chen, Weiguang, et autres
Publié: (2025)
Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech
par: Li, Yuxin, et autres
Publié: (2025)
par: Li, Yuxin, et autres
Publié: (2025)
Wav2code: Restore Clean Speech Representations via Codebook Lookup for Noise-Robust ASR
par: Hu, Yuchen, et autres
Publié: (2023)
par: Hu, Yuchen, et autres
Publié: (2023)
Continual Learning Optimizations for Auto-regressive Decoder of Multilingual ASR systems
par: Kwok, Chin Yuen, et autres
Publié: (2024)
par: Kwok, Chin Yuen, et autres
Publié: (2024)
Documents similaires
-
NTU-NPU System for Voice Privacy 2024 Challenge
par: Kuzmin, Nikita, et autres
Publié: (2024) -
StreamVoiceAnon+: Emotion-Preserving Streaming Speaker Anonymization via Frame-Level Acoustic Distillation
par: Kuzmin, Nikita, et autres
Publié: (2026) -
Stream-Voice-Anon: Enhancing Utility of Real-Time Speaker Anonymization via Neural Audio Codec and Language Models
par: Kuzmin, Nikita, et autres
Publié: (2026) -
EASY: Emotion-aware Speaker Anonymization via Factorized Distillation
par: Yao, Jixun, et autres
Publié: (2025) -
Distinctive and Natural Speaker Anonymization via Singular Value Transformation-assisted Matrix
par: Yao, Jixun, et autres
Publié: (2024)