VoxEffects: A Speech-Oriented Audio Effects Dataset and Benchmark
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Zhe, Özer, Yigitcan, Yamagishi, Junichi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data
par: Liu, Yun, et autres
Publié: (2024)
par: Liu, Yun, et autres
Publié: (2024)
FakeMark: Deepfake Speech Attribution With Watermarked Artifacts
par: Ge, Wanying, et autres
Publié: (2025)
par: Ge, Wanying, et autres
Publié: (2025)
Towards Data Drift Monitoring for Speech Deepfake Detection in the context of MLOps
par: Wang, Xin, et autres
Publié: (2025)
par: Wang, Xin, et autres
Publié: (2025)
Does Fine-tuning by Reinforcement Learning Improve Generalization in Binary Speech Deepfake Detection?
par: Wang, Xin, et autres
Publié: (2026)
par: Wang, Xin, et autres
Publié: (2026)
Post-training for Deepfake Speech Detection
par: Ge, Wanying, et autres
Publié: (2025)
par: Ge, Wanying, et autres
Publié: (2025)
A Preliminary Case Study on Long-Form In-the-Wild Audio Spoofing Detection
par: Liu, Xuechen, et autres
Publié: (2024)
par: Liu, Xuechen, et autres
Publié: (2024)
From Sharpness to Better Generalization for Speech Deepfake Detection
par: Huang, Wen, et autres
Publié: (2025)
par: Huang, Wen, et autres
Publié: (2025)
Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits
par: Feng, Tiantian, et autres
Publié: (2025)
par: Feng, Tiantian, et autres
Publié: (2025)
Generating Speakers by Prompting Listener Impressions for Pre-trained Multi-Speaker Text-to-Speech Systems
par: Chen, Zhengyang, et autres
Publié: (2024)
par: Chen, Zhengyang, et autres
Publié: (2024)
YODAS: Youtube-Oriented Dataset for Audio and Speech
par: Li, Xinjian, et autres
Publié: (2024)
par: Li, Xinjian, et autres
Publié: (2024)
Mitigating Language Mismatch in SSL-Based Speaker Anonymization
par: Zhang, Zhe, et autres
Publié: (2025)
par: Zhang, Zhe, et autres
Publié: (2025)
Improving curriculum learning for target speaker extraction with synthetic speakers
par: Liu, Yun, et autres
Publié: (2024)
par: Liu, Yun, et autres
Publié: (2024)
Good practices for evaluation of synthesized speech
par: Cooper, Erica, et autres
Publié: (2025)
par: Cooper, Erica, et autres
Publié: (2025)
LENS-DF: Deepfake Detection and Temporal Localization for Long-Form Noisy Speech
par: Liu, Xuechen, et autres
Publié: (2025)
par: Liu, Xuechen, et autres
Publié: (2025)
VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models
par: Wang, Yuxiang, et autres
Publié: (2026)
par: Wang, Yuxiang, et autres
Publié: (2026)
ZMM-TTS: Zero-shot Multilingual and Multispeaker Speech Synthesis Conditioned on Self-supervised Discrete Speech Representations
par: Gong, Cheng, et autres
Publié: (2023)
par: Gong, Cheng, et autres
Publié: (2023)
VoxBlink2: A 100K+ Speaker Recognition Corpus and the Open-Set Speaker-Identification Benchmark
par: Lin, Yuke, et autres
Publié: (2024)
par: Lin, Yuke, et autres
Publié: (2024)
Target Speaker Extraction with Curriculum Learning
par: Liu, Yun, et autres
Publié: (2024)
par: Liu, Yun, et autres
Publié: (2024)
Explaining Speaker and Spoof Embeddings via Probing
par: Liu, Xuechen, et autres
Publié: (2024)
par: Liu, Xuechen, et autres
Publié: (2024)
DiffVox: A Differentiable Model for Capturing and Analysing Vocal Effects Distributions
par: Yu, Chin-Yun, et autres
Publié: (2025)
par: Yu, Chin-Yun, et autres
Publié: (2025)
Spoof Diarization: "What Spoofed When" in Partially Spoofed Audio
par: Zhang, Lin, et autres
Publié: (2024)
par: Zhang, Lin, et autres
Publié: (2024)
VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs
par: Zhang, Hezhao, et autres
Publié: (2026)
par: Zhang, Hezhao, et autres
Publié: (2026)
Human perception of audio deepfakes: the role of language and speaking style
par: Segundo, Eugenia San, et autres
Publié: (2025)
par: Segundo, Eugenia San, et autres
Publié: (2025)
The Effect of Training Dataset Size on Discriminative and Diffusion-Based Speech Enhancement Systems
par: Gonzalez, Philippe, et autres
Publié: (2024)
par: Gonzalez, Philippe, et autres
Publié: (2024)
QualiSpeech: A Speech Quality Assessment Dataset with Natural Language Reasoning and Descriptions
par: Wang, Siyin, et autres
Publié: (2025)
par: Wang, Siyin, et autres
Publié: (2025)
Quantifying Source Speaker Leakage in One-to-One Voice Conversion
par: Wellington, Scott, et autres
Publié: (2025)
par: Wellington, Scott, et autres
Publié: (2025)
ISSE: An Instruction-Guided Speech Style Editing Dataset And Benchmark
par: Chen, Yun, et autres
Publié: (2025)
par: Chen, Yun, et autres
Publié: (2025)
Towards An Integrated Approach for Expressive Piano Performance Synthesis from Music Scores
par: Tang, Jingjing, et autres
Publié: (2025)
par: Tang, Jingjing, et autres
Publié: (2025)
Spoofing-Aware Speaker Verification Robust Against Domain and Channel Mismatches
par: Zeng, Chang, et autres
Publié: (2024)
par: Zeng, Chang, et autres
Publié: (2024)
The VoiceMOS Challenge 2024: Beyond Speech Quality Prediction
par: Huang, Wen-Chin, et autres
Publié: (2024)
par: Huang, Wen-Chin, et autres
Publié: (2024)
VoxSim: A perceptual voice similarity dataset
par: Ahn, Junseok, et autres
Publié: (2024)
par: Ahn, Junseok, et autres
Publié: (2024)
MIDI-VALLE: Improving Expressive Piano Performance Synthesis Through Neural Codec Language Modelling
par: Tang, Jingjing, et autres
Publié: (2025)
par: Tang, Jingjing, et autres
Publié: (2025)
Disentangling the Prosody and Semantic Information with Pre-trained Model for In-Context Learning based Zero-Shot Voice Conversion
par: Chen, Zhengyang, et autres
Publié: (2024)
par: Chen, Zhengyang, et autres
Publié: (2024)
A Semi-spontaneous Dutch Speech Dataset for Speech Enhancement and Speech Recognition
par: de Groot, Dimme, et autres
Publié: (2026)
par: de Groot, Dimme, et autres
Publié: (2026)
A Knowledge-Driven Approach to Target Speech Extraction in the Presence of Background Sound Effects for Cinematic Audio Source Separation (CASS)
par: Ho, Chun-wei, et autres
Publié: (2026)
par: Ho, Chun-wei, et autres
Publié: (2026)
VoxATtack: A Multimodal Attack on Voice Anonymization Systems
par: Aloradi, Ahmad, et autres
Publié: (2025)
par: Aloradi, Ahmad, et autres
Publié: (2025)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
par: Yang, Qian, et autres
Publié: (2024)
par: Yang, Qian, et autres
Publié: (2024)
VoxInstruct: Expressive Human Instruction-to-Speech Generation with Unified Multilingual Codec Language Modelling
par: Zhou, Yixuan, et autres
Publié: (2024)
par: Zhou, Yixuan, et autres
Publié: (2024)
CodecFake+: A Large-Scale Neural Audio Codec-Based Deepfake Speech Dataset
par: Chen, Xuanjun, et autres
Publié: (2025)
par: Chen, Xuanjun, et autres
Publié: (2025)
Revisiting and Improving Scoring Fusion for Spoofing-aware Speaker Verification Using Compositional Data Analysis
par: Wang, Xin, et autres
Publié: (2024)
par: Wang, Xin, et autres
Publié: (2024)
Documents similaires
-
Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data
par: Liu, Yun, et autres
Publié: (2024) -
FakeMark: Deepfake Speech Attribution With Watermarked Artifacts
par: Ge, Wanying, et autres
Publié: (2025) -
Towards Data Drift Monitoring for Speech Deepfake Detection in the context of MLOps
par: Wang, Xin, et autres
Publié: (2025) -
Does Fine-tuning by Reinforcement Learning Improve Generalization in Binary Speech Deepfake Detection?
par: Wang, Xin, et autres
Publié: (2026) -
Post-training for Deepfake Speech Detection
par: Ge, Wanying, et autres
Publié: (2025)