VoxSafeBench: Not Just What Is Said, but Who, How, and Where
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yuxiang, Liu, Hongyu, Xu, Yijiang, Ni, Qinke, Wang, Li, Lin, Wan, Feng, Kunyu, Chen, Dekun, Tan, Xu, Wang, Lei, Shi, Jie, Wu, Zhizheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation
di: Ni, Qinke, et al.
Pubblicazione: (2026)
di: Ni, Qinke, et al.
Pubblicazione: (2026)
VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models
di: Wang, Yuxiang, et al.
Pubblicazione: (2026)
di: Wang, Yuxiang, et al.
Pubblicazione: (2026)
Who Said What WSW 2.0? Enhanced Automated Analysis of Preschool Classroom Speech
di: Sun, Anchen, et al.
Pubblicazione: (2025)
di: Sun, Anchen, et al.
Pubblicazione: (2025)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
di: Wang, Yuancheng, et al.
Pubblicazione: (2025)
di: Wang, Yuancheng, et al.
Pubblicazione: (2025)
Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits
di: Feng, Tiantian, et al.
Pubblicazione: (2025)
di: Feng, Tiantian, et al.
Pubblicazione: (2025)
VoxCog: Towards End-to-End Multilingual Cognitive Impairment Classification through Dialectal Knowledge
di: Feng, Tiantian, et al.
Pubblicazione: (2026)
di: Feng, Tiantian, et al.
Pubblicazione: (2026)
Safe Guard: an LLM-agent for Real-time Voice-based Hate Speech Detection in Social Virtual Reality
di: Xu, Yiwen, et al.
Pubblicazione: (2024)
di: Xu, Yiwen, et al.
Pubblicazione: (2024)
SD-Eval: A Benchmark Dataset for Spoken Dialogue Understanding Beyond Words
di: Ao, Junyi, et al.
Pubblicazione: (2024)
di: Ao, Junyi, et al.
Pubblicazione: (2024)
An Initial Investigation of Neural Replay Simulator for Over-the-Air Adversarial Perturbations to Automatic Speaker Verification
di: Li, Jiaqi, et al.
Pubblicazione: (2023)
di: Li, Jiaqi, et al.
Pubblicazione: (2023)
Neurodyne: Neural Pitch Manipulation with Representation Learning and Cycle-Consistency GAN
di: Gu, Yicheng, et al.
Pubblicazione: (2025)
di: Gu, Yicheng, et al.
Pubblicazione: (2025)
Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
Solla: Towards a Speech-Oriented LLM That Hears Acoustic Context
di: Ao, Junyi, et al.
Pubblicazione: (2025)
di: Ao, Junyi, et al.
Pubblicazione: (2025)
HeightCeleb - an enrichment of VoxCeleb dataset with speaker height information
di: Kacprzak, Stanisław, et al.
Pubblicazione: (2024)
di: Kacprzak, Stanisław, et al.
Pubblicazione: (2024)
AdvSV: An Over-the-Air Adversarial Attack Dataset for Speaker Verification
di: Wang, Li, et al.
Pubblicazione: (2023)
di: Wang, Li, et al.
Pubblicazione: (2023)
DiffVox: A Differentiable Model for Capturing and Analysing Vocal Effects Distributions
di: Yu, Chin-Yun, et al.
Pubblicazione: (2025)
di: Yu, Chin-Yun, et al.
Pubblicazione: (2025)
The CCF AATC 2025 Speech Restoration Challenge: A Retrospective
di: Zhang, Junan, et al.
Pubblicazione: (2025)
di: Zhang, Junan, et al.
Pubblicazione: (2025)
VoxMed: One-Step Respiratory Disease Classifier using Digital Stethoscope Sounds
di: Mundra, Paridhi, et al.
Pubblicazione: (2024)
di: Mundra, Paridhi, et al.
Pubblicazione: (2024)
Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data
di: Liu, Yun, et al.
Pubblicazione: (2024)
di: Liu, Yun, et al.
Pubblicazione: (2024)
VoxInstruct: Expressive Human Instruction-to-Speech Generation with Unified Multilingual Codec Language Modelling
di: Zhou, Yixuan, et al.
Pubblicazione: (2024)
di: Zhou, Yixuan, et al.
Pubblicazione: (2024)
DualCodec: A Low-Frame-Rate, Semantically-Enhanced Neural Audio Codec for Speech Generation
di: Li, Jiaqi, et al.
Pubblicazione: (2025)
di: Li, Jiaqi, et al.
Pubblicazione: (2025)
MSU-Bench: Towards Understanding the Conversational Multi-talker Scenarios
di: Wang, Shuai, et al.
Pubblicazione: (2025)
di: Wang, Shuai, et al.
Pubblicazione: (2025)
SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant
di: Hou, Yixuan, et al.
Pubblicazione: (2025)
di: Hou, Yixuan, et al.
Pubblicazione: (2025)
oboVox Far Field Speaker Recognition: A Novel Data Augmentation Approach with Pretrained Models
di: Dip, Muhammad Sudipto Siam, et al.
Pubblicazione: (2024)
di: Dip, Muhammad Sudipto Siam, et al.
Pubblicazione: (2024)
WearVox: An Egocentric Multichannel Voice Assistant Benchmark for Wearables
di: Lin, Zhaojiang, et al.
Pubblicazione: (2025)
di: Lin, Zhaojiang, et al.
Pubblicazione: (2025)
A New Perspective on Speaker Verification: Joint Modeling with DFSMN and Transformer
di: Wang, Hongyu, et al.
Pubblicazione: (2023)
di: Wang, Hongyu, et al.
Pubblicazione: (2023)
SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset
di: Gu, Yicheng, et al.
Pubblicazione: (2025)
di: Gu, Yicheng, et al.
Pubblicazione: (2025)
Predicting Global HRTFs From Scanned Head Geometry Using Deep Learning and Compact Representations
di: Wang, Yuxiang, et al.
Pubblicazione: (2022)
di: Wang, Yuxiang, et al.
Pubblicazione: (2022)
SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing
di: Zhang, Hanlin, et al.
Pubblicazione: (2026)
di: Zhang, Hanlin, et al.
Pubblicazione: (2026)
HiFi-Glot: High-Fidelity Neural Formant Synthesis with Differentiable Resonant Filters
di: Gu, Yicheng, et al.
Pubblicazione: (2024)
di: Gu, Yicheng, et al.
Pubblicazione: (2024)
LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
AudioCIL: A Python Toolbox for Audio Class-Incremental Learning with Multiple Scenes
di: Xu, Qisheng, et al.
Pubblicazione: (2024)
di: Xu, Qisheng, et al.
Pubblicazione: (2024)
How phonemes contribute to deep speaker models?
di: Li, Pengqi, et al.
Pubblicazione: (2024)
di: Li, Pengqi, et al.
Pubblicazione: (2024)
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
di: Zhou, Xuehao, et al.
Pubblicazione: (2024)
di: Zhou, Xuehao, et al.
Pubblicazione: (2024)
Improving Short Utterance Anti-Spoofing with AASIST2
di: Zhang, Yuxiang, et al.
Pubblicazione: (2023)
di: Zhang, Yuxiang, et al.
Pubblicazione: (2023)
The VoxCeleb Speaker Recognition Challenge: A Retrospective
di: Huh, Jaesung, et al.
Pubblicazione: (2024)
di: Huh, Jaesung, et al.
Pubblicazione: (2024)
ContextASR-Bench: A Massive Contextual Speech Recognition Benchmark
di: Wang, He, et al.
Pubblicazione: (2025)
di: Wang, He, et al.
Pubblicazione: (2025)
TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
WhispEar: A Bi-directional Framework for Scaling Whispered Speech Conversion via Pseudo-Parallel Whisper Generation
di: Fang, Zihao, et al.
Pubblicazione: (2026)
di: Fang, Zihao, et al.
Pubblicazione: (2026)
SingVERSE: A Diverse, Real-World Benchmark for Singing Voice Enhancement
di: Jiang, Shaohan, et al.
Pubblicazione: (2025)
di: Jiang, Shaohan, et al.
Pubblicazione: (2025)
ZSVC: Zero-shot Style Voice Conversion with Disentangled Latent Diffusion Models and Adversarial Training
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
Documenti analoghi
-
NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation
di: Ni, Qinke, et al.
Pubblicazione: (2026) -
VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models
di: Wang, Yuxiang, et al.
Pubblicazione: (2026) -
Who Said What WSW 2.0? Enhanced Automated Analysis of Preschool Classroom Speech
di: Sun, Anchen, et al.
Pubblicazione: (2025) -
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
di: Wang, Yuancheng, et al.
Pubblicazione: (2025) -
Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits
di: Feng, Tiantian, et al.
Pubblicazione: (2025)