VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yuxiang, Liu, Hongyu, Chen, Dekun, Zhang, Xueyao, Wu, Zhizheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation
por: Ni, Qinke, et al.
Publicado: (2026)
por: Ni, Qinke, et al.
Publicado: (2026)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
por: Wang, Yuancheng, et al.
Publicado: (2025)
por: Wang, Yuancheng, et al.
Publicado: (2025)
Multi-Metric Preference Alignment for Generative Speech Restoration
por: Zhang, Junan, et al.
Publicado: (2025)
por: Zhang, Junan, et al.
Publicado: (2025)
Metis: A Foundation Speech Generation Model with Masked Generative Pre-training
por: Wang, Yuancheng, et al.
Publicado: (2025)
por: Wang, Yuancheng, et al.
Publicado: (2025)
VoxSafeBench: Not Just What Is Said, but Who, How, and Where
por: Wang, Yuxiang, et al.
Publicado: (2026)
por: Wang, Yuxiang, et al.
Publicado: (2026)
VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs
por: Zhang, Hezhao, et al.
Publicado: (2026)
por: Zhang, Hezhao, et al.
Publicado: (2026)
Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment
por: Zhang, Xueyao, et al.
Publicado: (2025)
por: Zhang, Xueyao, et al.
Publicado: (2025)
MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer
por: Wang, Yuancheng, et al.
Publicado: (2024)
por: Wang, Yuancheng, et al.
Publicado: (2024)
Overview of the Amphion Toolkit (v0.2)
por: Li, Jiaqi, et al.
Publicado: (2025)
por: Li, Jiaqi, et al.
Publicado: (2025)
Closing the Modality Reasoning Gap for Speech Large Language Models
por: Wang, Chaoren, et al.
Publicado: (2026)
por: Wang, Chaoren, et al.
Publicado: (2026)
WavShape: Information-Theoretic Speech Representation Learning for Fair and Privacy-Aware Audio Processing
por: Baser, Oguzhan, et al.
Publicado: (2025)
por: Baser, Oguzhan, et al.
Publicado: (2025)
Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement
por: Zhang, Xueyao, et al.
Publicado: (2025)
por: Zhang, Xueyao, et al.
Publicado: (2025)
DEAF: A Benchmark for Diagnostic Evaluation of Acoustic Faithfulness in Audio Language Models
por: Xiong, Jiaqi, et al.
Publicado: (2026)
por: Xiong, Jiaqi, et al.
Publicado: (2026)
The VoxCeleb Speaker Recognition Challenge: A Retrospective
por: Huh, Jaesung, et al.
Publicado: (2024)
por: Huh, Jaesung, et al.
Publicado: (2024)
SeamlessExpressiveLM: Speech Language Model for Expressive Speech-to-Speech Translation with Chain-of-Thought
por: Gong, Hongyu, et al.
Publicado: (2024)
por: Gong, Hongyu, et al.
Publicado: (2024)
Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits
por: Feng, Tiantian, et al.
Publicado: (2025)
por: Feng, Tiantian, et al.
Publicado: (2025)
JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions
por: Zhang, Leying, et al.
Publicado: (2026)
por: Zhang, Leying, et al.
Publicado: (2026)
The Music Maestro or The Musically Challenged, A Massive Music Evaluation Benchmark for Large Language Models
por: Li, Jiajia, et al.
Publicado: (2024)
por: Li, Jiajia, et al.
Publicado: (2024)
Speech-DRAME: A Framework for Human-Aligned Benchmarks in Speech Role-Play
por: Shi, Jiatong, et al.
Publicado: (2025)
por: Shi, Jiatong, et al.
Publicado: (2025)
VoxHakka: A Dialectally Diverse Multi-speaker Text-to-Speech System for Taiwanese Hakka
por: Chen, Li-Wei, et al.
Publicado: (2024)
por: Chen, Li-Wei, et al.
Publicado: (2024)
DPI-TTS: Directional Patch Interaction for Fast-Converging and Style Temporal Modeling in Text-to-Speech
por: Qi, Xin, et al.
Publicado: (2024)
por: Qi, Xin, et al.
Publicado: (2024)
Regularized Federated Learning for Privacy-Preserving Dysarthric and Elderly Speech Recognition
por: Zhong, Tao, et al.
Publicado: (2025)
por: Zhong, Tao, et al.
Publicado: (2025)
Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models
por: Yang, Wanqi, et al.
Publicado: (2024)
por: Yang, Wanqi, et al.
Publicado: (2024)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
por: Song, Zirui, et al.
Publicado: (2025)
por: Song, Zirui, et al.
Publicado: (2025)
Deploying UDM Series in Real-Life Stuttered Speech Applications: A Clinical Evaluation Framework
por: Zhang, Eric, et al.
Publicado: (2025)
por: Zhang, Eric, et al.
Publicado: (2025)
DASB - Discrete Audio and Speech Benchmark
por: Mousavi, Pooneh, et al.
Publicado: (2024)
por: Mousavi, Pooneh, et al.
Publicado: (2024)
When LLMs Meets Acoustic Landmarks: An Efficient Approach to Integrate Speech into Large Language Models for Depression Detection
por: Zhang, Xiangyu, et al.
Publicado: (2024)
por: Zhang, Xiangyu, et al.
Publicado: (2024)
Quantum-Inspired Audio Unlearning: Towards Privacy-Preserving Voice Biometrics
por: Pathak, Shreyansh, et al.
Publicado: (2025)
por: Pathak, Shreyansh, et al.
Publicado: (2025)
Time and Tokens: Benchmarking End-to-End Speech Dysfluency Detection
por: Zhou, Xuanru, et al.
Publicado: (2024)
por: Zhou, Xuanru, et al.
Publicado: (2024)
Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language Models
por: Zhang, Wenda, et al.
Publicado: (2026)
por: Zhang, Wenda, et al.
Publicado: (2026)
Tiny-Align: Bridging Automatic Speech Recognition and Large Language Model on the Edge
por: Qin, Ruiyang, et al.
Publicado: (2024)
por: Qin, Ruiyang, et al.
Publicado: (2024)
VoxInstruct: Expressive Human Instruction-to-Speech Generation with Unified Multilingual Codec Language Modelling
por: Zhou, Yixuan, et al.
Publicado: (2024)
por: Zhou, Yixuan, et al.
Publicado: (2024)
A Lightweight and Real-Time Binaural Speech Enhancement Model with Spatial Cues Preservation
por: Wang, Jingyuan, et al.
Publicado: (2024)
por: Wang, Jingyuan, et al.
Publicado: (2024)
UAF: A Unified Audio Front-end LLM for Full-Duplex Speech Interaction
por: Li, Yadong, et al.
Publicado: (2026)
por: Li, Yadong, et al.
Publicado: (2026)
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
por: Lin, Zijian, et al.
Publicado: (2025)
por: Lin, Zijian, et al.
Publicado: (2025)
Listening and Seeing Again: Generative Error Correction for Audio-Visual Speech Recognition
por: Liu, Rui, et al.
Publicado: (2025)
por: Liu, Rui, et al.
Publicado: (2025)
Safe Guard: an LLM-agent for Real-time Voice-based Hate Speech Detection in Social Virtual Reality
por: Xu, Yiwen, et al.
Publicado: (2024)
por: Xu, Yiwen, et al.
Publicado: (2024)
Leveraging Diverse Semantic-based Audio Pretrained Models for Singing Voice Conversion
por: Zhang, Xueyao, et al.
Publicado: (2023)
por: Zhang, Xueyao, et al.
Publicado: (2023)
EmoAttack: Utilizing Emotional Voice Conversion for Speech Backdoor Attacks on Deep Speech Classification Models
por: Yao, Wenhan, et al.
Publicado: (2024)
por: Yao, Wenhan, et al.
Publicado: (2024)
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
por: Wang, Xinsheng, et al.
Publicado: (2025)
por: Wang, Xinsheng, et al.
Publicado: (2025)
Ejemplares similares
-
NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation
por: Ni, Qinke, et al.
Publicado: (2026) -
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
por: Wang, Yuancheng, et al.
Publicado: (2025) -
Multi-Metric Preference Alignment for Generative Speech Restoration
por: Zhang, Junan, et al.
Publicado: (2025) -
Metis: A Foundation Speech Generation Model with Masked Generative Pre-training
por: Wang, Yuancheng, et al.
Publicado: (2025) -
VoxSafeBench: Not Just What Is Said, but Who, How, and Where
por: Wang, Yuxiang, et al.
Publicado: (2026)