U-GIFT: Uncertainty-Guided Firewall for Toxic Speech in Few-Shot Scenario
Fuente:
arXiv
Guardado en:
| Autores principales: | Song, Jiaxin, Wang, Xinyu, Wang, Yihao, Tang, Yifan, Zhang, Ru, Liu, Jianyi, Liu, Gongshen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Few-Shot and Pseudo-Label Guided Speech Quality Evaluation with Large Language Models
por: Zezario, Ryandhimas E., et al.
Publicado: (2026)
por: Zezario, Ryandhimas E., et al.
Publicado: (2026)
The Universal Personalizer: Few-Shot Dysarthric Speech Recognition via Meta-Learning
por: Agarwal, Dhruuv, et al.
Publicado: (2025)
por: Agarwal, Dhruuv, et al.
Publicado: (2025)
SaD: A Scenario-Aware Discriminator for Speech Enhancement
por: Yuan, Xihao, et al.
Publicado: (2025)
por: Yuan, Xihao, et al.
Publicado: (2025)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
por: Pan, Tianrui, et al.
Publicado: (2024)
por: Pan, Tianrui, et al.
Publicado: (2024)
Unfolding A Few Structures for The Many: Memory-Efficient Compression of Conformer and Speech Foundation Models
por: Li, Zhaoqing, et al.
Publicado: (2025)
por: Li, Zhaoqing, et al.
Publicado: (2025)
VoiceShop: A Unified Speech-to-Speech Framework for Identity-Preserving Zero-Shot Voice Editing
por: Anastassiou, Philip, et al.
Publicado: (2024)
por: Anastassiou, Philip, et al.
Publicado: (2024)
Leveraging Multimodal Methods and Spontaneous Speech for Alzheimer's Disease Identification
por: Gao, Yifan, et al.
Publicado: (2024)
por: Gao, Yifan, et al.
Publicado: (2024)
MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-Speech
por: Ji, Shengpeng, et al.
Publicado: (2024)
por: Ji, Shengpeng, et al.
Publicado: (2024)
Beyond Speaker Identity: Text Guided Target Speech Extraction
por: Huo, Mingyue, et al.
Publicado: (2025)
por: Huo, Mingyue, et al.
Publicado: (2025)
Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis
por: Wang, Tianrui, et al.
Publicado: (2025)
por: Wang, Tianrui, et al.
Publicado: (2025)
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
por: Wang, Huimeng, et al.
Publicado: (2025)
por: Wang, Huimeng, et al.
Publicado: (2025)
Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis
por: Jiang, Ziyue, et al.
Publicado: (2023)
por: Jiang, Ziyue, et al.
Publicado: (2023)
SF-Speech: Straightened Flow for Zero-Shot Voice Clone
por: Li, Xuyuan, et al.
Publicado: (2024)
por: Li, Xuyuan, et al.
Publicado: (2024)
Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling
por: Jiang, Yuepeng, et al.
Publicado: (2024)
por: Jiang, Yuepeng, et al.
Publicado: (2024)
CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models
por: Chen, Junyang, et al.
Publicado: (2026)
por: Chen, Junyang, et al.
Publicado: (2026)
Few-Shot Speech Deepfake Detection Adaptation with Gaussian Processes
por: Glazer, Neta, et al.
Publicado: (2025)
por: Glazer, Neta, et al.
Publicado: (2025)
Vision Language Models Are Few-Shot Audio Spectrogram Classifiers
por: Dixit, Satvik, et al.
Publicado: (2024)
por: Dixit, Satvik, et al.
Publicado: (2024)
SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing
por: Zhang, Hanlin, et al.
Publicado: (2026)
por: Zhang, Hanlin, et al.
Publicado: (2026)
Audiobox TTA-RAG: Improving Zero-Shot and Few-Shot Text-To-Audio with Retrieval-Augmented Generation
por: Yang, Mu, et al.
Publicado: (2024)
por: Yang, Mu, et al.
Publicado: (2024)
Everyone-Can-Sing: Zero-Shot Singing Voice Synthesis and Conversion with Speech Reference
por: Dai, Shuqi, et al.
Publicado: (2025)
por: Dai, Shuqi, et al.
Publicado: (2025)
SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
Speech Intelligibility Assessment with Uncertainty-Aware Whisper Embeddings and sLSTM
por: Zezario, Ryandhimas E., et al.
Publicado: (2025)
por: Zezario, Ryandhimas E., et al.
Publicado: (2025)
SELM: Enhancing Speech Emotion Recognition for Out-of-Domain Scenarios
por: Bukhari, Hazim, et al.
Publicado: (2024)
por: Bukhari, Hazim, et al.
Publicado: (2024)
Zero Shot Text to Speech Augmentation for Automatic Speech Recognition on Low-Resource Accented Speech Corpora
por: Nespoli, Francesco, et al.
Publicado: (2024)
por: Nespoli, Francesco, et al.
Publicado: (2024)
Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction
por: Dai, Wang, et al.
Publicado: (2025)
por: Dai, Wang, et al.
Publicado: (2025)
Few-step Adversarial Schrödinger Bridge for Generative Speech Enhancement
por: Han, Seungu, et al.
Publicado: (2025)
por: Han, Seungu, et al.
Publicado: (2025)
Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis
por: Hu, Yifan, et al.
Publicado: (2025)
por: Hu, Yifan, et al.
Publicado: (2025)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
por: Liao, Shijia, et al.
Publicado: (2024)
por: Liao, Shijia, et al.
Publicado: (2024)
SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding
por: Wei, Linye, et al.
Publicado: (2025)
por: Wei, Linye, et al.
Publicado: (2025)
DCIM-AVSR : Efficient Audio-Visual Speech Recognition via Dual Conformer Interaction Module
por: Wang, Xinyu, et al.
Publicado: (2024)
por: Wang, Xinyu, et al.
Publicado: (2024)
Few-Shot Bioacoustic Event Detection with Frame-Level Embedding Learning System
por: Zhao, PengYuan, et al.
Publicado: (2024)
por: Zhao, PengYuan, et al.
Publicado: (2024)
GALD-SE: Guided Anisotropic Lightweight Diffusion for Efficient Speech Enhancement
por: Wang, Chengzhong, et al.
Publicado: (2024)
por: Wang, Chengzhong, et al.
Publicado: (2024)
Advanced Zero-Shot Text-to-Speech for Background Removal and Preservation with Controllable Masked Speech Prediction
por: Zhang, Leying, et al.
Publicado: (2025)
por: Zhang, Leying, et al.
Publicado: (2025)
MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder
por: Zhang, Bowen, et al.
Publicado: (2025)
por: Zhang, Bowen, et al.
Publicado: (2025)
Enroll-on-Wakeup: A First Comparative Study of Target Speech Extraction for Seamless Interaction in Real Noisy Human-Machine Dialogue Scenarios
por: Yang, Yiming, et al.
Publicado: (2026)
por: Yang, Yiming, et al.
Publicado: (2026)
MiMo-Audio: Audio Language Models are Few-Shot Learners
por: Core Team, et al.
Publicado: (2025)
por: Core Team, et al.
Publicado: (2025)
Neural Directed Speech Enhancement with Dual Microphone Array in High Noise Scenario
por: Wen, Wen, et al.
Publicado: (2024)
por: Wen, Wen, et al.
Publicado: (2024)
PhoenixCodec: Taming Neural Speech Coding for Extreme Low-Resource Scenarios
por: Wan, Zixiang, et al.
Publicado: (2025)
por: Wan, Zixiang, et al.
Publicado: (2025)
SNIPER Training: Single-Shot Sparse Training for Text-to-Speech
por: Lam, Perry, et al.
Publicado: (2022)
por: Lam, Perry, et al.
Publicado: (2022)
Zero-Shot Text-to-Speech from Continuous Text Streams
por: Dang, Trung, et al.
Publicado: (2024)
por: Dang, Trung, et al.
Publicado: (2024)
Ejemplares similares
-
Few-Shot and Pseudo-Label Guided Speech Quality Evaluation with Large Language Models
por: Zezario, Ryandhimas E., et al.
Publicado: (2026) -
The Universal Personalizer: Few-Shot Dysarthric Speech Recognition via Meta-Learning
por: Agarwal, Dhruuv, et al.
Publicado: (2025) -
SaD: A Scenario-Aware Discriminator for Speech Enhancement
por: Yuan, Xihao, et al.
Publicado: (2025) -
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
por: Pan, Tianrui, et al.
Publicado: (2024) -
Unfolding A Few Structures for The Many: Memory-Efficient Compression of Conformer and Speech Foundation Models
por: Li, Zhaoqing, et al.
Publicado: (2025)