PPPR: Portable Plug-in Prompt Refiner for Text to Audio Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Shi, Shuchen, Fu, Ruibo, Wen, Zhengqi, Tao, Jianhua, Wang, Tao, Qiang, Chunyu, Lu, Yi, Qi, Xin, Liu, Xuefei, Liu, Yukun, Li, Yongwei, Wang, Zhiyong, Wang, Xiaopeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Mel-Refine: A Plug-and-Play Approach to Refine Mel-Spectrogram in Audio Generation
por: Guo, Hongming, et al.
Publicado: (2024)
por: Guo, Hongming, et al.
Publicado: (2024)
Generalized Fake Audio Detection via Deep Stable Learning
por: Wang, Zhiyong, et al.
Publicado: (2024)
por: Wang, Zhiyong, et al.
Publicado: (2024)
Genuine-Focused Learning using Mask AutoEncoder for Generalized Fake Audio Detection
por: Wang, Xiaopeng, et al.
Publicado: (2024)
por: Wang, Xiaopeng, et al.
Publicado: (2024)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
por: Fu, Ruibo, et al.
Publicado: (2024)
por: Fu, Ruibo, et al.
Publicado: (2024)
Codecfake: An Initial Dataset for Detecting LLM-based Deepfake Audio
por: Lu, Yi, et al.
Publicado: (2024)
por: Lu, Yi, et al.
Publicado: (2024)
EELE: Exploring Efficient and Extensible LoRA Integration in Emotional Text-to-Speech
por: Qi, Xin, et al.
Publicado: (2024)
por: Qi, Xin, et al.
Publicado: (2024)
A Noval Feature via Color Quantisation for Fake Audio Detection
por: Wang, Zhiyong, et al.
Publicado: (2024)
por: Wang, Zhiyong, et al.
Publicado: (2024)
RPRA-ADD: Forgery Trace Enhancement-Driven Audio Deepfake Detection
por: Fu, Ruibo, et al.
Publicado: (2025)
por: Fu, Ruibo, et al.
Publicado: (2025)
Mixture of Experts Fusion for Fake Audio Detection Using Frozen wav2vec 2.0
por: Wang, Zhiyong, et al.
Publicado: (2024)
por: Wang, Zhiyong, et al.
Publicado: (2024)
DPI-TTS: Directional Patch Interaction for Fast-Converging and Style Temporal Modeling in Text-to-Speech
por: Qi, Xin, et al.
Publicado: (2024)
por: Qi, Xin, et al.
Publicado: (2024)
Text Prompt is Not Enough: Sound Event Enhanced Prompt Adapter for Target Style Audio Generation
por: Xiong, Chenxu, et al.
Publicado: (2024)
por: Xiong, Chenxu, et al.
Publicado: (2024)
MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation
por: Fu, Ruibo, et al.
Publicado: (2024)
por: Fu, Ruibo, et al.
Publicado: (2024)
Generalized Source Tracing: Detecting Novel Audio Deepfake Algorithm with Real Emphasis and Fake Dispersion Strategy
por: Xie, Yuankun, et al.
Publicado: (2024)
por: Xie, Yuankun, et al.
Publicado: (2024)
Does Current Deepfake Audio Detection Model Effectively Detect ALM-based Deepfake Audio?
por: Xie, Yuankun, et al.
Publicado: (2024)
por: Xie, Yuankun, et al.
Publicado: (2024)
The Codecfake Dataset and Countermeasures for the Universally Detection of Deepfake Audio
por: Xie, Yuankun, et al.
Publicado: (2024)
por: Xie, Yuankun, et al.
Publicado: (2024)
Edit Content, Preserve Acoustics: Imperceptible Text-Based Speech Editing via Self-Consistency Rewards
por: Ren, Yong, et al.
Publicado: (2026)
por: Ren, Yong, et al.
Publicado: (2026)
A multi-speaker multi-lingual voice cloning system based on vits2 for limmits 2024 challenge
por: Wang, Xiaopeng, et al.
Publicado: (2024)
por: Wang, Xiaopeng, et al.
Publicado: (2024)
Temporal Variability and Multi-Viewed Self-Supervised Representations to Tackle the ASVspoof5 Deepfake Challenge
por: Xie, Yuankun, et al.
Publicado: (2024)
por: Xie, Yuankun, et al.
Publicado: (2024)
Dual-Branch Knowledge Distillation for Noise-Robust Synthetic Speech Detection
por: Fan, Cunhang, et al.
Publicado: (2023)
por: Fan, Cunhang, et al.
Publicado: (2023)
TraceableSpeech: Towards Proactively Traceable Text-to-Speech with Watermarking
por: Zhou, Junzuo, et al.
Publicado: (2024)
por: Zhou, Junzuo, et al.
Publicado: (2024)
The FruitShell French synthesis system at the Blizzard 2023 Challenge
por: Qi, Xin, et al.
Publicado: (2023)
por: Qi, Xin, et al.
Publicado: (2023)
Residual Speaker Representation for One-Shot Voice Conversion
por: Xu, Le, et al.
Publicado: (2023)
por: Xu, Le, et al.
Publicado: (2023)
SecoustiCodec: Cross-Modal Aligned Streaming Single-Codecbook Speech Codec
por: Qiang, Chunyu, et al.
Publicado: (2025)
por: Qiang, Chunyu, et al.
Publicado: (2025)
OV-InstructTTS: Towards Open-Vocabulary Instruct Text-to-Speech
por: Ren, Yong, et al.
Publicado: (2026)
por: Ren, Yong, et al.
Publicado: (2026)
ALLM4ADD: Unlocking the Capabilities of Audio Large Language Models for Audio Deepfake Detection
por: Gu, Hao, et al.
Publicado: (2025)
por: Gu, Hao, et al.
Publicado: (2025)
Neural Codec Source Tracing: Toward Comprehensive Attribution in Open-Set Condition
por: Xie, Yuankun, et al.
Publicado: (2025)
por: Xie, Yuankun, et al.
Publicado: (2025)
SceneFake: An Initial Dataset and Benchmarks for Scene Fake Audio Detection
por: Yi, Jiangyan, et al.
Publicado: (2022)
por: Yi, Jiangyan, et al.
Publicado: (2022)
ADD 2022: the First Audio Deep Synthesis Detection Challenge
por: Yi, Jiangyan, et al.
Publicado: (2022)
por: Yi, Jiangyan, et al.
Publicado: (2022)
VQ-CTAP: Cross-Modal Fine-Grained Sequence Representation Learning for Speech Processing
por: Qiang, Chunyu, et al.
Publicado: (2024)
por: Qiang, Chunyu, et al.
Publicado: (2024)
Towards Robust Audio Deepfake Detection: A Evolving Benchmark for Continual Learning
por: Zhang, Xiaohui, et al.
Publicado: (2024)
por: Zhang, Xiaohui, et al.
Publicado: (2024)
EmoFake: An Initial Dataset for Emotion Fake Audio Detection
por: Zhao, Yan, et al.
Publicado: (2022)
por: Zhao, Yan, et al.
Publicado: (2022)
Bridging Language Gaps in Audio-Text Retrieval
por: Yan, Zhiyong, et al.
Publicado: (2024)
por: Yan, Zhiyong, et al.
Publicado: (2024)
Streaming Audio Transformers for Online Audio Tagging
por: Dinkel, Heinrich, et al.
Publicado: (2023)
por: Dinkel, Heinrich, et al.
Publicado: (2023)
InstructAudio: Unified speech and music generation with natural language instruction
por: Qiang, Chunyu, et al.
Publicado: (2025)
por: Qiang, Chunyu, et al.
Publicado: (2025)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
por: Liu, Huadai, et al.
Publicado: (2024)
por: Liu, Huadai, et al.
Publicado: (2024)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
por: Liu, Huadai, et al.
Publicado: (2024)
por: Liu, Huadai, et al.
Publicado: (2024)
Utilizing Speaker Profiles for Impersonation Audio Detection
por: Gu, Hao, et al.
Publicado: (2024)
por: Gu, Hao, et al.
Publicado: (2024)
Plug-and-Play Co-Occurring Face Attention for Robust Audio-Visual Speaker Extraction
por: Pan, Zexu, et al.
Publicado: (2025)
por: Pan, Zexu, et al.
Publicado: (2025)
Refining Knowledge Transfer on Audio-Image Temporal Agreement for Audio-Text Cross Retrieval
por: Tsubaki, Shunsuke, et al.
Publicado: (2024)
por: Tsubaki, Shunsuke, et al.
Publicado: (2024)
ADD 2023: Towards Audio Deepfake Detection and Analysis in the Wild
por: Yi, Jiangyan, et al.
Publicado: (2024)
por: Yi, Jiangyan, et al.
Publicado: (2024)
Ejemplares similares
-
Mel-Refine: A Plug-and-Play Approach to Refine Mel-Spectrogram in Audio Generation
por: Guo, Hongming, et al.
Publicado: (2024) -
Generalized Fake Audio Detection via Deep Stable Learning
por: Wang, Zhiyong, et al.
Publicado: (2024) -
Genuine-Focused Learning using Mask AutoEncoder for Generalized Fake Audio Detection
por: Wang, Xiaopeng, et al.
Publicado: (2024) -
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
por: Fu, Ruibo, et al.
Publicado: (2024) -
Codecfake: An Initial Dataset for Detecting LLM-based Deepfake Audio
por: Lu, Yi, et al.
Publicado: (2024)