LiteFocus: Accelerated Diffusion Inference for Long Audio Synthesis
Fuente:
arXiv
Salvato in:
| Autori principali: | Tan, Zhenxiong, Ma, Xinyin, Fang, Gongfan, Wang, Xinchao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AFSS: Artifact-Focused Self-Synthesis for Mitigating Bias in Audio Deepfake Detection
di: Nguyen-Le, Hai-Son, et al.
Pubblicazione: (2026)
di: Nguyen-Le, Hai-Son, et al.
Pubblicazione: (2026)
Inference-time Scaling for Diffusion-based Audio Super-resolution
di: Jin, Yizhu, et al.
Pubblicazione: (2025)
di: Jin, Yizhu, et al.
Pubblicazione: (2025)
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
di: Lin, Zijian, et al.
Pubblicazione: (2025)
di: Lin, Zijian, et al.
Pubblicazione: (2025)
MuseControlLite: Multifunctional Music Generation with Lightweight Conditioners
di: Tsai, Fang-Duo, et al.
Pubblicazione: (2025)
di: Tsai, Fang-Duo, et al.
Pubblicazione: (2025)
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
di: Yuan, Yi, et al.
Pubblicazione: (2025)
di: Yuan, Yi, et al.
Pubblicazione: (2025)
AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
Audio Mamba: Selective State Spaces for Self-Supervised Audio Representations
di: Yadav, Sarthak, et al.
Pubblicazione: (2024)
di: Yadav, Sarthak, et al.
Pubblicazione: (2024)
Audio Codec Augmentation for Robust Collaborative Watermarking of Speech Synthesis
di: Juvela, Lauri, et al.
Pubblicazione: (2024)
di: Juvela, Lauri, et al.
Pubblicazione: (2024)
RDSinger: Reference-based Diffusion Network for Singing Voice Synthesis
di: Sui, Kehan, et al.
Pubblicazione: (2024)
di: Sui, Kehan, et al.
Pubblicazione: (2024)
Audio-Conditioned Diffusion LLMs for ASR and Deliberation Processing
di: Wang, Mengqi, et al.
Pubblicazione: (2025)
di: Wang, Mengqi, et al.
Pubblicazione: (2025)
Audio Explanation Synthesis with Generative Foundation Models
di: Akman, Alican, et al.
Pubblicazione: (2024)
di: Akman, Alican, et al.
Pubblicazione: (2024)
Gibberish is All You Need for Membership Inference Detection in Contrastive Language-Audio Pretraining
di: Cheng, Ruoxi, et al.
Pubblicazione: (2024)
di: Cheng, Ruoxi, et al.
Pubblicazione: (2024)
AudioScene: Integrating Object-Event Audio into 3D Scenes
di: Yuan, Shuaihang, et al.
Pubblicazione: (2025)
di: Yuan, Shuaihang, et al.
Pubblicazione: (2025)
Accelerating Codec-based Speech Synthesis with Multi-Token Prediction and Speculative Decoding
di: Nguyen, Tan Dat, et al.
Pubblicazione: (2024)
di: Nguyen, Tan Dat, et al.
Pubblicazione: (2024)
Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models
di: Yang, Wanqi, et al.
Pubblicazione: (2024)
di: Yang, Wanqi, et al.
Pubblicazione: (2024)
DSpAST: Disentangled Representations for Spatial Audio Reasoning with Large Language Models
di: Wilkinghoff, Kevin, et al.
Pubblicazione: (2025)
di: Wilkinghoff, Kevin, et al.
Pubblicazione: (2025)
AudioMAE++: learning better masked audio representations with SwiGLU FFNs
di: Yadav, Sarthak, et al.
Pubblicazione: (2025)
di: Yadav, Sarthak, et al.
Pubblicazione: (2025)
Estimating Musical Surprisal from Audio in Autoregressive Diffusion Model Noise Spaces
di: Bjare, Mathias Rose, et al.
Pubblicazione: (2025)
di: Bjare, Mathias Rose, et al.
Pubblicazione: (2025)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
di: Han, Bing, et al.
Pubblicazione: (2026)
di: Han, Bing, et al.
Pubblicazione: (2026)
Plug-and-Play Co-Occurring Face Attention for Robust Audio-Visual Speaker Extraction
di: Pan, Zexu, et al.
Pubblicazione: (2025)
di: Pan, Zexu, et al.
Pubblicazione: (2025)
DiffCSS: Diverse and Expressive Conversational Speech Synthesis with Diffusion Models
di: wu, Weihao, et al.
Pubblicazione: (2025)
di: wu, Weihao, et al.
Pubblicazione: (2025)
DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization
di: Lee, Geonyoung, et al.
Pubblicazione: (2025)
di: Lee, Geonyoung, et al.
Pubblicazione: (2025)
CoLLAP: Contrastive Long-form Language-Audio Pretraining with Musical Temporal Structure Augmentation
di: Wu, Junda, et al.
Pubblicazione: (2024)
di: Wu, Junda, et al.
Pubblicazione: (2024)
Audio Mamba: Pretrained Audio State Space Model For Audio Tagging
di: Lin, Jiaju, et al.
Pubblicazione: (2024)
di: Lin, Jiaju, et al.
Pubblicazione: (2024)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
di: Song, Zirui, et al.
Pubblicazione: (2025)
di: Song, Zirui, et al.
Pubblicazione: (2025)
LJ-Spoof: A Generatively Varied Corpus for Audio Anti-Spoofing and Synthesis Source Tracing
di: Subramani, Surya, et al.
Pubblicazione: (2026)
di: Subramani, Surya, et al.
Pubblicazione: (2026)
UltraEval-Audio: A Unified Framework for Comprehensive Evaluation of Audio Foundation Models
di: Shi, Qundong, et al.
Pubblicazione: (2026)
di: Shi, Qundong, et al.
Pubblicazione: (2026)
Audio Atlas: Visualizing and Exploring Audio Datasets
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2024)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2024)
AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
di: Chen, Liyang, et al.
Pubblicazione: (2026)
di: Chen, Liyang, et al.
Pubblicazione: (2026)
Cross-Domain Audio Deepfake Detection: Dataset and Analysis
di: Li, Yuang, et al.
Pubblicazione: (2024)
di: Li, Yuang, et al.
Pubblicazione: (2024)
Does Current Deepfake Audio Detection Model Effectively Detect ALM-based Deepfake Audio?
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
di: Xie, Yuankun, et al.
Pubblicazione: (2024)
DreamHead: Learning Spatial-Temporal Correspondence via Hierarchical Diffusion for Audio-driven Talking Head Synthesis
di: Hong, Fa-Ting, et al.
Pubblicazione: (2024)
di: Hong, Fa-Ting, et al.
Pubblicazione: (2024)
Arrange, Inpaint, and Refine: Steerable Long-term Music Audio Generation and Editing via Content-based Controls
di: Lin, Liwei, et al.
Pubblicazione: (2024)
di: Lin, Liwei, et al.
Pubblicazione: (2024)
Audio Spatially-Guided Fusion for Audio-Visual Navigation
di: Zhou, Xinyu, et al.
Pubblicazione: (2026)
di: Zhou, Xinyu, et al.
Pubblicazione: (2026)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
FreeAudio: Training-Free Timing Planning for Controllable Long-Form Text-to-Audio Generation
di: Jiang, Yuxuan, et al.
Pubblicazione: (2025)
di: Jiang, Yuxuan, et al.
Pubblicazione: (2025)
FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion
di: Chen, Shunian, et al.
Pubblicazione: (2025)
di: Chen, Shunian, et al.
Pubblicazione: (2025)
Retrieval-Augmented Audio Deepfake Detection
di: Kang, Zuheng, et al.
Pubblicazione: (2024)
di: Kang, Zuheng, et al.
Pubblicazione: (2024)
Audio Mamba: Bidirectional State Space Model for Audio Representation Learning
di: Erol, Mehmet Hamza, et al.
Pubblicazione: (2024)
di: Erol, Mehmet Hamza, et al.
Pubblicazione: (2024)
GROOT: Generating Robust Watermark for Diffusion-Model-Based Audio Synthesis
di: Liu, Weizhi, et al.
Pubblicazione: (2024)
di: Liu, Weizhi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
AFSS: Artifact-Focused Self-Synthesis for Mitigating Bias in Audio Deepfake Detection
di: Nguyen-Le, Hai-Son, et al.
Pubblicazione: (2026) -
Inference-time Scaling for Diffusion-based Audio Super-resolution
di: Jin, Yizhu, et al.
Pubblicazione: (2025) -
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
di: Lin, Zijian, et al.
Pubblicazione: (2025) -
MuseControlLite: Multifunctional Music Generation with Lightweight Conditioners
di: Tsai, Fang-Duo, et al.
Pubblicazione: (2025) -
DreamAudio: Customized Text-to-Audio Generation with Diffusion Models
di: Yuan, Yi, et al.
Pubblicazione: (2025)