EVA-GAN: Enhanced Various Audio Generation via Scalable Generative Adversarial Networks
Fuente:
arXiv
Salvato in:
| Autori principali: | Liao, Shijia, Lan, Shiyi, Zachariah, Arun George |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Fast Text-to-Audio Generation with Adversarial Post-Training
di: Novack, Zachary, et al.
Pubblicazione: (2025)
di: Novack, Zachary, et al.
Pubblicazione: (2025)
DPN-GAN: Inducing Periodic Activations in Generative Adversarial Networks for High-Fidelity Audio Synthesis
di: Ahmad, Zeeshan, et al.
Pubblicazione: (2025)
di: Ahmad, Zeeshan, et al.
Pubblicazione: (2025)
Guiding Audio Editing with Audio Language Model
di: Lan, Zitong, et al.
Pubblicazione: (2025)
di: Lan, Zitong, et al.
Pubblicazione: (2025)
Masked Audio Generation using a Single Non-Autoregressive Transformer
di: Ziv, Alon, et al.
Pubblicazione: (2024)
di: Ziv, Alon, et al.
Pubblicazione: (2024)
AudioGenX: Explainability on Text-to-Audio Generative Models
di: Kang, Hyunju, et al.
Pubblicazione: (2025)
di: Kang, Hyunju, et al.
Pubblicazione: (2025)
EffiFusion-GAN: Efficient Fusion Generative Adversarial Network for Speech Enhancement
di: Wen, Bin, et al.
Pubblicazione: (2025)
di: Wen, Bin, et al.
Pubblicazione: (2025)
A Survey of Deep Learning Audio Generation Methods
di: Božić, Matej, et al.
Pubblicazione: (2024)
di: Božić, Matej, et al.
Pubblicazione: (2024)
PoDAR: Power-Disentangled Audio Representation for Generative Modeling
di: Luebs, Alejandro, et al.
Pubblicazione: (2026)
di: Luebs, Alejandro, et al.
Pubblicazione: (2026)
Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework
di: Zhang, Kuiyuan, et al.
Pubblicazione: (2025)
di: Zhang, Kuiyuan, et al.
Pubblicazione: (2025)
KAD: No More FAD! An Effective and Efficient Evaluation Metric for Audio Generation
di: Chung, Yoonjin, et al.
Pubblicazione: (2025)
di: Chung, Yoonjin, et al.
Pubblicazione: (2025)
Generative AI for Music and Audio
di: Dong, Hao-Wen
Pubblicazione: (2024)
di: Dong, Hao-Wen
Pubblicazione: (2024)
Diffused Responsibility: Analyzing the Energy Consumption of Generative Text-to-Audio Diffusion Models
di: Passoni, Riccardo, et al.
Pubblicazione: (2025)
di: Passoni, Riccardo, et al.
Pubblicazione: (2025)
CoDiCodec: Unifying Continuous and Discrete Compressed Representations of Audio
di: Pasini, Marco, et al.
Pubblicazione: (2025)
di: Pasini, Marco, et al.
Pubblicazione: (2025)
RespLLM: Unifying Audio and Text with Multimodal LLMs for Generalized Respiratory Health Prediction
di: Zhang, Yuwei, et al.
Pubblicazione: (2024)
di: Zhang, Yuwei, et al.
Pubblicazione: (2024)
Investigating Design Choices in Joint-Embedding Predictive Architectures for General Audio Representation Learning
di: Riou, Alain, et al.
Pubblicazione: (2024)
di: Riou, Alain, et al.
Pubblicazione: (2024)
Tuberculosis Screening from Cough Audio: Baseline Models, Clinical Variables, and Uncertainty Quantification
di: Kafentzis, George P., et al.
Pubblicazione: (2026)
di: Kafentzis, George P., et al.
Pubblicazione: (2026)
Music2Latent2: Audio Compression with Summary Embeddings and Autoregressive Decoding
di: Pasini, Marco, et al.
Pubblicazione: (2025)
di: Pasini, Marco, et al.
Pubblicazione: (2025)
BigVSAN: Enhancing GAN-based Neural Vocoders with Slicing Adversarial Network
di: Shibuya, Takashi, et al.
Pubblicazione: (2023)
di: Shibuya, Takashi, et al.
Pubblicazione: (2023)
TACNET: Temporal Audio Source Counting Network
di: Ahmadnejad, Amirreza, et al.
Pubblicazione: (2023)
di: Ahmadnejad, Amirreza, et al.
Pubblicazione: (2023)
Gull: A Generative Multifunctional Audio Codec
di: Luo, Yi, et al.
Pubblicazione: (2024)
di: Luo, Yi, et al.
Pubblicazione: (2024)
CMGAN: Conformer-based Metric GAN for Speech Enhancement
di: Cao, Ruizhe, et al.
Pubblicazione: (2022)
di: Cao, Ruizhe, et al.
Pubblicazione: (2022)
Accelerating High-Fidelity Waveform Generation via Adversarial Flow Matching Optimization
di: Lee, Sang-Hoon, et al.
Pubblicazione: (2024)
di: Lee, Sang-Hoon, et al.
Pubblicazione: (2024)
SSLAM: Enhancing Self-Supervised Models with Audio Mixtures for Polyphonic Soundscapes
di: Alex, Tony, et al.
Pubblicazione: (2025)
di: Alex, Tony, et al.
Pubblicazione: (2025)
CMGAN: Conformer-Based Metric-GAN for Monaural Speech Enhancement
di: Abdulatif, Sherif, et al.
Pubblicazione: (2022)
di: Abdulatif, Sherif, et al.
Pubblicazione: (2022)
Learning Linearity in Audio Consistency Autoencoders via Implicit Regularization
di: Torres, Bernardo, et al.
Pubblicazione: (2025)
di: Torres, Bernardo, et al.
Pubblicazione: (2025)
Text-Queried Audio Source Separation via Hierarchical Modeling
di: Yin, Xinlei, et al.
Pubblicazione: (2025)
di: Yin, Xinlei, et al.
Pubblicazione: (2025)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
di: Kuan, Chun-Yi, et al.
Pubblicazione: (2026)
Multimodal Audio-based Disease Prediction with Transformer-based Hierarchical Fusion Network
di: Cai, Jinjin, et al.
Pubblicazione: (2024)
di: Cai, Jinjin, et al.
Pubblicazione: (2024)
Towards Generating Diverse Audio Captions via Adversarial Training
di: Mei, Xinhao, et al.
Pubblicazione: (2022)
di: Mei, Xinhao, et al.
Pubblicazione: (2022)
Challenge on Sound Scene Synthesis: Evaluating Text-to-Audio Generation
di: Lee, Junwon, et al.
Pubblicazione: (2024)
di: Lee, Junwon, et al.
Pubblicazione: (2024)
HEAR: Holistic Evaluation of Audio Representations
di: Turian, Joseph, et al.
Pubblicazione: (2022)
di: Turian, Joseph, et al.
Pubblicazione: (2022)
SAGE-Music: Low-Latency Symbolic Music Generation via Attribute-Specialized Key-Value Head Sharing
di: Tan, Jiaye, et al.
Pubblicazione: (2025)
di: Tan, Jiaye, et al.
Pubblicazione: (2025)
Geometry-Aware Optimization for Respiratory Sound Classification: Enhancing Sensitivity with SAM-Optimized Audio Spectrogram Transformers
di: Işık, Atakan, et al.
Pubblicazione: (2025)
di: Işık, Atakan, et al.
Pubblicazione: (2025)
From Generality to Mastery: Composer-Style Symbolic Music Generation via Large-Scale Pre-training
di: Yao, Mingyang, et al.
Pubblicazione: (2025)
di: Yao, Mingyang, et al.
Pubblicazione: (2025)
SLAP: Scalable Language-Audio Pretraining with Variable-Duration Audio and Multi-Objective Training
di: Mei, Xinhao, et al.
Pubblicazione: (2026)
di: Mei, Xinhao, et al.
Pubblicazione: (2026)
Koel-TTS: Enhancing LLM based Speech Generation with Preference Alignment and Classifier Free Guidance
di: Hussain, Shehzeen, et al.
Pubblicazione: (2025)
di: Hussain, Shehzeen, et al.
Pubblicazione: (2025)
AnyEnhance: A Unified Generative Model with Prompt-Guidance and Self-Critic for Voice Enhancement
di: Zhang, Junan, et al.
Pubblicazione: (2025)
di: Zhang, Junan, et al.
Pubblicazione: (2025)
AAT: Adapting Audio Transformer for Various Acoustics Recognition Tasks
di: Liang, Yun, et al.
Pubblicazione: (2024)
di: Liang, Yun, et al.
Pubblicazione: (2024)
Learning Source Disentanglement in Neural Audio Codec
di: Bie, Xiaoyu, et al.
Pubblicazione: (2024)
di: Bie, Xiaoyu, et al.
Pubblicazione: (2024)
Metis: A Foundation Speech Generation Model with Masked Generative Pre-training
di: Wang, Yuancheng, et al.
Pubblicazione: (2025)
di: Wang, Yuancheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Fast Text-to-Audio Generation with Adversarial Post-Training
di: Novack, Zachary, et al.
Pubblicazione: (2025) -
DPN-GAN: Inducing Periodic Activations in Generative Adversarial Networks for High-Fidelity Audio Synthesis
di: Ahmad, Zeeshan, et al.
Pubblicazione: (2025) -
Guiding Audio Editing with Audio Language Model
di: Lan, Zitong, et al.
Pubblicazione: (2025) -
Masked Audio Generation using a Single Non-Autoregressive Transformer
di: Ziv, Alon, et al.
Pubblicazione: (2024) -
AudioGenX: Explainability on Text-to-Audio Generative Models
di: Kang, Hyunju, et al.
Pubblicazione: (2025)