DPN-GAN: Inducing Periodic Activations in Generative Adversarial Networks for High-Fidelity Audio Synthesis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ahmad, Zeeshan, Bao, Shudi, Chen, Meng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
As Good as It KAN Get: High-Fidelity Audio Representation
par: Marszałek, Patryk, et autres
Publié: (2025)
par: Marszałek, Patryk, et autres
Publié: (2025)
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
par: Shan, Sizhe, et autres
Publié: (2025)
par: Shan, Sizhe, et autres
Publié: (2025)
CCStereo: Audio-Visual Contextual and Contrastive Learning for Binaural Audio Generation
par: Chen, Yuanhong, et autres
Publié: (2025)
par: Chen, Yuanhong, et autres
Publié: (2025)
OmniAudio: Generating Spatial Audio from 360-Degree Video
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs
par: Anand, et autres
Publié: (2025)
par: Anand, et autres
Publié: (2025)
AudioGAN: A Compact and Efficient Framework for Real-Time High-Fidelity Text-to-Audio Generation
par: Chung, HaeChun
Publié: (2025)
par: Chung, HaeChun
Publié: (2025)
JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching
par: Kwon, Mingi, et autres
Publié: (2025)
par: Kwon, Mingi, et autres
Publié: (2025)
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
par: Zhang, Haomin, et autres
Publié: (2025)
par: Zhang, Haomin, et autres
Publié: (2025)
Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues
par: Chen, Tianxiang, et autres
Publié: (2024)
par: Chen, Tianxiang, et autres
Publié: (2024)
Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis
par: Yang, Qi, et autres
Publié: (2024)
par: Yang, Qi, et autres
Publié: (2024)
Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio
par: Chen, Gongyu, et autres
Publié: (2024)
par: Chen, Gongyu, et autres
Publié: (2024)
Dynamic Derivation and Elimination: Audio Visual Segmentation with Enhanced Audio Semantics
par: Liu, Chen, et autres
Publié: (2025)
par: Liu, Chen, et autres
Publié: (2025)
DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos
par: Liang, Yunming, et autres
Publié: (2025)
par: Liang, Yunming, et autres
Publié: (2025)
Dual Audio-Centric Modality Coupling for Talking Head Generation
par: Fu, Ao, et autres
Publié: (2025)
par: Fu, Ao, et autres
Publié: (2025)
ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
Synchronized Video-to-Audio Generation via Mel Quantization-Continuum Decomposition
par: Wang, Juncheng, et autres
Publié: (2025)
par: Wang, Juncheng, et autres
Publié: (2025)
Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching
par: Wang, Yongqi, et autres
Publié: (2024)
par: Wang, Yongqi, et autres
Publié: (2024)
Video-to-Audio Generation with Hidden Alignment
par: Xu, Manjie, et autres
Publié: (2024)
par: Xu, Manjie, et autres
Publié: (2024)
Global-Local Distillation Network-Based Audio-Visual Speaker Tracking with Incomplete Modalities
par: Li, Yidi, et autres
Publié: (2024)
par: Li, Yidi, et autres
Publié: (2024)
Both Ears Wide Open: Towards Language-Driven Spatial Audio Generation
par: Sun, Peiwen, et autres
Publié: (2024)
par: Sun, Peiwen, et autres
Publié: (2024)
Audio-Plane: Audio Factorization Plane Gaussian Splatting for Real-Time Talking Head Synthesis
par: Shen, Shuai, et autres
Publié: (2025)
par: Shen, Shuai, et autres
Publié: (2025)
Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction
par: Yang, Shu-wen, et autres
Publié: (2025)
par: Yang, Shu-wen, et autres
Publié: (2025)
TapToTab : Video-Based Guitar Tabs Generation using AI and Audio Analysis
par: Ghaleb, Ali, et autres
Publié: (2024)
par: Ghaleb, Ali, et autres
Publié: (2024)
DDAVS: Disentangled Audio Semantics and Delayed Bidirectional Alignment for Audio-Visual Segmentation
par: Tian, Jingqi, et autres
Publié: (2025)
par: Tian, Jingqi, et autres
Publié: (2025)
ExpGest: Expressive Speaker Generation Using Diffusion Model and Hybrid Audio-Text Guidance
par: Cheng, Yongkang, et autres
Publié: (2024)
par: Cheng, Yongkang, et autres
Publié: (2024)
CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization
par: Bai, Detao, et autres
Publié: (2025)
par: Bai, Detao, et autres
Publié: (2025)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
par: Wang, Le, et autres
Publié: (2025)
par: Wang, Le, et autres
Publié: (2025)
Learning to Highlight Audio by Watching Movies
par: Huang, Chao, et autres
Publié: (2025)
par: Huang, Chao, et autres
Publié: (2025)
Conditional GAN for Enhancing Diffusion Models in Efficient and Authentic Global Gesture Generation from Audios
par: Cheng, Yongkang, et autres
Publié: (2024)
par: Cheng, Yongkang, et autres
Publié: (2024)
MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
par: Cappellazzo, Umberto, et autres
Publié: (2025)
par: Cappellazzo, Umberto, et autres
Publié: (2025)
Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper
par: Chen, Gehui, et autres
Publié: (2025)
par: Chen, Gehui, et autres
Publié: (2025)
Text-driven Talking Face Synthesis by Reprogramming Audio-driven Models
par: Choi, Jeongsoo, et autres
Publié: (2023)
par: Choi, Jeongsoo, et autres
Publié: (2023)
Segment Beyond View: Handling Partially Missing Modality for Audio-Visual Semantic Segmentation
par: Wu, Renjie, et autres
Publié: (2023)
par: Wu, Renjie, et autres
Publié: (2023)
Pindrop it! Audio and Visual Deepfake Countermeasures for Robust Detection and Fine Grained-Localization
par: Klein, Nicholas, et autres
Publié: (2025)
par: Klein, Nicholas, et autres
Publié: (2025)
Weakly-supervised Audio Temporal Forgery Localization via Progressive Audio-language Co-learning Network
par: Wu, Junyan, et autres
Publié: (2025)
par: Wu, Junyan, et autres
Publié: (2025)
MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis
par: Cheng, Ho Kei, et autres
Publié: (2024)
par: Cheng, Ho Kei, et autres
Publié: (2024)
Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion Latent Aligners
par: Xing, Yazhou, et autres
Publié: (2024)
par: Xing, Yazhou, et autres
Publié: (2024)
ZeroSep: Separate Anything in Audio with Zero Training
par: Huang, Chao, et autres
Publié: (2025)
par: Huang, Chao, et autres
Publié: (2025)
Siamese Vision Transformers are Scalable Audio-visual Learners
par: Lin, Yan-Bo, et autres
Publié: (2024)
par: Lin, Yan-Bo, et autres
Publié: (2024)
Aligned Better, Listen Better for Audio-Visual Large Language Models
par: Guo, Yuxin, et autres
Publié: (2025)
par: Guo, Yuxin, et autres
Publié: (2025)
Documents similaires
-
As Good as It KAN Get: High-Fidelity Audio Representation
par: Marszałek, Patryk, et autres
Publié: (2025) -
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
par: Shan, Sizhe, et autres
Publié: (2025) -
CCStereo: Audio-Visual Contextual and Contrastive Learning for Binaural Audio Generation
par: Chen, Yuanhong, et autres
Publié: (2025) -
OmniAudio: Generating Spatial Audio from 360-Degree Video
par: Liu, Huadai, et autres
Publié: (2025) -
Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs
par: Anand, et autres
Publié: (2025)