Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Petermann, Darius, Kalayeh, Mahdi M. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
por: Ryu, Hyeonggon, et al.
Publicado: (2025)
por: Ryu, Hyeonggon, et al.
Publicado: (2025)
MACS: Multi-source Audio-to-image Generation with Contextual Significance and Semantic Alignment
por: Zhou, Hao, et al.
Publicado: (2025)
por: Zhou, Hao, et al.
Publicado: (2025)
READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation
por: Wang, Haotian, et al.
Publicado: (2025)
por: Wang, Haotian, et al.
Publicado: (2025)
Audio-Plane: Audio Factorization Plane Gaussian Splatting for Real-Time Talking Head Synthesis
por: Shen, Shuai, et al.
Publicado: (2025)
por: Shen, Shuai, et al.
Publicado: (2025)
Text-driven Talking Face Synthesis by Reprogramming Audio-driven Models
por: Choi, Jeongsoo, et al.
Publicado: (2023)
por: Choi, Jeongsoo, et al.
Publicado: (2023)
RAP: Real-time Audio-driven Portrait Animation with Video Diffusion Transformer
por: Du, Fangyu, et al.
Publicado: (2025)
por: Du, Fangyu, et al.
Publicado: (2025)
Looking Similar, Sounding Different: Leveraging Counterfactual Cross-Modal Pairs for Audiovisual Representation Learning
por: Singh, Nikhil, et al.
Publicado: (2023)
por: Singh, Nikhil, et al.
Publicado: (2023)
DIDiffGes: Decoupled Semi-Implicit Diffusion Models for Real-time Gesture Generation from Speech
por: Cheng, Yongkang, et al.
Publicado: (2025)
por: Cheng, Yongkang, et al.
Publicado: (2025)
Audio-Visual Talker Localization in Video for Spatial Sound Reproduction
por: Berghi, Davide, et al.
Publicado: (2024)
por: Berghi, Davide, et al.
Publicado: (2024)
Sonic: Shifting Focus to Global Audio Perception in Portrait Animation
por: Ji, Xiaozhong, et al.
Publicado: (2024)
por: Ji, Xiaozhong, et al.
Publicado: (2024)
MIDGET: Music Conditioned 3D Dance Generation
por: Wang, Jinwu, et al.
Publicado: (2024)
por: Wang, Jinwu, et al.
Publicado: (2024)
Inter-Diffusion Generation Model of Speakers and Listeners for Effective Communication
por: Huang, Jinhe, et al.
Publicado: (2025)
por: Huang, Jinhe, et al.
Publicado: (2025)
GCDance: Genre-Controlled Music-Driven 3D Full Body Dance Generation
por: Liu, Xinran, et al.
Publicado: (2025)
por: Liu, Xinran, et al.
Publicado: (2025)
DuetGen: Music Driven Two-Person Dance Generation via Hierarchical Masked Modeling
por: Ghosh, Anindita, et al.
Publicado: (2025)
por: Ghosh, Anindita, et al.
Publicado: (2025)
MotionRAG-Diff: A Retrieval-Augmented Diffusion Framework for Long-Term Music-to-Dance Generation
por: Huang, Mingyang, et al.
Publicado: (2025)
por: Huang, Mingyang, et al.
Publicado: (2025)
Lodge: A Coarse to Fine Diffusion Network for Long Dance Generation Guided by the Characteristic Dance Primitives
por: Li, Ronghui, et al.
Publicado: (2024)
por: Li, Ronghui, et al.
Publicado: (2024)
Conditional GAN for Enhancing Diffusion Models in Efficient and Authentic Global Gesture Generation from Audios
por: Cheng, Yongkang, et al.
Publicado: (2024)
por: Cheng, Yongkang, et al.
Publicado: (2024)
Aligning Sight and Sound: Advanced Sound Source Localization Through Audio-Visual Alignment
por: Senocak, Arda, et al.
Publicado: (2024)
por: Senocak, Arda, et al.
Publicado: (2024)
NeRF-3DTalker: Neural Radiance Field with 3D Prior Aided Audio Disentanglement for Talking Head Synthesis
por: Liu, Xiaoxing, et al.
Publicado: (2025)
por: Liu, Xiaoxing, et al.
Publicado: (2025)
Silence is Golden: Leveraging Adversarial Examples to Nullify Audio Control in LDM-based Talking-Head Generation
por: Gan, Yuan, et al.
Publicado: (2025)
por: Gan, Yuan, et al.
Publicado: (2025)
A Critical Assessment of Visual Sound Source Localization Models Including Negative Audio
por: Juanola, Xavier, et al.
Publicado: (2024)
por: Juanola, Xavier, et al.
Publicado: (2024)
TCDiff++: An End-to-end Trajectory-Controllable Diffusion Model for Harmonious Music-Driven Group Choreography
por: Dai, Yuqin, et al.
Publicado: (2025)
por: Dai, Yuqin, et al.
Publicado: (2025)
Semantic Gesticulator: Semantics-Aware Co-Speech Gesture Synthesis
por: Zhang, Zeyi, et al.
Publicado: (2024)
por: Zhang, Zeyi, et al.
Publicado: (2024)
Duolando: Follower GPT with Off-Policy Reinforcement Learning for Dance Accompaniment
por: Siyao, Li, et al.
Publicado: (2024)
por: Siyao, Li, et al.
Publicado: (2024)
GaussianSpeech: Audio-Driven Gaussian Avatars
por: Aneja, Shivangi, et al.
Publicado: (2024)
por: Aneja, Shivangi, et al.
Publicado: (2024)
Learning Self-Supervised Audio-Visual Representations for Sound Recommendations
por: Krishnamurthy, Sudha
Publicado: (2024)
por: Krishnamurthy, Sudha
Publicado: (2024)
DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos
por: Liang, Yunming, et al.
Publicado: (2025)
por: Liang, Yunming, et al.
Publicado: (2025)
FaceTalk: Audio-Driven Motion Diffusion for Neural Parametric Head Models
por: Aneja, Shivangi, et al.
Publicado: (2023)
por: Aneja, Shivangi, et al.
Publicado: (2023)
Sound2Vision: Generating Diverse Visuals from Audio through Cross-Modal Latent Alignment
por: Sung-Bin, Kim, et al.
Publicado: (2024)
por: Sung-Bin, Kim, et al.
Publicado: (2024)
InterDance:Reactive 3D Dance Generation with Realistic Duet Interactions
por: Li, Ronghui, et al.
Publicado: (2024)
por: Li, Ronghui, et al.
Publicado: (2024)
It Takes Two: Real-time Co-Speech Two-person's Interaction Generation via Reactive Auto-regressive Diffusion Model
por: Shi, Mingyi, et al.
Publicado: (2024)
por: Shi, Mingyi, et al.
Publicado: (2024)
ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
por: Liu, Huadai, et al.
Publicado: (2025)
por: Liu, Huadai, et al.
Publicado: (2025)
Hearing and Seeing Through CLIP: A Framework for Self-Supervised Sound Source Localization
por: Park, Sooyoung, et al.
Publicado: (2025)
por: Park, Sooyoung, et al.
Publicado: (2025)
SoundWeaver: Semantic Warm-Starting for Text-to-Audio Diffusion Serving
por: Barik, Ayush, et al.
Publicado: (2026)
por: Barik, Ayush, et al.
Publicado: (2026)
Listen and Move: Improving GANs Coherency in Agnostic Sound-to-Video Generation
por: Redondo, Rafael
Publicado: (2024)
por: Redondo, Rafael
Publicado: (2024)
Continual Audio-Visual Sound Separation
por: Pian, Weiguo, et al.
Publicado: (2024)
por: Pian, Weiguo, et al.
Publicado: (2024)
SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation
por: Pham, Kien T., et al.
Publicado: (2025)
por: Pham, Kien T., et al.
Publicado: (2025)
High-Quality Visually-Guided Sound Separation from Diverse Categories
por: Huang, Chao, et al.
Publicado: (2023)
por: Huang, Chao, et al.
Publicado: (2023)
Gotta Hear Them All: Towards Sound Source Aware Audio Generation
por: Guo, Wei, et al.
Publicado: (2024)
por: Guo, Wei, et al.
Publicado: (2024)
QEAN: Quaternion-Enhanced Attention Network for Visual Dance Generation
por: Zhou, Zhizhen, et al.
Publicado: (2024)
por: Zhou, Zhizhen, et al.
Publicado: (2024)
Ejemplares similares
-
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
por: Ryu, Hyeonggon, et al.
Publicado: (2025) -
MACS: Multi-source Audio-to-image Generation with Contextual Significance and Semantic Alignment
por: Zhou, Hao, et al.
Publicado: (2025) -
READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation
por: Wang, Haotian, et al.
Publicado: (2025) -
Audio-Plane: Audio Factorization Plane Gaussian Splatting for Real-Time Talking Head Synthesis
por: Shen, Shuai, et al.
Publicado: (2025) -
Text-driven Talking Face Synthesis by Reprogramming Audio-driven Models
por: Choi, Jeongsoo, et al.
Publicado: (2023)