From Vision to Audio and Beyond: A Unified Model for Audio-Visual Representation and Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Su, Kun, Liu, Xiulong, Shlizerman, Eli |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Tell What You Hear From What You See -- Video to Audio Generation Through Text
di: Liu, Xiulong, et al.
Pubblicazione: (2024)
di: Liu, Xiulong, et al.
Pubblicazione: (2024)
SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing
di: Chen, Mingfei, et al.
Pubblicazione: (2025)
di: Chen, Mingfei, et al.
Pubblicazione: (2025)
AudioX: A Unified Framework for Anything-to-Audio Generation
di: Tian, Zeyue, et al.
Pubblicazione: (2025)
di: Tian, Zeyue, et al.
Pubblicazione: (2025)
Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation
di: Yang, Shiqi, et al.
Pubblicazione: (2024)
di: Yang, Shiqi, et al.
Pubblicazione: (2024)
Audio-Visual Instance Segmentation
di: Guo, Ruohao, et al.
Pubblicazione: (2023)
di: Guo, Ruohao, et al.
Pubblicazione: (2023)
Continual Audio-Visual Sound Separation
di: Pian, Weiguo, et al.
Pubblicazione: (2024)
di: Pian, Weiguo, et al.
Pubblicazione: (2024)
Sequential Contrastive Audio-Visual Learning
di: Tsiamas, Ioannis, et al.
Pubblicazione: (2024)
di: Tsiamas, Ioannis, et al.
Pubblicazione: (2024)
Self-Supervised Audio-Visual Soundscape Stylization
di: Li, Tingle, et al.
Pubblicazione: (2024)
di: Li, Tingle, et al.
Pubblicazione: (2024)
Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer
di: Wang, Yaoting, et al.
Pubblicazione: (2023)
di: Wang, Yaoting, et al.
Pubblicazione: (2023)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
di: Wang, Le, et al.
Pubblicazione: (2025)
di: Wang, Le, et al.
Pubblicazione: (2025)
Dual Mean-Teacher: An Unbiased Semi-Supervised Framework for Audio-Visual Source Localization
di: Guo, Yuxin, et al.
Pubblicazione: (2024)
di: Guo, Yuxin, et al.
Pubblicazione: (2024)
Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation
di: Li, Kexin, et al.
Pubblicazione: (2024)
di: Li, Kexin, et al.
Pubblicazione: (2024)
AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis with Acoustic Transfer
di: Fang, Pengjun, et al.
Pubblicazione: (2026)
di: Fang, Pengjun, et al.
Pubblicazione: (2026)
Aligning Audio-Visual Joint Representations with an Agentic Workflow
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
di: Lin, Yan-Bo, et al.
Pubblicazione: (2025)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2025)
Learning Self-Supervised Audio-Visual Representations for Sound Recommendations
di: Krishnamurthy, Sudha
Pubblicazione: (2024)
di: Krishnamurthy, Sudha
Pubblicazione: (2024)
DETECLAP: Enhancing Audio-Visual Representation Learning with Object Information
di: Nakada, Shota, et al.
Pubblicazione: (2024)
di: Nakada, Shota, et al.
Pubblicazione: (2024)
Audio-visual Generalized Zero-shot Learning the Easy Way
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
Sounding that Object: Interactive Object-Aware Image to Audio Generation
di: Li, Tingle, et al.
Pubblicazione: (2025)
di: Li, Tingle, et al.
Pubblicazione: (2025)
AV-SUPERB: A Multi-Task Evaluation Benchmark for Audio-Visual Representation Models
di: Tseng, Yuan, et al.
Pubblicazione: (2023)
di: Tseng, Yuan, et al.
Pubblicazione: (2023)
Separate in the Speech Chain: Cross-Modal Conditional Audio-Visual Target Speech Extraction
di: Mu, Zhaoxi, et al.
Pubblicazione: (2024)
di: Mu, Zhaoxi, et al.
Pubblicazione: (2024)
Hear What Matters! Text-conditioned Selective Video-to-Audio Generation
di: Lee, Junwon, et al.
Pubblicazione: (2025)
di: Lee, Junwon, et al.
Pubblicazione: (2025)
StereoSync: Spatially-Aware Stereo Audio Generation from Video
di: Marinoni, Christian, et al.
Pubblicazione: (2025)
di: Marinoni, Christian, et al.
Pubblicazione: (2025)
FoleyGRAM: Video-to-Audio Generation with GRAM-Aligned Multimodal Encoders
di: Gramaccioni, Riccardo Fosco, et al.
Pubblicazione: (2025)
di: Gramaccioni, Riccardo Fosco, et al.
Pubblicazione: (2025)
Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision
di: Liu, Che, et al.
Pubblicazione: (2025)
di: Liu, Che, et al.
Pubblicazione: (2025)
CMMD: Contrastive Multi-Modal Diffusion for Video-Audio Conditional Modeling
di: Yang, Ruihan, et al.
Pubblicazione: (2023)
di: Yang, Ruihan, et al.
Pubblicazione: (2023)
Getting More for Less: Using Weak Labels and AV-Mixup for Robust Audio-Visual Speaker Verification
di: Selvakumar, Anith, et al.
Pubblicazione: (2023)
di: Selvakumar, Anith, et al.
Pubblicazione: (2023)
Semantic Grouping Network for Audio Source Separation
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
Sound2Vision: Generating Diverse Visuals from Audio through Cross-Modal Latent Alignment
di: Sung-Bin, Kim, et al.
Pubblicazione: (2024)
di: Sung-Bin, Kim, et al.
Pubblicazione: (2024)
UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization
di: Geng, Tiantian, et al.
Pubblicazione: (2024)
di: Geng, Tiantian, et al.
Pubblicazione: (2024)
A Study of Dropout-Induced Modality Bias on Robustness to Missing Video Frames for Audio-Visual Speech Recognition
di: Dai, Yusheng, et al.
Pubblicazione: (2024)
di: Dai, Yusheng, et al.
Pubblicazione: (2024)
Cross Pseudo-Labeling for Semi-Supervised Audio-Visual Source Localization
di: Guo, Yuxin, et al.
Pubblicazione: (2024)
di: Guo, Yuxin, et al.
Pubblicazione: (2024)
3D Audio-Visual Segmentation
di: Sokolov, Artem, et al.
Pubblicazione: (2024)
di: Sokolov, Artem, et al.
Pubblicazione: (2024)
MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation
di: Hayakawa, Akio, et al.
Pubblicazione: (2024)
di: Hayakawa, Akio, et al.
Pubblicazione: (2024)
Audio-Visual Speech Enhancement In Complex Scenarios With Separation And Dereverberation Joint Modeling
di: Du, Jiarong, et al.
Pubblicazione: (2025)
di: Du, Jiarong, et al.
Pubblicazione: (2025)
Audio-Vision Contrastive Learning for Phonological Class Recognition
di: Liu, Daiqi, et al.
Pubblicazione: (2025)
di: Liu, Daiqi, et al.
Pubblicazione: (2025)
AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment
di: Cao, Yuqin, et al.
Pubblicazione: (2025)
di: Cao, Yuqin, et al.
Pubblicazione: (2025)
Network Bending of Diffusion Models for Audio-Visual Generation
di: Dzwonczyk, Luke, et al.
Pubblicazione: (2024)
di: Dzwonczyk, Luke, et al.
Pubblicazione: (2024)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
di: Liu, Zehua, et al.
Pubblicazione: (2024)
di: Liu, Zehua, et al.
Pubblicazione: (2024)
Aligned Better, Listen Better for Audio-Visual Large Language Models
di: Guo, Yuxin, et al.
Pubblicazione: (2025)
di: Guo, Yuxin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Tell What You Hear From What You See -- Video to Audio Generation Through Text
di: Liu, Xiulong, et al.
Pubblicazione: (2024) -
SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing
di: Chen, Mingfei, et al.
Pubblicazione: (2025) -
AudioX: A Unified Framework for Anything-to-Audio Generation
di: Tian, Zeyue, et al.
Pubblicazione: (2025) -
Visual Echoes: A Simple Unified Transformer for Audio-Visual Generation
di: Yang, Shiqi, et al.
Pubblicazione: (2024) -
Audio-Visual Instance Segmentation
di: Guo, Ruohao, et al.
Pubblicazione: (2023)