Improving Sound Source Localization with Joint Slot Attention on Image and Audio
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Inho, Song, Youngkil, Park, Jicheol, Kim, Won Hwa, Kwak, Suha |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PLOT: Text-based Person Search with Part Slot Attention for Corresponding Part Discovery
di: Park, Jicheol, et al.
Pubblicazione: (2024)
di: Park, Jicheol, et al.
Pubblicazione: (2024)
Learning Audio-guided Video Representation with Gated Attention for Video-Text Retrieval
di: Jeong, Boseung, et al.
Pubblicazione: (2025)
di: Jeong, Boseung, et al.
Pubblicazione: (2025)
Online Temporal Action Localization with Memory-Augmented Transformer
di: Song, Youngkil, et al.
Pubblicazione: (2024)
di: Song, Youngkil, et al.
Pubblicazione: (2024)
Improving Text-based Person Search via Part-level Cross-modal Correspondence
di: Park, Jicheol, et al.
Pubblicazione: (2024)
di: Park, Jicheol, et al.
Pubblicazione: (2024)
Towards More Practical Group Activity Detection: A New Benchmark and Model
di: Kim, Dongkeun, et al.
Pubblicazione: (2023)
di: Kim, Dongkeun, et al.
Pubblicazione: (2023)
Bootstrapping Top-down Information for Self-modulating Slot Attention
di: Kim, Dongwon, et al.
Pubblicazione: (2024)
di: Kim, Dongwon, et al.
Pubblicazione: (2024)
Aligning Sight and Sound: Advanced Sound Source Localization Through Audio-Visual Alignment
di: Senocak, Arda, et al.
Pubblicazione: (2024)
di: Senocak, Arda, et al.
Pubblicazione: (2024)
Learning to Visually Localize Sound Sources from Mixtures without Prior Source Knowledge
di: Kim, Dongjin, et al.
Pubblicazione: (2024)
di: Kim, Dongjin, et al.
Pubblicazione: (2024)
What's Making That Sound Right Now? Video-centric Audio-Visual Localization
di: Choi, Hahyeon, et al.
Pubblicazione: (2025)
di: Choi, Hahyeon, et al.
Pubblicazione: (2025)
A Critical Assessment of Visual Sound Source Localization Models Including Negative Audio
di: Juanola, Xavier, et al.
Pubblicazione: (2024)
di: Juanola, Xavier, et al.
Pubblicazione: (2024)
AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control
di: Guo, Xinyue, et al.
Pubblicazione: (2025)
di: Guo, Xinyue, et al.
Pubblicazione: (2025)
Efficient Audio-Visual Speech Separation with Discrete Lip Semantics and Multi-Scale Global-Local Attention
di: Li, Kai, et al.
Pubblicazione: (2025)
di: Li, Kai, et al.
Pubblicazione: (2025)
Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes
di: Ryu, Hyeonggon, et al.
Pubblicazione: (2025)
di: Ryu, Hyeonggon, et al.
Pubblicazione: (2025)
Hearing and Seeing Through CLIP: A Framework for Self-Supervised Sound Source Localization
di: Park, Sooyoung, et al.
Pubblicazione: (2025)
di: Park, Sooyoung, et al.
Pubblicazione: (2025)
Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer
di: Wang, Yaoting, et al.
Pubblicazione: (2023)
di: Wang, Yaoting, et al.
Pubblicazione: (2023)
Audio-Visual Talker Localization in Video for Spatial Sound Reproduction
di: Berghi, Davide, et al.
Pubblicazione: (2024)
di: Berghi, Davide, et al.
Pubblicazione: (2024)
Extending CLIP's Image-Text Alignment to Referring Image Segmentation
di: Kim, Seoyeon, et al.
Pubblicazione: (2023)
di: Kim, Seoyeon, et al.
Pubblicazione: (2023)
Audio-Visual Person Verification based on Recursive Fusion of Joint Cross-Attention
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation
di: Petermann, Darius, et al.
Pubblicazione: (2025)
di: Petermann, Darius, et al.
Pubblicazione: (2025)
T-VSL: Text-Guided Visual Sound Source Localization in Mixtures
di: Mahmud, Tanvir, et al.
Pubblicazione: (2024)
di: Mahmud, Tanvir, et al.
Pubblicazione: (2024)
Audio-Visual World Models: Towards Multisensory Imagination in Sight and Sound
di: Wang, Jiahua, et al.
Pubblicazione: (2025)
di: Wang, Jiahua, et al.
Pubblicazione: (2025)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
di: Dai, Yusheng, et al.
Pubblicazione: (2026)
di: Dai, Yusheng, et al.
Pubblicazione: (2026)
JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching
di: Kwon, Mingi, et al.
Pubblicazione: (2025)
di: Kwon, Mingi, et al.
Pubblicazione: (2025)
Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation
di: Cheng, Shihao, et al.
Pubblicazione: (2026)
di: Cheng, Shihao, et al.
Pubblicazione: (2026)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
di: Liu, Kai, et al.
Pubblicazione: (2026)
di: Liu, Kai, et al.
Pubblicazione: (2026)
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
di: Su, Yaofeng, et al.
Pubblicazione: (2026)
di: Su, Yaofeng, et al.
Pubblicazione: (2026)
Gotta Hear Them All: Towards Sound Source Aware Audio Generation
di: Guo, Wei, et al.
Pubblicazione: (2024)
di: Guo, Wei, et al.
Pubblicazione: (2024)
Sound Sparks Motion: Audio and Text Tuning for Video Editing
di: Razlighi, AmirHossein Naghi, et al.
Pubblicazione: (2026)
di: Razlighi, AmirHossein Naghi, et al.
Pubblicazione: (2026)
MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
di: Rho, Kyeongha, et al.
Pubblicazione: (2025)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
di: Yang, Jianxuan, et al.
Pubblicazione: (2025)
di: Yang, Jianxuan, et al.
Pubblicazione: (2025)
Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
Sound2Vision: Generating Diverse Visuals from Audio through Cross-Modal Latent Alignment
di: Sung-Bin, Kim, et al.
Pubblicazione: (2024)
di: Sung-Bin, Kim, et al.
Pubblicazione: (2024)
Cross Pseudo-Labeling for Semi-Supervised Audio-Visual Source Localization
di: Guo, Yuxin, et al.
Pubblicazione: (2024)
di: Guo, Yuxin, et al.
Pubblicazione: (2024)
Robust Audio-Visual Segmentation via Audio-Guided Visual Convergent Alignment
di: Liu, Chen, et al.
Pubblicazione: (2025)
di: Liu, Chen, et al.
Pubblicazione: (2025)
MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video
di: Tateishi, Kazuya, et al.
Pubblicazione: (2026)
di: Tateishi, Kazuya, et al.
Pubblicazione: (2026)
Diffusion Models for Joint Audio-Video Generation
di: La Torre, Alejandro Paredes
Pubblicazione: (2026)
di: La Torre, Alejandro Paredes
Pubblicazione: (2026)
Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
di: Guan, Kaisi, et al.
Pubblicazione: (2025)
di: Guan, Kaisi, et al.
Pubblicazione: (2025)
SemiPL: A Semi-supervised Method for Event Sound Source Localization
di: Li, Yue, et al.
Pubblicazione: (2024)
di: Li, Yue, et al.
Pubblicazione: (2024)
SoundBrush: Sound as a Brush for Visual Scene Editing
di: Sung-Bin, Kim, et al.
Pubblicazione: (2024)
di: Sung-Bin, Kim, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PLOT: Text-based Person Search with Part Slot Attention for Corresponding Part Discovery
di: Park, Jicheol, et al.
Pubblicazione: (2024) -
Learning Audio-guided Video Representation with Gated Attention for Video-Text Retrieval
di: Jeong, Boseung, et al.
Pubblicazione: (2025) -
Online Temporal Action Localization with Memory-Augmented Transformer
di: Song, Youngkil, et al.
Pubblicazione: (2024) -
Improving Text-based Person Search via Part-level Cross-modal Correspondence
di: Park, Jicheol, et al.
Pubblicazione: (2024) -
Towards More Practical Group Activity Detection: A New Benchmark and Model
di: Kim, Dongkeun, et al.
Pubblicazione: (2023)