Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Lee, Seung-jae, Seo, Paul Hongsuck |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning
di: Xu, Le, et al.
Pubblicazione: (2025)
di: Xu, Le, et al.
Pubblicazione: (2025)
ZeroSep: Separate Anything in Audio with Zero Training
di: Huang, Chao, et al.
Pubblicazione: (2025)
di: Huang, Chao, et al.
Pubblicazione: (2025)
Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning
di: Li, Wenrui, et al.
Pubblicazione: (2024)
di: Li, Wenrui, et al.
Pubblicazione: (2024)
DDAVS: Disentangled Audio Semantics and Delayed Bidirectional Alignment for Audio-Visual Segmentation
di: Tian, Jingqi, et al.
Pubblicazione: (2025)
di: Tian, Jingqi, et al.
Pubblicazione: (2025)
Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries
di: Kim, Minyoung, et al.
Pubblicazione: (2025)
di: Kim, Minyoung, et al.
Pubblicazione: (2025)
Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues
di: Chen, Tianxiang, et al.
Pubblicazione: (2024)
di: Chen, Tianxiang, et al.
Pubblicazione: (2024)
VAInpaint: Zero-Shot Video-Audio inpainting framework with LLMs-driven Module
di: Wu, Kam Man, et al.
Pubblicazione: (2025)
di: Wu, Kam Man, et al.
Pubblicazione: (2025)
Discrepancy-Aware Attention Network for Enhanced Audio-Visual Zero-Shot Learning
di: Yu, RunLin, et al.
Pubblicazione: (2024)
di: Yu, RunLin, et al.
Pubblicazione: (2024)
Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
di: Yeo, Jeong Hun, et al.
Pubblicazione: (2025)
Dynamic Derivation and Elimination: Audio Visual Segmentation with Enhanced Audio Semantics
di: Liu, Chen, et al.
Pubblicazione: (2025)
di: Liu, Chen, et al.
Pubblicazione: (2025)
An Eye for an Ear: Zero-shot Audio Description Leveraging an Image Captioner using Audiovisual Distribution Alignment
di: Malard, Hugo, et al.
Pubblicazione: (2024)
di: Malard, Hugo, et al.
Pubblicazione: (2024)
Segment Beyond View: Handling Partially Missing Modality for Audio-Visual Semantic Segmentation
di: Wu, Renjie, et al.
Pubblicazione: (2023)
di: Wu, Renjie, et al.
Pubblicazione: (2023)
Siamese Vision Transformers are Scalable Audio-visual Learners
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
PSM: Learning Probabilistic Embeddings for Multi-scale Zero-Shot Soundscape Mapping
di: Khanal, Subash, et al.
Pubblicazione: (2024)
di: Khanal, Subash, et al.
Pubblicazione: (2024)
FSSUAVL: A Discriminative Framework using Vision Models for Federated Self-Supervised Audio and Image Understanding
di: Rehman, Yasar Abbas Ur, et al.
Pubblicazione: (2025)
di: Rehman, Yasar Abbas Ur, et al.
Pubblicazione: (2025)
When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining
di: Yeo, Juan, et al.
Pubblicazione: (2024)
di: Yeo, Juan, et al.
Pubblicazione: (2024)
3D Audio-Visual Segmentation
di: Sokolov, Artem, et al.
Pubblicazione: (2024)
di: Sokolov, Artem, et al.
Pubblicazione: (2024)
Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision
di: Liu, Che, et al.
Pubblicazione: (2025)
di: Liu, Che, et al.
Pubblicazione: (2025)
Accuracy enhancement method for speech emotion recognition from spectrogram using temporal frequency correlation and positional information learning through knowledge transfer
di: Kim, Jeong-Yoon, et al.
Pubblicazione: (2024)
di: Kim, Jeong-Yoon, et al.
Pubblicazione: (2024)
Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio
di: Chen, Gongyu, et al.
Pubblicazione: (2024)
di: Chen, Gongyu, et al.
Pubblicazione: (2024)
Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction
di: Yang, Shu-wen, et al.
Pubblicazione: (2025)
di: Yang, Shu-wen, et al.
Pubblicazione: (2025)
Robust Audiovisual Speech Recognition Models with Mixture-of-Experts
di: Wu, Yihan, et al.
Pubblicazione: (2024)
di: Wu, Yihan, et al.
Pubblicazione: (2024)
Contrastive Conditional Latent Diffusion for Audio-visual Segmentation
di: Mao, Yuxin, et al.
Pubblicazione: (2023)
di: Mao, Yuxin, et al.
Pubblicazione: (2023)
CCStereo: Audio-Visual Contextual and Contrastive Learning for Binaural Audio Generation
di: Chen, Yuanhong, et al.
Pubblicazione: (2025)
di: Chen, Yuanhong, et al.
Pubblicazione: (2025)
OmniAudio: Generating Spatial Audio from 360-Degree Video
di: Liu, Huadai, et al.
Pubblicazione: (2025)
di: Liu, Huadai, et al.
Pubblicazione: (2025)
Audio-Vision Contrastive Learning for Phonological Class Recognition
di: Liu, Daiqi, et al.
Pubblicazione: (2025)
di: Liu, Daiqi, et al.
Pubblicazione: (2025)
M&M: Multimodal-Multitask Model Integrating Audiovisual Cues in Cognitive Load Assessment
di: Nguyen-Phuoc, Long, et al.
Pubblicazione: (2024)
di: Nguyen-Phuoc, Long, et al.
Pubblicazione: (2024)
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
di: Lin, Yan-Bo, et al.
Pubblicazione: (2025)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2025)
SSAVSV: Towards Unified Model for Self-Supervised Audio-Visual Speaker Verification
di: Rajasekhar, Gnana Praveen, et al.
Pubblicazione: (2025)
di: Rajasekhar, Gnana Praveen, et al.
Pubblicazione: (2025)
SAVE: Segment Audio-Visual Easy way using Segment Anything Model
di: Nguyen, Khanh-Binh, et al.
Pubblicazione: (2024)
di: Nguyen, Khanh-Binh, et al.
Pubblicazione: (2024)
RTFS-Net: Recurrent Time-Frequency Modelling for Efficient Audio-Visual Speech Separation
di: Pegg, Samuel, et al.
Pubblicazione: (2023)
di: Pegg, Samuel, et al.
Pubblicazione: (2023)
A Critical Assessment of Visual Sound Source Localization Models Including Negative Audio
di: Juanola, Xavier, et al.
Pubblicazione: (2024)
di: Juanola, Xavier, et al.
Pubblicazione: (2024)
Learning to Highlight Audio by Watching Movies
di: Huang, Chao, et al.
Pubblicazione: (2025)
di: Huang, Chao, et al.
Pubblicazione: (2025)
MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
di: Qiang, Chunyu, et al.
Pubblicazione: (2026)
ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
di: Liu, Huadai, et al.
Pubblicazione: (2025)
di: Liu, Huadai, et al.
Pubblicazione: (2025)
ExpGest: Expressive Speaker Generation Using Diffusion Model and Hybrid Audio-Text Guidance
di: Cheng, Yongkang, et al.
Pubblicazione: (2024)
di: Cheng, Yongkang, et al.
Pubblicazione: (2024)
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
di: Zhang, Haomin, et al.
Pubblicazione: (2025)
Out-Of-Distribution Detection for Audio-visual Generalized Zero-Shot Learning: A General Framework
di: Wen, Liuyuan
Pubblicazione: (2024)
di: Wen, Liuyuan
Pubblicazione: (2024)
Towards Reliable Audio Deepfake Attribution and Model Recognition: A Multi-Level Autoencoder-Based Framework
di: Di Pierno, Andrea, et al.
Pubblicazione: (2025)
di: Di Pierno, Andrea, et al.
Pubblicazione: (2025)
DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization
di: Lee, Geonyoung, et al.
Pubblicazione: (2025)
di: Lee, Geonyoung, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning
di: Xu, Le, et al.
Pubblicazione: (2025) -
ZeroSep: Separate Anything in Audio with Zero Training
di: Huang, Chao, et al.
Pubblicazione: (2025) -
Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning
di: Li, Wenrui, et al.
Pubblicazione: (2024) -
DDAVS: Disentangled Audio Semantics and Delayed Bidirectional Alignment for Audio-Visual Segmentation
di: Tian, Jingqi, et al.
Pubblicazione: (2025) -
Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries
di: Kim, Minyoung, et al.
Pubblicazione: (2025)