Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lee, Seung-jae, Seo, Paul Hongsuck |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning
par: Xu, Le, et autres
Publié: (2025)
par: Xu, Le, et autres
Publié: (2025)
ZeroSep: Separate Anything in Audio with Zero Training
par: Huang, Chao, et autres
Publié: (2025)
par: Huang, Chao, et autres
Publié: (2025)
Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning
par: Li, Wenrui, et autres
Publié: (2024)
par: Li, Wenrui, et autres
Publié: (2024)
DDAVS: Disentangled Audio Semantics and Delayed Bidirectional Alignment for Audio-Visual Segmentation
par: Tian, Jingqi, et autres
Publié: (2025)
par: Tian, Jingqi, et autres
Publié: (2025)
Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries
par: Kim, Minyoung, et autres
Publié: (2025)
par: Kim, Minyoung, et autres
Publié: (2025)
Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues
par: Chen, Tianxiang, et autres
Publié: (2024)
par: Chen, Tianxiang, et autres
Publié: (2024)
VAInpaint: Zero-Shot Video-Audio inpainting framework with LLMs-driven Module
par: Wu, Kam Man, et autres
Publié: (2025)
par: Wu, Kam Man, et autres
Publié: (2025)
Discrepancy-Aware Attention Network for Enhanced Audio-Visual Zero-Shot Learning
par: Yu, RunLin, et autres
Publié: (2024)
par: Yu, RunLin, et autres
Publié: (2024)
Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations
par: Yeo, Jeong Hun, et autres
Publié: (2025)
par: Yeo, Jeong Hun, et autres
Publié: (2025)
Dynamic Derivation and Elimination: Audio Visual Segmentation with Enhanced Audio Semantics
par: Liu, Chen, et autres
Publié: (2025)
par: Liu, Chen, et autres
Publié: (2025)
An Eye for an Ear: Zero-shot Audio Description Leveraging an Image Captioner using Audiovisual Distribution Alignment
par: Malard, Hugo, et autres
Publié: (2024)
par: Malard, Hugo, et autres
Publié: (2024)
Segment Beyond View: Handling Partially Missing Modality for Audio-Visual Semantic Segmentation
par: Wu, Renjie, et autres
Publié: (2023)
par: Wu, Renjie, et autres
Publié: (2023)
Siamese Vision Transformers are Scalable Audio-visual Learners
par: Lin, Yan-Bo, et autres
Publié: (2024)
par: Lin, Yan-Bo, et autres
Publié: (2024)
PSM: Learning Probabilistic Embeddings for Multi-scale Zero-Shot Soundscape Mapping
par: Khanal, Subash, et autres
Publié: (2024)
par: Khanal, Subash, et autres
Publié: (2024)
FSSUAVL: A Discriminative Framework using Vision Models for Federated Self-Supervised Audio and Image Understanding
par: Rehman, Yasar Abbas Ur, et autres
Publié: (2025)
par: Rehman, Yasar Abbas Ur, et autres
Publié: (2025)
When Vision Models Meet Parameter Efficient Look-Aside Adapters Without Large-Scale Audio Pretraining
par: Yeo, Juan, et autres
Publié: (2024)
par: Yeo, Juan, et autres
Publié: (2024)
3D Audio-Visual Segmentation
par: Sokolov, Artem, et autres
Publié: (2024)
par: Sokolov, Artem, et autres
Publié: (2024)
Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision
par: Liu, Che, et autres
Publié: (2025)
par: Liu, Che, et autres
Publié: (2025)
Accuracy enhancement method for speech emotion recognition from spectrogram using temporal frequency correlation and positional information learning through knowledge transfer
par: Kim, Jeong-Yoon, et autres
Publié: (2024)
par: Kim, Jeong-Yoon, et autres
Publié: (2024)
Multiple Consistency-guided Test-Time Adaptation for Contrastive Audio-Language Models with Unlabeled Audio
par: Chen, Gongyu, et autres
Publié: (2024)
par: Chen, Gongyu, et autres
Publié: (2024)
Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction
par: Yang, Shu-wen, et autres
Publié: (2025)
par: Yang, Shu-wen, et autres
Publié: (2025)
Robust Audiovisual Speech Recognition Models with Mixture-of-Experts
par: Wu, Yihan, et autres
Publié: (2024)
par: Wu, Yihan, et autres
Publié: (2024)
Contrastive Conditional Latent Diffusion for Audio-visual Segmentation
par: Mao, Yuxin, et autres
Publié: (2023)
par: Mao, Yuxin, et autres
Publié: (2023)
CCStereo: Audio-Visual Contextual and Contrastive Learning for Binaural Audio Generation
par: Chen, Yuanhong, et autres
Publié: (2025)
par: Chen, Yuanhong, et autres
Publié: (2025)
OmniAudio: Generating Spatial Audio from 360-Degree Video
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
Audio-Vision Contrastive Learning for Phonological Class Recognition
par: Liu, Daiqi, et autres
Publié: (2025)
par: Liu, Daiqi, et autres
Publié: (2025)
M&M: Multimodal-Multitask Model Integrating Audiovisual Cues in Cognitive Load Assessment
par: Nguyen-Phuoc, Long, et autres
Publié: (2024)
par: Nguyen-Phuoc, Long, et autres
Publié: (2024)
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
par: Lin, Yan-Bo, et autres
Publié: (2025)
par: Lin, Yan-Bo, et autres
Publié: (2025)
SSAVSV: Towards Unified Model for Self-Supervised Audio-Visual Speaker Verification
par: Rajasekhar, Gnana Praveen, et autres
Publié: (2025)
par: Rajasekhar, Gnana Praveen, et autres
Publié: (2025)
SAVE: Segment Audio-Visual Easy way using Segment Anything Model
par: Nguyen, Khanh-Binh, et autres
Publié: (2024)
par: Nguyen, Khanh-Binh, et autres
Publié: (2024)
RTFS-Net: Recurrent Time-Frequency Modelling for Efficient Audio-Visual Speech Separation
par: Pegg, Samuel, et autres
Publié: (2023)
par: Pegg, Samuel, et autres
Publié: (2023)
A Critical Assessment of Visual Sound Source Localization Models Including Negative Audio
par: Juanola, Xavier, et autres
Publié: (2024)
par: Juanola, Xavier, et autres
Publié: (2024)
Learning to Highlight Audio by Watching Movies
par: Huang, Chao, et autres
Publié: (2025)
par: Huang, Chao, et autres
Publié: (2025)
MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning
par: Qiang, Chunyu, et autres
Publié: (2026)
par: Qiang, Chunyu, et autres
Publié: (2026)
ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
ExpGest: Expressive Speaker Generation Using Diffusion Model and Hybrid Audio-Text Guidance
par: Cheng, Yongkang, et autres
Publié: (2024)
par: Cheng, Yongkang, et autres
Publié: (2024)
DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation
par: Zhang, Haomin, et autres
Publié: (2025)
par: Zhang, Haomin, et autres
Publié: (2025)
Out-Of-Distribution Detection for Audio-visual Generalized Zero-Shot Learning: A General Framework
par: Wen, Liuyuan
Publié: (2024)
par: Wen, Liuyuan
Publié: (2024)
Towards Reliable Audio Deepfake Attribution and Model Recognition: A Multi-Level Autoencoder-Based Framework
par: Di Pierno, Andrea, et autres
Publié: (2025)
par: Di Pierno, Andrea, et autres
Publié: (2025)
DGMO: Training-Free Audio Source Separation through Diffusion-Guided Mask Optimization
par: Lee, Geonyoung, et autres
Publié: (2025)
par: Lee, Geonyoung, et autres
Publié: (2025)
Documents similaires
-
Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning
par: Xu, Le, et autres
Publié: (2025) -
ZeroSep: Separate Anything in Audio with Zero Training
par: Huang, Chao, et autres
Publié: (2025) -
Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning
par: Li, Wenrui, et autres
Publié: (2024) -
DDAVS: Disentangled Audio Semantics and Delayed Bidirectional Alignment for Audio-Visual Segmentation
par: Tian, Jingqi, et autres
Publié: (2025) -
Cross-Modal Watermarking for Authentic Audio Recovery and Tamper Localization in Synthesized Audiovisual Forgeries
par: Kim, Minyoung, et autres
Publié: (2025)