CoLeaF: A Contrastive-Collaborative Learning Framework for Weakly Supervised Audio-Visual Video Parsing
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sardari, Faegheh, Mustafa, Armin, Jackson, Philip J. B., Hilton, Adrian |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
An Effective-Efficient Approach for Dense Multi-Label Action Detection
von: Sardari, Faegheh, et al.
Veröffentlicht: (2024)
von: Sardari, Faegheh, et al.
Veröffentlicht: (2024)
Reframing Dense Action Detection (RefDense): A Paradigm Shift in Problem Solving & a Novel Optimization Strategy
von: Sardari, Faegheh, et al.
Veröffentlicht: (2025)
von: Sardari, Faegheh, et al.
Veröffentlicht: (2025)
NarrativeBridge: Enhancing Video Captioning with Causal-Temporal Narrative
von: Nadeem, Asmar, et al.
Veröffentlicht: (2024)
von: Nadeem, Asmar, et al.
Veröffentlicht: (2024)
TEn-CATG:Text-Enriched Audio-Visual Video Parsing with Multi-Scale Category-Aware Temporal Graph
von: Chen, Yaru, et al.
Veröffentlicht: (2025)
von: Chen, Yaru, et al.
Veröffentlicht: (2025)
Reinforced Label Denoising for Weakly-Supervised Audio-Visual Video Parsing
von: Gao, Yongbiao, et al.
Veröffentlicht: (2024)
von: Gao, Yongbiao, et al.
Veröffentlicht: (2024)
EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing
von: Li, Huilai, et al.
Veröffentlicht: (2026)
von: Li, Huilai, et al.
Veröffentlicht: (2026)
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
von: Zhou, Jinxing, et al.
Veröffentlicht: (2024)
von: Zhou, Jinxing, et al.
Veröffentlicht: (2024)
Catalogue Grounded Multimodal Attribution for Museum Video under Resource and Regulatory Constraints
von: Nanang, Minsak, et al.
Veröffentlicht: (2026)
von: Nanang, Minsak, et al.
Veröffentlicht: (2026)
Efficient Audio-Visual Fusion for Video Classification
von: Awan, Mahrukh, et al.
Veröffentlicht: (2024)
von: Awan, Mahrukh, et al.
Veröffentlicht: (2024)
Unsupervised View-Invariant Human Posture Representation
von: Sardari, Faegheh, et al.
Veröffentlicht: (2021)
von: Sardari, Faegheh, et al.
Veröffentlicht: (2021)
UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing
von: Lai, Yung-Hsuan, et al.
Veröffentlicht: (2025)
von: Lai, Yung-Hsuan, et al.
Veröffentlicht: (2025)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
von: Chen, Yaru, et al.
Veröffentlicht: (2025)
von: Chen, Yaru, et al.
Veröffentlicht: (2025)
LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing
von: Wang, Langyu, et al.
Veröffentlicht: (2024)
von: Wang, Langyu, et al.
Veröffentlicht: (2024)
MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing
von: Wang, Langyu, et al.
Veröffentlicht: (2025)
von: Wang, Langyu, et al.
Veröffentlicht: (2025)
Audio-Visual Talker Localization in Video for Spatial Sound Reproduction
von: Berghi, Davide, et al.
Veröffentlicht: (2024)
von: Berghi, Davide, et al.
Veröffentlicht: (2024)
Learning Weakly Supervised Audio-Visual Violence Detection in Hyperbolic Space
von: Peng, Xiaogang, et al.
Veröffentlicht: (2023)
von: Peng, Xiaogang, et al.
Veröffentlicht: (2023)
Attend-Fusion: Efficient Audio-Visual Fusion for Video Classification
von: Awan, Mahrukh, et al.
Veröffentlicht: (2024)
von: Awan, Mahrukh, et al.
Veröffentlicht: (2024)
Realistic Clothed Human and Object Joint Reconstruction from a Single Image
von: Dutta, Ayushi, et al.
Veröffentlicht: (2025)
von: Dutta, Ayushi, et al.
Veröffentlicht: (2025)
Label-anticipated Event Disentanglement for Audio-Visual Video Parsing
von: Zhou, Jinxing, et al.
Veröffentlicht: (2024)
von: Zhou, Jinxing, et al.
Veröffentlicht: (2024)
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
von: Zhao, Pengcheng, et al.
Veröffentlicht: (2024)
von: Zhao, Pengcheng, et al.
Veröffentlicht: (2024)
DisFaceRep: Representation Disentanglement for Co-occurring Facial Components in Weakly Supervised Face Parsing
von: Wang, Xiaoqin, et al.
Veröffentlicht: (2025)
von: Wang, Xiaoqin, et al.
Veröffentlicht: (2025)
TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing
von: Chen, Yaru, et al.
Veröffentlicht: (2025)
von: Chen, Yaru, et al.
Veröffentlicht: (2025)
Weakly Supervised Contrastive Learning for Histopathology Patch Embeddings
von: Zhang, Bodong, et al.
Veröffentlicht: (2026)
von: Zhang, Bodong, et al.
Veröffentlicht: (2026)
WeakSupCon: Weakly Supervised Contrastive Learning for Encoder Pre-training
von: Zhang, Bodong, et al.
Veröffentlicht: (2025)
von: Zhang, Bodong, et al.
Veröffentlicht: (2025)
Leveraging Multi-View Weak Supervision for Occlusion-Aware Multi-Human Parsing
von: Bragagnolo, Laura, et al.
Veröffentlicht: (2025)
von: Bragagnolo, Laura, et al.
Veröffentlicht: (2025)
Complementary and Contrastive Learning for Audio-Visual Segmentation
von: Gong, Sitong, et al.
Veröffentlicht: (2025)
von: Gong, Sitong, et al.
Veröffentlicht: (2025)
Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models
von: Baid, Ami, et al.
Veröffentlicht: (2026)
von: Baid, Ami, et al.
Veröffentlicht: (2026)
Selective Contrastive Learning for Weakly Supervised Affordance Grounding
von: Moon, WonJun, et al.
Veröffentlicht: (2025)
von: Moon, WonJun, et al.
Veröffentlicht: (2025)
Contrastive Learning with Diffusion Features for Weakly Supervised Medical Image Segmentation
von: Zeng, Dewen, et al.
Veröffentlicht: (2025)
von: Zeng, Dewen, et al.
Veröffentlicht: (2025)
Self-Contrastive Weakly Supervised Learning Framework for Prognostic Prediction Using Whole Slide Images
von: Fuster, Saul, et al.
Veröffentlicht: (2024)
von: Fuster, Saul, et al.
Veröffentlicht: (2024)
DocSLM: A Small Vision-Language Model for Long Multimodal Document Understanding
von: Hannan, Tanveer, et al.
Veröffentlicht: (2025)
von: Hannan, Tanveer, et al.
Veröffentlicht: (2025)
PreFM: Online Audio-Visual Event Parsing via Predictive Future Modeling
von: Yu, Xiao, et al.
Veröffentlicht: (2025)
von: Yu, Xiao, et al.
Veröffentlicht: (2025)
Contrastive Prompt Clustering for Weakly Supervised Semantic Segmentation
von: Wu, Wangyu, et al.
Veröffentlicht: (2025)
von: Wu, Wangyu, et al.
Veröffentlicht: (2025)
Adaptive Patch Contrast for Weakly Supervised Semantic Segmentation
von: Wu, Wangyu, et al.
Veröffentlicht: (2024)
von: Wu, Wangyu, et al.
Veröffentlicht: (2024)
Learning Event Completeness for Weakly Supervised Video Anomaly Detection
von: Wang, Yu, et al.
Veröffentlicht: (2025)
von: Wang, Yu, et al.
Veröffentlicht: (2025)
Semi-Supervised Audio-Visual Video Action Recognition with Audio Source Localization Guided Mixup
von: Kang, Seokun, et al.
Veröffentlicht: (2025)
von: Kang, Seokun, et al.
Veröffentlicht: (2025)
Contrastive Multiple Instance Learning for Weakly Supervised Person ReID
von: Tyo, Jacob, et al.
Veröffentlicht: (2024)
von: Tyo, Jacob, et al.
Veröffentlicht: (2024)
CACE-Net: Co-guidance Attention and Contrastive Enhancement for Effective Audio-Visual Event Localization
von: He, Xiang, et al.
Veröffentlicht: (2024)
von: He, Xiang, et al.
Veröffentlicht: (2024)
ScreenParse: Moving Beyond Sparse Grounding with Complete Screen Parsing Supervision
von: Gurbuz, A. Said, et al.
Veröffentlicht: (2026)
von: Gurbuz, A. Said, et al.
Veröffentlicht: (2026)
WP-CrackNet: A Collaborative Adversarial Learning Framework for End-to-End Weakly-Supervised Road Crack Detection
von: Ma, Nachuan, et al.
Veröffentlicht: (2025)
von: Ma, Nachuan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
An Effective-Efficient Approach for Dense Multi-Label Action Detection
von: Sardari, Faegheh, et al.
Veröffentlicht: (2024) -
Reframing Dense Action Detection (RefDense): A Paradigm Shift in Problem Solving & a Novel Optimization Strategy
von: Sardari, Faegheh, et al.
Veröffentlicht: (2025) -
NarrativeBridge: Enhancing Video Captioning with Causal-Temporal Narrative
von: Nadeem, Asmar, et al.
Veröffentlicht: (2024) -
TEn-CATG:Text-Enriched Audio-Visual Video Parsing with Multi-Scale Category-Aware Temporal Graph
von: Chen, Yaru, et al.
Veröffentlicht: (2025) -
Reinforced Label Denoising for Weakly-Supervised Audio-Visual Video Parsing
von: Gao, Yongbiao, et al.
Veröffentlicht: (2024)