CLASP: Cross-modal Salient Anchor-based Semantic Propagation for Weakly-supervised Dense Audio-Visual Event Localization
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhou, Jinxing, Zhou, Ziheng, Zhou, Yanghao, Mao, Yuxin, Duan, Zhangling, Guo, Dan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Towards Open-Vocabulary Audio-Visual Event Localization
von: Zhou, Jinxing, et al.
Veröffentlicht: (2024)
von: Zhou, Jinxing, et al.
Veröffentlicht: (2024)
Label-anticipated Event Disentanglement for Audio-Visual Video Parsing
von: Zhou, Jinxing, et al.
Veröffentlicht: (2024)
von: Zhou, Jinxing, et al.
Veröffentlicht: (2024)
Look, Listen and Segment: Towards Weakly Supervised Audio-visual Semantic Segmentation
von: Li, Chengzhi, et al.
Veröffentlicht: (2026)
von: Li, Chengzhi, et al.
Veröffentlicht: (2026)
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
von: Zhou, Jinxing, et al.
Veröffentlicht: (2024)
von: Zhou, Jinxing, et al.
Veröffentlicht: (2024)
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
von: Zhao, Pengcheng, et al.
Veröffentlicht: (2024)
von: Zhao, Pengcheng, et al.
Veröffentlicht: (2024)
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
von: Li, Zhangbin, et al.
Veröffentlicht: (2024)
von: Li, Zhangbin, et al.
Veröffentlicht: (2024)
ESG-Net: Event-Aware Semantic Guided Network for Dense Audio-Visual Event Localization
von: Li, Huilai, et al.
Veröffentlicht: (2025)
von: Li, Huilai, et al.
Veröffentlicht: (2025)
Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation
von: Zhou, Jinxing, et al.
Veröffentlicht: (2025)
von: Zhou, Jinxing, et al.
Veröffentlicht: (2025)
Dense Audio-Visual Event Localization under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration
von: Zhou, Ziheng, et al.
Veröffentlicht: (2024)
von: Zhou, Ziheng, et al.
Veröffentlicht: (2024)
Audit After Segmentation: Reference-Free Mask Quality Assessment for Language-Referred Audio-Visual Segmentation
von: Zhou, Jinxing, et al.
Veröffentlicht: (2026)
von: Zhou, Jinxing, et al.
Veröffentlicht: (2026)
Face-Guided Sentiment Boundary Enhancement for Weakly-Supervised Temporal Sentiment Localization
von: Han, Cailing, et al.
Veröffentlicht: (2026)
von: Han, Cailing, et al.
Veröffentlicht: (2026)
Cross Pseudo-Labeling for Semi-Supervised Audio-Visual Source Localization
von: Guo, Yuxin, et al.
Veröffentlicht: (2024)
von: Guo, Yuxin, et al.
Veröffentlicht: (2024)
MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation
von: Li, Haitian, et al.
Veröffentlicht: (2026)
von: Li, Haitian, et al.
Veröffentlicht: (2026)
EidetiCom: A Cross-modal Brain-Computer Semantic Communication Paradigm for Decoding Visual Perception
von: Zheng, Linfeng, et al.
Veröffentlicht: (2024)
von: Zheng, Linfeng, et al.
Veröffentlicht: (2024)
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
von: Zhou, Yang-Hao, et al.
Veröffentlicht: (2026)
von: Zhou, Yang-Hao, et al.
Veröffentlicht: (2026)
Voices, Faces, and Feelings: Multi-modal Emotion-Cognition Captioning for Mental Health Understanding
von: Zhou, Zhiyuan, et al.
Veröffentlicht: (2026)
von: Zhou, Zhiyuan, et al.
Veröffentlicht: (2026)
Weakly-supervised Audio Temporal Forgery Localization via Progressive Audio-language Co-learning Network
von: Wu, Junyan, et al.
Veröffentlicht: (2025)
von: Wu, Junyan, et al.
Veröffentlicht: (2025)
Pilot-guided Multimodal Semantic Communication for Audio-Visual Event Localization
von: Yu, Fei, et al.
Veröffentlicht: (2024)
von: Yu, Fei, et al.
Veröffentlicht: (2024)
Open-Vocabulary Audio-Visual Semantic Segmentation
von: Guo, Ruohao, et al.
Veröffentlicht: (2024)
von: Guo, Ruohao, et al.
Veröffentlicht: (2024)
HDA-SELD: Hierarchical Cross-Modal Distillation with Multi-Level Data Augmentation for Low-Resource Audio-Visual Sound Event Localization and Detection
von: Wang, Qing, et al.
Veröffentlicht: (2025)
von: Wang, Qing, et al.
Veröffentlicht: (2025)
EEmo-Bench: A Benchmark for Multi-modal Large Language Models on Image Evoked Emotion Assessment
von: Gao, Lancheng, et al.
Veröffentlicht: (2025)
von: Gao, Lancheng, et al.
Veröffentlicht: (2025)
TAVGBench: Benchmarking Text to Audible-Video Generation
von: Mao, Yuxin, et al.
Veröffentlicht: (2024)
von: Mao, Yuxin, et al.
Veröffentlicht: (2024)
Anchorage: Visual Analysis of Satisfaction in Customer Service Videos via Anchor Events
von: Wong, Kam Kwai, et al.
Veröffentlicht: (2023)
von: Wong, Kam Kwai, et al.
Veröffentlicht: (2023)
Cross-Modality and Within-Modality Regularization for Audio-Visual DeepFake Detection
von: Zou, Heqing, et al.
Veröffentlicht: (2024)
von: Zou, Heqing, et al.
Veröffentlicht: (2024)
UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization
von: Geng, Tiantian, et al.
Veröffentlicht: (2024)
von: Geng, Tiantian, et al.
Veröffentlicht: (2024)
Audio-Visual Instance Segmentation
von: Guo, Ruohao, et al.
Veröffentlicht: (2023)
von: Guo, Ruohao, et al.
Veröffentlicht: (2023)
Audio-Visual Cross-Modal Compression for Generative Face Video Coding
von: Xu, Youmin, et al.
Veröffentlicht: (2025)
von: Xu, Youmin, et al.
Veröffentlicht: (2025)
PixelatedScatter: Arbitrary-level Visual Abstraction for Large-scale Multiclass Scatterplots
von: Guo, Ziheng, et al.
Veröffentlicht: (2025)
von: Guo, Ziheng, et al.
Veröffentlicht: (2025)
Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
von: Cai, Dongnuan, et al.
Veröffentlicht: (2026)
von: Cai, Dongnuan, et al.
Veröffentlicht: (2026)
AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues
von: Zhou, Dingkun, et al.
Veröffentlicht: (2025)
von: Zhou, Dingkun, et al.
Veröffentlicht: (2025)
CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction
von: Wang, Jiadong, et al.
Veröffentlicht: (2026)
von: Wang, Jiadong, et al.
Veröffentlicht: (2026)
Routing Experts: Learning to Route Dynamic Experts in Multi-modal Large Language Models
von: Wu, Qiong, et al.
Veröffentlicht: (2024)
von: Wu, Qiong, et al.
Veröffentlicht: (2024)
Enkidu: Universal Frequential Perturbation for Real-Time Audio Privacy Protection against Voice Deepfakes
von: Feng, Zhou, et al.
Veröffentlicht: (2025)
von: Feng, Zhou, et al.
Veröffentlicht: (2025)
Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control
von: Li, Bingliang, et al.
Veröffentlicht: (2024)
von: Li, Bingliang, et al.
Veröffentlicht: (2024)
Autoregressive Image Generation with Linear Complexity: A Spatial-Aware Decay Perspective
von: Mao, Yuxin, et al.
Veröffentlicht: (2025)
von: Mao, Yuxin, et al.
Veröffentlicht: (2025)
Multi-modal and Metadata Capture Model for Micro Video Popularity Prediction
von: Lu, Jiacheng, et al.
Veröffentlicht: (2025)
von: Lu, Jiacheng, et al.
Veröffentlicht: (2025)
Multimodal Semantic Communication for Generative Audio-Driven Video Conferencing
von: Tong, Haonan, et al.
Veröffentlicht: (2024)
von: Tong, Haonan, et al.
Veröffentlicht: (2024)
SimToken: A Simple Baseline for Referring Audio-Visual Segmentation
von: Jin, Dian, et al.
Veröffentlicht: (2025)
von: Jin, Dian, et al.
Veröffentlicht: (2025)
Semantic Compensation via Adversarial Removal for Robust Zero-Shot ECG Diagnosis
von: Liu, Hongjun, et al.
Veröffentlicht: (2026)
von: Liu, Hongjun, et al.
Veröffentlicht: (2026)
EMID: An Emotional Aligned Dataset in Audio-Visual Modality
von: Zou, Jialing, et al.
Veröffentlicht: (2023)
von: Zou, Jialing, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
Towards Open-Vocabulary Audio-Visual Event Localization
von: Zhou, Jinxing, et al.
Veröffentlicht: (2024) -
Label-anticipated Event Disentanglement for Audio-Visual Video Parsing
von: Zhou, Jinxing, et al.
Veröffentlicht: (2024) -
Look, Listen and Segment: Towards Weakly Supervised Audio-visual Semantic Segmentation
von: Li, Chengzhi, et al.
Veröffentlicht: (2026) -
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
von: Zhou, Jinxing, et al.
Veröffentlicht: (2024) -
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
von: Zhao, Pengcheng, et al.
Veröffentlicht: (2024)