Dense Audio-Visual Event Localization under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhou, Ziheng, Zhou, Jinxing, Qian, Wei, Tang, Shengeng, Chang, Xiaojun, Guo, Dan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CLASP: Cross-modal Salient Anchor-based Semantic Propagation for Weakly-supervised Dense Audio-Visual Event Localization
par: Zhou, Jinxing, et autres
Publié: (2025)
par: Zhou, Jinxing, et autres
Publié: (2025)
Towards Open-Vocabulary Audio-Visual Event Localization
par: Zhou, Jinxing, et autres
Publié: (2024)
par: Zhou, Jinxing, et autres
Publié: (2024)
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
par: Li, Zhangbin, et autres
Publié: (2024)
par: Li, Zhangbin, et autres
Publié: (2024)
Label-anticipated Event Disentanglement for Audio-Visual Video Parsing
par: Zhou, Jinxing, et autres
Publié: (2024)
par: Zhou, Jinxing, et autres
Publié: (2024)
Locality-aware Cross-modal Correspondence Learning for Dense Audio-Visual Events Localization
par: Xing, Ling, et autres
Publié: (2024)
par: Xing, Ling, et autres
Publié: (2024)
SimToken: A Simple Baseline for Referring Audio-Visual Segmentation
par: Jin, Dian, et autres
Publié: (2025)
par: Jin, Dian, et autres
Publié: (2025)
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
par: Zhou, Jinxing, et autres
Publié: (2024)
par: Zhou, Jinxing, et autres
Publié: (2024)
DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding
par: Ahmadian, Mona, et autres
Publié: (2025)
par: Ahmadian, Mona, et autres
Publié: (2025)
Face-Guided Sentiment Boundary Enhancement for Weakly-Supervised Temporal Sentiment Localization
par: Han, Cailing, et autres
Publié: (2026)
par: Han, Cailing, et autres
Publié: (2026)
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
par: Zhao, Pengcheng, et autres
Publié: (2024)
par: Zhao, Pengcheng, et autres
Publié: (2024)
Mettle: Meta-Token Learning for Memory-Efficient Audio-Visual Adaptation
par: Zhou, Jinxing, et autres
Publié: (2025)
par: Zhou, Jinxing, et autres
Publié: (2025)
Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation
par: Zhou, Jinxing, et autres
Publié: (2025)
par: Zhou, Jinxing, et autres
Publié: (2025)
Event-based Video Person Re-identification via Cross-Modality and Temporal Collaboration
par: Li, Renkai, et autres
Publié: (2025)
par: Li, Renkai, et autres
Publié: (2025)
ESG-Net: Event-Aware Semantic Guided Network for Dense Audio-Visual Event Localization
par: Li, Huilai, et autres
Publié: (2025)
par: Li, Huilai, et autres
Publié: (2025)
Linguistics-Vision Monotonic Consistent Network for Sign Language Production
par: Wang, Xu, et autres
Publié: (2024)
par: Wang, Xu, et autres
Publié: (2024)
Event-based Motion Deblurring via Multi-Temporal Granularity Fusion
par: Lin, Xiaopeng, et autres
Publié: (2024)
par: Lin, Xiaopeng, et autres
Publié: (2024)
CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation
par: Hao, Haihong, et autres
Publié: (2025)
par: Hao, Haihong, et autres
Publié: (2025)
CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization
par: Xia, Rui, et autres
Publié: (2025)
par: Xia, Rui, et autres
Publié: (2025)
Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency
par: Guo, Xiangyu, et autres
Publié: (2025)
par: Guo, Xiangyu, et autres
Publié: (2025)
Modality Alignment Meets Federated Broadcasting
par: Ma, Yuting, et autres
Publié: (2024)
par: Ma, Yuting, et autres
Publié: (2024)
TemCoCo: Temporally Consistent Multi-modal Video Fusion with Visual-Semantic Collaboration
par: Gong, Meiqi, et autres
Publié: (2025)
par: Gong, Meiqi, et autres
Publié: (2025)
Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
par: Zhou, Ziwei, et autres
Publié: (2025)
par: Zhou, Ziwei, et autres
Publié: (2025)
FreqPhys: Repurposing Implicit Physiological Frequency Prior for Robust Remote Photoplethysmography
par: Qian, Wei, et autres
Publié: (2026)
par: Qian, Wei, et autres
Publié: (2026)
EchoingPixels: Cross-Modal Adaptive Token Reduction for Efficient Audio-Visual LLMs
par: Gong, Chao, et autres
Publié: (2025)
par: Gong, Chao, et autres
Publié: (2025)
Contextual Cross-Modal Attention for Audio-Visual Deepfake Detection and Localization
par: Katamneni, Vinaya Sree, et autres
Publié: (2024)
par: Katamneni, Vinaya Sree, et autres
Publié: (2024)
Self-Consistency as a Free Lunch: Reducing Hallucinations in Vision-Language Models via Self-Reflection
par: Han, Mingfei, et autres
Publié: (2025)
par: Han, Mingfei, et autres
Publié: (2025)
Leveraging the Video-level Semantic Consistency of Event for Audio-visual Event Localization
par: Jiang, Yuanyuan, et autres
Publié: (2022)
par: Jiang, Yuanyuan, et autres
Publié: (2022)
MTGA: Multi-View Temporal Granularity Aligned Aggregation for Event-Based Lip-Reading
par: Zhang, Wenhao, et autres
Publié: (2024)
par: Zhang, Wenhao, et autres
Publié: (2024)
HAVT-IVD: Heterogeneity-Aware Cross-Modal Network for Audio-Visual Surveillance: Idling Vehicles Detection With Multichannel Audio and Multiscale Visual Cues
par: Li, Xiwen, et autres
Publié: (2025)
par: Li, Xiwen, et autres
Publié: (2025)
Cross Pseudo-Labeling for Semi-Supervised Audio-Visual Source Localization
par: Guo, Yuxin, et autres
Publié: (2024)
par: Guo, Yuxin, et autres
Publié: (2024)
EventVGGT: Exploring Cross-Modal Distillation for Consistent Event-based Depth Estimation
par: Ren, Yinrui, et autres
Publié: (2026)
par: Ren, Yinrui, et autres
Publié: (2026)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
par: Liu, Zehua, et autres
Publié: (2024)
par: Liu, Zehua, et autres
Publié: (2024)
Serial Over Parallel: Learning Continual Unification for Multi-Modal Visual Object Tracking and Benchmarking
par: Tang, Zhangyong, et autres
Publié: (2025)
par: Tang, Zhangyong, et autres
Publié: (2025)
Cross-Modal Consistency Learning for Sign Language Recognition
par: Wu, Kepeng, et autres
Publié: (2025)
par: Wu, Kepeng, et autres
Publié: (2025)
LiDAR-VGGT: Cross-Modal Coarse-to-Fine Fusion for Globally Consistent and Metric-Scale Dense Mapping
par: Wang, Lijie, et autres
Publié: (2025)
par: Wang, Lijie, et autres
Publié: (2025)
Sign-IDD: Iconicity Disentangled Diffusion for Sign Language Production
par: Tang, Shengeng, et autres
Publié: (2024)
par: Tang, Shengeng, et autres
Publié: (2024)
SDSTrack: Self-Distillation Symmetric Adapter Learning for Multi-Modal Visual Object Tracking
par: Hou, Xiaojun, et autres
Publié: (2024)
par: Hou, Xiaojun, et autres
Publié: (2024)
Cross Modal Fine-Grained Alignment via Granularity-Aware and Region-Uncertain Modeling
par: Liu, Jiale, et autres
Publié: (2025)
par: Liu, Jiale, et autres
Publié: (2025)
MGHFT: Multi-Granularity Hierarchical Fusion Transformer for Cross-Modal Sticker Emotion Recognition
par: Chen, Jian, et autres
Publié: (2025)
par: Chen, Jian, et autres
Publié: (2025)
Wi-CBR: Salient-aware Adaptive WiFi Sensing for Cross-domain Behavior Recognition
par: Zhang, Ruobei, et autres
Publié: (2025)
par: Zhang, Ruobei, et autres
Publié: (2025)
Documents similaires
-
CLASP: Cross-modal Salient Anchor-based Semantic Propagation for Weakly-supervised Dense Audio-Visual Event Localization
par: Zhou, Jinxing, et autres
Publié: (2025) -
Towards Open-Vocabulary Audio-Visual Event Localization
par: Zhou, Jinxing, et autres
Publié: (2024) -
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
par: Li, Zhangbin, et autres
Publié: (2024) -
Label-anticipated Event Disentanglement for Audio-Visual Video Parsing
par: Zhou, Jinxing, et autres
Publié: (2024) -
Locality-aware Cross-modal Correspondence Learning for Dense Audio-Visual Events Localization
par: Xing, Ling, et autres
Publié: (2024)