Dense Audio-Visual Event Localization under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Ziheng, Zhou, Jinxing, Qian, Wei, Tang, Shengeng, Chang, Xiaojun, Guo, Dan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CLASP: Cross-modal Salient Anchor-based Semantic Propagation for Weakly-supervised Dense Audio-Visual Event Localization
por: Zhou, Jinxing, et al.
Publicado: (2025)
por: Zhou, Jinxing, et al.
Publicado: (2025)
Towards Open-Vocabulary Audio-Visual Event Localization
por: Zhou, Jinxing, et al.
Publicado: (2024)
por: Zhou, Jinxing, et al.
Publicado: (2024)
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
por: Li, Zhangbin, et al.
Publicado: (2024)
por: Li, Zhangbin, et al.
Publicado: (2024)
Label-anticipated Event Disentanglement for Audio-Visual Video Parsing
por: Zhou, Jinxing, et al.
Publicado: (2024)
por: Zhou, Jinxing, et al.
Publicado: (2024)
Locality-aware Cross-modal Correspondence Learning for Dense Audio-Visual Events Localization
por: Xing, Ling, et al.
Publicado: (2024)
por: Xing, Ling, et al.
Publicado: (2024)
SimToken: A Simple Baseline for Referring Audio-Visual Segmentation
por: Jin, Dian, et al.
Publicado: (2025)
por: Jin, Dian, et al.
Publicado: (2025)
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
por: Zhou, Jinxing, et al.
Publicado: (2024)
por: Zhou, Jinxing, et al.
Publicado: (2024)
DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding
por: Ahmadian, Mona, et al.
Publicado: (2025)
por: Ahmadian, Mona, et al.
Publicado: (2025)
Face-Guided Sentiment Boundary Enhancement for Weakly-Supervised Temporal Sentiment Localization
por: Han, Cailing, et al.
Publicado: (2026)
por: Han, Cailing, et al.
Publicado: (2026)
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
por: Zhao, Pengcheng, et al.
Publicado: (2024)
por: Zhao, Pengcheng, et al.
Publicado: (2024)
Mettle: Meta-Token Learning for Memory-Efficient Audio-Visual Adaptation
por: Zhou, Jinxing, et al.
Publicado: (2025)
por: Zhou, Jinxing, et al.
Publicado: (2025)
Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation
por: Zhou, Jinxing, et al.
Publicado: (2025)
por: Zhou, Jinxing, et al.
Publicado: (2025)
Event-based Video Person Re-identification via Cross-Modality and Temporal Collaboration
por: Li, Renkai, et al.
Publicado: (2025)
por: Li, Renkai, et al.
Publicado: (2025)
ESG-Net: Event-Aware Semantic Guided Network for Dense Audio-Visual Event Localization
por: Li, Huilai, et al.
Publicado: (2025)
por: Li, Huilai, et al.
Publicado: (2025)
Linguistics-Vision Monotonic Consistent Network for Sign Language Production
por: Wang, Xu, et al.
Publicado: (2024)
por: Wang, Xu, et al.
Publicado: (2024)
Event-based Motion Deblurring via Multi-Temporal Granularity Fusion
por: Lin, Xiaopeng, et al.
Publicado: (2024)
por: Lin, Xiaopeng, et al.
Publicado: (2024)
CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation
por: Hao, Haihong, et al.
Publicado: (2025)
por: Hao, Haihong, et al.
Publicado: (2025)
CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization
por: Xia, Rui, et al.
Publicado: (2025)
por: Xia, Rui, et al.
Publicado: (2025)
Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency
por: Guo, Xiangyu, et al.
Publicado: (2025)
por: Guo, Xiangyu, et al.
Publicado: (2025)
Modality Alignment Meets Federated Broadcasting
por: Ma, Yuting, et al.
Publicado: (2024)
por: Ma, Yuting, et al.
Publicado: (2024)
TemCoCo: Temporally Consistent Multi-modal Video Fusion with Visual-Semantic Collaboration
por: Gong, Meiqi, et al.
Publicado: (2025)
por: Gong, Meiqi, et al.
Publicado: (2025)
Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
por: Zhou, Ziwei, et al.
Publicado: (2025)
por: Zhou, Ziwei, et al.
Publicado: (2025)
FreqPhys: Repurposing Implicit Physiological Frequency Prior for Robust Remote Photoplethysmography
por: Qian, Wei, et al.
Publicado: (2026)
por: Qian, Wei, et al.
Publicado: (2026)
EchoingPixels: Cross-Modal Adaptive Token Reduction for Efficient Audio-Visual LLMs
por: Gong, Chao, et al.
Publicado: (2025)
por: Gong, Chao, et al.
Publicado: (2025)
Contextual Cross-Modal Attention for Audio-Visual Deepfake Detection and Localization
por: Katamneni, Vinaya Sree, et al.
Publicado: (2024)
por: Katamneni, Vinaya Sree, et al.
Publicado: (2024)
Self-Consistency as a Free Lunch: Reducing Hallucinations in Vision-Language Models via Self-Reflection
por: Han, Mingfei, et al.
Publicado: (2025)
por: Han, Mingfei, et al.
Publicado: (2025)
Leveraging the Video-level Semantic Consistency of Event for Audio-visual Event Localization
por: Jiang, Yuanyuan, et al.
Publicado: (2022)
por: Jiang, Yuanyuan, et al.
Publicado: (2022)
MTGA: Multi-View Temporal Granularity Aligned Aggregation for Event-Based Lip-Reading
por: Zhang, Wenhao, et al.
Publicado: (2024)
por: Zhang, Wenhao, et al.
Publicado: (2024)
HAVT-IVD: Heterogeneity-Aware Cross-Modal Network for Audio-Visual Surveillance: Idling Vehicles Detection With Multichannel Audio and Multiscale Visual Cues
por: Li, Xiwen, et al.
Publicado: (2025)
por: Li, Xiwen, et al.
Publicado: (2025)
Cross Pseudo-Labeling for Semi-Supervised Audio-Visual Source Localization
por: Guo, Yuxin, et al.
Publicado: (2024)
por: Guo, Yuxin, et al.
Publicado: (2024)
EventVGGT: Exploring Cross-Modal Distillation for Consistent Event-based Depth Estimation
por: Ren, Yinrui, et al.
Publicado: (2026)
por: Ren, Yinrui, et al.
Publicado: (2026)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
por: Liu, Zehua, et al.
Publicado: (2024)
por: Liu, Zehua, et al.
Publicado: (2024)
Serial Over Parallel: Learning Continual Unification for Multi-Modal Visual Object Tracking and Benchmarking
por: Tang, Zhangyong, et al.
Publicado: (2025)
por: Tang, Zhangyong, et al.
Publicado: (2025)
Cross-Modal Consistency Learning for Sign Language Recognition
por: Wu, Kepeng, et al.
Publicado: (2025)
por: Wu, Kepeng, et al.
Publicado: (2025)
LiDAR-VGGT: Cross-Modal Coarse-to-Fine Fusion for Globally Consistent and Metric-Scale Dense Mapping
por: Wang, Lijie, et al.
Publicado: (2025)
por: Wang, Lijie, et al.
Publicado: (2025)
Sign-IDD: Iconicity Disentangled Diffusion for Sign Language Production
por: Tang, Shengeng, et al.
Publicado: (2024)
por: Tang, Shengeng, et al.
Publicado: (2024)
SDSTrack: Self-Distillation Symmetric Adapter Learning for Multi-Modal Visual Object Tracking
por: Hou, Xiaojun, et al.
Publicado: (2024)
por: Hou, Xiaojun, et al.
Publicado: (2024)
Cross Modal Fine-Grained Alignment via Granularity-Aware and Region-Uncertain Modeling
por: Liu, Jiale, et al.
Publicado: (2025)
por: Liu, Jiale, et al.
Publicado: (2025)
MGHFT: Multi-Granularity Hierarchical Fusion Transformer for Cross-Modal Sticker Emotion Recognition
por: Chen, Jian, et al.
Publicado: (2025)
por: Chen, Jian, et al.
Publicado: (2025)
Wi-CBR: Salient-aware Adaptive WiFi Sensing for Cross-domain Behavior Recognition
por: Zhang, Ruobei, et al.
Publicado: (2025)
por: Zhang, Ruobei, et al.
Publicado: (2025)
Ejemplares similares
-
CLASP: Cross-modal Salient Anchor-based Semantic Propagation for Weakly-supervised Dense Audio-Visual Event Localization
por: Zhou, Jinxing, et al.
Publicado: (2025) -
Towards Open-Vocabulary Audio-Visual Event Localization
por: Zhou, Jinxing, et al.
Publicado: (2024) -
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
por: Li, Zhangbin, et al.
Publicado: (2024) -
Label-anticipated Event Disentanglement for Audio-Visual Video Parsing
por: Zhou, Jinxing, et al.
Publicado: (2024) -
Locality-aware Cross-modal Correspondence Learning for Dense Audio-Visual Events Localization
por: Xing, Ling, et al.
Publicado: (2024)