HAVT-IVD: Heterogeneity-Aware Cross-Modal Network for Audio-Visual Surveillance: Idling Vehicles Detection With Multichannel Audio and Multiscale Visual Cues
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Xiwen, Tang, Xiaoya, Tasdizen, Tolga |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Joint Audio-Visual Idling Vehicle Detection with Streamlined Input Dependencies
por: Li, Xiwen, et al.
Publicado: (2024)
por: Li, Xiwen, et al.
Publicado: (2024)
Real-Time Idling Vehicles Detection using Combined Audio-Visual Deep Learning
por: Li, Xiwen, et al.
Publicado: (2023)
por: Li, Xiwen, et al.
Publicado: (2023)
Residual Cross-Modal Fusion Networks for Audio-Visual Navigation
por: Wang, Yi, et al.
Publicado: (2026)
por: Wang, Yi, et al.
Publicado: (2026)
DuoFormer: Leveraging Hierarchical Visual Representations by Local and Global Attention
por: Tang, Xiaoya, et al.
Publicado: (2024)
por: Tang, Xiaoya, et al.
Publicado: (2024)
VISTA: A Visual and Textual Attention Dataset for Interpreting Multimodal Models
por: Harshit, et al.
Publicado: (2024)
por: Harshit, et al.
Publicado: (2024)
ANAVI: Audio Noise Awareness using Visuals of Indoor environments for NAVIgation
por: Jain, Vidhi, et al.
Publicado: (2024)
por: Jain, Vidhi, et al.
Publicado: (2024)
Weakly Supervised Contrastive Learning for Histopathology Patch Embeddings
por: Zhang, Bodong, et al.
Publicado: (2026)
por: Zhang, Bodong, et al.
Publicado: (2026)
Latent Object Characteristics Recognition with Visual to Haptic-Audio Cross-modal Transfer Learning
por: Saito, Namiko, et al.
Publicado: (2024)
por: Saito, Namiko, et al.
Publicado: (2024)
FrontierNet: Learning Visual Cues to Explore
por: Sun, Boyang, et al.
Publicado: (2025)
por: Sun, Boyang, et al.
Publicado: (2025)
Audio-3DVG: Unified Audio -- Point Cloud Fusion for 3D Visual Grounding
por: Cao-Dinh, Duc, et al.
Publicado: (2025)
por: Cao-Dinh, Duc, et al.
Publicado: (2025)
Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues
por: Chen, Tianxiang, et al.
Publicado: (2024)
por: Chen, Tianxiang, et al.
Publicado: (2024)
DuoFormer: Leveraging Hierarchical Representations by Local and Global Attention Vision Transformer
por: Tang, Xiaoya, et al.
Publicado: (2025)
por: Tang, Xiaoya, et al.
Publicado: (2025)
A Comparison of Object Detection and Phrase Grounding Models in Chest X-ray Abnormality Localization using Eye-tracking Data
por: Ghelichkhan, Elham, et al.
Publicado: (2025)
por: Ghelichkhan, Elham, et al.
Publicado: (2025)
How to Build Robust, Scalable Models for GSV-Based Indicators in Neighborhood Research
por: Tang, Xiaoya, et al.
Publicado: (2026)
por: Tang, Xiaoya, et al.
Publicado: (2026)
WeakSupCon: Weakly Supervised Contrastive Learning for Encoder Pre-training
por: Zhang, Bodong, et al.
Publicado: (2025)
por: Zhang, Bodong, et al.
Publicado: (2025)
Cross-Modal Visual Relocalization in Prior LiDAR Maps Utilizing Intensity Textures
por: Shen, Qiyuan, et al.
Publicado: (2024)
por: Shen, Qiyuan, et al.
Publicado: (2024)
MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing
por: Wang, Langyu, et al.
Publicado: (2025)
por: Wang, Langyu, et al.
Publicado: (2025)
Hearing Touch: Audio-Visual Pretraining for Contact-Rich Manipulation
por: Mejia, Jared, et al.
Publicado: (2024)
por: Mejia, Jared, et al.
Publicado: (2024)
Piggyback Camera: Easy-to-Deploy Visual Surveillance by Mobile Sensing on Commercial Robot Vacuums
por: Yonetani, Ryo
Publicado: (2025)
por: Yonetani, Ryo
Publicado: (2025)
Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
por: Li, Guangyao, et al.
Publicado: (2024)
por: Li, Guangyao, et al.
Publicado: (2024)
ActiveRIR: Active Audio-Visual Exploration for Acoustic Environment Modeling
por: Somayazulu, Arjun, et al.
Publicado: (2024)
por: Somayazulu, Arjun, et al.
Publicado: (2024)
Event-Based Visual Odometry on Non-Holonomic Ground Vehicles
por: Xu, Wanting, et al.
Publicado: (2024)
por: Xu, Wanting, et al.
Publicado: (2024)
Dense Audio-Visual Event Localization under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration
por: Zhou, Ziheng, et al.
Publicado: (2024)
por: Zhou, Ziheng, et al.
Publicado: (2024)
Enhancing Audio-Visual Spiking Neural Networks through Semantic-Alignment and Cross-Modal Residual Learning
por: He, Xiang, et al.
Publicado: (2025)
por: He, Xiang, et al.
Publicado: (2025)
VVLoc: Prior-free 3-DoF Vehicle Visual Localization
por: Huang, Ze, et al.
Publicado: (2026)
por: Huang, Ze, et al.
Publicado: (2026)
Semantic and Feature Guided Uncertainty Quantification of Visual Localization for Autonomous Vehicles
por: Wu, Qiyuan, et al.
Publicado: (2025)
por: Wu, Qiyuan, et al.
Publicado: (2025)
Attentive Feature Aggregation or: How Policies Learn to Stop Worrying about Robustness and Attend to Task-Relevant Visual Cues
por: Tsagkas, Nikolaos, et al.
Publicado: (2025)
por: Tsagkas, Nikolaos, et al.
Publicado: (2025)
Monocular Visual Place Recognition in LiDAR Maps via Cross-Modal State Space Model and Multi-View Matching
por: Yao, Gongxin, et al.
Publicado: (2024)
por: Yao, Gongxin, et al.
Publicado: (2024)
AffordGrasp: Cross-Modal Diffusion for Affordance-Aware Grasp Synthesis
por: Wu, Xiaofei, et al.
Publicado: (2026)
por: Wu, Xiaofei, et al.
Publicado: (2026)
A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning
por: Chen, Tianle, et al.
Publicado: (2026)
por: Chen, Tianle, et al.
Publicado: (2026)
AVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models
por: Sung-Bin, Kim, et al.
Publicado: (2024)
por: Sung-Bin, Kim, et al.
Publicado: (2024)
EchoingPixels: Cross-Modal Adaptive Token Reduction for Efficient Audio-Visual LLMs
por: Gong, Chao, et al.
Publicado: (2025)
por: Gong, Chao, et al.
Publicado: (2025)
Inconsistency-Aware Cross-Attention for Audio-Visual Fusion in Dimensional Emotion Recognition
por: Rajasekhar, G, et al.
Publicado: (2024)
por: Rajasekhar, G, et al.
Publicado: (2024)
Unsupervised Audio-Visual Segmentation with Modality Alignment
por: Bhosale, Swapnil, et al.
Publicado: (2024)
por: Bhosale, Swapnil, et al.
Publicado: (2024)
Contextual Cross-Modal Attention for Audio-Visual Deepfake Detection and Localization
por: Katamneni, Vinaya Sree, et al.
Publicado: (2024)
por: Katamneni, Vinaya Sree, et al.
Publicado: (2024)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
por: Liu, Zehua, et al.
Publicado: (2024)
por: Liu, Zehua, et al.
Publicado: (2024)
Integrating Object Detection Modality into Visual Language Model for Enhanced Autonomous Driving Agent
por: He, Linfeng, et al.
Publicado: (2024)
por: He, Linfeng, et al.
Publicado: (2024)
Audio-Guided Visual Editing with Complex Multi-Modal Prompts
por: Kim, Hyeonyu, et al.
Publicado: (2025)
por: Kim, Hyeonyu, et al.
Publicado: (2025)
LINK: Adaptive Modality Interaction for Audio-Visual Video Parsing
por: Wang, Langyu, et al.
Publicado: (2024)
por: Wang, Langyu, et al.
Publicado: (2024)
Unsupervised Welding Defect Detection Using Audio And Video
por: Stemmer, Georg, et al.
Publicado: (2024)
por: Stemmer, Georg, et al.
Publicado: (2024)
Ejemplares similares
-
Joint Audio-Visual Idling Vehicle Detection with Streamlined Input Dependencies
por: Li, Xiwen, et al.
Publicado: (2024) -
Real-Time Idling Vehicles Detection using Combined Audio-Visual Deep Learning
por: Li, Xiwen, et al.
Publicado: (2023) -
Residual Cross-Modal Fusion Networks for Audio-Visual Navigation
por: Wang, Yi, et al.
Publicado: (2026) -
DuoFormer: Leveraging Hierarchical Visual Representations by Local and Global Attention
por: Tang, Xiaoya, et al.
Publicado: (2024) -
VISTA: A Visual and Textual Attention Dataset for Interpreting Multimodal Models
por: Harshit, et al.
Publicado: (2024)