WaterVG: Waterway Visual Grounding based on Text-Guided Vision and mmWave Radar
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guan, Runwei, Jia, Liye, Yang, Fengyufan, Yao, Shanliang, Purwanto, Erick, Zhu, Xiaohui, Lim, Eng Gee, Smith, Jeremy, Man, Ka Lok, Hu, Xuming, Yue, Yutao |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ASY-VRNet: Waterway Panoptic Driving Perception Model based on Asymmetric Fair Fusion of Vision and 4D mmWave Radar
par: Guan, Runwei, et autres
Publié: (2023)
par: Guan, Runwei, et autres
Publié: (2023)
NanoMVG: USV-Centric Low-Power Multi-Task Visual Grounding based on Prompt-Guided Camera and 4D mmWave Radar
par: Guan, Runwei, et autres
Publié: (2024)
par: Guan, Runwei, et autres
Publié: (2024)
Referring Flexible Image Restoration
par: Guan, Runwei, et autres
Publié: (2024)
par: Guan, Runwei, et autres
Publié: (2024)
Quantify the Causes of Causal Emergence: Critical Conditions of Uncertainty and Asymmetry in Causal Structure
par: Jia, Liye, et autres
Publié: (2022)
par: Jia, Liye, et autres
Publié: (2022)
RadarNeXt: Real-Time and Reliable 3D Object Detector Based On 4D mmWave Imaging Radar
par: Jia, Liye, et autres
Publié: (2025)
par: Jia, Liye, et autres
Publié: (2025)
Talk2Radar: Bridging Natural Language with 4D mmWave Radar for 3D Referring Expression Comprehension
par: Guan, Runwei, et autres
Publié: (2024)
par: Guan, Runwei, et autres
Publié: (2024)
Exploring Radar Data Representations in Autonomous Driving: A Comprehensive Review
par: Yao, Shanliang, et autres
Publié: (2023)
par: Yao, Shanliang, et autres
Publié: (2023)
USVTrack: USV-Based 4D Radar-Camera Tracking Dataset for Autonomous Driving in Inland Waterways
par: Yao, Shanliang, et autres
Publié: (2025)
par: Yao, Shanliang, et autres
Publié: (2025)
VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting
par: Ilaslan, Muhammet Furkan, et autres
Publié: (2024)
par: Ilaslan, Muhammet Furkan, et autres
Publié: (2024)
WaterScenes: A Multi-Task 4D Radar-Camera Fusion Dataset and Benchmarks for Autonomous Driving on Water Surfaces
par: Yao, Shanliang, et autres
Publié: (2023)
par: Yao, Shanliang, et autres
Publié: (2023)
UniBEVFusion: Unified Radar-Vision BEVFusion for 3D Object Detection
par: Zhao, Haocheng, et autres
Publié: (2024)
par: Zhao, Haocheng, et autres
Publié: (2024)
radarODE: An ODE-Embedded Deep Learning Model for Contactless ECG Reconstruction from Millimeter-Wave Radar
par: Zhang, Yuanyuan, et autres
Publié: (2024)
par: Zhang, Yuanyuan, et autres
Publié: (2024)
G3R: Generating Rich and Fine-grained mmWave Radar Data from 2D Videos for Generalized Gesture Recognition
par: Deng, Kaikai, et autres
Publié: (2024)
par: Deng, Kaikai, et autres
Publié: (2024)
Multi-view Hypergraph-based Contrastive Learning Model for Cold-Start Micro-video Recommendation
par: Lyu, Sisuo, et autres
Publié: (2024)
par: Lyu, Sisuo, et autres
Publié: (2024)
Automatic Prompt Generation and Grounding Object Detection for Zero-Shot Image Anomaly Detection
par: Cheung, Tsun-Hin, et autres
Publié: (2024)
par: Cheung, Tsun-Hin, et autres
Publié: (2024)
Music Grounding by Short Video
par: Xin, Zijie, et autres
Publié: (2024)
par: Xin, Zijie, et autres
Publié: (2024)
Cross-Modality and Within-Modality Regularization for Audio-Visual DeepFake Detection
par: Zou, Heqing, et autres
Publié: (2024)
par: Zou, Heqing, et autres
Publié: (2024)
Neural-Enhanced Rate Adaptation and Computation Distribution for Emerging mmWave Multi-User 3D Video Streaming Systems
par: Badnava, Babak, et autres
Publié: (2025)
par: Badnava, Babak, et autres
Publié: (2025)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
par: Zhang, Zhenxing, et autres
Publié: (2024)
par: Zhang, Zhenxing, et autres
Publié: (2024)
Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding
par: Guan, Runwei, et autres
Publié: (2025)
par: Guan, Runwei, et autres
Publié: (2025)
MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding
par: Fang, Pengcheng, et autres
Publié: (2026)
par: Fang, Pengcheng, et autres
Publié: (2026)
Will It Go Viral? Grounding Micro-Video Popularity Prediction on the Open Web
par: Heo, Ryang, et autres
Publié: (2026)
par: Heo, Ryang, et autres
Publié: (2026)
Muse: A Multimodal Conversational Recommendation Dataset with Scenario-Grounded User Profiles
par: Wang, Zihan, et autres
Publié: (2024)
par: Wang, Zihan, et autres
Publié: (2024)
Recognizing Everything from All Modalities at Once: Grounded Multimodal Universal Information Extraction
par: Zhang, Meishan, et autres
Publié: (2024)
par: Zhang, Meishan, et autres
Publié: (2024)
Orthogonal Disentanglement with Projected Feature Alignment for Multimodal Emotion Recognition in Conversation
par: Che, Xinyi, et autres
Publié: (2025)
par: Che, Xinyi, et autres
Publié: (2025)
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
par: Wang, Jieyi, et autres
Publié: (2026)
par: Wang, Jieyi, et autres
Publié: (2026)
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
par: Sun, Luoyi, et autres
Publié: (2026)
par: Sun, Luoyi, et autres
Publié: (2026)
Angle-Optimized Partial Disentanglement for Multimodal Emotion Recognition in Conversation
par: Che, Xinyi, et autres
Publié: (2025)
par: Che, Xinyi, et autres
Publié: (2025)
Self-Training Boosted Multi-Factor Matching Network for Composed Image Retrieval
par: Wen, Haokun, et autres
Publié: (2023)
par: Wen, Haokun, et autres
Publié: (2023)
Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning
par: Xu, Xinmeng, et autres
Publié: (2026)
par: Xu, Xinmeng, et autres
Publié: (2026)
Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding
par: Wang, Shaoguang, et autres
Publié: (2026)
par: Wang, Shaoguang, et autres
Publié: (2026)
StreamOptix: A Cross-layer Adaptive Video Delivery Scheme
par: Liu, Mufan, et autres
Publié: (2024)
par: Liu, Mufan, et autres
Publié: (2024)
OmniDPO: A Preference Optimization Framework to Address Omni-Modal Hallucination
par: Chen, Junzhe, et autres
Publié: (2025)
par: Chen, Junzhe, et autres
Publié: (2025)
RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild
par: Xu, Danni, et autres
Publié: (2026)
par: Xu, Danni, et autres
Publié: (2026)
QMAVIS: Long Video-Audio Understanding using Fusion of Large Multimodal Models
par: Lin, Zixing, et autres
Publié: (2026)
par: Lin, Zixing, et autres
Publié: (2026)
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
par: Zhang, Xiaohui, et autres
Publié: (2024)
par: Zhang, Xiaohui, et autres
Publié: (2024)
GestureHYDRA: Semantic Co-speech Gesture Synthesis via Hybrid Modality Diffusion Transformer and Cascaded-Synchronized Retrieval-Augmented Generation
par: Yang, Quanwei, et autres
Publié: (2025)
par: Yang, Quanwei, et autres
Publié: (2025)
Structured Visual Narratives Undermine Safety Alignment in Multimodal Large Language Models
par: Tan, Rui Yang, et autres
Publié: (2026)
par: Tan, Rui Yang, et autres
Publié: (2026)
From Talking to Singing: A New Challenge for Audio-Visual Deepfake Detection
par: Liu, Ke, et autres
Publié: (2026)
par: Liu, Ke, et autres
Publié: (2026)
Self-Attention and Hybrid Features for Replay and Deep-Fake Audio Detection
par: Huang, Lian, et autres
Publié: (2024)
par: Huang, Lian, et autres
Publié: (2024)
Documents similaires
-
ASY-VRNet: Waterway Panoptic Driving Perception Model based on Asymmetric Fair Fusion of Vision and 4D mmWave Radar
par: Guan, Runwei, et autres
Publié: (2023) -
NanoMVG: USV-Centric Low-Power Multi-Task Visual Grounding based on Prompt-Guided Camera and 4D mmWave Radar
par: Guan, Runwei, et autres
Publié: (2024) -
Referring Flexible Image Restoration
par: Guan, Runwei, et autres
Publié: (2024) -
Quantify the Causes of Causal Emergence: Critical Conditions of Uncertainty and Asymmetry in Causal Structure
par: Jia, Liye, et autres
Publié: (2022) -
RadarNeXt: Real-Time and Reliable 3D Object Detector Based On 4D mmWave Imaging Radar
par: Jia, Liye, et autres
Publié: (2025)