Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Guan, Runwei, Ouyang, Ningwei, Xu, Tianhao, Liang, Shaofeng, Dai, Wei, Sun, Yafeng, Gao, Shang, Lai, Songning, Yao, Shanliang, Hu, Xuming, Liu, Ryan Wen, Yue, Yutao, Xiong, Hui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
USVTrack: USV-Based 4D Radar-Camera Tracking Dataset for Autonomous Driving in Inland Waterways
por: Yao, Shanliang, et al.
Publicado: (2025)
por: Yao, Shanliang, et al.
Publicado: (2025)
WaterVG: Waterway Visual Grounding based on Text-Guided Vision and mmWave Radar
por: Guan, Runwei, et al.
Publicado: (2024)
por: Guan, Runwei, et al.
Publicado: (2024)
ASY-VRNet: Waterway Panoptic Driving Perception Model based on Asymmetric Fair Fusion of Vision and 4D mmWave Radar
por: Guan, Runwei, et al.
Publicado: (2023)
por: Guan, Runwei, et al.
Publicado: (2023)
WaterVideoQA: ASV-Centric Perception and Rule-Compliant Reasoning via Multi-Modal Agents
por: Guan, Runwei, et al.
Publicado: (2026)
por: Guan, Runwei, et al.
Publicado: (2026)
Talk2PC: Enhancing 3D Visual Grounding through LiDAR and Radar Point Clouds Fusion for Autonomous Driving
por: Guan, Runwei, et al.
Publicado: (2025)
por: Guan, Runwei, et al.
Publicado: (2025)
NanoMVG: USV-Centric Low-Power Multi-Task Visual Grounding based on Prompt-Guided Camera and 4D mmWave Radar
por: Guan, Runwei, et al.
Publicado: (2024)
por: Guan, Runwei, et al.
Publicado: (2024)
PEPL: Precision-Enhanced Pseudo-Labeling for Fine-Grained Image Classification in Semi-Supervised Learning
por: Tian, Bowen, et al.
Publicado: (2024)
por: Tian, Bowen, et al.
Publicado: (2024)
RoadSceneVQA: Benchmarking Visual Question Answering in Roadside Perception Systems for Intelligent Transportation System
por: Guan, Runwei, et al.
Publicado: (2025)
por: Guan, Runwei, et al.
Publicado: (2025)
Mitigating Spurious Background Bias in Multimedia Recognition with Disentangled Concept Bottlenecks
por: Huang, Gaoxiang, et al.
Publicado: (2025)
por: Huang, Gaoxiang, et al.
Publicado: (2025)
Wolf2Pack: The AutoFusion Framework for Dynamic Parameter Fusion
por: Tian, Bowen, et al.
Publicado: (2024)
por: Tian, Bowen, et al.
Publicado: (2024)
Talk2Radar: Bridging Natural Language with 4D mmWave Radar for 3D Referring Expression Comprehension
por: Guan, Runwei, et al.
Publicado: (2024)
por: Guan, Runwei, et al.
Publicado: (2024)
DRIVE: Dependable Robust Interpretable Visionary Ensemble Framework in Autonomous Driving
por: Lai, Songning, et al.
Publicado: (2024)
por: Lai, Songning, et al.
Publicado: (2024)
MMDrive: Interactive Scene Understanding Beyond Vision with Multi-representational Fusion
por: Hou, Minghui, et al.
Publicado: (2025)
por: Hou, Minghui, et al.
Publicado: (2025)
Cognitive Disentanglement for Referring Multi-Object Tracking
por: Liang, Shaofeng, et al.
Publicado: (2025)
por: Liang, Shaofeng, et al.
Publicado: (2025)
Wavelet-based Multi-View Fusion of 4D Radar Tensor and Camera for Robust 3D Object Detection
por: Guan, Runwei, et al.
Publicado: (2025)
por: Guan, Runwei, et al.
Publicado: (2025)
WaterScenes: A Multi-Task 4D Radar-Camera Fusion Dataset and Benchmarks for Autonomous Driving on Water Surfaces
por: Yao, Shanliang, et al.
Publicado: (2023)
por: Yao, Shanliang, et al.
Publicado: (2023)
Adaptive H&E-IHC information fusion staining framework based on feature extra
por: Jia, Yifan, et al.
Publicado: (2025)
por: Jia, Yifan, et al.
Publicado: (2025)
SECURE: Stable Early Collision Understanding via Robust Embeddings in Autonomous Driving
por: Wang, Wenjing, et al.
Publicado: (2026)
por: Wang, Wenjing, et al.
Publicado: (2026)
Guarding the Gate: ConceptGuard Battles Concept-Level Backdoors in Concept Bottleneck Models
por: Lai, Songning, et al.
Publicado: (2024)
por: Lai, Songning, et al.
Publicado: (2024)
DRIVE: Dual-Robustness via Information Variability and Entropic Consistency in Source-Free Unsupervised Domain Adaptation
por: Xiao, Ruiqiang, et al.
Publicado: (2024)
por: Xiao, Ruiqiang, et al.
Publicado: (2024)
Text2Weight: Bridging Natural Language and Neural Network Weight Spaces
por: Tian, Bowen, et al.
Publicado: (2025)
por: Tian, Bowen, et al.
Publicado: (2025)
Beyond Task Vectors: Selective Task Arithmetic Based on Importance Metrics
por: Bowen, Tian, et al.
Publicado: (2024)
por: Bowen, Tian, et al.
Publicado: (2024)
Maintaining Informative Coherence: Migrating Hallucinations in Large Language Models via Absorbing Markov Chains
por: Wu, Jiemin, et al.
Publicado: (2024)
por: Wu, Jiemin, et al.
Publicado: (2024)
radarODE: An ODE-Embedded Deep Learning Model for Contactless ECG Reconstruction from Millimeter-Wave Radar
por: Zhang, Yuanyuan, et al.
Publicado: (2024)
por: Zhang, Yuanyuan, et al.
Publicado: (2024)
UniBEVFusion: Unified Radar-Vision BEVFusion for 3D Object Detection
por: Zhao, Haocheng, et al.
Publicado: (2024)
por: Zhao, Haocheng, et al.
Publicado: (2024)
Exploring Radar Data Representations in Autonomous Driving: A Comprehensive Review
por: Yao, Shanliang, et al.
Publicado: (2023)
por: Yao, Shanliang, et al.
Publicado: (2023)
4D-CAAL: 4D Radar-Camera Calibration and Auto-Labeling for Autonomous Driving
por: Yao, Shanliang, et al.
Publicado: (2026)
por: Yao, Shanliang, et al.
Publicado: (2026)
USV: Towards Understanding the User-generated Short-form Videos
por: Cheng, Haoyue, et al.
Publicado: (2026)
por: Cheng, Haoyue, et al.
Publicado: (2026)
ACE: Attribution-Controlled Knowledge Editing for Multi-hop Factual Recall
por: Yang, Jiayu, et al.
Publicado: (2025)
por: Yang, Jiayu, et al.
Publicado: (2025)
IMTS is Worth Time $\times$ Channel Patches: Visual Masked Autoencoders for Irregular Multivariate Time Series Prediction
por: Hu, Zhangyi, et al.
Publicado: (2025)
por: Hu, Zhangyi, et al.
Publicado: (2025)
Free-T2M: Robust Text-to-Motion Generation for Humanoid Robots via Frequency-Domain
por: Chen, Wenshuo, et al.
Publicado: (2025)
por: Chen, Wenshuo, et al.
Publicado: (2025)
FTS: A Framework to Find a Faithful TimeSieve
por: Lai, Songning, et al.
Publicado: (2024)
por: Lai, Songning, et al.
Publicado: (2024)
ExCap3D: Expressive 3D Scene Understanding via Object Captioning with Varying Detail
por: Yeshwanth, Chandan, et al.
Publicado: (2025)
por: Yeshwanth, Chandan, et al.
Publicado: (2025)
Perturbation-mitigated USV Navigation with Distributionally Robust Reinforcement Learning
por: Zhang, Zhaofan, et al.
Publicado: (2025)
por: Zhang, Zhaofan, et al.
Publicado: (2025)
Optimizing USV AoI for RIS‐Assisted UAV–USV MEC Network
por: Chao Ma, et al.
Publicado: (2025)
por: Chao Ma, et al.
Publicado: (2025)
Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms
por: Cao, Zhixiang, et al.
Publicado: (2026)
por: Cao, Zhixiang, et al.
Publicado: (2026)
Large Foundation Models for Trajectory Prediction in Autonomous Driving: A Comprehensive Survey
por: Dai, Wei, et al.
Publicado: (2025)
por: Dai, Wei, et al.
Publicado: (2025)
RadarNeXt: Real-Time and Reliable 3D Object Detector Based On 4D mmWave Imaging Radar
por: Jia, Liye, et al.
Publicado: (2025)
por: Jia, Liye, et al.
Publicado: (2025)
Rivers and Waterways in the Roman World
Publicado: (2024)
Publicado: (2024)
You Only Train Once: A Flexible Training Framework for Code Vulnerability Detection Driven by Vul-Vector
por: Tian, Bowen, et al.
Publicado: (2025)
por: Tian, Bowen, et al.
Publicado: (2025)
Ejemplares similares
-
USVTrack: USV-Based 4D Radar-Camera Tracking Dataset for Autonomous Driving in Inland Waterways
por: Yao, Shanliang, et al.
Publicado: (2025) -
WaterVG: Waterway Visual Grounding based on Text-Guided Vision and mmWave Radar
por: Guan, Runwei, et al.
Publicado: (2024) -
ASY-VRNet: Waterway Panoptic Driving Perception Model based on Asymmetric Fair Fusion of Vision and 4D mmWave Radar
por: Guan, Runwei, et al.
Publicado: (2023) -
WaterVideoQA: ASV-Centric Perception and Rule-Compliant Reasoning via Multi-Modal Agents
por: Guan, Runwei, et al.
Publicado: (2026) -
Talk2PC: Enhancing 3D Visual Grounding through LiDAR and Radar Point Clouds Fusion for Autonomous Driving
por: Guan, Runwei, et al.
Publicado: (2025)