UVLM: Benchmarking Video Language Model for Underwater World Understanding
Fuente:
arXiv
Saved in:
| Main Authors: | Xue, Xizhe, Zhou, Yang, Yan, Dawei, Tao, Lijie, Li, Junjie, Li, Ying, Zhang, Haokui, Xiao, Rong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Open-Vocabulary Object Detection in UAV Imagery: A Review and Future Perspectives
by: Zhou, Yang, et al.
Published: (2025)
by: Zhou, Yang, et al.
Published: (2025)
Bridging Sensor Gaps via Attention Gated Tuning for Hyperspectral Image Classification
by: Xue, Xizhe, et al.
Published: (2023)
by: Xue, Xizhe, et al.
Published: (2023)
3D-RCNet: Learning from Transformer to Build a 3D Relational ConvNet for Hyperspectral Image Classification
by: Jing, Haizhao, et al.
Published: (2024)
by: Jing, Haizhao, et al.
Published: (2024)
TRIO: Token Reduction via Inference-Objective Guidance for Efficient Vision-Language Models
by: Zhang, Haokui, et al.
Published: (2026)
by: Zhang, Haokui, et al.
Published: (2026)
Towards Unified Vision Language Models for Forest Ecological Analysis in Earth Observation
by: Xue, Xizhe, et al.
Published: (2025)
by: Xue, Xizhe, et al.
Published: (2025)
UWBench: A Comprehensive Vision-Language Benchmark for Underwater Understanding
by: Zhang, Da, et al.
Published: (2025)
by: Zhang, Da, et al.
Published: (2025)
OS-W2S: An Automatic Labeling Engine for Language-Guided Open-Set Aerial Object Detection
by: Wei, Guoting, et al.
Published: (2025)
by: Wei, Guoting, et al.
Published: (2025)
REO-VLM: Transforming VLM to Meet Regression Challenges in Earth Observation
by: Xue, Xizhe, et al.
Published: (2024)
by: Xue, Xizhe, et al.
Published: (2024)
RT-OVAD: Real-Time Open-Vocabulary Aerial Object Detection via Image-Text Collaboration
by: Wei, Guoting, et al.
Published: (2024)
by: Wei, Guoting, et al.
Published: (2024)
Regression in EO: Are VLMs Up to the Challenge?
by: Xue, Xizhe, et al.
Published: (2025)
by: Xue, Xizhe, et al.
Published: (2025)
CC-Pan: Channel-wise Compression based Diffusion for Efficient Pan-Sharpening
by: Li, Junjie, et al.
Published: (2026)
by: Li, Junjie, et al.
Published: (2026)
Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding
by: Shu, Yan, et al.
Published: (2024)
by: Shu, Yan, et al.
Published: (2024)
Rethinking Practical and Efficient Quantization Calibration for Vision-Language Models
by: Shang, Zhenhao, et al.
Published: (2026)
by: Shang, Zhenhao, et al.
Published: (2026)
Faces of the Mind: Unveiling Mental Health States Through Facial Expressions in 11,427 Adolescents
by: Xu, Xiao, et al.
Published: (2024)
by: Xu, Xiao, et al.
Published: (2024)
UVLM: A Universal Vision-Language Model Loader for Reproducible Multimodal Benchmarking
by: Perez, Joan, et al.
Published: (2026)
by: Perez, Joan, et al.
Published: (2026)
UVEB: A Large-scale Benchmark and Baseline Towards Real-World Underwater Video Enhancement
by: Xie, Yaofeng, et al.
Published: (2024)
by: Xie, Yaofeng, et al.
Published: (2024)
VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing
by: Deng, Andong, et al.
Published: (2026)
by: Deng, Andong, et al.
Published: (2026)
UFVideo: Towards Unified Fine-Grained Video Cooperative Understanding with Large Language Models
by: Pan, Hewen, et al.
Published: (2025)
by: Pan, Hewen, et al.
Published: (2025)
MLVU: Benchmarking Multi-task Long Video Understanding
by: Zhou, Junjie, et al.
Published: (2024)
by: Zhou, Junjie, et al.
Published: (2024)
CauCLIP: Bridging the Sim-to-Real Gap in Surgical Video Understanding via Causality-Inspired Vision-Language Modeling
by: He, Yuxin, et al.
Published: (2026)
by: He, Yuxin, et al.
Published: (2026)
RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video
by: Xun, Shuhang, et al.
Published: (2025)
by: Xun, Shuhang, et al.
Published: (2025)
M$^2$: Dual-Memory Augmentation for Long-Horizon Web Agents via Trajectory Summarization and Insight Retrieval
by: Yan, Dawei, et al.
Published: (2026)
by: Yan, Dawei, et al.
Published: (2026)
Language Embedding Meets Dynamic Graph: A New Exploration for Neural Architecture Representation Learning
by: Jing, Haizhao, et al.
Published: (2025)
by: Jing, Haizhao, et al.
Published: (2025)
Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability
by: Zhou, Lijie
Published: (2026)
by: Zhou, Lijie
Published: (2026)
Are Vision LLMs Road-Ready? A Comprehensive Benchmark for Safety-Critical Driving Video Understanding
by: Zeng, Tong, et al.
Published: (2025)
by: Zeng, Tong, et al.
Published: (2025)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
by: Zhang, Zicheng, et al.
Published: (2024)
by: Zhang, Zicheng, et al.
Published: (2024)
Understanding Long Videos with Multimodal Language Models
by: Ranasinghe, Kanchana, et al.
Published: (2024)
by: Ranasinghe, Kanchana, et al.
Published: (2024)
Exploring the Underwater World Segmentation without Extra Training
by: Li, Bingyu, et al.
Published: (2025)
by: Li, Bingyu, et al.
Published: (2025)
MBench: A Comprehensive Benchmark on Memory Capability for Video World Models
by: Zhang, Shengjun, et al.
Published: (2026)
by: Zhang, Shengjun, et al.
Published: (2026)
VideoCogQA: A Controllable Benchmark for Evaluating Cognitive Abilities in Video-Language Models
by: Li, Chenglin, et al.
Published: (2024)
by: Li, Chenglin, et al.
Published: (2024)
Long Video Understanding with Learnable Retrieval in Video-Language Models
by: Xu, Jiaqi, et al.
Published: (2023)
by: Xu, Jiaqi, et al.
Published: (2023)
VideoExplorer: Think With Videos For Agentic Long-Video Understanding
by: Yuan, Huaying, et al.
Published: (2025)
by: Yuan, Huaying, et al.
Published: (2025)
Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model
by: Xu, Lu, et al.
Published: (2024)
by: Xu, Lu, et al.
Published: (2024)
Benchmarking the Robustness of LiDAR Semantic Segmentation Models
by: Yan, Xu, et al.
Published: (2023)
by: Yan, Xu, et al.
Published: (2023)
DriveWorld: 4D Pre-trained Scene Understanding via World Models for Autonomous Driving
by: Min, Chen, et al.
Published: (2024)
by: Min, Chen, et al.
Published: (2024)
Exploring Hallucination of Large Multimodal Models in Video Understanding: Benchmark, Analysis and Mitigation
by: Gao, Hongcheng, et al.
Published: (2025)
by: Gao, Hongcheng, et al.
Published: (2025)
HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks
by: Zhou, Ting, et al.
Published: (2024)
by: Zhou, Ting, et al.
Published: (2024)
MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models
by: Hong, Wenyi, et al.
Published: (2025)
by: Hong, Wenyi, et al.
Published: (2025)
D$^2$-World: An Efficient World Model through Decoupled Dynamic Flow
by: Zhang, Haiming, et al.
Published: (2024)
by: Zhang, Haiming, et al.
Published: (2024)
Unveiling the Underwater World: CLIP Perception Model-Guided Underwater Image Enhancement
by: Cao, Jiangzhong, et al.
Published: (2025)
by: Cao, Jiangzhong, et al.
Published: (2025)
Similar Items
-
Open-Vocabulary Object Detection in UAV Imagery: A Review and Future Perspectives
by: Zhou, Yang, et al.
Published: (2025) -
Bridging Sensor Gaps via Attention Gated Tuning for Hyperspectral Image Classification
by: Xue, Xizhe, et al.
Published: (2023) -
3D-RCNet: Learning from Transformer to Build a 3D Relational ConvNet for Hyperspectral Image Classification
by: Jing, Haizhao, et al.
Published: (2024) -
TRIO: Token Reduction via Inference-Objective Guidance for Efficient Vision-Language Models
by: Zhang, Haokui, et al.
Published: (2026) -
Towards Unified Vision Language Models for Forest Ecological Analysis in Earth Observation
by: Xue, Xizhe, et al.
Published: (2025)