NAUTILUS: A Large Multimodal Model for Underwater Scene Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Wei, Wang, Cheng, Liang, Dingkang, Zhao, Zongchuang, Jiang, Xingyu, Zhang, Peng, Bai, Xiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Unified Image-Dense Annotation Generation Model for Underwater Scenes
di: Lin, Hongkai, et al.
Pubblicazione: (2025)
di: Lin, Hongkai, et al.
Pubblicazione: (2025)
Extending Large Vision-Language Model for Diverse Interactive Tasks in Autonomous Driving
di: Zhao, Zongchuang, et al.
Pubblicazione: (2025)
di: Zhao, Zongchuang, et al.
Pubblicazione: (2025)
A Unified Framework for 3D Scene Understanding
di: Xu, Wei, et al.
Pubblicazione: (2024)
di: Xu, Wei, et al.
Pubblicazione: (2024)
HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation
di: Zhou, Xin, et al.
Pubblicazione: (2026)
di: Zhou, Xin, et al.
Pubblicazione: (2026)
MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning
di: Fu, Haoyu, et al.
Pubblicazione: (2025)
di: Fu, Haoyu, et al.
Pubblicazione: (2025)
ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation
di: Fu, Haoyu, et al.
Pubblicazione: (2025)
di: Fu, Haoyu, et al.
Pubblicazione: (2025)
AVS-Net: Point Sampling with Adaptive Voxel Size for 3D Scene Understanding
di: Yang, Hongcheng, et al.
Pubblicazione: (2024)
di: Yang, Hongcheng, et al.
Pubblicazione: (2024)
PointTPA: Dynamic Network Parameter Adaptation for 3D Scene Understanding
di: Liu, Siyuan, et al.
Pubblicazione: (2026)
di: Liu, Siyuan, et al.
Pubblicazione: (2026)
HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation
di: Zhou, Xin, et al.
Pubblicazione: (2025)
di: Zhou, Xin, et al.
Pubblicazione: (2025)
Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding
di: Wu, Xianjin, et al.
Pubblicazione: (2026)
di: Wu, Xianjin, et al.
Pubblicazione: (2026)
The Role of World Models in Shaping Autonomous Driving: A Comprehensive Survey
di: Tu, Sifan, et al.
Pubblicazione: (2025)
di: Tu, Sifan, et al.
Pubblicazione: (2025)
MINIMA: Modality Invariant Image Matching
di: Ren, Jiangwei, et al.
Pubblicazione: (2024)
di: Ren, Jiangwei, et al.
Pubblicazione: (2024)
Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution
di: Liang, Dingkang, et al.
Pubblicazione: (2025)
di: Liang, Dingkang, et al.
Pubblicazione: (2025)
SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding
di: Xu, Pengxin, et al.
Pubblicazione: (2026)
di: Xu, Pengxin, et al.
Pubblicazione: (2026)
Anomaly Detection by Adapting a pre-trained Vision Language Model
di: Cai, Yuxuan, et al.
Pubblicazione: (2024)
di: Cai, Yuxuan, et al.
Pubblicazione: (2024)
More Than Generation: Unifying Generation and Depth Estimation via Text-to-Image Diffusion Models
di: Lin, Hongkai, et al.
Pubblicazione: (2025)
di: Lin, Hongkai, et al.
Pubblicazione: (2025)
Make Your ViT-based Multi-view 3D Detectors Faster via Token Compression
di: Zhang, Dingyuan, et al.
Pubblicazione: (2024)
di: Zhang, Dingyuan, et al.
Pubblicazione: (2024)
Dynamic Adapter Meets Prompt Tuning: Parameter-Efficient Transfer Learning for Point Cloud Analysis
di: Zhou, Xin, et al.
Pubblicazione: (2024)
di: Zhou, Xin, et al.
Pubblicazione: (2024)
A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning
di: Jiang, Siyang, et al.
Pubblicazione: (2025)
di: Jiang, Siyang, et al.
Pubblicazione: (2025)
Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation
di: Zhu, Xingyu, et al.
Pubblicazione: (2026)
di: Zhu, Xingyu, et al.
Pubblicazione: (2026)
PointMamba: A Simple State Space Model for Point Cloud Analysis
di: Liang, Dingkang, et al.
Pubblicazione: (2024)
di: Liang, Dingkang, et al.
Pubblicazione: (2024)
DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding
di: Yu, Wenwen, et al.
Pubblicazione: (2025)
di: Yu, Wenwen, et al.
Pubblicazione: (2025)
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
di: Ma, Ji, et al.
Pubblicazione: (2026)
di: Ma, Ji, et al.
Pubblicazione: (2026)
SOOD++: Leveraging Unlabeled Data to Boost Oriented Object Detection
di: Liang, Dingkang, et al.
Pubblicazione: (2024)
di: Liang, Dingkang, et al.
Pubblicazione: (2024)
Underwater360: Reconstructing Underwater Scenes from Panoramic Images with Omnidirectional Gaussian Splatting
di: Hu, Jiangbei, et al.
Pubblicazione: (2026)
di: Hu, Jiangbei, et al.
Pubblicazione: (2026)
Mini-Monkey: Alleviating the Semantic Sawtooth Effect for Lightweight MLLMs via Complementary Image Pyramid
di: Huang, Mingxin, et al.
Pubblicazione: (2024)
di: Huang, Mingxin, et al.
Pubblicazione: (2024)
RGB-D Indiscernible Object Counting in Underwater Scenes
di: Sun, Guolei, et al.
Pubblicazione: (2023)
di: Sun, Guolei, et al.
Pubblicazione: (2023)
MCTBench: Multimodal Cognition towards Text-Rich Visual Scenes Benchmark
di: Shan, Bin, et al.
Pubblicazione: (2024)
di: Shan, Bin, et al.
Pubblicazione: (2024)
Advances in Deep Concealed Scene Understanding
di: Fan, Deng-Ping, et al.
Pubblicazione: (2023)
di: Fan, Deng-Ping, et al.
Pubblicazione: (2023)
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
di: Liu, Yuliang, et al.
Pubblicazione: (2024)
di: Liu, Yuliang, et al.
Pubblicazione: (2024)
MLLM-SUL: Multimodal Large Language Model for Semantic Scene Understanding and Localization in Traffic Scenarios
di: Fan, Jiaqi, et al.
Pubblicazione: (2024)
di: Fan, Jiaqi, et al.
Pubblicazione: (2024)
Spatial-ORMLLM: Improve Spatial Relation Understanding in the Operating Room with Multimodal Large Language Model
di: He, Peiqi, et al.
Pubblicazione: (2025)
di: He, Peiqi, et al.
Pubblicazione: (2025)
Parameter-Efficient Fine-Tuning in Spectral Domain for Point Cloud Learning
di: Liang, Dingkang, et al.
Pubblicazione: (2024)
di: Liang, Dingkang, et al.
Pubblicazione: (2024)
3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding
di: Xiong, Haomiao, et al.
Pubblicazione: (2025)
di: Xiong, Haomiao, et al.
Pubblicazione: (2025)
LET-US: Long Event-Text Understanding of Scenes
di: Chen, Rui, et al.
Pubblicazione: (2025)
di: Chen, Rui, et al.
Pubblicazione: (2025)
Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind
di: Li, Qingmei, et al.
Pubblicazione: (2025)
di: Li, Qingmei, et al.
Pubblicazione: (2025)
Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers
di: Huang, Haifeng, et al.
Pubblicazione: (2023)
di: Huang, Haifeng, et al.
Pubblicazione: (2023)
Zero-Shot Scene Understanding with Multimodal Large Language Models for Automated Vehicles
di: Elhenawy, Mohammed, et al.
Pubblicazione: (2025)
di: Elhenawy, Mohammed, et al.
Pubblicazione: (2025)
MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue
di: Jiang, Yue, et al.
Pubblicazione: (2026)
di: Jiang, Yue, et al.
Pubblicazione: (2026)
When Semantics Mislead Vision: Mitigating Large Multimodal Models Hallucinations in Scene Text Spotting and Understanding
di: Shu, Yan, et al.
Pubblicazione: (2025)
di: Shu, Yan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
A Unified Image-Dense Annotation Generation Model for Underwater Scenes
di: Lin, Hongkai, et al.
Pubblicazione: (2025) -
Extending Large Vision-Language Model for Diverse Interactive Tasks in Autonomous Driving
di: Zhao, Zongchuang, et al.
Pubblicazione: (2025) -
A Unified Framework for 3D Scene Understanding
di: Xu, Wei, et al.
Pubblicazione: (2024) -
HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation
di: Zhou, Xin, et al.
Pubblicazione: (2026) -
MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning
di: Fu, Haoyu, et al.
Pubblicazione: (2025)