GLACIA: Instance-Aware Positional Reasoning for Glacial Lake Segmentation via Multimodal Large Language Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Maurya, Lalit, Kaushik, Saurabh, Tellman, Beth |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cryo-Bench: Benchmarking Foundation Models for Cryosphere Applications
di: Kaushik, Saurabh, et al.
Pubblicazione: (2026)
di: Kaushik, Saurabh, et al.
Pubblicazione: (2026)
Prithvi-Complimentary Adaptive Fusion Encoder (CAFE): unlocking full-potential for flood inundation mapping
di: Kaushik, Saurabh, et al.
Pubblicazione: (2026)
di: Kaushik, Saurabh, et al.
Pubblicazione: (2026)
Assessing the value of Geo-Foundational Models for Flood Inundation Mapping: Benchmarking models for Sentinel-1, Sentinel-2, and Planetscope for end-users
di: Kaushik, Saurabh, et al.
Pubblicazione: (2025)
di: Kaushik, Saurabh, et al.
Pubblicazione: (2025)
Language-Guided Instance-Aware Domain-Adaptive Panoptic Segmentation
di: Mansour, Elham Amin, et al.
Pubblicazione: (2024)
di: Mansour, Elham Amin, et al.
Pubblicazione: (2024)
WeatherReasonSeg: A Benchmark for Weather-Aware Reasoning Segmentation in Visual Language Models
di: Du, Wanjun, et al.
Pubblicazione: (2026)
di: Du, Wanjun, et al.
Pubblicazione: (2026)
Jailbreaks on Vision Language Model via Multimodal Reasoning
di: Noheria, Aarush, et al.
Pubblicazione: (2026)
di: Noheria, Aarush, et al.
Pubblicazione: (2026)
SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model
di: Yu, Chunlin, et al.
Pubblicazione: (2024)
di: Yu, Chunlin, et al.
Pubblicazione: (2024)
Parameter-Efficient Fine-Tuning of Large Pretrained Models for Instance Segmentation Tasks
di: Baker, Nermeen Abou, et al.
Pubblicazione: (2026)
di: Baker, Nermeen Abou, et al.
Pubblicazione: (2026)
EDVD-LLaMA: Explainable Deepfake Video Detection via Multimodal Large Language Model Reasoning
di: Sun, Haoran, et al.
Pubblicazione: (2025)
di: Sun, Haoran, et al.
Pubblicazione: (2025)
Foveated Instance Segmentation
di: Zeng, Hongyi, et al.
Pubblicazione: (2025)
di: Zeng, Hongyi, et al.
Pubblicazione: (2025)
PARIS3D: Reasoning-based 3D Part Segmentation Using Large Multimodal Model
di: Kareem, Amrin, et al.
Pubblicazione: (2024)
di: Kareem, Amrin, et al.
Pubblicazione: (2024)
C^2ROPE: Causal Continuous Rotary Positional Encoding for 3D Large Multimodal-Models Reasoning
di: Ye, Guanting, et al.
Pubblicazione: (2026)
di: Ye, Guanting, et al.
Pubblicazione: (2026)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
di: Wang, Xinhao, et al.
Pubblicazione: (2026)
di: Wang, Xinhao, et al.
Pubblicazione: (2026)
Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning
di: Hao, Pengfei, et al.
Pubblicazione: (2025)
di: Hao, Pengfei, et al.
Pubblicazione: (2025)
Unsupervised Instance Segmentation with Superpixels
di: Hoang, Cuong Manh
Pubblicazione: (2025)
di: Hoang, Cuong Manh
Pubblicazione: (2025)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
di: Wang, Yuqing, et al.
Pubblicazione: (2023)
di: Wang, Yuqing, et al.
Pubblicazione: (2023)
LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models
di: Tian, Shi-Yu, et al.
Pubblicazione: (2026)
di: Tian, Shi-Yu, et al.
Pubblicazione: (2026)
DeepSport: A Multimodal Large Language Model for Comprehensive Sports Video Reasoning via Agentic Reinforcement Learning
di: Zou, Junbo, et al.
Pubblicazione: (2025)
di: Zou, Junbo, et al.
Pubblicazione: (2025)
Vocabulary-Free 3D Instance Segmentation with Vision and Language Assistant
di: Mei, Guofeng, et al.
Pubblicazione: (2024)
di: Mei, Guofeng, et al.
Pubblicazione: (2024)
Semantically Aware UAV Landing Site Assessment from Remote Sensing Imagery via Multimodal Large Language Models
di: Hua, Chunliang, et al.
Pubblicazione: (2026)
di: Hua, Chunliang, et al.
Pubblicazione: (2026)
Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models
di: Shi, Yuheng, et al.
Pubblicazione: (2026)
di: Shi, Yuheng, et al.
Pubblicazione: (2026)
Leveraging Multimodal-LLMs Assisted by Instance Segmentation for Intelligent Traffic Monitoring
di: Onsu, Murat Arda, et al.
Pubblicazione: (2025)
di: Onsu, Murat Arda, et al.
Pubblicazione: (2025)
Learning to Inference Adaptively for Multimodal Large Language Models
di: Xu, Zhuoyan, et al.
Pubblicazione: (2025)
di: Xu, Zhuoyan, et al.
Pubblicazione: (2025)
ReaMIL: Reasoning- and Evidence-Aware Multiple Instance Learning for Whole-Slide Histopathology
di: Jung, Hyun Do, et al.
Pubblicazione: (2026)
di: Jung, Hyun Do, et al.
Pubblicazione: (2026)
Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation
di: Hao, Chao, et al.
Pubblicazione: (2026)
di: Hao, Chao, et al.
Pubblicazione: (2026)
Redefining Instance Matching: A Unified Framework for Part-Aware Matching in Panoptic Segmentation Evaluation
di: Großkopf, Erik, et al.
Pubblicazione: (2026)
di: Großkopf, Erik, et al.
Pubblicazione: (2026)
Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models
di: Wang, Lu, et al.
Pubblicazione: (2026)
di: Wang, Lu, et al.
Pubblicazione: (2026)
Generalized Class Discovery in Instance Segmentation
di: Hoang, Cuong Manh, et al.
Pubblicazione: (2025)
di: Hoang, Cuong Manh, et al.
Pubblicazione: (2025)
IVLMap: Instance-Aware Visual Language Grounding for Consumer Robot Navigation
di: Huang, Jiacui, et al.
Pubblicazione: (2024)
di: Huang, Jiacui, et al.
Pubblicazione: (2024)
AgroNVILA: Perception-Reasoning Decoupling for Multi-view Agricultural Multimodal Large Language Models
di: Zhang, Jiarui, et al.
Pubblicazione: (2026)
di: Zhang, Jiarui, et al.
Pubblicazione: (2026)
EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models
di: Fang, Yiyang, et al.
Pubblicazione: (2026)
di: Fang, Yiyang, et al.
Pubblicazione: (2026)
Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models
di: Zhang, Yue, et al.
Pubblicazione: (2024)
di: Zhang, Yue, et al.
Pubblicazione: (2024)
HierarchicalPrune: Position-Aware Compression for Large-Scale Diffusion Models
di: Kwon, Young D., et al.
Pubblicazione: (2025)
di: Kwon, Young D., et al.
Pubblicazione: (2025)
Anatomy-R1: Enhancing Anatomy Reasoning in Multimodal Large Language Models via Anatomical Similarity Curriculum and Group Diversity Augmentation
di: Song, Ziyang, et al.
Pubblicazione: (2025)
di: Song, Ziyang, et al.
Pubblicazione: (2025)
Decoupling the Image Perception and Multimodal Reasoning for Reasoning Segmentation with Digital Twin Representations
di: Li, Yizhen, et al.
Pubblicazione: (2025)
di: Li, Yizhen, et al.
Pubblicazione: (2025)
An Empirical Analysis on Spatial Reasoning Capabilities of Large Multimodal Models
di: Shiri, Fatemeh, et al.
Pubblicazione: (2024)
di: Shiri, Fatemeh, et al.
Pubblicazione: (2024)
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
di: Li, Jingyao, et al.
Pubblicazione: (2025)
di: Li, Jingyao, et al.
Pubblicazione: (2025)
MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models
di: Zhou, Pengfei, et al.
Pubblicazione: (2025)
di: Zhou, Pengfei, et al.
Pubblicazione: (2025)
ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models
di: Xue, Kaiwen, et al.
Pubblicazione: (2026)
di: Xue, Kaiwen, et al.
Pubblicazione: (2026)
3D-Aware Instance Segmentation and Tracking in Egocentric Videos
di: Bhalgat, Yash, et al.
Pubblicazione: (2024)
di: Bhalgat, Yash, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Cryo-Bench: Benchmarking Foundation Models for Cryosphere Applications
di: Kaushik, Saurabh, et al.
Pubblicazione: (2026) -
Prithvi-Complimentary Adaptive Fusion Encoder (CAFE): unlocking full-potential for flood inundation mapping
di: Kaushik, Saurabh, et al.
Pubblicazione: (2026) -
Assessing the value of Geo-Foundational Models for Flood Inundation Mapping: Benchmarking models for Sentinel-1, Sentinel-2, and Planetscope for end-users
di: Kaushik, Saurabh, et al.
Pubblicazione: (2025) -
Language-Guided Instance-Aware Domain-Adaptive Panoptic Segmentation
di: Mansour, Elham Amin, et al.
Pubblicazione: (2024) -
WeatherReasonSeg: A Benchmark for Weather-Aware Reasoning Segmentation in Visual Language Models
di: Du, Wanjun, et al.
Pubblicazione: (2026)