GLACIA: Instance-Aware Positional Reasoning for Glacial Lake Segmentation via Multimodal Large Language Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Maurya, Lalit, Kaushik, Saurabh, Tellman, Beth |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cryo-Bench: Benchmarking Foundation Models for Cryosphere Applications
par: Kaushik, Saurabh, et autres
Publié: (2026)
par: Kaushik, Saurabh, et autres
Publié: (2026)
Prithvi-Complimentary Adaptive Fusion Encoder (CAFE): unlocking full-potential for flood inundation mapping
par: Kaushik, Saurabh, et autres
Publié: (2026)
par: Kaushik, Saurabh, et autres
Publié: (2026)
Assessing the value of Geo-Foundational Models for Flood Inundation Mapping: Benchmarking models for Sentinel-1, Sentinel-2, and Planetscope for end-users
par: Kaushik, Saurabh, et autres
Publié: (2025)
par: Kaushik, Saurabh, et autres
Publié: (2025)
Language-Guided Instance-Aware Domain-Adaptive Panoptic Segmentation
par: Mansour, Elham Amin, et autres
Publié: (2024)
par: Mansour, Elham Amin, et autres
Publié: (2024)
WeatherReasonSeg: A Benchmark for Weather-Aware Reasoning Segmentation in Visual Language Models
par: Du, Wanjun, et autres
Publié: (2026)
par: Du, Wanjun, et autres
Publié: (2026)
Jailbreaks on Vision Language Model via Multimodal Reasoning
par: Noheria, Aarush, et autres
Publié: (2026)
par: Noheria, Aarush, et autres
Publié: (2026)
SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model
par: Yu, Chunlin, et autres
Publié: (2024)
par: Yu, Chunlin, et autres
Publié: (2024)
Parameter-Efficient Fine-Tuning of Large Pretrained Models for Instance Segmentation Tasks
par: Baker, Nermeen Abou, et autres
Publié: (2026)
par: Baker, Nermeen Abou, et autres
Publié: (2026)
EDVD-LLaMA: Explainable Deepfake Video Detection via Multimodal Large Language Model Reasoning
par: Sun, Haoran, et autres
Publié: (2025)
par: Sun, Haoran, et autres
Publié: (2025)
Foveated Instance Segmentation
par: Zeng, Hongyi, et autres
Publié: (2025)
par: Zeng, Hongyi, et autres
Publié: (2025)
PARIS3D: Reasoning-based 3D Part Segmentation Using Large Multimodal Model
par: Kareem, Amrin, et autres
Publié: (2024)
par: Kareem, Amrin, et autres
Publié: (2024)
C^2ROPE: Causal Continuous Rotary Positional Encoding for 3D Large Multimodal-Models Reasoning
par: Ye, Guanting, et autres
Publié: (2026)
par: Ye, Guanting, et autres
Publié: (2026)
QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models
par: Wang, Xinhao, et autres
Publié: (2026)
par: Wang, Xinhao, et autres
Publié: (2026)
Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning
par: Hao, Pengfei, et autres
Publié: (2025)
par: Hao, Pengfei, et autres
Publié: (2025)
Unsupervised Instance Segmentation with Superpixels
par: Hoang, Cuong Manh
Publié: (2025)
par: Hoang, Cuong Manh
Publié: (2025)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
par: Wang, Yuqing, et autres
Publié: (2023)
par: Wang, Yuqing, et autres
Publié: (2023)
LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models
par: Tian, Shi-Yu, et autres
Publié: (2026)
par: Tian, Shi-Yu, et autres
Publié: (2026)
DeepSport: A Multimodal Large Language Model for Comprehensive Sports Video Reasoning via Agentic Reinforcement Learning
par: Zou, Junbo, et autres
Publié: (2025)
par: Zou, Junbo, et autres
Publié: (2025)
Vocabulary-Free 3D Instance Segmentation with Vision and Language Assistant
par: Mei, Guofeng, et autres
Publié: (2024)
par: Mei, Guofeng, et autres
Publié: (2024)
Semantically Aware UAV Landing Site Assessment from Remote Sensing Imagery via Multimodal Large Language Models
par: Hua, Chunliang, et autres
Publié: (2026)
par: Hua, Chunliang, et autres
Publié: (2026)
Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models
par: Shi, Yuheng, et autres
Publié: (2026)
par: Shi, Yuheng, et autres
Publié: (2026)
Leveraging Multimodal-LLMs Assisted by Instance Segmentation for Intelligent Traffic Monitoring
par: Onsu, Murat Arda, et autres
Publié: (2025)
par: Onsu, Murat Arda, et autres
Publié: (2025)
Learning to Inference Adaptively for Multimodal Large Language Models
par: Xu, Zhuoyan, et autres
Publié: (2025)
par: Xu, Zhuoyan, et autres
Publié: (2025)
ReaMIL: Reasoning- and Evidence-Aware Multiple Instance Learning for Whole-Slide Histopathology
par: Jung, Hyun Do, et autres
Publié: (2026)
par: Jung, Hyun Do, et autres
Publié: (2026)
Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation
par: Hao, Chao, et autres
Publié: (2026)
par: Hao, Chao, et autres
Publié: (2026)
Redefining Instance Matching: A Unified Framework for Part-Aware Matching in Panoptic Segmentation Evaluation
par: Großkopf, Erik, et autres
Publié: (2026)
par: Großkopf, Erik, et autres
Publié: (2026)
Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models
par: Wang, Lu, et autres
Publié: (2026)
par: Wang, Lu, et autres
Publié: (2026)
Generalized Class Discovery in Instance Segmentation
par: Hoang, Cuong Manh, et autres
Publié: (2025)
par: Hoang, Cuong Manh, et autres
Publié: (2025)
IVLMap: Instance-Aware Visual Language Grounding for Consumer Robot Navigation
par: Huang, Jiacui, et autres
Publié: (2024)
par: Huang, Jiacui, et autres
Publié: (2024)
AgroNVILA: Perception-Reasoning Decoupling for Multi-view Agricultural Multimodal Large Language Models
par: Zhang, Jiarui, et autres
Publié: (2026)
par: Zhang, Jiarui, et autres
Publié: (2026)
EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models
par: Fang, Yiyang, et autres
Publié: (2026)
par: Fang, Yiyang, et autres
Publié: (2026)
Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models
par: Zhang, Yue, et autres
Publié: (2024)
par: Zhang, Yue, et autres
Publié: (2024)
HierarchicalPrune: Position-Aware Compression for Large-Scale Diffusion Models
par: Kwon, Young D., et autres
Publié: (2025)
par: Kwon, Young D., et autres
Publié: (2025)
Anatomy-R1: Enhancing Anatomy Reasoning in Multimodal Large Language Models via Anatomical Similarity Curriculum and Group Diversity Augmentation
par: Song, Ziyang, et autres
Publié: (2025)
par: Song, Ziyang, et autres
Publié: (2025)
Decoupling the Image Perception and Multimodal Reasoning for Reasoning Segmentation with Digital Twin Representations
par: Li, Yizhen, et autres
Publié: (2025)
par: Li, Yizhen, et autres
Publié: (2025)
An Empirical Analysis on Spatial Reasoning Capabilities of Large Multimodal Models
par: Shiri, Fatemeh, et autres
Publié: (2024)
par: Shiri, Fatemeh, et autres
Publié: (2024)
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
par: Li, Jingyao, et autres
Publié: (2025)
par: Li, Jingyao, et autres
Publié: (2025)
MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models
par: Zhou, Pengfei, et autres
Publié: (2025)
par: Zhou, Pengfei, et autres
Publié: (2025)
ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models
par: Xue, Kaiwen, et autres
Publié: (2026)
par: Xue, Kaiwen, et autres
Publié: (2026)
3D-Aware Instance Segmentation and Tracking in Egocentric Videos
par: Bhalgat, Yash, et autres
Publié: (2024)
par: Bhalgat, Yash, et autres
Publié: (2024)
Documents similaires
-
Cryo-Bench: Benchmarking Foundation Models for Cryosphere Applications
par: Kaushik, Saurabh, et autres
Publié: (2026) -
Prithvi-Complimentary Adaptive Fusion Encoder (CAFE): unlocking full-potential for flood inundation mapping
par: Kaushik, Saurabh, et autres
Publié: (2026) -
Assessing the value of Geo-Foundational Models for Flood Inundation Mapping: Benchmarking models for Sentinel-1, Sentinel-2, and Planetscope for end-users
par: Kaushik, Saurabh, et autres
Publié: (2025) -
Language-Guided Instance-Aware Domain-Adaptive Panoptic Segmentation
par: Mansour, Elham Amin, et autres
Publié: (2024) -
WeatherReasonSeg: A Benchmark for Weather-Aware Reasoning Segmentation in Visual Language Models
par: Du, Wanjun, et autres
Publié: (2026)