Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding
Fuente:
arXiv
Guardado en:
| Autores principales: | Guo, Leilei, Rivera, Antonio Carlos, Tang, Peiyu, Ren, Haoxuan, Song, Zheyu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Beyond the Global Scores: Fine-Grained Token Grounding as a Robust Detector of LVLM Hallucinations
por: Nguyen, Tuan Dung, et al.
Publicado: (2026)
por: Nguyen, Tuan Dung, et al.
Publicado: (2026)
Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding
por: Xiao, Han, et al.
Publicado: (2025)
por: Xiao, Han, et al.
Publicado: (2025)
ReasonGrounder: LVLM-Guided Hierarchical Feature Splatting for Open-Vocabulary 3D Visual Grounding and Reasoning
por: Liu, Zhenyang, et al.
Publicado: (2025)
por: Liu, Zhenyang, et al.
Publicado: (2025)
ToolFG: Towards Well-Grounded Fine-Grained Image Classification
por: Xue, Yu, et al.
Publicado: (2026)
por: Xue, Yu, et al.
Publicado: (2026)
Vocabulary-free Fine-grained Visual Recognition via Enriched Contextually Grounded Vision-Language Model
por: Demidov, Dmitry, et al.
Publicado: (2025)
por: Demidov, Dmitry, et al.
Publicado: (2025)
HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
por: Xiao, Linhui, et al.
Publicado: (2024)
por: Xiao, Linhui, et al.
Publicado: (2024)
EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models
por: Shan, Haozhe, et al.
Publicado: (2026)
por: Shan, Haozhe, et al.
Publicado: (2026)
Fine-Grained Spatial and Verbal Losses for 3D Visual Grounding
por: Dey, Sombit, et al.
Publicado: (2024)
por: Dey, Sombit, et al.
Publicado: (2024)
Kestrel: Grounding Self-Refinement for LVLM Hallucination Mitigation
por: Mao, Jiawei, et al.
Publicado: (2026)
por: Mao, Jiawei, et al.
Publicado: (2026)
ContextGuard-LVLM: Enhancing News Veracity through Fine-grained Cross-modal Contextual Consistency Verification
por: Ma, Sihan, et al.
Publicado: (2025)
por: Ma, Sihan, et al.
Publicado: (2025)
CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding
por: Zheng, Lihao, et al.
Publicado: (2026)
por: Zheng, Lihao, et al.
Publicado: (2026)
An LLM-LVLM Driven Agent for Iterative and Fine-Grained Image Editing
por: Liang, Zihan, et al.
Publicado: (2025)
por: Liang, Zihan, et al.
Publicado: (2025)
Towards Understanding Visual Grounding in Visual Language Models
por: Pantazopoulos, Georgios, et al.
Publicado: (2025)
por: Pantazopoulos, Georgios, et al.
Publicado: (2025)
COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation
por: Deng, Xueqing, et al.
Publicado: (2025)
por: Deng, Xueqing, et al.
Publicado: (2025)
Surgical-LVLM: Learning to Adapt Large Vision-Language Model for Grounded Visual Question Answering in Robotic Surgery
por: Wang, Guankun, et al.
Publicado: (2024)
por: Wang, Guankun, et al.
Publicado: (2024)
Adversarial Robustness for Visual Grounding of Multimodal Large Language Models
por: Gao, Kuofeng, et al.
Publicado: (2024)
por: Gao, Kuofeng, et al.
Publicado: (2024)
Cross-Hierarchical Bidirectional Consistency Learning for Fine-Grained Visual Classification
por: Gao, Pengxiang, et al.
Publicado: (2025)
por: Gao, Pengxiang, et al.
Publicado: (2025)
DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Model
por: Tao, Zhou, et al.
Publicado: (2025)
por: Tao, Zhou, et al.
Publicado: (2025)
EGM: Efficient Visual Grounding Language Models
por: Zhan, Guanqi, et al.
Publicado: (2026)
por: Zhan, Guanqi, et al.
Publicado: (2026)
Robust Diagram Reasoning: A Framework for Enhancing LVLM Performance on Visually Perturbed Scientific Diagrams
por: Zhou, Minghao, et al.
Publicado: (2025)
por: Zhou, Minghao, et al.
Publicado: (2025)
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
por: Yan, Siming, et al.
Publicado: (2024)
por: Yan, Siming, et al.
Publicado: (2024)
Adapting Fine-Grained Cross-View Localization to Areas without Fine Ground Truth
por: Xia, Zimin, et al.
Publicado: (2024)
por: Xia, Zimin, et al.
Publicado: (2024)
Enhancing Fine-Grained Spatial Grounding in 3D CT Report Generation via Discriminative Guidance
por: Wang, Chenyu, et al.
Publicado: (2026)
por: Wang, Chenyu, et al.
Publicado: (2026)
GroundingGPT:Language Enhanced Multi-modal Grounding Model
por: Li, Zhaowei, et al.
Publicado: (2024)
por: Li, Zhaowei, et al.
Publicado: (2024)
Grounding-IQA: Grounding Multimodal Language Model for Image Quality Assessment
por: Chen, Zheng, et al.
Publicado: (2024)
por: Chen, Zheng, et al.
Publicado: (2024)
Fooling the LVLM Judges: Visual Biases in LVLM-Based Evaluation
por: Hwang, Yerin, et al.
Publicado: (2025)
por: Hwang, Yerin, et al.
Publicado: (2025)
Grounding Everything in Tokens for Multimodal Large Language Models
por: Ren, Xiangxuan, et al.
Publicado: (2025)
por: Ren, Xiangxuan, et al.
Publicado: (2025)
VL-UniTrack: A Unified Framework with Visual-Language Prompts for UAV-Ground Visual Tracking
por: Xu, Boyue, et al.
Publicado: (2026)
por: Xu, Boyue, et al.
Publicado: (2026)
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
por: Xiao, Yicheng, et al.
Publicado: (2025)
por: Xiao, Yicheng, et al.
Publicado: (2025)
ResVG: Enhancing Relation and Semantic Understanding in Multiple Instances for Visual Grounding
por: Zheng, Minghang, et al.
Publicado: (2024)
por: Zheng, Minghang, et al.
Publicado: (2024)
MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs
por: Barrios, Wayner, et al.
Publicado: (2025)
por: Barrios, Wayner, et al.
Publicado: (2025)
Semantically Grounded QFormer for Efficient Vision Language Understanding
por: Choraria, Moulik, et al.
Publicado: (2023)
por: Choraria, Moulik, et al.
Publicado: (2023)
Generating by Understanding: Neural Visual Generation with Logical Symbol Groundings
por: Peng, Yifei, et al.
Publicado: (2023)
por: Peng, Yifei, et al.
Publicado: (2023)
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
por: Fan, Rong, et al.
Publicado: (2026)
por: Fan, Rong, et al.
Publicado: (2026)
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
por: Zhou, Yue, et al.
Publicado: (2024)
por: Zhou, Yue, et al.
Publicado: (2024)
Guiding the Inner Eye: A Framework for Hierarchical and Flexible Visual Grounded Reasoning
por: Wei, Zhaoyang, et al.
Publicado: (2025)
por: Wei, Zhaoyang, et al.
Publicado: (2025)
FastV-RAG: Towards Fast and Fine-Grained Video QA with Retrieval-Augmented Generation
por: Li, Gen, et al.
Publicado: (2026)
por: Li, Gen, et al.
Publicado: (2026)
GroundingME: Exposing the Visual Grounding Gap in MLLMs through Multi-Dimensional Evaluation
por: Li, Rang, et al.
Publicado: (2025)
por: Li, Rang, et al.
Publicado: (2025)
VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos
por: Li, Kaining, et al.
Publicado: (2025)
por: Li, Kaining, et al.
Publicado: (2025)
ChangingGrounding: 3D Visual Grounding in Changing Scenes
por: Hu, Miao, et al.
Publicado: (2025)
por: Hu, Miao, et al.
Publicado: (2025)
Ejemplares similares
-
Beyond the Global Scores: Fine-Grained Token Grounding as a Robust Detector of LVLM Hallucinations
por: Nguyen, Tuan Dung, et al.
Publicado: (2026) -
Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding
por: Xiao, Han, et al.
Publicado: (2025) -
ReasonGrounder: LVLM-Guided Hierarchical Feature Splatting for Open-Vocabulary 3D Visual Grounding and Reasoning
por: Liu, Zhenyang, et al.
Publicado: (2025) -
ToolFG: Towards Well-Grounded Fine-Grained Image Classification
por: Xue, Yu, et al.
Publicado: (2026) -
Vocabulary-free Fine-grained Visual Recognition via Enriched Contextually Grounded Vision-Language Model
por: Demidov, Dmitry, et al.
Publicado: (2025)