GroundSight: Augmenting Vision-Language Models with Grounding Information and De-hallucination
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Xinxi, Chen, Tianyang, Hong, Lijia |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
GroundCount: Grounding Vision-Language Models with Object Detection for Mitigating Counting Hallucinations
by: Chen, Boyuan, et al.
Published: (2026)
by: Chen, Boyuan, et al.
Published: (2026)
Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding
by: Jones, Joshua, et al.
Published: (2025)
by: Jones, Joshua, et al.
Published: (2025)
Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models
by: Ye, Zekai, et al.
Published: (2026)
by: Ye, Zekai, et al.
Published: (2026)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
by: Prasad, Archiki, et al.
Published: (2023)
by: Prasad, Archiki, et al.
Published: (2023)
SpotAgent: Grounding Visual Geo-localization in Large Vision-Language Models through Agentic Reasoning
by: Jia, Furong, et al.
Published: (2026)
by: Jia, Furong, et al.
Published: (2026)
GUI-Eyes: Tool-Augmented Perception for Visual Grounding in GUI Agents
by: Chen, Chen, et al.
Published: (2026)
by: Chen, Chen, et al.
Published: (2026)
MolGround: A Benchmark for Molecular Grounding
by: Wu, Jiaxin, et al.
Published: (2025)
by: Wu, Jiaxin, et al.
Published: (2025)
Mini-Giants: "Small" Language Models and Open Source Win-Win
by: Zhou, Zhengping, et al.
Published: (2023)
by: Zhou, Zhengping, et al.
Published: (2023)
Gondola: Grounded Vision Language Planning for Generalizable Robotic Manipulation
by: Chen, Shizhe, et al.
Published: (2025)
by: Chen, Shizhe, et al.
Published: (2025)
Auditing Frontier Vision-Language Models for Trustworthy Medical VQA: Grounding Failures, Format Collapse, and Domain Adaptation
by: Chen, Xupeng, et al.
Published: (2026)
by: Chen, Xupeng, et al.
Published: (2026)
CubeRobot: Grounding Language in Rubik's Cube Manipulation via Vision-Language Model
by: Wang, Feiyang, et al.
Published: (2025)
by: Wang, Feiyang, et al.
Published: (2025)
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
by: Zhang, Xinsong, et al.
Published: (2025)
by: Zhang, Xinsong, et al.
Published: (2025)
Physically Grounded Vision-Language Models for Robotic Manipulation
by: Gao, Jensen, et al.
Published: (2023)
by: Gao, Jensen, et al.
Published: (2023)
Solver-Informed RL: Grounding Large Language Models for Authentic Optimization Modeling
by: Chen, Yitian, et al.
Published: (2025)
by: Chen, Yitian, et al.
Published: (2025)
XplainLLM: A Knowledge-Augmented Dataset for Reliable Grounded Explanations in LLMs
by: Chen, Zichen, et al.
Published: (2023)
by: Chen, Zichen, et al.
Published: (2023)
Transcoders Trace Visual Grounding and Hallucinations in Vision-Language Models
by: Damianos, Dimitrios, et al.
Published: (2026)
by: Damianos, Dimitrios, et al.
Published: (2026)
Grounded Vision-Language Interpreter for Integrated Task and Motion Planning
by: Siburian, Jeremy, et al.
Published: (2025)
by: Siburian, Jeremy, et al.
Published: (2025)
Event-Grounded Sparse Autoencoders for Vision-Language-Action Policies
by: Jin, Xinchen, et al.
Published: (2026)
by: Jin, Xinchen, et al.
Published: (2026)
MedGround: Bridging the Evidence Gap in Medical Vision-Language Models with Verified Grounding Data
by: Zhang, Mengmeng, et al.
Published: (2026)
by: Zhang, Mengmeng, et al.
Published: (2026)
Augmented Commonsense Knowledge for Remote Object Grounding
by: Mohammadi, Bahram, et al.
Published: (2024)
by: Mohammadi, Bahram, et al.
Published: (2024)
A Satellite-Ground Synergistic Large Vision-Language Model System for Earth Observation
by: Zhang, Yuxin, et al.
Published: (2025)
by: Zhang, Yuxin, et al.
Published: (2025)
Honest AI: Fine-Tuning "Small" Language Models to Say "I Don't Know", and Reducing Hallucination in RAG
by: Chen, Xinxi, et al.
Published: (2024)
by: Chen, Xinxi, et al.
Published: (2024)
GRAMMAR: Grounded and Modular Methodology for Assessment of Closed-Domain Retrieval-Augmented Language Model
by: Li, Xinzhe, et al.
Published: (2024)
by: Li, Xinzhe, et al.
Published: (2024)
Grounding and Enhancing Informativeness and Utility in Dataset Distillation
by: Wang, Shaobo, et al.
Published: (2026)
by: Wang, Shaobo, et al.
Published: (2026)
DeFacto: Counterfactual Thinking with Images for Enforcing Evidence-Grounded and Faithful Reasoning
by: Xu, Tianrun, et al.
Published: (2025)
by: Xu, Tianrun, et al.
Published: (2025)
PathGLS: Evaluating Pathology Vision-Language Models without Ground Truth through Multi-Dimensional Consistency
by: Chen, Minbing, et al.
Published: (2026)
by: Chen, Minbing, et al.
Published: (2026)
Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding
by: Xue, Haotian, et al.
Published: (2025)
by: Xue, Haotian, et al.
Published: (2025)
Grounded Vision-Language Navigation for UAVs with Open-Vocabulary Goal Understanding
by: Zhang, Yuhang, et al.
Published: (2025)
by: Zhang, Yuhang, et al.
Published: (2025)
Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI
by: Ernhofer, Benjamin Raphael, et al.
Published: (2025)
by: Ernhofer, Benjamin Raphael, et al.
Published: (2025)
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
by: Kumbhar, Shrinidhi, et al.
Published: (2026)
by: Kumbhar, Shrinidhi, et al.
Published: (2026)
To Agree or To Be Right? The Grounding-Sycophancy Tradeoff in Medical Vision-Language Models
by: Aranya, OFM Riaz Rahman, et al.
Published: (2026)
by: Aranya, OFM Riaz Rahman, et al.
Published: (2026)
HREF: Human Response-Guided Evaluation of Instruction Following in Language Models
by: Lyu, Xinxi, et al.
Published: (2024)
by: Lyu, Xinxi, et al.
Published: (2024)
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
by: Yan, Siming, et al.
Published: (2024)
by: Yan, Siming, et al.
Published: (2024)
RITUAL: Random Image Transformations as a Universal Anti-hallucination Lever in Large Vision Language Models
by: Woo, Sangmin, et al.
Published: (2024)
by: Woo, Sangmin, et al.
Published: (2024)
Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments
by: Li, Zerui, et al.
Published: (2025)
by: Li, Zerui, et al.
Published: (2025)
Grounding Sim-to-Real Generalization in Dexterous Manipulation: An Empirical Study with Vision-Language-Action Models
by: Jin, Ruixing, et al.
Published: (2026)
by: Jin, Ruixing, et al.
Published: (2026)
Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards
by: Han, Tianyang, et al.
Published: (2026)
by: Han, Tianyang, et al.
Published: (2026)
A comprehensive taxonomy of hallucinations in Large Language Models
by: Cossio, Manuel
Published: (2025)
by: Cossio, Manuel
Published: (2025)
3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning
by: Tang, Guoqin, et al.
Published: (2025)
by: Tang, Guoqin, et al.
Published: (2025)
Enabling Near-realtime Remote Sensing via Satellite-Ground Collaboration of Large Vision-Language Models
by: Li, Zihan, et al.
Published: (2025)
by: Li, Zihan, et al.
Published: (2025)
Similar Items
-
GroundCount: Grounding Vision-Language Models with Object Detection for Mitigating Counting Hallucinations
by: Chen, Boyuan, et al.
Published: (2026) -
Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding
by: Jones, Joshua, et al.
Published: (2025) -
Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models
by: Ye, Zekai, et al.
Published: (2026) -
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
by: Prasad, Archiki, et al.
Published: (2023) -
SpotAgent: Grounding Visual Geo-localization in Large Vision-Language Models through Agentic Reasoning
by: Jia, Furong, et al.
Published: (2026)