ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
Fuente:
arXiv
Salvato in:
| Autori principali: | Yan, Siming, Bai, Min, Chen, Weifeng, Zhou, Xiong, Huang, Qixing, Li, Li Erran |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AffordanceLLM: Grounding Affordance from Vision Language Models
di: Qian, Shengyi, et al.
Pubblicazione: (2024)
di: Qian, Shengyi, et al.
Pubblicazione: (2024)
ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?
di: Han, Haonan, et al.
Pubblicazione: (2026)
di: Han, Haonan, et al.
Pubblicazione: (2026)
ViSurf: Visual Supervised-and-Reinforcement Fine-Tuning for Large Vision-and-Language Models
di: Liu, Yuqi, et al.
Pubblicazione: (2025)
di: Liu, Yuqi, et al.
Pubblicazione: (2025)
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
di: Li, Yue, et al.
Pubblicazione: (2025)
di: Li, Yue, et al.
Pubblicazione: (2025)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
di: Wang, Haibo, et al.
Pubblicazione: (2024)
di: Wang, Haibo, et al.
Pubblicazione: (2024)
GranViT: A Fine-Grained Vision Model With Autoregressive Perception For MLLMs
di: Zheng, Guanghao, et al.
Pubblicazione: (2025)
di: Zheng, Guanghao, et al.
Pubblicazione: (2025)
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
di: Sun, Luoyi, et al.
Pubblicazione: (2026)
di: Sun, Luoyi, et al.
Pubblicazione: (2026)
ViTCoP: Accelerating Large Vision-Language Models via Visual and Textual Semantic Collaborative Pruning
di: Luo, Wen, et al.
Pubblicazione: (2026)
di: Luo, Wen, et al.
Pubblicazione: (2026)
Proposer-Agent-Evaluator(PAE): Autonomous Skill Discovery For Foundation Model Internet Agents
di: Zhou, Yifei, et al.
Pubblicazione: (2024)
di: Zhou, Yifei, et al.
Pubblicazione: (2024)
Grounding the Score: Explicit Visual Premise Verification for Reliable Vision-Language Process Reward Models
di: Wang, Junxin, et al.
Pubblicazione: (2026)
di: Wang, Junxin, et al.
Pubblicazione: (2026)
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
di: Zhou, Yue, et al.
Pubblicazione: (2024)
di: Zhou, Yue, et al.
Pubblicazione: (2024)
Learning Fine-Grained Grounded Citations for Attributed Large Language Models
di: Huang, Lei, et al.
Pubblicazione: (2024)
di: Huang, Lei, et al.
Pubblicazione: (2024)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
di: Zhu, Yingjie, et al.
Pubblicazione: (2024)
di: Zhu, Yingjie, et al.
Pubblicazione: (2024)
Improving Vision-language Models with Perception-centric Process Reward Models
di: Min, Yingqian, et al.
Pubblicazione: (2026)
di: Min, Yingqian, et al.
Pubblicazione: (2026)
ViLBench: A Suite for Vision-Language Process Reward Modeling
di: Tu, Haoqin, et al.
Pubblicazione: (2025)
di: Tu, Haoqin, et al.
Pubblicazione: (2025)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
di: Tang, Zicong, et al.
Pubblicazione: (2025)
di: Tang, Zicong, et al.
Pubblicazione: (2025)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
di: Liu, Yan, et al.
Pubblicazione: (2024)
di: Liu, Yan, et al.
Pubblicazione: (2024)
EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models
di: Shan, Haozhe, et al.
Pubblicazione: (2026)
di: Shan, Haozhe, et al.
Pubblicazione: (2026)
DVGBench: Implicit-to-Explicit Visual Grounding Benchmark in UAV Imagery with Large Vision-Language Models
di: Zhou, Yue, et al.
Pubblicazione: (2026)
di: Zhou, Yue, et al.
Pubblicazione: (2026)
Multi-View Representation is What You Need for Point-Cloud Pre-Training
di: Yan, Siming, et al.
Pubblicazione: (2023)
di: Yan, Siming, et al.
Pubblicazione: (2023)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
di: Zhu, Fengbin, et al.
Pubblicazione: (2024)
di: Zhu, Fengbin, et al.
Pubblicazione: (2024)
Finer: Investigating and Enhancing Fine-Grained Visual Concept Recognition in Large Vision Language Models
di: Kim, Jeonghwan, et al.
Pubblicazione: (2024)
di: Kim, Jeonghwan, et al.
Pubblicazione: (2024)
From Captions to Rewards (CAREVL): Leveraging Large Language Model Experts for Enhanced Reward Modeling in Large Vision-Language Models
di: Dai, Muzhi, et al.
Pubblicazione: (2025)
di: Dai, Muzhi, et al.
Pubblicazione: (2025)
GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding
di: Zhang, Peirong, et al.
Pubblicazione: (2025)
di: Zhang, Peirong, et al.
Pubblicazione: (2025)
Fine-Tuning Language Models with Reward Learning on Policy
di: Lang, Hao, et al.
Pubblicazione: (2024)
di: Lang, Hao, et al.
Pubblicazione: (2024)
Adversarial Robustness for Visual Grounding of Multimodal Large Language Models
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
Emergent Visual Grounding in Large Multimodal Models Without Grounding Supervision
di: Cao, Shengcao, et al.
Pubblicazione: (2024)
di: Cao, Shengcao, et al.
Pubblicazione: (2024)
DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Model
di: Tao, Zhou, et al.
Pubblicazione: (2025)
di: Tao, Zhou, et al.
Pubblicazione: (2025)
Detecting and Mitigating Hallucination in Large Vision Language Models via Fine-Grained AI Feedback
di: Xiao, Wenyi, et al.
Pubblicazione: (2024)
di: Xiao, Wenyi, et al.
Pubblicazione: (2024)
GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing
di: Fang, Rongyao, et al.
Pubblicazione: (2025)
di: Fang, Rongyao, et al.
Pubblicazione: (2025)
LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models
di: Shen, Yuxiang, et al.
Pubblicazione: (2026)
di: Shen, Yuxiang, et al.
Pubblicazione: (2026)
Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding
di: He, Jinlong, et al.
Pubblicazione: (2024)
di: He, Jinlong, et al.
Pubblicazione: (2024)
Visual In-Context Learning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
Evaluating the Efficacy of Large Language Models for Generating Fine-Grained Visual Privacy Policies in Homes
di: Zhang, Shuning, et al.
Pubblicazione: (2025)
di: Zhang, Shuning, et al.
Pubblicazione: (2025)
Just Go Parallel: Improving the Multilingual Capabilities of Large Language Models
di: Qorib, Muhammad Reza, et al.
Pubblicazione: (2025)
di: Qorib, Muhammad Reza, et al.
Pubblicazione: (2025)
UFVideo: Towards Unified Fine-Grained Video Cooperative Understanding with Large Language Models
di: Pan, Hewen, et al.
Pubblicazione: (2025)
di: Pan, Hewen, et al.
Pubblicazione: (2025)
FILA: Fine-Grained Vision Language Models
di: Zhu, Shiding, et al.
Pubblicazione: (2024)
di: Zhu, Shiding, et al.
Pubblicazione: (2024)
Analyzing and Boosting the Power of Fine-Grained Visual Recognition for Multi-modal Large Language Models
di: He, Hulingxiao, et al.
Pubblicazione: (2025)
di: He, Hulingxiao, et al.
Pubblicazione: (2025)
Towards Visual Text Grounding of Multimodal Large Language Model
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
LaViC: Adapting Large Vision-Language Models to Visually-Aware Conversational Recommendation
di: Jeon, Hyunsik, et al.
Pubblicazione: (2025)
di: Jeon, Hyunsik, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AffordanceLLM: Grounding Affordance from Vision Language Models
di: Qian, Shengyi, et al.
Pubblicazione: (2024) -
ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?
di: Han, Haonan, et al.
Pubblicazione: (2026) -
ViSurf: Visual Supervised-and-Reinforcement Fine-Tuning for Large Vision-and-Language Models
di: Liu, Yuqi, et al.
Pubblicazione: (2025) -
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
di: Li, Yue, et al.
Pubblicazione: (2025) -
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
di: Wang, Haibo, et al.
Pubblicazione: (2024)