ViLBench: A Suite for Vision-Language Process Reward Modeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tu, Haoqin, Feng, Weitao, Chen, Hardy, Liu, Hui, Tang, Xianfeng, Xie, Cihang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
par: Wu, Juncheng, et autres
Publié: (2026)
par: Wu, Juncheng, et autres
Publié: (2026)
SpatialThinker: Reinforcing 3D Reasoning in Multimodal LLMs via Spatial Rewards
par: Batra, Hunar, et autres
Publié: (2025)
par: Batra, Hunar, et autres
Publié: (2025)
Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales
par: Qian, Zhaofang, et autres
Publié: (2025)
par: Qian, Zhaofang, et autres
Publié: (2025)
OpenVision: A Fully-Open, Cost-Effective Family of Advanced Vision Encoders for Multimodal Learning
par: Li, Xianhang, et autres
Publié: (2025)
par: Li, Xianhang, et autres
Publié: (2025)
SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models
par: Chen, Hardy, et autres
Publié: (2025)
par: Chen, Hardy, et autres
Publié: (2025)
ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding
par: Kang, Jialiang, et autres
Publié: (2025)
par: Kang, Jialiang, et autres
Publié: (2025)
What If We Recaption Billions of Web Images with LLaMA-3?
par: Li, Xianhang, et autres
Publié: (2024)
par: Li, Xianhang, et autres
Publié: (2024)
HSCR: Hierarchical Self-Contrastive Rewarding for Aligning Medical Vision Language Models
par: Jiang, Songtao, et autres
Publié: (2025)
par: Jiang, Songtao, et autres
Publié: (2025)
VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models
par: Li, Lei, et autres
Publié: (2024)
par: Li, Lei, et autres
Publié: (2024)
ViT-5: Vision Transformers for The Mid-2020s
par: Wang, Feng, et autres
Publié: (2026)
par: Wang, Feng, et autres
Publié: (2026)
HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
par: Guan, Tianrui, et autres
Publié: (2023)
par: Guan, Tianrui, et autres
Publié: (2023)
A Comprehensive Analysis for Visual Object Hallucination in Large Vision-Language Models
par: Jing, Liqiang, et autres
Publié: (2025)
par: Jing, Liqiang, et autres
Publié: (2025)
Localization vs. Semantics: Visual Representations in Unimodal and Multimodal Models
par: Li, Zhuowan, et autres
Publié: (2022)
par: Li, Zhuowan, et autres
Publié: (2022)
Do Vision-Language Models Really Understand Visual Language?
par: Hou, Yifan, et autres
Publié: (2024)
par: Hou, Yifan, et autres
Publié: (2024)
Calibrated Self-Rewarding Vision Language Models
par: Zhou, Yiyang, et autres
Publié: (2024)
par: Zhou, Yiyang, et autres
Publié: (2024)
URPO: A Unified Reward & Policy Optimization Framework for Large Language Models
par: Lu, Songshuo, et autres
Publié: (2025)
par: Lu, Songshuo, et autres
Publié: (2025)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
par: Zhu, Tinghui, et autres
Publié: (2024)
par: Zhu, Tinghui, et autres
Publié: (2024)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
par: Tang, Zicong, et autres
Publié: (2025)
par: Tang, Zicong, et autres
Publié: (2025)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
par: Wang, Weiyun, et autres
Publié: (2025)
par: Wang, Weiyun, et autres
Publié: (2025)
VHELM: A Holistic Evaluation of Vision Language Models
par: Lee, Tony, et autres
Publié: (2024)
par: Lee, Tony, et autres
Publié: (2024)
Autoregressive Pretraining with Mamba in Vision
par: Ren, Sucheng, et autres
Publié: (2024)
par: Ren, Sucheng, et autres
Publié: (2024)
Reward Design for Physical Reasoning in Vision-Language Models
par: Lilienthal, Derek, et autres
Publié: (2026)
par: Lilienthal, Derek, et autres
Publié: (2026)
Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models
par: Zhong, Weihong, et autres
Publié: (2024)
par: Zhong, Weihong, et autres
Publié: (2024)
VividMed: Vision Language Model with Versatile Visual Grounding for Medicine
par: Luo, Lingxiao, et autres
Publié: (2024)
par: Luo, Lingxiao, et autres
Publié: (2024)
TLDR: Token-Level Detective Reward Model for Large Vision Language Models
par: Fu, Deqing, et autres
Publié: (2024)
par: Fu, Deqing, et autres
Publié: (2024)
VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
par: Zhang, Juntian, et autres
Publié: (2025)
par: Zhang, Juntian, et autres
Publié: (2025)
CrowdVLM-R1: Expanding R1 Ability to Vision Language Model for Crowd Counting using Fuzzy Group Relative Policy Reward
par: Wang, Zhiqiang, et autres
Publié: (2025)
par: Wang, Zhiqiang, et autres
Publié: (2025)
ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention
par: Liu, Wenjie, et autres
Publié: (2026)
par: Liu, Wenjie, et autres
Publié: (2026)
Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling
par: Chen, Qiyuan, et autres
Publié: (2026)
par: Chen, Qiyuan, et autres
Publié: (2026)
Kestrel: Grounding Self-Refinement for LVLM Hallucination Mitigation
par: Mao, Jiawei, et autres
Publié: (2026)
par: Mao, Jiawei, et autres
Publié: (2026)
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
par: Zhang, Yi-Fan, et autres
Publié: (2025)
par: Zhang, Yi-Fan, et autres
Publié: (2025)
Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness
par: Wang, Zeyu, et autres
Publié: (2025)
par: Wang, Zeyu, et autres
Publié: (2025)
Vision-centric Token Compression in Large Language Model
par: Xing, Ling, et autres
Publié: (2025)
par: Xing, Ling, et autres
Publié: (2025)
Lost in Embeddings: Information Loss in Vision-Language Models
par: Li, Wenyan, et autres
Publié: (2025)
par: Li, Wenyan, et autres
Publié: (2025)
MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?
par: Chen, Zhaorun, et autres
Publié: (2024)
par: Chen, Zhaorun, et autres
Publié: (2024)
SCoPE VLM: Selective Context Processing for Efficient Document Navigation in Vision-Language Models
par: Lim, Gyubeum, et autres
Publié: (2025)
par: Lim, Gyubeum, et autres
Publié: (2025)
Learning to Exploit Temporal Structure for Biomedical Vision-Language Processing
par: Bannur, Shruthi, et autres
Publié: (2023)
par: Bannur, Shruthi, et autres
Publié: (2023)
HiMo-CLIP: Modeling Semantic Hierarchy and Monotonicity in Vision-Language Alignment
par: Wu, Ruijia, et autres
Publié: (2025)
par: Wu, Ruijia, et autres
Publié: (2025)
VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment
par: Li, Lei, et autres
Publié: (2024)
par: Li, Lei, et autres
Publié: (2024)
Documents similaires
-
From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
par: Wu, Juncheng, et autres
Publié: (2026) -
SpatialThinker: Reinforcing 3D Reasoning in Multimodal LLMs via Spatial Rewards
par: Batra, Hunar, et autres
Publié: (2025) -
Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales
par: Qian, Zhaofang, et autres
Publié: (2025) -
OpenVision: A Fully-Open, Cost-Effective Family of Advanced Vision Encoders for Multimodal Learning
par: Li, Xianhang, et autres
Publié: (2025) -
SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models
par: Chen, Hardy, et autres
Publié: (2025)