Reward Design for Physical Reasoning in Vision-Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Lilienthal, Derek, Mukherjee, Manisha, Horawalavithana, Sameera |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Back to the Barn with LLAMAs: Evolving Pretrained LLM Backbones in Finetuning Vision Language Models
von: Horawalavithana, Sameera, et al.
Veröffentlicht: (2026)
von: Horawalavithana, Sameera, et al.
Veröffentlicht: (2026)
SCITUNE: Aligning Large Language Models with Human-Curated Scientific Multimodal Instructions
von: Horawalavithana, Sameera, et al.
Veröffentlicht: (2023)
von: Horawalavithana, Sameera, et al.
Veröffentlicht: (2023)
On the Cultural Anachronism and Temporal Reasoning in Vision Language Models
von: Ranjan, Mukul, et al.
Veröffentlicht: (2026)
von: Ranjan, Mukul, et al.
Veröffentlicht: (2026)
Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling
von: Chen, Qiyuan, et al.
Veröffentlicht: (2026)
von: Chen, Qiyuan, et al.
Veröffentlicht: (2026)
How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning
von: Yang, Luyu, et al.
Veröffentlicht: (2026)
von: Yang, Luyu, et al.
Veröffentlicht: (2026)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
von: Li, Hongxing, et al.
Veröffentlicht: (2025)
von: Li, Hongxing, et al.
Veröffentlicht: (2025)
Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
von: Xiao, Wenyi, et al.
Veröffentlicht: (2025)
von: Xiao, Wenyi, et al.
Veröffentlicht: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
von: Ding, Meidan, et al.
Veröffentlicht: (2025)
von: Ding, Meidan, et al.
Veröffentlicht: (2025)
Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning
von: Zhao, Bingchen, et al.
Veröffentlicht: (2024)
von: Zhao, Bingchen, et al.
Veröffentlicht: (2024)
VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning
von: Xiao, Wenyi, et al.
Veröffentlicht: (2026)
von: Xiao, Wenyi, et al.
Veröffentlicht: (2026)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
von: Jia, Mengdi, et al.
Veröffentlicht: (2025)
von: Jia, Mengdi, et al.
Veröffentlicht: (2025)
Data Metabolism: An Efficient Data Design Schema For Vision Language Model
von: Zhang, Jingyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Jingyuan, et al.
Veröffentlicht: (2025)
Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft
von: Li, Hao, et al.
Veröffentlicht: (2023)
von: Li, Hao, et al.
Veröffentlicht: (2023)
Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models
von: Qu, Kevin, et al.
Veröffentlicht: (2026)
von: Qu, Kevin, et al.
Veröffentlicht: (2026)
Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models
von: Xiong, Guangzhi, et al.
Veröffentlicht: (2026)
von: Xiong, Guangzhi, et al.
Veröffentlicht: (2026)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
von: Chen, Qiguang, et al.
Veröffentlicht: (2026)
von: Chen, Qiguang, et al.
Veröffentlicht: (2026)
CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting
von: Pothiraj, Atin, et al.
Veröffentlicht: (2025)
von: Pothiraj, Atin, et al.
Veröffentlicht: (2025)
A Cognitive Evaluation Benchmark of Image Reasoning and Description for Large Vision-Language Models
von: Song, Xiujie, et al.
Veröffentlicht: (2024)
von: Song, Xiujie, et al.
Veröffentlicht: (2024)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
von: Zhang, Beichen, et al.
Veröffentlicht: (2025)
von: Zhang, Beichen, et al.
Veröffentlicht: (2025)
CANVAS: A Benchmark for Vision-Language Models on Tool-Based User Interface Design
von: Jeong, Daeheon, et al.
Veröffentlicht: (2025)
von: Jeong, Daeheon, et al.
Veröffentlicht: (2025)
CultureVLM: Characterizing and Improving Cultural Understanding of Vision-Language Models for over 100 Countries
von: Liu, Shudong, et al.
Veröffentlicht: (2025)
von: Liu, Shudong, et al.
Veröffentlicht: (2025)
Seeing Symbols, Missing Cultures: Probing Vision-Language Models' Reasoning on Fire Imagery and Cultural Meaning
von: Yu, Haorui, et al.
Veröffentlicht: (2025)
von: Yu, Haorui, et al.
Veröffentlicht: (2025)
DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models
von: Zou, Chengke, et al.
Veröffentlicht: (2024)
von: Zou, Chengke, et al.
Veröffentlicht: (2024)
G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
von: Hu, Wenbo, et al.
Veröffentlicht: (2025)
von: Hu, Wenbo, et al.
Veröffentlicht: (2025)
CityRiSE: Reasoning Urban Socio-Economic Status in Vision-Language Models via Reinforcement Learning
von: Liu, Tianhui, et al.
Veröffentlicht: (2025)
von: Liu, Tianhui, et al.
Veröffentlicht: (2025)
DocReward: A Document Reward Model for Structuring and Stylizing
von: Liu, Junpeng, et al.
Veröffentlicht: (2025)
von: Liu, Junpeng, et al.
Veröffentlicht: (2025)
HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning
von: Wang, Shenzhi, et al.
Veröffentlicht: (2026)
von: Wang, Shenzhi, et al.
Veröffentlicht: (2026)
MC-GPT: Empowering Vision-and-Language Navigation with Memory Map and Reasoning Chains
von: Zhan, Zhaohuan, et al.
Veröffentlicht: (2024)
von: Zhan, Zhaohuan, et al.
Veröffentlicht: (2024)
ROVER: Recursive Reasoning Over Videos with Vision-Language Models for Embodied Tasks
von: Schroeder, Philip, et al.
Veröffentlicht: (2025)
von: Schroeder, Philip, et al.
Veröffentlicht: (2025)
NTSEBENCH: Cognitive Reasoning Benchmark for Vision Language Models
von: Pandya, Pranshu, et al.
Veröffentlicht: (2024)
von: Pandya, Pranshu, et al.
Veröffentlicht: (2024)
Understanding the Effects of Distractors on Reasoning Vision-Language Models
von: Bae, Jiyun, et al.
Veröffentlicht: (2025)
von: Bae, Jiyun, et al.
Veröffentlicht: (2025)
Revisiting the Role of Language Priors in Vision-Language Models
von: Lin, Zhiqiu, et al.
Veröffentlicht: (2023)
von: Lin, Zhiqiu, et al.
Veröffentlicht: (2023)
Survey on Vision-Language-Action Models
von: Adilkhanov, Adilzhan, et al.
Veröffentlicht: (2025)
von: Adilkhanov, Adilzhan, et al.
Veröffentlicht: (2025)
NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models
von: Zhou, Gengze, et al.
Veröffentlicht: (2024)
von: Zhou, Gengze, et al.
Veröffentlicht: (2024)
WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences
von: Lu, Yujie, et al.
Veröffentlicht: (2024)
von: Lu, Yujie, et al.
Veröffentlicht: (2024)
EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training
von: Du, Yiyang, et al.
Veröffentlicht: (2026)
von: Du, Yiyang, et al.
Veröffentlicht: (2026)
Reasoning in the Dark: Interleaved Vision-Text Reasoning in Latent Space
von: Chen, Chao, et al.
Veröffentlicht: (2025)
von: Chen, Chao, et al.
Veröffentlicht: (2025)
Multi-Object Hallucination in Vision-Language Models
von: Chen, Xuweiyi, et al.
Veröffentlicht: (2024)
von: Chen, Xuweiyi, et al.
Veröffentlicht: (2024)
Benchmarking Vision Language Models for Cultural Understanding
von: Nayak, Shravan, et al.
Veröffentlicht: (2024)
von: Nayak, Shravan, et al.
Veröffentlicht: (2024)
Multimodal Chain-of-Thought Reasoning in Language Models
von: Zhang, Zhuosheng, et al.
Veröffentlicht: (2023)
von: Zhang, Zhuosheng, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
Back to the Barn with LLAMAs: Evolving Pretrained LLM Backbones in Finetuning Vision Language Models
von: Horawalavithana, Sameera, et al.
Veröffentlicht: (2026) -
SCITUNE: Aligning Large Language Models with Human-Curated Scientific Multimodal Instructions
von: Horawalavithana, Sameera, et al.
Veröffentlicht: (2023) -
On the Cultural Anachronism and Temporal Reasoning in Vision Language Models
von: Ranjan, Mukul, et al.
Veröffentlicht: (2026) -
Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling
von: Chen, Qiyuan, et al.
Veröffentlicht: (2026) -
How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning
von: Yang, Luyu, et al.
Veröffentlicht: (2026)