Physics Context Builders: A Modular Framework for Physical Reasoning in Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Balazadeh, Vahid, Ataei, Mohammadmehdi, Cheong, Hyunmin, Khasahmadi, Amir Hosein, Krishnan, Rahul G. |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
e-SimFT: Alignment of Generative Models with Simulation Feedback for Pareto-Front Design Exploration
by: Cheong, Hyunmin, et al.
Published: (2025)
by: Cheong, Hyunmin, et al.
Published: (2025)
CadVLM: Bridging Language and Vision in the Generation of Parametric CAD Sketches
by: Wu, Sifan, et al.
Published: (2024)
by: Wu, Sifan, et al.
Published: (2024)
VSF-Med:A Vulnerability Scoring Framework for Medical Vision-Language Models
by: Sadanandan, Binesh, et al.
Published: (2025)
by: Sadanandan, Binesh, et al.
Published: (2025)
Deep Generative Model for Mechanical System Configuration Design
by: Etesam, Yasaman, et al.
Published: (2024)
by: Etesam, Yasaman, et al.
Published: (2024)
Reward Design for Physical Reasoning in Vision-Language Models
by: Lilienthal, Derek, et al.
Published: (2026)
by: Lilienthal, Derek, et al.
Published: (2026)
Zero-to-CAD: Agentic Synthesis of Interpretable CAD Programs at Million-Scale Without Real Data
by: Ataei, Mohammadmehdi, et al.
Published: (2026)
by: Ataei, Mohammadmehdi, et al.
Published: (2026)
Understanding Counting Mechanisms in Large Language and Vision-Language Models
by: Hasani, Hosein, et al.
Published: (2025)
by: Hasani, Hosein, et al.
Published: (2025)
VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis
by: Kang, Donggoo, et al.
Published: (2024)
by: Kang, Donggoo, et al.
Published: (2024)
mPOLICE: Provable Enforcement of Multi-Region Affine Constraints in Deep Neural Networks
by: Ataei, Mohammadmehdi, et al.
Published: (2025)
by: Ataei, Mohammadmehdi, et al.
Published: (2025)
Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis
by: Fadaei, Amir Hosein, et al.
Published: (2025)
by: Fadaei, Amir Hosein, et al.
Published: (2025)
Physical Prompt Injection Attacks on Large Vision-Language Models
by: Ling, Chen, et al.
Published: (2026)
by: Ling, Chen, et al.
Published: (2026)
Phantasia: Context-Adaptive Backdoors in Vision Language Models
by: Tran, Nam Duong, et al.
Published: (2026)
by: Tran, Nam Duong, et al.
Published: (2026)
Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models
by: Thapa, Rahul, et al.
Published: (2024)
by: Thapa, Rahul, et al.
Published: (2024)
Physically Grounded Vision-Language Models for Robotic Manipulation
by: Gao, Jensen, et al.
Published: (2023)
by: Gao, Jensen, et al.
Published: (2023)
CARE Drive A Framework for Evaluating Reason-Responsiveness of Vision Language Models in Automated Driving
by: Suryana, Lucas Elbert, et al.
Published: (2026)
by: Suryana, Lucas Elbert, et al.
Published: (2026)
Multi-view Phase-aware Pedestrian-Vehicle Incident Reasoning Framework with Vision-Language Models
by: Zhen, Hao, et al.
Published: (2025)
by: Zhen, Hao, et al.
Published: (2025)
ReasonEdit: Editing Vision-Language Models using Human Reasoning
by: Qiu, Jiaxing, et al.
Published: (2026)
by: Qiu, Jiaxing, et al.
Published: (2026)
Prompt Tuning with Soft Context Sharing for Vision-Language Models
by: Ding, Kun, et al.
Published: (2022)
by: Ding, Kun, et al.
Published: (2022)
In-Context Learning Improves Compositional Understanding of Vision-Language Models
by: Nulli, Matteo, et al.
Published: (2024)
by: Nulli, Matteo, et al.
Published: (2024)
Large Vision-Language Models as Emotion Recognizers in Context Awareness
by: Lei, Yuxuan, et al.
Published: (2024)
by: Lei, Yuxuan, et al.
Published: (2024)
Prompting Large Vision-Language Models for Compositional Reasoning
by: Ossowski, Timothy, et al.
Published: (2024)
by: Ossowski, Timothy, et al.
Published: (2024)
Jailbreaks on Vision Language Model via Multimodal Reasoning
by: Noheria, Aarush, et al.
Published: (2026)
by: Noheria, Aarush, et al.
Published: (2026)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
by: Tan, Huajie, et al.
Published: (2025)
by: Tan, Huajie, et al.
Published: (2025)
Elicitron: An LLM Agent-Based Simulation Framework for Design Requirements Elicitation
by: Ataei, Mohammadmehdi, et al.
Published: (2024)
by: Ataei, Mohammadmehdi, et al.
Published: (2024)
VLIPP: Towards Physically Plausible Video Generation with Vision and Language Informed Physical Prior
by: Yang, Xindi, et al.
Published: (2025)
by: Yang, Xindi, et al.
Published: (2025)
Re-ranking Reasoning Context with Tree Search Makes Large Vision-Language Models Stronger
by: Yang, Qi, et al.
Published: (2025)
by: Yang, Qi, et al.
Published: (2025)
BiasICL: In-Context Learning and Demographic Biases of Vision Language Models
by: Xu, Sonnet, et al.
Published: (2025)
by: Xu, Sonnet, et al.
Published: (2025)
SUREON: A Benchmark and Vision-Language-Model for Surgical Reasoning
by: Perez, Alejandra, et al.
Published: (2026)
by: Perez, Alejandra, et al.
Published: (2026)
Reasoning under Vision: Understanding Visual-Spatial Cognition in Vision-Language Models for CAPTCHA
by: Song, Python, et al.
Published: (2025)
by: Song, Python, et al.
Published: (2025)
ORCA: An Agentic Reasoning Framework for Hallucination and Adversarial Robustness in Vision-Language Models
by: Yu, Chung-En Johnny, et al.
Published: (2025)
by: Yu, Chung-En Johnny, et al.
Published: (2025)
Jailbreaking Multimodal Large Language Models using Multi-Clip Video
by: Kang, Choongwon, et al.
Published: (2026)
by: Kang, Choongwon, et al.
Published: (2026)
How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning
by: Yang, Luyu, et al.
Published: (2026)
by: Yang, Luyu, et al.
Published: (2026)
Aerial Vision-Language Navigation with a Unified Framework for Spatial, Temporal and Embodied Reasoning
by: Xu, Huilin, et al.
Published: (2025)
by: Xu, Huilin, et al.
Published: (2025)
Weakly-Supervised Image Forgery Localization via Vision-Language Collaborative Reasoning Framework
by: Sheng, Ziqi, et al.
Published: (2025)
by: Sheng, Ziqi, et al.
Published: (2025)
Investigating Mechanisms for In-Context Vision Language Binding
by: Saravanan, Darshana, et al.
Published: (2025)
by: Saravanan, Darshana, et al.
Published: (2025)
DL$^3$M: A Vision-to-Language Framework for Expert-Level Medical Reasoning through Deep Learning and Large Language Models
by: Hasan, Md. Najib, et al.
Published: (2025)
by: Hasan, Md. Najib, et al.
Published: (2025)
UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks
by: Nguyen, Jason, et al.
Published: (2026)
by: Nguyen, Jason, et al.
Published: (2026)
Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models
by: Chen, Yan, et al.
Published: (2025)
by: Chen, Yan, et al.
Published: (2025)
FRIEDA: Benchmarking Multi-Step Cartographic Reasoning in Vision-Language Models
by: Pyo, Jiyoon, et al.
Published: (2025)
by: Pyo, Jiyoon, et al.
Published: (2025)
Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
by: Wang, Jiaqi, et al.
Published: (2025)
by: Wang, Jiaqi, et al.
Published: (2025)
Similar Items
-
e-SimFT: Alignment of Generative Models with Simulation Feedback for Pareto-Front Design Exploration
by: Cheong, Hyunmin, et al.
Published: (2025) -
CadVLM: Bridging Language and Vision in the Generation of Parametric CAD Sketches
by: Wu, Sifan, et al.
Published: (2024) -
VSF-Med:A Vulnerability Scoring Framework for Medical Vision-Language Models
by: Sadanandan, Binesh, et al.
Published: (2025) -
Deep Generative Model for Mechanical System Configuration Design
by: Etesam, Yasaman, et al.
Published: (2024) -
Reward Design for Physical Reasoning in Vision-Language Models
by: Lilienthal, Derek, et al.
Published: (2026)