PhysicsMind: Sim and Real Mechanics Benchmarking for Physical Reasoning and Prediction in Foundational VLMs and World Models
Fuente:
arXiv
Saved in:
| Main Authors: | Mak, Chak-Wing, Zhu, Guanyu, Zhang, Boyi, Li, Hongji, Chi, Xiaowei, Zhang, Kevin, Wu, Yichen, He, Yangfan, Fan, Chun-Kai, Lu, Wentao, Ge, Kuangzhi, Fang, Xinyu, He, Hongyang, Lu, Kuan, Xu, Tianxiang, Zhang, Li, Ni, Yongxin, Li, Youhua, Zhang, Shanghang |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Can World Models Benefit VLMs for World Dynamics?
by: Zhang, Kevin, et al.
Published: (2025)
by: Zhang, Kevin, et al.
Published: (2025)
LABSHIELD: A Multimodal Benchmark for Safety-Critical Reasoning and Planning in Scientific Laboratories
by: Sun, Qianpu, et al.
Published: (2026)
by: Sun, Qianpu, et al.
Published: (2026)
MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders
by: Cao, Jiajun, et al.
Published: (2025)
by: Cao, Jiajun, et al.
Published: (2025)
Teach Me How to Denoise: A Universal Framework for Denoising Multi-modal Recommender Systems via Guided Calibration
by: Li, Hongji, et al.
Published: (2025)
by: Li, Hongji, et al.
Published: (2025)
TRiCo: Triadic Game-Theoretic Co-Training for Robust Semi-Supervised Learning
by: He, Hongyang, et al.
Published: (2025)
by: He, Hongyang, et al.
Published: (2025)
RustNeRF: Robust Neural Radiance Field with Low-Quality Images
by: Li, Mengfei, et al.
Published: (2024)
by: Li, Mengfei, et al.
Published: (2024)
Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
by: Chen, Zejian, et al.
Published: (2026)
by: Chen, Zejian, et al.
Published: (2026)
Symplectic Wigner Distribution in the Linear Canonical Transform Domain: Theory and Application
by: He, Yangfan, et al.
Published: (2025)
by: He, Yangfan, et al.
Published: (2025)
MinD: Learning A Dual-System World Model for Real-Time Planning and Implicit Risk Analysis
by: Chi, Xiaowei, et al.
Published: (2025)
by: Chi, Xiaowei, et al.
Published: (2025)
Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs
by: Zhang, Qizhe, et al.
Published: (2024)
by: Zhang, Qizhe, et al.
Published: (2024)
SCBench: A Sports Commentary Benchmark for Video LLMs
by: Ge, Kuangzhi, et al.
Published: (2024)
by: Ge, Kuangzhi, et al.
Published: (2024)
Beyond GSD-as-Token: Continuous Scale Conditioning for Remote Sensing VLMs
by: Zhang, Song, et al.
Published: (2026)
by: Zhang, Song, et al.
Published: (2026)
Cultivating Game Sense for Yourself: Making VLMs Gaming Experts
by: Lu, Wenxuan, et al.
Published: (2025)
by: Lu, Wenxuan, et al.
Published: (2025)
TrajTok: Technical Report for 2025 Waymo Open Sim Agents Challenge
by: Zhang, Zhiyuan, et al.
Published: (2025)
by: Zhang, Zhiyuan, et al.
Published: (2025)
Rational Molecular Design of Aniline‐Based Donor‐Acceptor Conducting Polymers Enhancing Ionic Molecular Interaction for High‐Performance Wearable Bioelectronics
by: Junning Qian, et al.
Published: (2025)
by: Junning Qian, et al.
Published: (2025)
Multidimensional and Multifunctional Laser‐Induced Graphene (LIG) for Point‐of‐Care and Wearable Biosensing, Theranostics, and Bioactive Interfaces Toward Personalized Healthcare and Regenerative Medicine
by: Li Zhang, et al.
Published: (2026)
by: Li Zhang, et al.
Published: (2026)
BEVUDA: Multi-geometric Space Alignments for Domain Adaptive BEV 3D Object Detection
by: Liu, Jiaming, et al.
Published: (2022)
by: Liu, Jiaming, et al.
Published: (2022)
TC-IDM: Grounding Video Generation for Executable Zero-shot Robot Motion
by: Mi, Weishi, et al.
Published: (2026)
by: Mi, Weishi, et al.
Published: (2026)
Proximity QA: Unleashing the Power of Multi-Modal Large Language Models for Spatial Proximity Analysis
by: Li, Jianing, et al.
Published: (2024)
by: Li, Jianing, et al.
Published: (2024)
Video-Bench: Human-Aligned Video Generation Benchmark
by: Han, Hui, et al.
Published: (2025)
by: Han, Hui, et al.
Published: (2025)
Efficient Temporal Consistency in Diffusion-Based Video Editing with Adaptor Modules: A Theoretical Framework
by: Song, Xinyuan, et al.
Published: (2025)
by: Song, Xinyuan, et al.
Published: (2025)
Enhancing Intent Understanding for Ambiguous prompt: A Human-Machine Co-Adaption Strategy
by: He, Yangfan, et al.
Published: (2025)
by: He, Yangfan, et al.
Published: (2025)
Scalable Fine-tuning from Multiple Data Sources: A First-Order Approximation Approach
by: Li, Dongyue, et al.
Published: (2024)
by: Li, Dongyue, et al.
Published: (2024)
Efficient Ensemble for Fine-tuning Language Models on Multiple Datasets
by: Li, Dongyue, et al.
Published: (2025)
by: Li, Dongyue, et al.
Published: (2025)
Concept-as-Tree: A Controllable Synthetic Data Framework Makes Stronger Personalized VLMs
by: An, Ruichuan, et al.
Published: (2025)
by: An, Ruichuan, et al.
Published: (2025)
Angular Graph Fractional Fourier Transform: Theory and Application
by: Zhao, Feiyue, et al.
Published: (2025)
by: Zhao, Feiyue, et al.
Published: (2025)
DWAFM: Dynamic Weighted Graph Structure Embedding Integrated with Attention and Frequency-Domain MLPs for Traffic Forecasting
by: Shi, Sen, et al.
Published: (2026)
by: Shi, Sen, et al.
Published: (2026)
Graph Embedding in the Graph Fractional Fourier Transform Domain
by: Sheng, Changjie, et al.
Published: (2025)
by: Sheng, Changjie, et al.
Published: (2025)
TreeRare: Syntax Tree-Guided Retrieval and Reasoning for Knowledge-Intensive Question Answering
by: Zhang, Boyi, et al.
Published: (2025)
by: Zhang, Boyi, et al.
Published: (2025)
ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better
by: Zhang, Yuan, et al.
Published: (2025)
by: Zhang, Yuan, et al.
Published: (2025)
Distill Any Depth: Distillation Creates a Stronger Monocular Depth Estimator
by: He, Xiankang, et al.
Published: (2025)
by: He, Xiankang, et al.
Published: (2025)
Sensoformer: Robust Sim-to-Real Inference on Variable-Geometry Sensor Sets via Physics-Structured Randomization
by: Jia, Zhe, et al.
Published: (2026)
by: Jia, Zhe, et al.
Published: (2026)
Demo-JEPA: Joint-Embedding Predictive Architecture for One-shot Cross-Embodiment Imitation
by: He, Jingyang, et al.
Published: (2026)
by: He, Jingyang, et al.
Published: (2026)
QuasiSim: Parameterized Quasi-Physical Simulators for Dexterous Manipulations Transfer
by: Liu, Xueyi, et al.
Published: (2024)
by: Liu, Xueyi, et al.
Published: (2024)
Multi-Scenario Highway Lane-Change Intention Prediction: A Physics-Informed AI Framework for Three-Class Classification
by: Shi, Jiazhao, et al.
Published: (2025)
by: Shi, Jiazhao, et al.
Published: (2025)
On the Role of Language Representations in Auto-Bidding: Findings and Implications
by: Zhu, Guanyu, et al.
Published: (2026)
by: Zhu, Guanyu, et al.
Published: (2026)
Generalized Dynamics Generation towards Scannable Physical World Model
by: Li, Yichen, et al.
Published: (2025)
by: Li, Yichen, et al.
Published: (2025)
SimFair: Physics-Guided Fairness-Aware Learning with Simulation Models
by: Wang, Zhihao, et al.
Published: (2024)
by: Wang, Zhihao, et al.
Published: (2024)
MVCL-DAF++: Enhancing Multimodal Intent Recognition via Prototype-Aware Contrastive Alignment and Coarse-to-Fine Dynamic Attention Fusion
by: Huang, Haofeng, et al.
Published: (2025)
by: Huang, Haofeng, et al.
Published: (2025)
SPACENUM: Revisiting Spatial Numerical Understanding in VLMs
by: Zhang, Jianshu, et al.
Published: (2026)
by: Zhang, Jianshu, et al.
Published: (2026)
Similar Items
-
Can World Models Benefit VLMs for World Dynamics?
by: Zhang, Kevin, et al.
Published: (2025) -
LABSHIELD: A Multimodal Benchmark for Safety-Critical Reasoning and Planning in Scientific Laboratories
by: Sun, Qianpu, et al.
Published: (2026) -
MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders
by: Cao, Jiajun, et al.
Published: (2025) -
Teach Me How to Denoise: A Universal Framework for Denoising Multi-modal Recommender Systems via Guided Calibration
by: Li, Hongji, et al.
Published: (2025) -
TRiCo: Triadic Game-Theoretic Co-Training for Robust Semi-Supervised Learning
by: He, Hongyang, et al.
Published: (2025)