PhyBlock: A Progressive Benchmark for Physical Understanding and Planning via 3D Block Assembly
Fuente:
arXiv
Saved in:
| Main Authors: | Ma, Liang, Wen, Jiajun, Lin, Min, Xu, Rongtao, Liang, Xiwen, Lin, Bingqian, Ma, Jun, Wang, Yongxin, Wei, Ziming, Lin, Haokun, Han, Mingfei, Cao, Meng, Chen, Bokui, Laptev, Ivan, Liang, Xiaodan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Structured Preference Optimization for Vision-Language Long-Horizon Task Planning
by: Liang, Xiwen, et al.
Published: (2025)
by: Liang, Xiwen, et al.
Published: (2025)
EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation
by: Wang, Yongxin, et al.
Published: (2024)
by: Wang, Yongxin, et al.
Published: (2024)
MineAnyBuild: Benchmarking Spatial Planning for Open-world AI Agents
by: Wei, Ziming, et al.
Published: (2025)
by: Wei, Ziming, et al.
Published: (2025)
EvolveNav: Empowering LLM-Based Vision-Language Navigation via Self-Improving Embodied Reasoning
by: Lin, Bingqian, et al.
Published: (2025)
by: Lin, Bingqian, et al.
Published: (2025)
CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning
by: Wang, Yongxin, et al.
Published: (2025)
by: Wang, Yongxin, et al.
Published: (2025)
Actional Atomic-Concept Learning for Demystifying Vision-Language Navigation
by: Lin, Bingqian, et al.
Published: (2023)
by: Lin, Bingqian, et al.
Published: (2023)
Affordances-Oriented Planning using Foundation Models for Continuous Vision-Language Navigation
by: Chen, Jiaqi, et al.
Published: (2024)
by: Chen, Jiaqi, et al.
Published: (2024)
Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
by: Wei, Ziming, et al.
Published: (2025)
by: Wei, Ziming, et al.
Published: (2025)
RoomTour3D: Geometry-Aware Video-Instruction Tuning for Embodied Navigation
by: Han, Mingfei, et al.
Published: (2024)
by: Han, Mingfei, et al.
Published: (2024)
ActionSink: Toward Precise Robot Manipulation with Dynamic Integration of Action Flow
by: Guo, Shanshan, et al.
Published: (2025)
by: Guo, Shanshan, et al.
Published: (2025)
CorNav: Autonomous Agent with Self-Corrected Planning for Zero-Shot Vision-and-Language Navigation
by: Liang, Xiwen, et al.
Published: (2023)
by: Liang, Xiwen, et al.
Published: (2023)
Implicit Geometry Representations for Vision-and-Language Navigation from Web Videos
by: Han, Mingfei, et al.
Published: (2026)
by: Han, Mingfei, et al.
Published: (2026)
Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling
by: Cao, Meng, et al.
Published: (2025)
by: Cao, Meng, et al.
Published: (2025)
GLaD: Geometric Latent Distillation for Vision-Language-Action Models
by: Guo, Minghao, et al.
Published: (2025)
by: Guo, Minghao, et al.
Published: (2025)
Correctable Landmark Discovery via Large Models for Vision-Language Navigation
by: Lin, Bingqian, et al.
Published: (2024)
by: Lin, Bingqian, et al.
Published: (2024)
RoBridge: A Hierarchical Architecture Bridging Cognition and Execution for General Robotic Manipulation
by: Zhang, Kaidong, et al.
Published: (2025)
by: Zhang, Kaidong, et al.
Published: (2025)
PIVOT-R: Primitive-Driven Waypoint-Aware World Model for Robotic Manipulation
by: Zhang, Kaidong, et al.
Published: (2024)
by: Zhang, Kaidong, et al.
Published: (2024)
DNA Family: Boosting Weight-Sharing NAS with Block-Wise Supervisions
by: Wang, Guangrun, et al.
Published: (2024)
by: Wang, Guangrun, et al.
Published: (2024)
Towards Deviation-Robust Agent Navigation via Perturbation-Aware Contrastive Learning
by: Lin, Bingqian, et al.
Published: (2024)
by: Lin, Bingqian, et al.
Published: (2024)
EchoVLA: Synergistic Declarative Memory for VLA-Driven Mobile Manipulation
by: Lin, Min, et al.
Published: (2025)
by: Lin, Min, et al.
Published: (2025)
NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning
by: Lin, Bingqian, et al.
Published: (2024)
by: Lin, Bingqian, et al.
Published: (2024)
Controllable Self‐Assembly Morphologies of PPV‐Based Block Copolymers
by: Liang Han, et al.
Published: (2025)
by: Liang Han, et al.
Published: (2025)
RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models
by: Liufu, Weijia, et al.
Published: (2026)
by: Liufu, Weijia, et al.
Published: (2026)
MapGPT: Map-Guided Prompting with Adaptive Path Planning for Vision-and-Language Navigation
by: Chen, Jiaqi, et al.
Published: (2024)
by: Chen, Jiaqi, et al.
Published: (2024)
RADAR: Revealing Asymmetric Development of Abilities in MLLM Pre-training
by: Nie, Yunshuang, et al.
Published: (2026)
by: Nie, Yunshuang, et al.
Published: (2026)
Programmable In‐Situ Co‐Assembly of Organic Multi‐Block Nanowires for Cascade Optical Waveguides
by: Shuai Zhao, et al.
Published: (2024)
by: Shuai Zhao, et al.
Published: (2024)
Contrastive Learning with Counterfactual Explanations for Radiology Report Generation
by: Li, Mingjie, et al.
Published: (2024)
by: Li, Mingjie, et al.
Published: (2024)
ProPhy: Progressive Physical Alignment for Dynamic World Simulation
by: Wang, Zijun, et al.
Published: (2025)
by: Wang, Zijun, et al.
Published: (2025)
Mechanical Properties and In Vitro Degradation Study of Modified‐Polylactic Acid Block Copolymers/Polyetheretherketone Biocomposites
by: Meng Shi, et al.
Published: (2024)
by: Meng Shi, et al.
Published: (2024)
Design of Sprint Mechanical Auxiliary Starting Block Based on the Dynamic Simulation of Energy‐Release Efficiency
by: Liang Liang
Published: (2025)
by: Liang Liang
Published: (2025)
Efficient Training of Large Vision Models via Advanced Automated Progressive Learning
by: Li, Changlin, et al.
Published: (2024)
by: Li, Changlin, et al.
Published: (2024)
World2Act: Latent Action Post-Training from World Model Dynamics
by: Vuong, An Dinh, et al.
Published: (2026)
by: Vuong, An Dinh, et al.
Published: (2026)
Temporal Action Detection Model Compression by Progressive Block Drop
by: Chen, Xiaoyong, et al.
Published: (2025)
by: Chen, Xiaoyong, et al.
Published: (2025)
Block-Weighted Lasso for Joint Optimization of Memory Depth and Kernels in Wideband DPD
by: Wang, Jinfei, et al.
Published: (2025)
by: Wang, Jinfei, et al.
Published: (2025)
Choose What to Observe: Task-Aware Semantic-Geometric Representations for Visuomotor Policy
by: Ding, Haoran, et al.
Published: (2026)
by: Ding, Haoran, et al.
Published: (2026)
Rainbow Photonic Crystals: Self‐Assembly of Carbohydrate Bottlebrushes Block Copolymers
by: Hong Li, et al.
Published: (2025)
by: Hong Li, et al.
Published: (2025)
Confined Monopoles in Chiral Bag
by: Lin, Fan, et al.
Published: (2025)
by: Lin, Fan, et al.
Published: (2025)
Baryons as Vortexes on the $η^{\prime}$ Domain Wall
by: Lin, Fan, et al.
Published: (2023)
by: Lin, Fan, et al.
Published: (2023)
Baryon Construction with $η^\prime$ Meson Field
by: Lin, Fan, et al.
Published: (2025)
by: Lin, Fan, et al.
Published: (2025)
Deep Variable-Block Chain with Adaptive Variable Selection
by: Zhang, Lixiang, et al.
Published: (2019)
by: Zhang, Lixiang, et al.
Published: (2019)
Similar Items
-
Structured Preference Optimization for Vision-Language Long-Horizon Task Planning
by: Liang, Xiwen, et al.
Published: (2025) -
EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation
by: Wang, Yongxin, et al.
Published: (2024) -
MineAnyBuild: Benchmarking Spatial Planning for Open-world AI Agents
by: Wei, Ziming, et al.
Published: (2025) -
EvolveNav: Empowering LLM-Based Vision-Language Navigation via Self-Improving Embodied Reasoning
by: Lin, Bingqian, et al.
Published: (2025) -
CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning
by: Wang, Yongxin, et al.
Published: (2025)