PhyBlock: A Progressive Benchmark for Physical Understanding and Planning via 3D Block Assembly
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ma, Liang, Wen, Jiajun, Lin, Min, Xu, Rongtao, Liang, Xiwen, Lin, Bingqian, Ma, Jun, Wang, Yongxin, Wei, Ziming, Lin, Haokun, Han, Mingfei, Cao, Meng, Chen, Bokui, Laptev, Ivan, Liang, Xiaodan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Structured Preference Optimization for Vision-Language Long-Horizon Task Planning
par: Liang, Xiwen, et autres
Publié: (2025)
par: Liang, Xiwen, et autres
Publié: (2025)
EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation
par: Wang, Yongxin, et autres
Publié: (2024)
par: Wang, Yongxin, et autres
Publié: (2024)
MineAnyBuild: Benchmarking Spatial Planning for Open-world AI Agents
par: Wei, Ziming, et autres
Publié: (2025)
par: Wei, Ziming, et autres
Publié: (2025)
EvolveNav: Empowering LLM-Based Vision-Language Navigation via Self-Improving Embodied Reasoning
par: Lin, Bingqian, et autres
Publié: (2025)
par: Lin, Bingqian, et autres
Publié: (2025)
CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning
par: Wang, Yongxin, et autres
Publié: (2025)
par: Wang, Yongxin, et autres
Publié: (2025)
Actional Atomic-Concept Learning for Demystifying Vision-Language Navigation
par: Lin, Bingqian, et autres
Publié: (2023)
par: Lin, Bingqian, et autres
Publié: (2023)
Affordances-Oriented Planning using Foundation Models for Continuous Vision-Language Navigation
par: Chen, Jiaqi, et autres
Publié: (2024)
par: Chen, Jiaqi, et autres
Publié: (2024)
Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
par: Wei, Ziming, et autres
Publié: (2025)
par: Wei, Ziming, et autres
Publié: (2025)
RoomTour3D: Geometry-Aware Video-Instruction Tuning for Embodied Navigation
par: Han, Mingfei, et autres
Publié: (2024)
par: Han, Mingfei, et autres
Publié: (2024)
ActionSink: Toward Precise Robot Manipulation with Dynamic Integration of Action Flow
par: Guo, Shanshan, et autres
Publié: (2025)
par: Guo, Shanshan, et autres
Publié: (2025)
CorNav: Autonomous Agent with Self-Corrected Planning for Zero-Shot Vision-and-Language Navigation
par: Liang, Xiwen, et autres
Publié: (2023)
par: Liang, Xiwen, et autres
Publié: (2023)
Implicit Geometry Representations for Vision-and-Language Navigation from Web Videos
par: Han, Mingfei, et autres
Publié: (2026)
par: Han, Mingfei, et autres
Publié: (2026)
Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling
par: Cao, Meng, et autres
Publié: (2025)
par: Cao, Meng, et autres
Publié: (2025)
GLaD: Geometric Latent Distillation for Vision-Language-Action Models
par: Guo, Minghao, et autres
Publié: (2025)
par: Guo, Minghao, et autres
Publié: (2025)
Correctable Landmark Discovery via Large Models for Vision-Language Navigation
par: Lin, Bingqian, et autres
Publié: (2024)
par: Lin, Bingqian, et autres
Publié: (2024)
RoBridge: A Hierarchical Architecture Bridging Cognition and Execution for General Robotic Manipulation
par: Zhang, Kaidong, et autres
Publié: (2025)
par: Zhang, Kaidong, et autres
Publié: (2025)
PIVOT-R: Primitive-Driven Waypoint-Aware World Model for Robotic Manipulation
par: Zhang, Kaidong, et autres
Publié: (2024)
par: Zhang, Kaidong, et autres
Publié: (2024)
DNA Family: Boosting Weight-Sharing NAS with Block-Wise Supervisions
par: Wang, Guangrun, et autres
Publié: (2024)
par: Wang, Guangrun, et autres
Publié: (2024)
Towards Deviation-Robust Agent Navigation via Perturbation-Aware Contrastive Learning
par: Lin, Bingqian, et autres
Publié: (2024)
par: Lin, Bingqian, et autres
Publié: (2024)
EchoVLA: Synergistic Declarative Memory for VLA-Driven Mobile Manipulation
par: Lin, Min, et autres
Publié: (2025)
par: Lin, Min, et autres
Publié: (2025)
NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning
par: Lin, Bingqian, et autres
Publié: (2024)
par: Lin, Bingqian, et autres
Publié: (2024)
Controllable Self‐Assembly Morphologies of PPV‐Based Block Copolymers
par: Liang Han, et autres
Publié: (2025)
par: Liang Han, et autres
Publié: (2025)
RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models
par: Liufu, Weijia, et autres
Publié: (2026)
par: Liufu, Weijia, et autres
Publié: (2026)
MapGPT: Map-Guided Prompting with Adaptive Path Planning for Vision-and-Language Navigation
par: Chen, Jiaqi, et autres
Publié: (2024)
par: Chen, Jiaqi, et autres
Publié: (2024)
RADAR: Revealing Asymmetric Development of Abilities in MLLM Pre-training
par: Nie, Yunshuang, et autres
Publié: (2026)
par: Nie, Yunshuang, et autres
Publié: (2026)
Programmable In‐Situ Co‐Assembly of Organic Multi‐Block Nanowires for Cascade Optical Waveguides
par: Shuai Zhao, et autres
Publié: (2024)
par: Shuai Zhao, et autres
Publié: (2024)
Contrastive Learning with Counterfactual Explanations for Radiology Report Generation
par: Li, Mingjie, et autres
Publié: (2024)
par: Li, Mingjie, et autres
Publié: (2024)
ProPhy: Progressive Physical Alignment for Dynamic World Simulation
par: Wang, Zijun, et autres
Publié: (2025)
par: Wang, Zijun, et autres
Publié: (2025)
Mechanical Properties and In Vitro Degradation Study of Modified‐Polylactic Acid Block Copolymers/Polyetheretherketone Biocomposites
par: Meng Shi, et autres
Publié: (2024)
par: Meng Shi, et autres
Publié: (2024)
Design of Sprint Mechanical Auxiliary Starting Block Based on the Dynamic Simulation of Energy‐Release Efficiency
par: Liang Liang
Publié: (2025)
par: Liang Liang
Publié: (2025)
Efficient Training of Large Vision Models via Advanced Automated Progressive Learning
par: Li, Changlin, et autres
Publié: (2024)
par: Li, Changlin, et autres
Publié: (2024)
World2Act: Latent Action Post-Training from World Model Dynamics
par: Vuong, An Dinh, et autres
Publié: (2026)
par: Vuong, An Dinh, et autres
Publié: (2026)
Temporal Action Detection Model Compression by Progressive Block Drop
par: Chen, Xiaoyong, et autres
Publié: (2025)
par: Chen, Xiaoyong, et autres
Publié: (2025)
Block-Weighted Lasso for Joint Optimization of Memory Depth and Kernels in Wideband DPD
par: Wang, Jinfei, et autres
Publié: (2025)
par: Wang, Jinfei, et autres
Publié: (2025)
Choose What to Observe: Task-Aware Semantic-Geometric Representations for Visuomotor Policy
par: Ding, Haoran, et autres
Publié: (2026)
par: Ding, Haoran, et autres
Publié: (2026)
Rainbow Photonic Crystals: Self‐Assembly of Carbohydrate Bottlebrushes Block Copolymers
par: Hong Li, et autres
Publié: (2025)
par: Hong Li, et autres
Publié: (2025)
Confined Monopoles in Chiral Bag
par: Lin, Fan, et autres
Publié: (2025)
par: Lin, Fan, et autres
Publié: (2025)
Baryons as Vortexes on the $η^{\prime}$ Domain Wall
par: Lin, Fan, et autres
Publié: (2023)
par: Lin, Fan, et autres
Publié: (2023)
Baryon Construction with $η^\prime$ Meson Field
par: Lin, Fan, et autres
Publié: (2025)
par: Lin, Fan, et autres
Publié: (2025)
Deep Variable-Block Chain with Adaptive Variable Selection
par: Zhang, Lixiang, et autres
Publié: (2019)
par: Zhang, Lixiang, et autres
Publié: (2019)
Documents similaires
-
Structured Preference Optimization for Vision-Language Long-Horizon Task Planning
par: Liang, Xiwen, et autres
Publié: (2025) -
EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation
par: Wang, Yongxin, et autres
Publié: (2024) -
MineAnyBuild: Benchmarking Spatial Planning for Open-world AI Agents
par: Wei, Ziming, et autres
Publié: (2025) -
EvolveNav: Empowering LLM-Based Vision-Language Navigation via Self-Improving Embodied Reasoning
par: Lin, Bingqian, et autres
Publié: (2025) -
CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning
par: Wang, Yongxin, et autres
Publié: (2025)