Aligning Perception, Reasoning, Modeling and Interaction: A Survey on Physical AI
Fuente:
arXiv
Saved in:
| Main Authors: | Xiang, Kun, Zhang, Terry Jingchen, Huang, Yinya, He, Jixi, Liu, Zirong, Tang, Yueling, Zhou, Ruizhe, Luo, Lijing, Wen, Youpeng, Chen, Xiuwei, Lin, Bingqian, Han, Jianhua, Xu, Hang, Li, Hanhui, Dong, Bin, Liang, Xiaodan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SeePhys: Does Seeing Help Thinking? -- Benchmarking Vision-Based Physics Reasoning
by: Xiang, Kun, et al.
Published: (2025)
by: Xiang, Kun, et al.
Published: (2025)
AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning
by: Xiang, Kun, et al.
Published: (2024)
by: Xiang, Kun, et al.
Published: (2024)
SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning
by: Xiang, Kun, et al.
Published: (2026)
by: Xiang, Kun, et al.
Published: (2026)
C2-Evo: Co-Evolving Multimodal Data and Model for Self-Improving Reasoning
by: Chen, Xiuwei, et al.
Published: (2025)
by: Chen, Xiuwei, et al.
Published: (2025)
Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration
by: Yang, Zhicheng, et al.
Published: (2025)
by: Yang, Zhicheng, et al.
Published: (2025)
VidMan: Exploiting Implicit Dynamics from Video Diffusion Model for Effective Robot Manipulation
by: Wen, Youpeng, et al.
Published: (2024)
by: Wen, Youpeng, et al.
Published: (2024)
NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning
by: Lin, Bingqian, et al.
Published: (2024)
by: Lin, Bingqian, et al.
Published: (2024)
RADAR: Revealing Asymmetric Development of Abilities in MLLM Pre-training
by: Nie, Yunshuang, et al.
Published: (2026)
by: Nie, Yunshuang, et al.
Published: (2026)
AlignCap: Aligning Speech Emotion Captioning to Human Preferences
by: Liang, Ziqi, et al.
Published: (2024)
by: Liang, Ziqi, et al.
Published: (2024)
AlignedCoT: Prompting Large Language Models via Native-Speaking Demonstrations
by: Yang, Zhicheng, et al.
Published: (2023)
by: Yang, Zhicheng, et al.
Published: (2023)
3D Visibility-aware Generalizable Neural Radiance Fields for Interacting Hands
by: Huang, Xuan, et al.
Published: (2024)
by: Huang, Xuan, et al.
Published: (2024)
Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI
by: Liu, Yang, et al.
Published: (2024)
by: Liu, Yang, et al.
Published: (2024)
ProPhy: Progressive Physical Alignment for Dynamic World Simulation
by: Wang, Zijun, et al.
Published: (2025)
by: Wang, Zijun, et al.
Published: (2025)
Thinking with Geometry: Active Geometry Integration for Spatial Reasoning
by: Li, Haoyuan, et al.
Published: (2026)
by: Li, Haoyuan, et al.
Published: (2026)
Can Atomic Step Decomposition Enhance the Self-structured Reasoning of Multimodal Large Models?
by: Xiang, Kun, et al.
Published: (2025)
by: Xiang, Kun, et al.
Published: (2025)
SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation
by: Chen, Zisheng, et al.
Published: (2025)
by: Chen, Zisheng, et al.
Published: (2025)
ORMind: A Cognitive-Inspired End-to-End Reasoning Framework for Operations Research
by: Wang, Zhiyuan, et al.
Published: (2025)
by: Wang, Zhiyuan, et al.
Published: (2025)
Educators' Perceptions of Large Language Models as Tutors: Comparing Human and AI Tutors in a Blind Text-only Setting
by: Chowdhury, Sankalan Pal, et al.
Published: (2025)
by: Chowdhury, Sankalan Pal, et al.
Published: (2025)
Lean Meets Theoretical Computer Science: Scalable Synthesis of Theorem Proving Challenges in Formal-Informal Pairs
by: Zhang, Terry Jingchen, et al.
Published: (2025)
by: Zhang, Terry Jingchen, et al.
Published: (2025)
MAVUL: Multi-Agent Vulnerability Detection via Contextual Reasoning and Interactive Refinement
by: Li, Youpeng, et al.
Published: (2025)
by: Li, Youpeng, et al.
Published: (2025)
TransMamba: Fast Universal Architecture Adaption from Transformers to Mamba
by: Chen, Xiuwei, et al.
Published: (2025)
by: Chen, Xiuwei, et al.
Published: (2025)
Accordion-Thinking: Self-Regulated Step Summaries for Efficient and Readable LLM Reasoning
by: Yang, Zhicheng, et al.
Published: (2026)
by: Yang, Zhicheng, et al.
Published: (2026)
Learning Interaction-aware 3D Gaussian Splatting for One-shot Hand Avatars
by: Huang, Xuan, et al.
Published: (2024)
by: Huang, Xuan, et al.
Published: (2024)
FVEL: Interactive Formal Verification Environment with Large Language Models via Theorem Proving
by: Lin, Xiaohan, et al.
Published: (2024)
by: Lin, Xiaohan, et al.
Published: (2024)
Exploring Chinese EFL Teachers' Perceptions of the Potentials and Challenges of Robot‐Assisted Language Learning
by: Hanhui Li, et al.
Published: (2025)
by: Hanhui Li, et al.
Published: (2025)
FormalAlign: Automated Alignment Evaluation for Autoformalization
by: Lu, Jianqiao, et al.
Published: (2024)
by: Lu, Jianqiao, et al.
Published: (2024)
Research and Design of a Grid Based Electronic Commerce Recommendation System
by: Yueling Liang
Published: (2010)
by: Yueling Liang
Published: (2010)
Struct2D: A Perception-Guided Framework for Spatial Reasoning in MLLMs
by: Zhu, Fangrui, et al.
Published: (2025)
by: Zhu, Fangrui, et al.
Published: (2025)
BRIEDGE: EEG-Adaptive Edge AI for Multi-Brain to Multi-Robot Interaction
by: Ouyang, Jinhui, et al.
Published: (2024)
by: Ouyang, Jinhui, et al.
Published: (2024)
Stargazer: A Scalable Model-Fitting Benchmark Environment for AI Agents under Astrophysical Constraints
by: Liu, Xinge, et al.
Published: (2026)
by: Liu, Xinge, et al.
Published: (2026)
Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning
by: Gou, Yunhao, et al.
Published: (2025)
by: Gou, Yunhao, et al.
Published: (2025)
Uncovering Hidden Correctness in LLM Causal Reasoning via Symbolic Verification
by: He, Paul, et al.
Published: (2026)
by: He, Paul, et al.
Published: (2026)
Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
by: Wei, Ziming, et al.
Published: (2025)
by: Wei, Ziming, et al.
Published: (2025)
PIVOT-R: Primitive-Driven Waypoint-Aware World Model for Robotic Manipulation
by: Zhang, Kaidong, et al.
Published: (2024)
by: Zhang, Kaidong, et al.
Published: (2024)
TreeRPO: Tree Relative Policy Optimization
by: Yang, Zhicheng, et al.
Published: (2025)
by: Yang, Zhicheng, et al.
Published: (2025)
AutoStudio: Crafting Consistent Subjects in Multi-turn Interactive Image Generation
by: Cheng, Junhao, et al.
Published: (2024)
by: Cheng, Junhao, et al.
Published: (2024)
A Human-Centric Pipeline for Aligning Large Language Models with Chinese Medical Ethics
by: Jin, Haoan, et al.
Published: (2026)
by: Jin, Haoan, et al.
Published: (2026)
AtomicVLA: Unlocking the Potential of Atomic Skill Learning in Robots
by: Zhang, Likui, et al.
Published: (2026)
by: Zhang, Likui, et al.
Published: (2026)
Actional Atomic-Concept Learning for Demystifying Vision-Language Navigation
by: Lin, Bingqian, et al.
Published: (2023)
by: Lin, Bingqian, et al.
Published: (2023)
Craft: Cross-modal Aligned Features Improve Robustness of Prompt Tuning
by: Sun, Jingchen, et al.
Published: (2024)
by: Sun, Jingchen, et al.
Published: (2024)
Similar Items
-
SeePhys: Does Seeing Help Thinking? -- Benchmarking Vision-Based Physics Reasoning
by: Xiang, Kun, et al.
Published: (2025) -
AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning
by: Xiang, Kun, et al.
Published: (2024) -
SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning
by: Xiang, Kun, et al.
Published: (2026) -
C2-Evo: Co-Evolving Multimodal Data and Model for Self-Improving Reasoning
by: Chen, Xiuwei, et al.
Published: (2025) -
Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration
by: Yang, Zhicheng, et al.
Published: (2025)