ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Wei, Liu, Jizhihui, Yixing, Li, Tong, Junwen, Shao, Rui, Nie, Liqiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SemanticVLA: Semantic-Aligned Sparsification and Enhancement for Efficient Robotic Manipulation
por: Li, Wei, et al.
Publicado: (2025)
por: Li, Wei, et al.
Publicado: (2025)
ST-VLA: Enabling 4D-Aware Spatiotemporal Understanding for General Robot Manipulation
por: Wu, You, et al.
Publicado: (2026)
por: Wu, You, et al.
Publicado: (2026)
AnchorVLA4D: an Anchor-Based Spatial-Temporal Vision-Language-Action Model for Robotic Manipulation
por: Zhu, Juan, et al.
Publicado: (2026)
por: Zhu, Juan, et al.
Publicado: (2026)
ActiveVLA: Injecting Active Perception into Vision-Language-Action Models for Precise 3D Robotic Manipulation
por: Liu, Zhenyang, et al.
Publicado: (2026)
por: Liu, Zhenyang, et al.
Publicado: (2026)
CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification
por: Li, Wei, et al.
Publicado: (2025)
por: Li, Wei, et al.
Publicado: (2025)
Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation
por: Li, Zaijing, et al.
Publicado: (2026)
por: Li, Zaijing, et al.
Publicado: (2026)
H-GAR: A Hierarchical Interaction Framework via Goal-Driven Observation-Action Refinement for Robotic Manipulation
por: Zhu, Yijie, et al.
Publicado: (2025)
por: Zhu, Yijie, et al.
Publicado: (2025)
SimVLA: A Simple VLA Baseline for Robotic Manipulation
por: Luo, Yuankai, et al.
Publicado: (2026)
por: Luo, Yuankai, et al.
Publicado: (2026)
IntentionVLA: Generalizable and Efficient Embodied Intention Reasoning for Human-Robot Interaction
por: Chen, Yandu, et al.
Publicado: (2025)
por: Chen, Yandu, et al.
Publicado: (2025)
RoboMP$^2$: A Robotic Multimodal Perception-Planning Framework with Multimodal Large Language Models
por: Lv, Qi, et al.
Publicado: (2024)
por: Lv, Qi, et al.
Publicado: (2024)
Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey
por: Shao, Rui, et al.
Publicado: (2025)
por: Shao, Rui, et al.
Publicado: (2025)
GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions
por: Huang, Helong, et al.
Publicado: (2025)
por: Huang, Helong, et al.
Publicado: (2025)
Audio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic Manipulation
por: Wei, Xiangyi, et al.
Publicado: (2025)
por: Wei, Xiangyi, et al.
Publicado: (2025)
BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models
por: Li, Peiyan, et al.
Publicado: (2025)
por: Li, Peiyan, et al.
Publicado: (2025)
No Need for Real 3D: Fusing 2D Vision with Pseudo 3D Representations for Robotic Manipulation Learning
por: Yu, Run, et al.
Publicado: (2025)
por: Yu, Run, et al.
Publicado: (2025)
Spatial-Temporal Graph Diffusion Policy with Kinematic Modeling for Bimanual Robotic Manipulation
por: Lv, Qi, et al.
Publicado: (2025)
por: Lv, Qi, et al.
Publicado: (2025)
PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation
por: Li, Yutai, et al.
Publicado: (2026)
por: Li, Yutai, et al.
Publicado: (2026)
Kinematics-Aware Diffusion Policy with Consistent 3D Observation and Action Space for Whole-Arm Robotic Manipulation
por: Lv, Kangchen, et al.
Publicado: (2025)
por: Lv, Kangchen, et al.
Publicado: (2025)
DySL-VLA: Efficient Vision-Language-Action Model Inference via Dynamic-Static Layer-Skipping for Robot Manipulation
por: Yang, Zebin, et al.
Publicado: (2026)
por: Yang, Zebin, et al.
Publicado: (2026)
GazeVLA: Learning Human Intention for Robotic Manipulation
por: Li, Chengyang, et al.
Publicado: (2026)
por: Li, Chengyang, et al.
Publicado: (2026)
Adaptive Robot Perception in Construction Environments using 4D BIM
por: Amani, Mani, et al.
Publicado: (2024)
por: Amani, Mani, et al.
Publicado: (2024)
Learning Surgical Robotic Manipulation with 3D Spatial Priors
por: Sheng, Yu, et al.
Publicado: (2026)
por: Sheng, Yu, et al.
Publicado: (2026)
OmniVLA: Physically-Grounded Multimodal VLA with Unified Multi-Sensor Perception for Robotic Manipulation
por: Guo, Heyu, et al.
Publicado: (2025)
por: Guo, Heyu, et al.
Publicado: (2025)
ManualVLA: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation
por: Gu, Chenyang, et al.
Publicado: (2025)
por: Gu, Chenyang, et al.
Publicado: (2025)
GAF: Gaussian Action Field as a 4D Representation for Dynamic World Modeling in Robotic Manipulation
por: Chai, Ying, et al.
Publicado: (2025)
por: Chai, Ying, et al.
Publicado: (2025)
Geometry-aware 4D Video Generation for Robot Manipulation
por: Liu, Zeyi, et al.
Publicado: (2025)
por: Liu, Zeyi, et al.
Publicado: (2025)
Real-time Monocular 2D and 3D Perception of Endoluminal Scenes for Controlling Flexible Robotic Endoscopic Instruments
por: Wei, Ruofeng, et al.
Publicado: (2026)
por: Wei, Ruofeng, et al.
Publicado: (2026)
Subsecond 3D Mesh Generation for Robot Manipulation
por: Wang, Qian, et al.
Publicado: (2025)
por: Wang, Qian, et al.
Publicado: (2025)
3D Affordance Keypoint Detection for Robotic Manipulation
por: Liu, Zhiyang, et al.
Publicado: (2025)
por: Liu, Zhiyang, et al.
Publicado: (2025)
TGM-VLA: Task-Guided Mixup for Sampling-Efficient and Robust Robotic Manipulation
por: Pu, Fanqi, et al.
Publicado: (2026)
por: Pu, Fanqi, et al.
Publicado: (2026)
3D Dynamics-Aware Manipulation: Endowing Manipulation Policies with 3D Foresight
por: He, Yuxin, et al.
Publicado: (2025)
por: He, Yuxin, et al.
Publicado: (2025)
Memory-Efficient 2D/3D Shape Assembly of Robot Swarms
por: Yue, Shuoyu, et al.
Publicado: (2025)
por: Yue, Shuoyu, et al.
Publicado: (2025)
GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation
por: Qian, Jingjing, et al.
Publicado: (2025)
por: Qian, Jingjing, et al.
Publicado: (2025)
OmniDP: Beyond-FOV Large-Workspace Humanoid Manipulation with Omnidirectional 3D Perception
por: Qu, Pei, et al.
Publicado: (2026)
por: Qu, Pei, et al.
Publicado: (2026)
Generalizable Coarse-to-Fine Robot Manipulation via Language-Aligned 3D Keypoints
por: Hu, Jianshu, et al.
Publicado: (2025)
por: Hu, Jianshu, et al.
Publicado: (2025)
EFEAR-4D: Ego-Velocity Filtering for Efficient and Accurate 4D radar Odometry
por: Wu, Xiaoyi, et al.
Publicado: (2024)
por: Wu, Xiaoyi, et al.
Publicado: (2024)
STAR: Learning Diverse Robot Skill Abstractions through Rotation-Augmented Vector Quantization
por: Li, Hao, et al.
Publicado: (2025)
por: Li, Hao, et al.
Publicado: (2025)
Robot Tape Manipulation for 3D Printing
por: Tushar, Nahid, et al.
Publicado: (2024)
por: Tushar, Nahid, et al.
Publicado: (2024)
Cortical Policy: A Dual-Stream View Transformer for Robotic Manipulation
por: Zhang, Xuening, et al.
Publicado: (2026)
por: Zhang, Xuening, et al.
Publicado: (2026)
VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation
por: Zhang, Haochen, et al.
Publicado: (2024)
por: Zhang, Haochen, et al.
Publicado: (2024)
Ejemplares similares
-
SemanticVLA: Semantic-Aligned Sparsification and Enhancement for Efficient Robotic Manipulation
por: Li, Wei, et al.
Publicado: (2025) -
ST-VLA: Enabling 4D-Aware Spatiotemporal Understanding for General Robot Manipulation
por: Wu, You, et al.
Publicado: (2026) -
AnchorVLA4D: an Anchor-Based Spatial-Temporal Vision-Language-Action Model for Robotic Manipulation
por: Zhu, Juan, et al.
Publicado: (2026) -
ActiveVLA: Injecting Active Perception into Vision-Language-Action Models for Precise 3D Robotic Manipulation
por: Liu, Zhenyang, et al.
Publicado: (2026) -
CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification
por: Li, Wei, et al.
Publicado: (2025)