Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation
Fuente:
arXiv
Guardado en:
| Autores principales: | Tan, Huajie, Co, Peterson, Xu, Yijie, Rong, Shanyu, Ji, Yuheng, Chi, Cheng, Chen, Xiansheng, Zhang, Qiongyu, Zhao, Zhongxia, Wang, Pengwei, Wang, Zhongyuan, Zhang, Shanghang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Robo-Dopamine: General Process Reward Modeling for High-Precision Robotic Manipulation
por: Tan, Huajie, et al.
Publicado: (2025)
por: Tan, Huajie, et al.
Publicado: (2025)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
por: Tan, Huajie, et al.
Publicado: (2025)
por: Tan, Huajie, et al.
Publicado: (2025)
SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics
por: Liu, Mengzhen, et al.
Publicado: (2026)
por: Liu, Mengzhen, et al.
Publicado: (2026)
TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics
por: Han, Yi, et al.
Publicado: (2025)
por: Han, Yi, et al.
Publicado: (2025)
PRM-as-a-Judge: A Dense Evaluation Paradigm for Fine-Grained Robotic Auditing
por: Ji, Yuheng, et al.
Publicado: (2026)
por: Ji, Yuheng, et al.
Publicado: (2026)
RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
por: Zhou, Enshen, et al.
Publicado: (2025)
por: Zhou, Enshen, et al.
Publicado: (2025)
RoboTracer: Mastering Spatial Trace with Reasoning in Vision-Language Models for Robotics
por: Zhou, Enshen, et al.
Publicado: (2025)
por: Zhou, Enshen, et al.
Publicado: (2025)
MathSticks: A Benchmark for Visual Symbolic Compositional Reasoning with Matchstick Puzzles
por: Ji, Yuheng, et al.
Publicado: (2025)
por: Ji, Yuheng, et al.
Publicado: (2025)
OmniSAT: Compact Action Token, Faster Auto Regression
por: Lyu, Huaihai, et al.
Publicado: (2025)
por: Lyu, Huaihai, et al.
Publicado: (2025)
DeepSketcher: Internalizing Visual Manipulation for Multimodal Reasoning
por: Zhang, Chi, et al.
Publicado: (2025)
por: Zhang, Chi, et al.
Publicado: (2025)
Reshaping Action Error Distributions for Reliable Vision-Language-Action Models
por: Bai, Shuanghao, et al.
Publicado: (2026)
por: Bai, Shuanghao, et al.
Publicado: (2026)
Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models
por: Bai, Shuanghao, et al.
Publicado: (2026)
por: Bai, Shuanghao, et al.
Publicado: (2026)
RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete
por: Ji, Yuheng, et al.
Publicado: (2025)
por: Ji, Yuheng, et al.
Publicado: (2025)
RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation
por: Liu, Jiaming, et al.
Publicado: (2024)
por: Liu, Jiaming, et al.
Publicado: (2024)
METIS: Multi-Source Egocentric Training for Integrated Dexterous Vision-Language-Action Model
por: Fu, Yankai, et al.
Publicado: (2025)
por: Fu, Yankai, et al.
Publicado: (2025)
LoLA: Long Horizon Latent Action Learning for General Robot Manipulation
por: Wang, Xiaofan, et al.
Publicado: (2025)
por: Wang, Xiaofan, et al.
Publicado: (2025)
Learning Long-Horizon Robot Manipulation Skills via Privileged Action
por: Mao, Xiaofeng, et al.
Publicado: (2025)
por: Mao, Xiaofeng, et al.
Publicado: (2025)
RoboBrain 2.5: Depth in Sight, Time in Mind
por: Tan, Huajie, et al.
Publicado: (2026)
por: Tan, Huajie, et al.
Publicado: (2026)
ManipDreamer: Boosting Robotic Manipulation World Model with Action Tree and Visual Guidance
por: Li, Ying, et al.
Publicado: (2025)
por: Li, Ying, et al.
Publicado: (2025)
Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation
por: Fan, Yiguo, et al.
Publicado: (2025)
por: Fan, Yiguo, et al.
Publicado: (2025)
AffordGrasp: In-Context Affordance Reasoning for Open-Vocabulary Task-Oriented Grasping in Clutter
por: Tang, Yingbo, et al.
Publicado: (2025)
por: Tang, Yingbo, et al.
Publicado: (2025)
RoboOS-NeXT: A Unified Memory-based Framework for Lifelong, Scalable, and Robust Multi-Robot Collaboration
por: Tan, Huajie, et al.
Publicado: (2025)
por: Tan, Huajie, et al.
Publicado: (2025)
DiffSketcher: Text Guided Vector Sketch Synthesis through Latent Diffusion Models
por: Xing, Ximing, et al.
Publicado: (2023)
por: Xing, Ximing, et al.
Publicado: (2023)
Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation
por: Jia, Yueru, et al.
Publicado: (2024)
por: Jia, Yueru, et al.
Publicado: (2024)
Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation
por: Liu, Jinkun, et al.
Publicado: (2026)
por: Liu, Jinkun, et al.
Publicado: (2026)
VLATest: Testing and Evaluating Vision-Language-Action Models for Robotic Manipulation
por: Wang, Zhijie, et al.
Publicado: (2024)
por: Wang, Zhijie, et al.
Publicado: (2024)
MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation
por: Zhang, Rongyu, et al.
Publicado: (2025)
por: Zhang, Rongyu, et al.
Publicado: (2025)
Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
por: Hu, Yuxuan, et al.
Publicado: (2026)
por: Hu, Yuxuan, et al.
Publicado: (2026)
Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation
por: Pei, Xiaohuan, et al.
Publicado: (2025)
por: Pei, Xiaohuan, et al.
Publicado: (2025)
Toward Accurate Long-Horizon Robotic Manipulation: Language-to-Action with Foundation Models via Scene Graphs
por: Dinesh, Sushil Samuel, et al.
Publicado: (2025)
por: Dinesh, Sushil Samuel, et al.
Publicado: (2025)
BagelVLA: Enhancing Long-Horizon Manipulation via Interleaved Vision-Language-Action Generation
por: Hu, Yucheng, et al.
Publicado: (2026)
por: Hu, Yucheng, et al.
Publicado: (2026)
From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation
por: Li, Yajie, et al.
Publicado: (2026)
por: Li, Yajie, et al.
Publicado: (2026)
Knowledge Authoring with Factual English, Rules, and Actions
por: Wang, Yuheng
Publicado: (2024)
por: Wang, Yuheng
Publicado: (2024)
CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation
por: Li, Xiaoqi, et al.
Publicado: (2025)
por: Li, Xiaoqi, et al.
Publicado: (2025)
VideoSketcher: Video Models Prior Enable Versatile Sequential Sketch Generation
por: Ren, Hui, et al.
Publicado: (2026)
por: Ren, Hui, et al.
Publicado: (2026)
TempoFit: Plug-and-Play Layer-Wise Temporal KV Memory for Long-Horizon Vision-Language-Action Manipulation
por: Sun, Jun, et al.
Publicado: (2026)
por: Sun, Jun, et al.
Publicado: (2026)
VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation
por: Liu, Zhuoyang, et al.
Publicado: (2025)
por: Liu, Zhuoyang, et al.
Publicado: (2025)
LADEV: A Language-Driven Testing and Evaluation Platform for Vision-Language-Action Models in Robotic Manipulation
por: Wang, Zhijie, et al.
Publicado: (2024)
por: Wang, Zhijie, et al.
Publicado: (2024)
PIGEON: VLM-Driven Object Navigation via Points of Interest Selection
por: Peng, Cheng, et al.
Publicado: (2025)
por: Peng, Cheng, et al.
Publicado: (2025)
Ejemplares similares
-
Robo-Dopamine: General Process Reward Modeling for High-Precision Robotic Manipulation
por: Tan, Huajie, et al.
Publicado: (2025) -
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
por: Tan, Huajie, et al.
Publicado: (2025) -
SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics
por: Liu, Mengzhen, et al.
Publicado: (2026) -
TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics
por: Han, Yi, et al.
Publicado: (2025) -
PRM-as-a-Judge: A Dense Evaluation Paradigm for Fine-Grained Robotic Auditing
por: Ji, Yuheng, et al.
Publicado: (2026)