ActionSink: Toward Precise Robot Manipulation with Dynamic Integration of Action Flow
Fuente:
arXiv
Salvato in:
| Autori principali: | Guo, Shanshan, Liang, Xiwen, Lin, Junfan, Zhuang, Yuzheng, Lin, Liang, Liang, Xiaodan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RoBridge: A Hierarchical Architecture Bridging Cognition and Execution for General Robotic Manipulation
di: Zhang, Kaidong, et al.
Pubblicazione: (2025)
di: Zhang, Kaidong, et al.
Pubblicazione: (2025)
VidMan: Exploiting Implicit Dynamics from Video Diffusion Model for Effective Robot Manipulation
di: Wen, Youpeng, et al.
Pubblicazione: (2024)
di: Wen, Youpeng, et al.
Pubblicazione: (2024)
Physical Autoregressive Model for Robotic Manipulation without Action Pretraining
di: Song, Zijian, et al.
Pubblicazione: (2025)
di: Song, Zijian, et al.
Pubblicazione: (2025)
Structured Preference Optimization for Vision-Language Long-Horizon Task Planning
di: Liang, Xiwen, et al.
Pubblicazione: (2025)
di: Liang, Xiwen, et al.
Pubblicazione: (2025)
PIVOT-R: Primitive-Driven Waypoint-Aware World Model for Robotic Manipulation
di: Zhang, Kaidong, et al.
Pubblicazione: (2024)
di: Zhang, Kaidong, et al.
Pubblicazione: (2024)
CorNav: Autonomous Agent with Self-Corrected Planning for Zero-Shot Vision-and-Language Navigation
di: Liang, Xiwen, et al.
Pubblicazione: (2023)
di: Liang, Xiwen, et al.
Pubblicazione: (2023)
Towards Weakly Supervised End-to-end Learning for Long-video Action Recognition
di: Zhou, Jiaming, et al.
Pubblicazione: (2023)
di: Zhou, Jiaming, et al.
Pubblicazione: (2023)
LORTSAR: Low-Rank Transformer for Skeleton-based Action Recognition
di: Oraki, Soroush, et al.
Pubblicazione: (2024)
di: Oraki, Soroush, et al.
Pubblicazione: (2024)
World2Act: Latent Action Post-Training from World Model Dynamics
di: Vuong, An Dinh, et al.
Pubblicazione: (2026)
di: Vuong, An Dinh, et al.
Pubblicazione: (2026)
ActionHub: A Large-scale Action Video Description Dataset for Zero-shot Action Recognition
di: Zhou, Jiaming, et al.
Pubblicazione: (2024)
di: Zhou, Jiaming, et al.
Pubblicazione: (2024)
Towards Generalizable Robotic Manipulation in Dynamic Environments
di: Fang, Heng, et al.
Pubblicazione: (2026)
di: Fang, Heng, et al.
Pubblicazione: (2026)
Temporal Action Detection Model Compression by Progressive Block Drop
di: Chen, Xiaoyong, et al.
Pubblicazione: (2025)
di: Chen, Xiaoyong, et al.
Pubblicazione: (2025)
RoboPearls: Editable Video Simulation for Robot Manipulation
di: Tang, Tao, et al.
Pubblicazione: (2025)
di: Tang, Tao, et al.
Pubblicazione: (2025)
Exploring the Limits of Vision-Language-Action Manipulations in Cross-task Generalization
di: Zhou, Jiaming, et al.
Pubblicazione: (2025)
di: Zhou, Jiaming, et al.
Pubblicazione: (2025)
CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
di: Li, Qixiu, et al.
Pubblicazione: (2024)
di: Li, Qixiu, et al.
Pubblicazione: (2024)
From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation
di: Li, Yajie, et al.
Pubblicazione: (2026)
di: Li, Yajie, et al.
Pubblicazione: (2026)
DFM-VLA: Iterative Action Refinement for Robot Manipulation via Discrete Flow Matching
di: Chen, Jiayi, et al.
Pubblicazione: (2026)
di: Chen, Jiayi, et al.
Pubblicazione: (2026)
Actional Atomic-Concept Learning for Demystifying Vision-Language Navigation
di: Lin, Bingqian, et al.
Pubblicazione: (2023)
di: Lin, Bingqian, et al.
Pubblicazione: (2023)
High-fidelity and Lip-synced Talking Face Synthesis via Landmark-based Diffusion Model
di: Zhong, Weizhi, et al.
Pubblicazione: (2024)
di: Zhong, Weizhi, et al.
Pubblicazione: (2024)
Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos
di: Li, Qixiu, et al.
Pubblicazione: (2025)
di: Li, Qixiu, et al.
Pubblicazione: (2025)
Observe Then Act: Asynchronous Active Vision-Action Model for Robotic Manipulation
di: Wang, Guokang, et al.
Pubblicazione: (2024)
di: Wang, Guokang, et al.
Pubblicazione: (2024)
RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation
di: Liu, Jiaming, et al.
Pubblicazione: (2024)
di: Liu, Jiaming, et al.
Pubblicazione: (2024)
Gaze-Regularized Vision-Language-Action Models for Robotic Manipulation
di: Pani, Anupam, et al.
Pubblicazione: (2026)
di: Pani, Anupam, et al.
Pubblicazione: (2026)
Seeing Space and Motion: Enhancing Latent Actions with Geometric and Dynamic Awareness for Vision-Language-Action Models
di: Cai, Zhejia, et al.
Pubblicazione: (2025)
di: Cai, Zhejia, et al.
Pubblicazione: (2025)
Demystifying Action Space Design for Robotic Manipulation Policies
di: Feng, Yuchun, et al.
Pubblicazione: (2026)
di: Feng, Yuchun, et al.
Pubblicazione: (2026)
Precise Action-to-Video Generation Through Visual Action Prompts
di: Wang, Yuang, et al.
Pubblicazione: (2025)
di: Wang, Yuang, et al.
Pubblicazione: (2025)
Towards Deviation-Robust Agent Navigation via Perturbation-Aware Contrastive Learning
di: Lin, Bingqian, et al.
Pubblicazione: (2024)
di: Lin, Bingqian, et al.
Pubblicazione: (2024)
Lane Change Classification and Prediction with Action Recognition Networks
di: Liang, Kai, et al.
Pubblicazione: (2022)
di: Liang, Kai, et al.
Pubblicazione: (2022)
Bootstrap Dynamic-Aware 3D Visual Representation for Scalable Robot Learning
di: Liang, Qiwei, et al.
Pubblicazione: (2025)
di: Liang, Qiwei, et al.
Pubblicazione: (2025)
ALow-Cost Real-Time Framework for Industrial Action Recognition Using Foundation Models
di: Wang, Zhicheng, et al.
Pubblicazione: (2024)
di: Wang, Zhicheng, et al.
Pubblicazione: (2024)
VLA-LPAF: Lightweight Perspective-Adaptive Fusion for Vision-Language-Action to Enable More Unconstrained Robotic Manipulation
di: Bian, Jinyue, et al.
Pubblicazione: (2025)
di: Bian, Jinyue, et al.
Pubblicazione: (2025)
MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
di: Shi, Hao, et al.
Pubblicazione: (2025)
di: Shi, Hao, et al.
Pubblicazione: (2025)
SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics
di: Liu, Mengzhen, et al.
Pubblicazione: (2026)
di: Liu, Mengzhen, et al.
Pubblicazione: (2026)
TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
di: Wen, Junjie, et al.
Pubblicazione: (2024)
di: Wen, Junjie, et al.
Pubblicazione: (2024)
Towards Completeness: A Generalizable Action Proposal Generator for Zero-Shot Temporal Action Localization
di: Du, Jia-Run, et al.
Pubblicazione: (2024)
di: Du, Jia-Run, et al.
Pubblicazione: (2024)
A Renaissance of Explicit Motion Information Mining from Transformers for Action Recognition
di: Zhuang, Peiqin, et al.
Pubblicazione: (2025)
di: Zhuang, Peiqin, et al.
Pubblicazione: (2025)
Mitigating the Human-Robot Domain Discrepancy in Visual Pre-training for Robotic Manipulation
di: Zhou, Jiaming, et al.
Pubblicazione: (2024)
di: Zhou, Jiaming, et al.
Pubblicazione: (2024)
Modular Retrieval-Augmented Generalization for Human Action Recognition
di: Liao, Peng, et al.
Pubblicazione: (2026)
di: Liao, Peng, et al.
Pubblicazione: (2026)
Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming
di: Tong, Baoshun, et al.
Pubblicazione: (2026)
di: Tong, Baoshun, et al.
Pubblicazione: (2026)
A Self-Correcting Vision-Language-Action Model for Fast and Slow System Manipulation
di: Li, Chenxuan, et al.
Pubblicazione: (2024)
di: Li, Chenxuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
RoBridge: A Hierarchical Architecture Bridging Cognition and Execution for General Robotic Manipulation
di: Zhang, Kaidong, et al.
Pubblicazione: (2025) -
VidMan: Exploiting Implicit Dynamics from Video Diffusion Model for Effective Robot Manipulation
di: Wen, Youpeng, et al.
Pubblicazione: (2024) -
Physical Autoregressive Model for Robotic Manipulation without Action Pretraining
di: Song, Zijian, et al.
Pubblicazione: (2025) -
Structured Preference Optimization for Vision-Language Long-Horizon Task Planning
di: Liang, Xiwen, et al.
Pubblicazione: (2025) -
PIVOT-R: Primitive-Driven Waypoint-Aware World Model for Robotic Manipulation
di: Zhang, Kaidong, et al.
Pubblicazione: (2024)