InterACT: Inter-dependency Aware Action Chunking with Hierarchical Attention Transformers for Bimanual Manipulation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lee, Andrew, Chuang, Ian, Chen, Ling-Yuan, Soltani, Iman |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Gaze on the Prize: Shaping Visual Attention with Return-Guided Contrastive Learning
par: Lee, Andrew, et autres
Publié: (2025)
par: Lee, Andrew, et autres
Publié: (2025)
Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers
par: Chuang, Ian, et autres
Publié: (2025)
par: Chuang, Ian, et autres
Publié: (2025)
VITA: Vision-to-Action Flow Matching Policy
par: Gao, Dechen, et autres
Publié: (2025)
par: Gao, Dechen, et autres
Publié: (2025)
Learning Bimanual Manipulation via Action Chunking and Inter-Arm Coordination with Transformers
par: Motoda, Tomohiro, et autres
Publié: (2025)
par: Motoda, Tomohiro, et autres
Publié: (2025)
AnyPos: Automated Task-Agnostic Actions for Bimanual Manipulation
par: Tan, Hengkai, et autres
Publié: (2025)
par: Tan, Hengkai, et autres
Publié: (2025)
VTAO-BiManip: Masked Visual-Tactile-Action Pre-training with Object Understanding for Bimanual Dexterous Manipulation
par: Sun, Zhengnan, et autres
Publié: (2025)
par: Sun, Zhengnan, et autres
Publié: (2025)
PEAfowl: Perception-Enhanced Multi-View Vision-Language-Action for Bimanual Manipulation
par: Fan, Qingyu, et autres
Publié: (2026)
par: Fan, Qingyu, et autres
Publié: (2026)
Low-Cost Infrared Vision Systems for Improved Safety of Emergency Vehicle Operations Under Low-Visibility Conditions
par: Naddaf-Sh, M-Mahdi, et autres
Publié: (2025)
par: Naddaf-Sh, M-Mahdi, et autres
Publié: (2025)
PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction
par: Chen, Shizhe, et autres
Publié: (2026)
par: Chen, Shizhe, et autres
Publié: (2026)
Mixture of Horizons in Action Chunking
par: Jing, Dong, et autres
Publié: (2025)
par: Jing, Dong, et autres
Publié: (2025)
Active Vision Might Be All You Need: Exploring Active Vision in Bimanual Robotic Manipulation
par: Chuang, Ian, et autres
Publié: (2024)
par: Chuang, Ian, et autres
Publié: (2024)
H-RDT: Human Manipulation Enhanced Bimanual Robotic Manipulation
par: Bi, Hongzhe, et autres
Publié: (2025)
par: Bi, Hongzhe, et autres
Publié: (2025)
PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding
par: Song, Wenxuan, et autres
Publié: (2025)
par: Song, Wenxuan, et autres
Publié: (2025)
ManipTrans: Efficient Dexterous Bimanual Manipulation Transfer via Residual Learning
par: Li, Kailin, et autres
Publié: (2025)
par: Li, Kailin, et autres
Publié: (2025)
Structural Action Transformer for 3D Dexterous Manipulation
par: Lei, Xiaohan, et autres
Publié: (2026)
par: Lei, Xiaohan, et autres
Publié: (2026)
DRIFT: Dual-Representation Inter-Fusion Transformer for Automated Driving Perception with 4D Radar Point Clouds
par: Pei, Siqi, et autres
Publié: (2026)
par: Pei, Siqi, et autres
Publié: (2026)
InterMimic: Towards Universal Whole-Body Control for Physics-Based Human-Object Interactions
par: Xu, Sirui, et autres
Publié: (2025)
par: Xu, Sirui, et autres
Publié: (2025)
Large Pre-Trained Models for Bimanual Manipulation in 3D
par: Yurchyk, Hanna, et autres
Publié: (2025)
par: Yurchyk, Hanna, et autres
Publié: (2025)
You Only Teach Once: Learn One-Shot Bimanual Robotic Manipulation from Video Demonstrations
par: Zhou, Huayi, et autres
Publié: (2025)
par: Zhou, Huayi, et autres
Publié: (2025)
SG-Tailor: Inter-Object Commonsense Relationship Reasoning for Scene Graph Manipulation
par: Shang, Haoliang, et autres
Publié: (2025)
par: Shang, Haoliang, et autres
Publié: (2025)
HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation
par: Li, Yi, et autres
Publié: (2025)
par: Li, Yi, et autres
Publié: (2025)
InterKey: Cross-modal Intersection Keypoints for Global Localization on OpenStreetMap
par: Tran, Nguyen Hoang Khoi, et autres
Publié: (2025)
par: Tran, Nguyen Hoang Khoi, et autres
Publié: (2025)
BFA++: Hierarchical Best-Feature-Aware Token Prune for Multi-View Vision Language Action Model
par: Li, Haosheng, et autres
Publié: (2026)
par: Li, Haosheng, et autres
Publié: (2026)
DexMan: Learning Bimanual Dexterous Manipulation from Human and Generated Videos
par: Hsieh, Jhen, et autres
Publié: (2025)
par: Hsieh, Jhen, et autres
Publié: (2025)
Planning-Guided Diffusion Policy Learning for Generalizable Contact-Rich Bimanual Manipulation
par: Li, Xuanlin, et autres
Publié: (2024)
par: Li, Xuanlin, et autres
Publié: (2024)
CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
par: Li, Qixiu, et autres
Publié: (2024)
par: Li, Qixiu, et autres
Publié: (2024)
See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation
par: Dai, Tingjun, et autres
Publié: (2026)
par: Dai, Tingjun, et autres
Publié: (2026)
AgentAlign: Misalignment-Adapted Multi-Agent Perception for Resilient Inter-Agent Sensor Correlations
par: Meng, Zonglin, et autres
Publié: (2024)
par: Meng, Zonglin, et autres
Publié: (2024)
LAD-Drive: Bridging Language and Trajectory with Action-Aware Diffusion Transformers
par: Schmidt, Fabian, et autres
Publié: (2026)
par: Schmidt, Fabian, et autres
Publié: (2026)
InterLoc: LiDAR-based Intersection Localization using Road Segmentation with Automated Evaluation Method
par: Tran, Nguyen Hoang Khoi, et autres
Publié: (2025)
par: Tran, Nguyen Hoang Khoi, et autres
Publié: (2025)
InterPrior: Scaling Generative Control for Physics-Based Human-Object Interactions
par: Xu, Sirui, et autres
Publié: (2026)
par: Xu, Sirui, et autres
Publié: (2026)
Closed-Loop Action Chunks with Dynamic Corrections for Training-Free Diffusion Policy
par: Wu, Pengyuan, et autres
Publié: (2026)
par: Wu, Pengyuan, et autres
Publié: (2026)
RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation
par: Liu, Songming, et autres
Publié: (2024)
par: Liu, Songming, et autres
Publié: (2024)
ACT-Bench: Towards Action Controllable World Models for Autonomous Driving
par: Arai, Hidehisa, et autres
Publié: (2024)
par: Arai, Hidehisa, et autres
Publié: (2024)
BiFold: Bimanual Cloth Folding with Language Guidance
par: Barbany, Oriol, et autres
Publié: (2025)
par: Barbany, Oriol, et autres
Publié: (2025)
From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation
par: Li, Yajie, et autres
Publié: (2026)
par: Li, Yajie, et autres
Publié: (2026)
TreeLoc: 6-DoF LiDAR Global Localization in Forests via Inter-Tree Geometric Matching
par: Jung, Minwoo, et autres
Publié: (2026)
par: Jung, Minwoo, et autres
Publié: (2026)
Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming
par: Tong, Baoshun, et autres
Publié: (2026)
par: Tong, Baoshun, et autres
Publié: (2026)
BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
par: Wang, Hongyu, et autres
Publié: (2025)
par: Wang, Hongyu, et autres
Publié: (2025)
DFM-VLA: Iterative Action Refinement for Robot Manipulation via Discrete Flow Matching
par: Chen, Jiayi, et autres
Publié: (2026)
par: Chen, Jiayi, et autres
Publié: (2026)
Documents similaires
-
Gaze on the Prize: Shaping Visual Attention with Return-Guided Contrastive Learning
par: Lee, Andrew, et autres
Publié: (2025) -
Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers
par: Chuang, Ian, et autres
Publié: (2025) -
VITA: Vision-to-Action Flow Matching Policy
par: Gao, Dechen, et autres
Publié: (2025) -
Learning Bimanual Manipulation via Action Chunking and Inter-Arm Coordination with Transformers
par: Motoda, Tomohiro, et autres
Publié: (2025) -
AnyPos: Automated Task-Agnostic Actions for Bimanual Manipulation
par: Tan, Hengkai, et autres
Publié: (2025)