ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation
Fuente:
arXiv
Guardado en:
| Autores principales: | He, Zeyuan, Yang, Bowen, Fang, Zhirui, Zhou, Keru, Jiang, Lei, Qian, Jingjing, Mo, Fan, Yan, Junchi, Torr, Philip, Li, Xiu, Jiang, Li, Yu, Jialin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization
por: Jia, Xiaosong, et al.
Publicado: (2026)
por: Jia, Xiaosong, et al.
Publicado: (2026)
4D Gaussian Splatting: Modeling Dynamic Scenes with Native 4D Primitives
por: Yang, Zeyu, et al.
Publicado: (2024)
por: Yang, Zeyu, et al.
Publicado: (2024)
Decoupled Alignment for Robust Plug-and-Play Adaptation
por: Luo, Haozheng, et al.
Publicado: (2024)
por: Luo, Haozheng, et al.
Publicado: (2024)
PlugSI: Plug-and-Play Test-Time Graph Adaptation for Spatial Interpolation
por: Wu, Xuhang, et al.
Publicado: (2026)
por: Wu, Xuhang, et al.
Publicado: (2026)
Embodiment Transfer Learning for Vision-Language-Action Models
por: Li, Chengmeng, et al.
Publicado: (2025)
por: Li, Chengmeng, et al.
Publicado: (2025)
VLSA: Vision-Language-Action Models with Plug-and-Play Safety Constraint Layer
por: Hu, Songqiao, et al.
Publicado: (2025)
por: Hu, Songqiao, et al.
Publicado: (2025)
3D-Mix for VLA: A Plug-and-Play Module for Integrating VGGT-based 3D Information into Vision-Language-Action Models
por: Yu, Bin, et al.
Publicado: (2026)
por: Yu, Bin, et al.
Publicado: (2026)
Plug-and-Play PDE Optimization for 3D Gaussian Splatting: Toward High-Quality Rendering and Reconstruction
por: Mo, Yifan, et al.
Publicado: (2025)
por: Mo, Yifan, et al.
Publicado: (2025)
RenderOcc: Vision-Centric 3D Occupancy Prediction with 2D Rendering Supervision
por: Pan, Mingjie, et al.
Publicado: (2023)
por: Pan, Mingjie, et al.
Publicado: (2023)
MOTIF: Learning Action Motifs for Few-shot Cross-Embodiment Transfer
por: Zhi, Heng, et al.
Publicado: (2026)
por: Zhi, Heng, et al.
Publicado: (2026)
Semi-Supervised Vision-Centric 3D Occupancy World Model for Autonomous Driving
por: Li, Xiang, et al.
Publicado: (2025)
por: Li, Xiang, et al.
Publicado: (2025)
ESCAPE: Episodic Spatial Memory and Adaptive Execution Policy for Long-Horizon Mobile Manipulation
por: Qian, Jingjing, et al.
Publicado: (2026)
por: Qian, Jingjing, et al.
Publicado: (2026)
GS-Net: Generalizable Plug-and-Play 3D Gaussian Splatting Module
por: Zhang, Yichen, et al.
Publicado: (2024)
por: Zhang, Yichen, et al.
Publicado: (2024)
Plug-and-Play Transformer Modules for Test-Time Adaptation
por: Chang, Xiangyu, et al.
Publicado: (2024)
por: Chang, Xiangyu, et al.
Publicado: (2024)
Safer by Diffusion, Broken by Context: Diffusion LLM's Safety Blessing and Its Failure Mode
por: He, Zeyuan, et al.
Publicado: (2026)
por: He, Zeyuan, et al.
Publicado: (2026)
A Plug-and-Play Physical Motion Restoration Approach for In-the-Wild High-Difficulty Motions
por: Zhang, Youliang, et al.
Publicado: (2024)
por: Zhang, Youliang, et al.
Publicado: (2024)
PlugSelect: Pruning Channels with Plug-and-Play Flexibility for Electroencephalography-based Brain Computer Interface
por: Yuan, Xue, et al.
Publicado: (2025)
por: Yuan, Xue, et al.
Publicado: (2025)
PAT-VCM: Plug-and-Play Auxiliary Tokens for Video Coding for Machines
por: Jiang, Wei, et al.
Publicado: (2026)
por: Jiang, Wei, et al.
Publicado: (2026)
Portal UX Agent -- A Plug-and-Play Engine for Rendering UIs from Natural Language Specifications
por: Li, Xinsong, et al.
Publicado: (2025)
por: Li, Xinsong, et al.
Publicado: (2025)
Numerical Solution for Nonlinear 4D Variational Data Assimilation (4D-Var) via ADMM
por: Li, Bowen, et al.
Publicado: (2024)
por: Li, Bowen, et al.
Publicado: (2024)
A Plug-and-Play Natural Language Rewriter for Natural Language to SQL
por: Ma, Peixian, et al.
Publicado: (2024)
por: Ma, Peixian, et al.
Publicado: (2024)
Toward Embodiment Equivariant Vision-Language-Action Policy
por: Chen, Anzhe, et al.
Publicado: (2025)
por: Chen, Anzhe, et al.
Publicado: (2025)
PADS: Plug-and-Play 3D Human Pose Analysis via Diffusion Generative Modeling
por: Ji, Haorui, et al.
Publicado: (2024)
por: Ji, Haorui, et al.
Publicado: (2024)
Derain-Agent: A Plug-and-Play Agent Framework for Rainy Image Restoration
por: Yu, Zhaocheng, et al.
Publicado: (2026)
por: Yu, Zhaocheng, et al.
Publicado: (2026)
ConsistentFeature: A Plug-and-Play Component for Neural Network Regularization
por: Jiang, RuiZhe, et al.
Publicado: (2024)
por: Jiang, RuiZhe, et al.
Publicado: (2024)
PureKV: Plug-and-Play KV Cache Optimization with Spatial-Temporal Sparse Attention for Vision-Language Large Models
por: Jiang, Zhonghua, et al.
Publicado: (2025)
por: Jiang, Zhonghua, et al.
Publicado: (2025)
X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
por: Zheng, Jinliang, et al.
Publicado: (2025)
por: Zheng, Jinliang, et al.
Publicado: (2025)
TraceDet: Hallucination Detection from the Decoding Trace of Diffusion Large Language Models
por: Chang, Shenxu, et al.
Publicado: (2025)
por: Chang, Shenxu, et al.
Publicado: (2025)
Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation
por: Xue, Bowen, et al.
Publicado: (2025)
por: Xue, Bowen, et al.
Publicado: (2025)
EC-Flow: Enabling Versatile Robotic Manipulation from Action-Unlabeled Videos via Embodiment-Centric Flow
por: Chen, Yixiang, et al.
Publicado: (2025)
por: Chen, Yixiang, et al.
Publicado: (2025)
TDGNet: Hallucination Detection in Diffusion Language Models via Temporal Dynamic Graphs
por: Hemmat, Arshia, et al.
Publicado: (2026)
por: Hemmat, Arshia, et al.
Publicado: (2026)
Plug-and-Play Training Framework for Preference Optimization
por: Ma, Jingyuan, et al.
Publicado: (2024)
por: Ma, Jingyuan, et al.
Publicado: (2024)
Accelerating Cross‐Scenario Metasurface Adaptability with Plug‐and‐Play Kernel
por: Nanxuan Wu, et al.
Publicado: (2025)
por: Nanxuan Wu, et al.
Publicado: (2025)
CLAMP: Majorized Plug-and-Play for Coherent 3D LIDAR Imaging
por: Allen, Tony G., et al.
Publicado: (2024)
por: Allen, Tony G., et al.
Publicado: (2024)
Plug-and-Play Versatile Compressed Video Enhancement
por: Zeng, Huimin, et al.
Publicado: (2025)
por: Zeng, Huimin, et al.
Publicado: (2025)
Last-Layer-Centric Feature Recombination: Unleashing 3D Geometric Knowledge in DINOv3 for Monocular Depth Estimation
por: Wang, Gongshu, et al.
Publicado: (2026)
por: Wang, Gongshu, et al.
Publicado: (2026)
OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision
por: Liu, Ruixun, et al.
Publicado: (2025)
por: Liu, Ruixun, et al.
Publicado: (2025)
Seeing Clearly, Reasoning Confidently: Plug-and-Play Remedies for Vision Language Model Blindness
por: Hu, Xin, et al.
Publicado: (2026)
por: Hu, Xin, et al.
Publicado: (2026)
Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation
por: Li, Hao, et al.
Publicado: (2025)
por: Li, Hao, et al.
Publicado: (2025)
Plug-and-Play regularized 3D seismic inversion with 2D pre-trained denoisers
por: Luiken, Nick, et al.
Publicado: (2024)
por: Luiken, Nick, et al.
Publicado: (2024)
Ejemplares similares
-
GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization
por: Jia, Xiaosong, et al.
Publicado: (2026) -
4D Gaussian Splatting: Modeling Dynamic Scenes with Native 4D Primitives
por: Yang, Zeyu, et al.
Publicado: (2024) -
Decoupled Alignment for Robust Plug-and-Play Adaptation
por: Luo, Haozheng, et al.
Publicado: (2024) -
PlugSI: Plug-and-Play Test-Time Graph Adaptation for Spatial Interpolation
por: Wu, Xuhang, et al.
Publicado: (2026) -
Embodiment Transfer Learning for Vision-Language-Action Models
por: Li, Chengmeng, et al.
Publicado: (2025)