METIS: Multi-Source Egocentric Training for Integrated Dexterous Vision-Language-Action Model
Fuente:
arXiv
Guardado en:
| Autores principales: | Fu, Yankai, Chen, Ning, Zhao, Junkai, Shan, Shaozhe, Yao, Guocai, Wang, Pengwei, Wang, Zhongyuan, Zhang, Shanghang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AoE: Always-on Egocentric Human Video Collection for Embodied AI
por: Yang, Bowen, et al.
Publicado: (2026)
por: Yang, Bowen, et al.
Publicado: (2026)
SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics
por: Liu, Mengzhen, et al.
Publicado: (2026)
por: Liu, Mengzhen, et al.
Publicado: (2026)
TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics
por: Han, Yi, et al.
Publicado: (2025)
por: Han, Yi, et al.
Publicado: (2025)
Reshaping Action Error Distributions for Reliable Vision-Language-Action Models
por: Bai, Shuanghao, et al.
Publicado: (2026)
por: Bai, Shuanghao, et al.
Publicado: (2026)
RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
por: Zhou, Enshen, et al.
Publicado: (2025)
por: Zhou, Enshen, et al.
Publicado: (2025)
Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models
por: Bai, Shuanghao, et al.
Publicado: (2026)
por: Bai, Shuanghao, et al.
Publicado: (2026)
RoboTracer: Mastering Spatial Trace with Reasoning in Vision-Language Models for Robotics
por: Zhou, Enshen, et al.
Publicado: (2025)
por: Zhou, Enshen, et al.
Publicado: (2025)
From Language to Locomotion: Retargeting-free Humanoid Control via Motion Latent Guidance
por: Li, Zhe, et al.
Publicado: (2025)
por: Li, Zhe, et al.
Publicado: (2025)
OmniSAT: Compact Action Token, Faster Auto Regression
por: Lyu, Huaihai, et al.
Publicado: (2025)
por: Lyu, Huaihai, et al.
Publicado: (2025)
SpikePingpong: Spike Vision-based Fast-Slow Pingpong Robot System
por: Wang, Hao, et al.
Publicado: (2025)
por: Wang, Hao, et al.
Publicado: (2025)
Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain
por: Luo, Yulin, et al.
Publicado: (2025)
por: Luo, Yulin, et al.
Publicado: (2025)
EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos
por: Yang, Ruihan, et al.
Publicado: (2025)
por: Yang, Ruihan, et al.
Publicado: (2025)
PIGEON: VLM-Driven Object Navigation via Points of Interest Selection
por: Peng, Cheng, et al.
Publicado: (2025)
por: Peng, Cheng, et al.
Publicado: (2025)
MAPLE: Encoding Dexterous Robotic Manipulation Priors Learned From Egocentric Videos
por: Gavryushin, Alexey, et al.
Publicado: (2025)
por: Gavryushin, Alexey, et al.
Publicado: (2025)
PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks
por: Zhang, Jiazhao, et al.
Publicado: (2024)
por: Zhang, Jiazhao, et al.
Publicado: (2024)
UniHM: Unified Dexterous Hand Manipulation with Vision Language Model
por: Zhang, Zhenhao, et al.
Publicado: (2026)
por: Zhang, Zhenhao, et al.
Publicado: (2026)
DexVLG: Dexterous Vision-Language-Grasp Model at Scale
por: He, Jiawei, et al.
Publicado: (2025)
por: He, Jiawei, et al.
Publicado: (2025)
MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation
por: Zhang, Lingfeng, et al.
Publicado: (2025)
por: Zhang, Lingfeng, et al.
Publicado: (2025)
Structural Action Transformer for 3D Dexterous Manipulation
por: Lei, Xiaohan, et al.
Publicado: (2026)
por: Lei, Xiaohan, et al.
Publicado: (2026)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
por: Wen, Junjie, et al.
Publicado: (2025)
por: Wen, Junjie, et al.
Publicado: (2025)
Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation
por: Tan, Huajie, et al.
Publicado: (2026)
por: Tan, Huajie, et al.
Publicado: (2026)
BLaDA: Bridging Language to Functional Dexterous Actions within 3DGS Fields
por: Yang, Fan, et al.
Publicado: (2026)
por: Yang, Fan, et al.
Publicado: (2026)
Unified Vision-Language-Action Model
por: Wang, Yuqi, et al.
Publicado: (2025)
por: Wang, Yuqi, et al.
Publicado: (2025)
GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning
por: Ma, Guoqing, et al.
Publicado: (2026)
por: Ma, Guoqing, et al.
Publicado: (2026)
AffordGrasp: In-Context Affordance Reasoning for Open-Vocabulary Task-Oriented Grasping in Clutter
por: Tang, Yingbo, et al.
Publicado: (2025)
por: Tang, Yingbo, et al.
Publicado: (2025)
Robo-Dopamine: General Process Reward Modeling for High-Precision Robotic Manipulation
por: Tan, Huajie, et al.
Publicado: (2025)
por: Tan, Huajie, et al.
Publicado: (2025)
Interactive Post-Training for Vision-Language-Action Models
por: Tan, Shuhan, et al.
Publicado: (2025)
por: Tan, Shuhan, et al.
Publicado: (2025)
HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
por: Liu, Jiaming, et al.
Publicado: (2025)
por: Liu, Jiaming, et al.
Publicado: (2025)
Seeing Realism from Simulation: Efficient Video Transfer for Vision-Language-Action Data Augmentation
por: Hui, Chenyu, et al.
Publicado: (2026)
por: Hui, Chenyu, et al.
Publicado: (2026)
OpenEgo: A Large-Scale Multimodal Egocentric Dataset for Dexterous Manipulation
por: Jawaid, Ahad, et al.
Publicado: (2025)
por: Jawaid, Ahad, et al.
Publicado: (2025)
EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video
por: Hoque, Ryan, et al.
Publicado: (2025)
por: Hoque, Ryan, et al.
Publicado: (2025)
AnyTouch 2: General Optical Tactile Representation Learning For Dynamic Tactile Perception
por: Feng, Ruoxuan, et al.
Publicado: (2026)
por: Feng, Ruoxuan, et al.
Publicado: (2026)
DexHiL: A Human-in-the-Loop Framework for Vision-Language-Action Model Post-Training in Dexterous Manipulation
por: Han, Yifan, et al.
Publicado: (2026)
por: Han, Yifan, et al.
Publicado: (2026)
LLaDA-VLA: Vision Language Diffusion Action Models
por: Wen, Yuqing, et al.
Publicado: (2025)
por: Wen, Yuqing, et al.
Publicado: (2025)
CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
por: Li, Hao, et al.
Publicado: (2025)
por: Li, Hao, et al.
Publicado: (2025)
VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models
por: Zhang, Borong, et al.
Publicado: (2025)
por: Zhang, Borong, et al.
Publicado: (2025)
Dexora: Open-source VLA for High-DoF Bimanual Dexterity
por: Zhang, Zongzheng, et al.
Publicado: (2026)
por: Zhang, Zongzheng, et al.
Publicado: (2026)
$NavA^3$: Understanding Any Instruction, Navigating Anywhere, Finding Anything
por: Zhang, Lingfeng, et al.
Publicado: (2025)
por: Zhang, Lingfeng, et al.
Publicado: (2025)
CordViP: Correspondence-based Visuomotor Policy for Dexterous Manipulation in Real-World
por: Fu, Yankai, et al.
Publicado: (2025)
por: Fu, Yankai, et al.
Publicado: (2025)
Ejemplares similares
-
AoE: Always-on Egocentric Human Video Collection for Embodied AI
por: Yang, Bowen, et al.
Publicado: (2026) -
SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics
por: Liu, Mengzhen, et al.
Publicado: (2026) -
TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics
por: Han, Yi, et al.
Publicado: (2025) -
Reshaping Action Error Distributions for Reliable Vision-Language-Action Models
por: Bai, Shuanghao, et al.
Publicado: (2026) -
RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
por: Zhou, Enshen, et al.
Publicado: (2025)