D2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied AI
Fuente:
arXiv
Guardado en:
| Autores principales: | Choi, Suhwan, Jung, Jaeyoon, Seong, Haebin, Kim, Minchan, Kim, Minyeong, Cho, Yongjun, Kim, Yoonshik, Park, Yubeen, Yu, Youngjae, Lee, Yunsung |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CostNav: A Navigation Benchmark for Real-World Economic-Cost Evaluation of Physical AI Agents
por: Seong, Haebin, et al.
Publicado: (2025)
por: Seong, Haebin, et al.
Publicado: (2025)
CANVAS: Commonsense-Aware Navigation System for Intuitive Human-Robot Interaction
por: Choi, Suhwan, et al.
Publicado: (2024)
por: Choi, Suhwan, et al.
Publicado: (2024)
KOFFVQA: An Objectively Evaluated Free-form VQA Benchmark for Large Vision-Language Models in the Korean Language
por: Kim, Yoonshik, et al.
Publicado: (2025)
por: Kim, Yoonshik, et al.
Publicado: (2025)
vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models
por: Choi, Suhwan, et al.
Publicado: (2026)
por: Choi, Suhwan, et al.
Publicado: (2026)
ESREAL: Exploiting Semantic Reconstruction to Mitigate Hallucinations in Vision-Language Models
por: Kim, Minchan, et al.
Publicado: (2024)
por: Kim, Minchan, et al.
Publicado: (2024)
BiC-MPPI: Goal-Pursuing, Sampling-Based Bidirectional Rollout Clustering Path Integral for Trajectory Optimization
por: Jung, Minchan, et al.
Publicado: (2024)
por: Jung, Minchan, et al.
Publicado: (2024)
MuNES: Multifloor Navigation Including Elevators and Stairs
por: Jung, Donghwi, et al.
Publicado: (2024)
por: Jung, Donghwi, et al.
Publicado: (2024)
Temporal Action Representation Learning for Tactical Resource Control and Subsequent Maneuver Generation
por: Jung, Hoseong, et al.
Publicado: (2026)
por: Jung, Hoseong, et al.
Publicado: (2026)
Dynamic Policy Learning for Legged Robot with Simplified Model Pretraining and Model Homotopy Transfer
por: Kang, Dongyun, et al.
Publicado: (2025)
por: Kang, Dongyun, et al.
Publicado: (2025)
Multi-Modal Grounded Planning and Efficient Replanning For Learning Embodied Agents with A Few Examples
por: Kim, Taewoong, et al.
Publicado: (2024)
por: Kim, Taewoong, et al.
Publicado: (2024)
Context-Aware Planning and Environment-Aware Memory for Instruction Following Embodied Agents
por: Kim, Byeonghwi, et al.
Publicado: (2023)
por: Kim, Byeonghwi, et al.
Publicado: (2023)
Action Deviation-Aware Inference for Low-Latency Wireless Robots
por: Park, Jeyoung, et al.
Publicado: (2025)
por: Park, Jeyoung, et al.
Publicado: (2025)
ReALFRED: An Embodied Instruction Following Benchmark in Photo-Realistic Environments
por: Kim, Taewoong, et al.
Publicado: (2024)
por: Kim, Taewoong, et al.
Publicado: (2024)
Pretrained Vision-Language-Action Models are Surprisingly Resistant to Forgetting in Continual Learning
por: Liu, Huihan, et al.
Publicado: (2026)
por: Liu, Huihan, et al.
Publicado: (2026)
Explainable Adversarial-Robust Vision-Language-Action Model for Robotic Manipulation
por: Kim, Ju-Young, et al.
Publicado: (2025)
por: Kim, Ju-Young, et al.
Publicado: (2025)
RetoVLA: Reusing Register Tokens for Spatial Reasoning in Vision-Language-Action Models
por: Koo, Jiyeon, et al.
Publicado: (2025)
por: Koo, Jiyeon, et al.
Publicado: (2025)
Test-Time Training for Visual Foresight Vision-Language-Action Models
por: Park, Sangwu, et al.
Publicado: (2026)
por: Park, Sangwu, et al.
Publicado: (2026)
Hallucination-Aware Generative Pretrained Transformer for Cooperative Aerial Mobility Control
por: Ahn, Hyojun, et al.
Publicado: (2025)
por: Ahn, Hyojun, et al.
Publicado: (2025)
GOTPR: General Outdoor Text-based Place Recognition Using Scene Graph Retrieval with OpenStreetMap
por: Jung, Donghwi, et al.
Publicado: (2025)
por: Jung, Donghwi, et al.
Publicado: (2025)
VCA: Vision-Click-Action Framework for Precise Manipulation of Segmented Objects in Target Ambiguous Environments
por: Kim, Donggeon, et al.
Publicado: (2026)
por: Kim, Donggeon, et al.
Publicado: (2026)
Systematic Vulnerability Audit of Post-Hoc XAI under Common Corruptions: A Factor Analysis Across Vision Benchmarks
por: Kim, Minyeong
Publicado: (2026)
por: Kim, Minyeong
Publicado: (2026)
Systematic Vulnerability Audit of Post-Hoc XAI under Common Corruptions: A Factor Analysis Across Vision Benchmarks
por: Kim, Minyeong
Publicado: (2026)
por: Kim, Minyeong
Publicado: (2026)
MEM: Multi-Scale Embodied Memory for Vision Language Action Models
por: Torne, Marcel, et al.
Publicado: (2026)
por: Torne, Marcel, et al.
Publicado: (2026)
No More Potentially Dynamic Objects: Static Point Cloud Map Generation based on 3D Object Detection and Ground Projection
por: Woo, Soojin, et al.
Publicado: (2024)
por: Woo, Soojin, et al.
Publicado: (2024)
3D Operation of Autonomous Excavator based on Reinforcement Learning through Independent Reward for Individual Joints
por: Yoo, Yoonkyu, et al.
Publicado: (2024)
por: Yoo, Yoonkyu, et al.
Publicado: (2024)
HalLoc: Token-level Localization of Hallucinations for Vision Language Models
por: Park, Eunkyu, et al.
Publicado: (2025)
por: Park, Eunkyu, et al.
Publicado: (2025)
Sparse Identification of Nonlinear Dynamics-based Model Predictive Control for Multirotor Collision Avoidance
por: Lee, Jayden Dongwoo, et al.
Publicado: (2024)
por: Lee, Jayden Dongwoo, et al.
Publicado: (2024)
PHASOR: Phase-Anchored Universal Action Representations for Humanoid Embodiments
por: Kim, Kihyun, et al.
Publicado: (2026)
por: Kim, Kihyun, et al.
Publicado: (2026)
DM0: An Embodied-Native Vision-Language-Action Model towards Physical AI
por: Yu, En, et al.
Publicado: (2026)
por: Yu, En, et al.
Publicado: (2026)
Verifier-free Test-Time Sampling for Vision Language Action Models
por: Jang, Suhyeok, et al.
Publicado: (2025)
por: Jang, Suhyeok, et al.
Publicado: (2025)
ACG: Action Coherence Guidance for Flow-based Vision-Language-Action models
por: Park, Minho, et al.
Publicado: (2025)
por: Park, Minho, et al.
Publicado: (2025)
Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics
por: Kim, Dongyoung, et al.
Publicado: (2025)
por: Kim, Dongyoung, et al.
Publicado: (2025)
ReFeree: Radar-based efficient global descriptor using a Feature and Free space for Place Recognition
por: Choi, Byunghee, et al.
Publicado: (2024)
por: Choi, Byunghee, et al.
Publicado: (2024)
mmWave Radar-Based Non-Line-of-Sight Pedestrian Localization at T-Junctions Utilizing Road Layout Extraction via Camera
por: Park, Byeonggyu, et al.
Publicado: (2025)
por: Park, Byeonggyu, et al.
Publicado: (2025)
AnyCamVLA: Zero-Shot Camera Adaptation for Viewpoint Robust Vision-Language-Action Models
por: Heo, Hyeongjun, et al.
Publicado: (2026)
por: Heo, Hyeongjun, et al.
Publicado: (2026)
Efficient Policy Adaptation with Contrastive Prompt Ensemble for Embodied Agents
por: Choi, Wonje, et al.
Publicado: (2024)
por: Choi, Wonje, et al.
Publicado: (2024)
HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy
por: Koo, Myungkyu, et al.
Publicado: (2025)
por: Koo, Myungkyu, et al.
Publicado: (2025)
RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
por: Tai, Cong, et al.
Publicado: (2025)
por: Tai, Cong, et al.
Publicado: (2025)
ReFeree: Radar-Based Lightweight and Robust Localization using Feature and Free space
por: Kim, Hogyun, et al.
Publicado: (2024)
por: Kim, Hogyun, et al.
Publicado: (2024)
A Humanoid Visual-Tactile-Action Dataset for Contact-Rich Manipulation
por: Kwon, Eunju, et al.
Publicado: (2025)
por: Kwon, Eunju, et al.
Publicado: (2025)
Ejemplares similares
-
CostNav: A Navigation Benchmark for Real-World Economic-Cost Evaluation of Physical AI Agents
por: Seong, Haebin, et al.
Publicado: (2025) -
CANVAS: Commonsense-Aware Navigation System for Intuitive Human-Robot Interaction
por: Choi, Suhwan, et al.
Publicado: (2024) -
KOFFVQA: An Objectively Evaluated Free-form VQA Benchmark for Large Vision-Language Models in the Korean Language
por: Kim, Yoonshik, et al.
Publicado: (2025) -
vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models
por: Choi, Suhwan, et al.
Publicado: (2026) -
ESREAL: Exploiting Semantic Reconstruction to Mitigate Hallucinations in Vision-Language Models
por: Kim, Minchan, et al.
Publicado: (2024)