Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lin, Tao, Du, Yuxin, Liu, Jiting, Zhu, Nuobei, Li, Yunhe, Fu, Yuqian, Chen, Yinxinyu, Cai, Hongyi, Ye, Zewei, Cheng, Bing, Ye, Kai, Mao, Yiran, Zhong, Yilei, Dong, MingKang, Yan, Junchi, Li, Gen, Zhao, Bo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment
par: Lin, Tao, et autres
Publié: (2025)
par: Lin, Tao, et autres
Publié: (2025)
Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding
par: Lin, Tao, et autres
Publié: (2025)
par: Lin, Tao, et autres
Publié: (2025)
Focusable Monocular Depth Estimation
par: Du, Yuxin, et autres
Publié: (2026)
par: Du, Yuxin, et autres
Publié: (2026)
EndoDepthL: Lightweight Endoscopic Monocular Depth Estimation with CNN-Transformer
par: Li, Yangke
Publié: (2023)
par: Li, Yangke
Publié: (2023)
DepthCache: Depth-Guided Training-Free Visual Token Merging for Vision-Language-Action Model Inference
par: Li, Yuquan, et autres
Publié: (2026)
par: Li, Yuquan, et autres
Publié: (2026)
Deep Neighbor Layer Aggregation for Lightweight Self-Supervised Monocular Depth Estimation
par: Boya, Wang, et autres
Publié: (2023)
par: Boya, Wang, et autres
Publié: (2023)
A Depth Control Method for Full Ocean Depth AUV
par: Yueming Li, et autres
Publié: (2026)
par: Yueming Li, et autres
Publié: (2026)
Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control
par: Li, Bingliang, et autres
Publié: (2024)
par: Li, Bingliang, et autres
Publié: (2024)
DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning
par: Yuan, Tianyuan, et autres
Publié: (2025)
par: Yuan, Tianyuan, et autres
Publié: (2025)
OpenDlign: Open-World Point Cloud Understanding with Depth-Aligned Images
par: Mao, Ye, et autres
Publié: (2024)
par: Mao, Ye, et autres
Publié: (2024)
QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models
par: Li, Yixuan, et autres
Publié: (2025)
par: Li, Yixuan, et autres
Publié: (2025)
Smaller Depth-2 Linear Circuits for Disjointness Matrices
par: Ye, Lixi
Publié: (2026)
par: Ye, Lixi
Publié: (2026)
DepthCues: Evaluating Monocular Depth Perception in Large Vision Models
par: Danier, Duolikun, et autres
Publié: (2024)
par: Danier, Duolikun, et autres
Publié: (2024)
TacoDepth: Towards Efficient Radar-Camera Depth Estimation with One-stage Fusion
par: Wang, Yiran, et autres
Publié: (2025)
par: Wang, Yiran, et autres
Publié: (2025)
DepthLM: Metric Depth From Vision Language Models
par: Cai, Zhipeng, et autres
Publié: (2025)
par: Cai, Zhipeng, et autres
Publié: (2025)
DepthPolyp: Pseudo-Depth Guided Lightweight Segmentation for Real-Time Colonoscopy
par: Wu, Zhuoyu, et autres
Publié: (2026)
par: Wu, Zhuoyu, et autres
Publié: (2026)
DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving
par: Yang, Zhenjie, et autres
Publié: (2025)
par: Yang, Zhenjie, et autres
Publié: (2025)
Universal YOCO for Efficient Depth Scaling
par: Sun, Yutao, et autres
Publié: (2026)
par: Sun, Yutao, et autres
Publié: (2026)
BenchDepth: Are We on the Right Way to Evaluate Depth Foundation Models?
par: Li, Zhenyu, et autres
Publié: (2025)
par: Li, Zhenyu, et autres
Publié: (2025)
RoboFAC: A Comprehensive Framework for Robotic Failure Analysis and Correction
par: Ye, Zewei, et autres
Publié: (2025)
par: Ye, Zewei, et autres
Publié: (2025)
Depth-guided Texture Diffusion for Image Semantic Segmentation
par: Sun, Wei, et autres
Publié: (2024)
par: Sun, Wei, et autres
Publié: (2024)
In‐Depth Structural Analysis of a Stapled Pentapeptide and Its Assembly Into Straight α‐Helices
par: Jianbo Liu, et autres
Publié: (2024)
par: Jianbo Liu, et autres
Publié: (2024)
UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models
par: Govind, Manish Kumar, et autres
Publié: (2026)
par: Govind, Manish Kumar, et autres
Publié: (2026)
EvoVLA: Self-Evolving Vision-Language-Action Model
par: Liu, Zeting, et autres
Publié: (2025)
par: Liu, Zeting, et autres
Publié: (2025)
EvoTaxo: Building and Evolving Taxonomy from Social Media Streams
par: Li, Yiyang, et autres
Publié: (2026)
par: Li, Yiyang, et autres
Publié: (2026)
PuriLight: A Lightweight Shuffle and Purification Framework for Monocular Depth Estimation
par: Chen, Yujie, et autres
Publié: (2026)
par: Chen, Yujie, et autres
Publié: (2026)
DEAR: Depth-Enhanced Action Recognition
par: Rahmaniboldaji, Sadegh, et autres
Publié: (2024)
par: Rahmaniboldaji, Sadegh, et autres
Publié: (2024)
Sewer Image Super-Resolution with Depth Priors and Its Lightweight Network
par: Pan, Gang, et autres
Publié: (2024)
par: Pan, Gang, et autres
Publié: (2024)
Learning Spatial Decay for Vision Transformers
par: Mao, Yuxin, et autres
Publié: (2025)
par: Mao, Yuxin, et autres
Publié: (2025)
Self-Distilled Depth Refinement with Noisy Poisson Fusion
par: Li, Jiaqi, et autres
Publié: (2024)
par: Li, Jiaqi, et autres
Publié: (2024)
Bridge the Cosmological Tensions with Thawing Gravity
par: Ye, Gen
Publié: (2024)
par: Ye, Gen
Publié: (2024)
StereoAdapter-2: Globally Structure-Consistent Underwater Stereo Depth Estimation
par: Ren, Zeyu, et autres
Publié: (2026)
par: Ren, Zeyu, et autres
Publié: (2026)
Depth-Weighted Detection of Behaviours of Risk in People with Dementia using Cameras
par: Mishra, Pratik K., et autres
Publié: (2024)
par: Mishra, Pratik K., et autres
Publié: (2024)
Bench2Drive-VL: Benchmarks for Closed-Loop Autonomous Driving with Vision-Language Models
par: Jia, Xiaosong, et autres
Publié: (2026)
par: Jia, Xiaosong, et autres
Publié: (2026)
DeepSight: Bridging Depth Maps and Language with a Depth-Driven Multimodal Model
par: Yang, Hao, et autres
Publié: (2026)
par: Yang, Hao, et autres
Publié: (2026)
In‐Depth Structural Analysis of a Stapled Pentapeptide and Its Assembly Into Straight α‐Helices (Small 4/2025)
par: Jianbo Liu, et autres
Publié: (2025)
par: Jianbo Liu, et autres
Publié: (2025)
Mixture-of-Depths Attention
par: Zhu, Lianghui, et autres
Publié: (2026)
par: Zhu, Lianghui, et autres
Publié: (2026)
Depth Any Panoramas: A Foundation Model for Panoramic Depth Estimation
par: Lin, Xin, et autres
Publié: (2025)
par: Lin, Xin, et autres
Publié: (2025)
Toward Accurate Camera-based 3D Object Detection via Cascade Depth Estimation and Calibration
par: Wang, Chaoqun, et autres
Publié: (2024)
par: Wang, Chaoqun, et autres
Publié: (2024)
Depth as Points: Center Point-based Depth Estimation
par: Tu, Zhiheng, et autres
Publié: (2025)
par: Tu, Zhiheng, et autres
Publié: (2025)
Documents similaires
-
Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment
par: Lin, Tao, et autres
Publié: (2025) -
Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding
par: Lin, Tao, et autres
Publié: (2025) -
Focusable Monocular Depth Estimation
par: Du, Yuxin, et autres
Publié: (2026) -
EndoDepthL: Lightweight Endoscopic Monocular Depth Estimation with CNN-Transformer
par: Li, Yangke
Publié: (2023) -
DepthCache: Depth-Guided Training-Free Visual Token Merging for Vision-Language-Action Model Inference
par: Li, Yuquan, et autres
Publié: (2026)