CRAVES: Controlling Robotic Arm with a Vision-based Economic System
Fuente:
arXiv
Salvato in:
| Autori principali: | Zuo, Yiming, Qiu, Weichao, Xie, Lingxi, Zhong, Fangwei, Wang, Yizhou, Yuille, Alan L. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2018
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Computer Vision and Its Relationship to Cognitive Science: A perspective from Bayes Decision Theory
di: Yuille, Alan, et al.
Pubblicazione: (2026)
di: Yuille, Alan, et al.
Pubblicazione: (2026)
Study on Aspect Ratio Variability toward Robustness of Vision Transformer-based Vehicle Re-identification
di: Qiu, Mei, et al.
Pubblicazione: (2024)
di: Qiu, Mei, et al.
Pubblicazione: (2024)
SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference
di: Wang, Feng, et al.
Pubblicazione: (2023)
di: Wang, Feng, et al.
Pubblicazione: (2023)
Clinical Inspired MRI Lesion Segmentation
di: Yan, Lijun, et al.
Pubblicazione: (2025)
di: Yan, Lijun, et al.
Pubblicazione: (2025)
SPFormer: Enhancing Vision Transformer with Superpixel Representation
di: Mei, Jieru, et al.
Pubblicazione: (2024)
di: Mei, Jieru, et al.
Pubblicazione: (2024)
LychSim: A Controllable and Interactive Simulation Framework for Vision Research
di: Ma, Wufei, et al.
Pubblicazione: (2026)
di: Ma, Wufei, et al.
Pubblicazione: (2026)
VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models
di: Wu, Kui, et al.
Pubblicazione: (2025)
di: Wu, Kui, et al.
Pubblicazione: (2025)
ViT-5: Vision Transformers for The Mid-2020s
di: Wang, Feng, et al.
Pubblicazione: (2026)
di: Wang, Feng, et al.
Pubblicazione: (2026)
From Pixels to Objects: A Hierarchical Approach for Part and Object Segmentation Using Local and Global Aggregation
di: Xie, Yunfei, et al.
Pubblicazione: (2024)
di: Xie, Yunfei, et al.
Pubblicazione: (2024)
Hierarchical Instruction-aware Embodied Visual Tracking
di: Wu, Kui, et al.
Pubblicazione: (2025)
di: Wu, Kui, et al.
Pubblicazione: (2025)
ViTamin: Designing Scalable Vision Models in the Vision-Language Era
di: Chen, Jieneng, et al.
Pubblicazione: (2024)
di: Chen, Jieneng, et al.
Pubblicazione: (2024)
LLM Enhanced Action Recognition via Hierarchical Global-Local Skeleton-Language Model
di: Wang, Ruosi, et al.
Pubblicazione: (2026)
di: Wang, Ruosi, et al.
Pubblicazione: (2026)
PaLM2-VAdapter: Progressively Aligned Language Model Makes a Strong Vision-language Adapter
di: Xiao, Junfei, et al.
Pubblicazione: (2024)
di: Xiao, Junfei, et al.
Pubblicazione: (2024)
Dictionary-based Framework for Interpretable and Consistent Object Parsing
di: Zhang, Tiezheng, et al.
Pubblicazione: (2025)
di: Zhang, Tiezheng, et al.
Pubblicazione: (2025)
Mamba-R: Vision Mamba ALSO Needs Registers
di: Wang, Feng, et al.
Pubblicazione: (2024)
di: Wang, Feng, et al.
Pubblicazione: (2024)
Beyond Masks: The Case for Medical Image Parsing
di: Gupta, Siddharth, et al.
Pubblicazione: (2026)
di: Gupta, Siddharth, et al.
Pubblicazione: (2026)
MulSMo: Multimodal Stylized Motion Generation by Bidirectional Control Flow
di: Li, Zhe, et al.
Pubblicazione: (2024)
di: Li, Zhe, et al.
Pubblicazione: (2024)
ReVision: Refining Video Diffusion with Explicit 3D Motion Modeling
di: Liu, Qihao, et al.
Pubblicazione: (2025)
di: Liu, Qihao, et al.
Pubblicazione: (2025)
Adventurer: Optimizing Vision Mamba Architecture Designs for Efficiency
di: Wang, Feng, et al.
Pubblicazione: (2024)
di: Wang, Feng, et al.
Pubblicazione: (2024)
Gaussian Scenes: Pose-Free Sparse-View Scene Reconstruction using Depth-Enhanced Diffusion Priors
di: Paul, Soumava, et al.
Pubblicazione: (2024)
di: Paul, Soumava, et al.
Pubblicazione: (2024)
Can These Views Be One Scene? Evaluating Multiview 3D Consistency when 3D Foundation Models Hallucinate
di: Paul, Soumava, et al.
Pubblicazione: (2026)
di: Paul, Soumava, et al.
Pubblicazione: (2026)
Quality Sentinel: Estimating Label Quality and Errors in Medical Segmentation Datasets
di: Chen, Yixiong, et al.
Pubblicazione: (2024)
di: Chen, Yixiong, et al.
Pubblicazione: (2024)
Adaptive Aspect Ratios with Patch-Mixup-ViT-based Vehicle ReID
di: Qiu, Mei, et al.
Pubblicazione: (2024)
di: Qiu, Mei, et al.
Pubblicazione: (2024)
Autoregressive Pretraining with Mamba in Vision
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding
di: Qiu, Jihao, et al.
Pubblicazione: (2026)
di: Qiu, Jihao, et al.
Pubblicazione: (2026)
TriDiff-4D: Fast 4D Generation through Diffusion-based Triplane Re-posing
di: Sheung, Eddie Pokming, et al.
Pubblicazione: (2025)
di: Sheung, Eddie Pokming, et al.
Pubblicazione: (2025)
Vision-Language-Vision Auto-Encoder: Scalable Knowledge Distillation from Diffusion Models
di: Zhang, Tiezheng, et al.
Pubblicazione: (2025)
di: Zhang, Tiezheng, et al.
Pubblicazione: (2025)
RNN as Linear Transformer: A Closer Investigation into Representational Potentials of Visual Mamba Models
di: Yang, Timing, et al.
Pubblicazione: (2025)
di: Yang, Timing, et al.
Pubblicazione: (2025)
ViMix-14M: A Curated Multi-Source Video-Text Dataset with Long-Form, High-Quality Captions and Crawl-Free Access
di: Yang, Timing, et al.
Pubblicazione: (2025)
di: Yang, Timing, et al.
Pubblicazione: (2025)
ExoViP: Step-by-step Verification and Exploration with Exoskeleton Modules for Compositional Visual Reasoning
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
AnyTeleop: A General Vision-Based Dexterous Robot Arm-Hand Teleoperation System
di: Qin, Yuzhe, et al.
Pubblicazione: (2023)
di: Qin, Yuzhe, et al.
Pubblicazione: (2023)
M-VAR: Decoupled Scale-wise Autoregressive Modeling for High-Quality Image Generation
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
Rejuvenating image-GPT as Strong Visual Representation Learners
di: Ren, Sucheng, et al.
Pubblicazione: (2023)
di: Ren, Sucheng, et al.
Pubblicazione: (2023)
UnrealZoo: Enriching Photo-realistic Virtual Worlds for Embodied AI
di: Zhong, Fangwei, et al.
Pubblicazione: (2024)
di: Zhong, Fangwei, et al.
Pubblicazione: (2024)
Medical Vision Generalist: Unifying Medical Imaging Tasks in Context
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
Large-Scale Label Quality Assessment for Medical Segmentation via a Vision-Language Judge and Synthetic Data
di: Chen, Yixiong, et al.
Pubblicazione: (2026)
di: Chen, Yixiong, et al.
Pubblicazione: (2026)
A Vision-Based Shared-Control Teleoperation Scheme for Controlling the Robotic Arm of a Four-Legged Robot
di: da Silva, Murilo Vinicius, et al.
Pubblicazione: (2025)
di: da Silva, Murilo Vinicius, et al.
Pubblicazione: (2025)
Towards Foundation Models for 3D Vision: How Close Are We?
di: Zuo, Yiming, et al.
Pubblicazione: (2024)
di: Zuo, Yiming, et al.
Pubblicazione: (2024)
GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models
di: Guan, Yaohan, et al.
Pubblicazione: (2026)
di: Guan, Yaohan, et al.
Pubblicazione: (2026)
Localization vs. Semantics: Visual Representations in Unimodal and Multimodal Models
di: Li, Zhuowan, et al.
Pubblicazione: (2022)
di: Li, Zhuowan, et al.
Pubblicazione: (2022)
Documenti analoghi
-
Computer Vision and Its Relationship to Cognitive Science: A perspective from Bayes Decision Theory
di: Yuille, Alan, et al.
Pubblicazione: (2026) -
Study on Aspect Ratio Variability toward Robustness of Vision Transformer-based Vehicle Re-identification
di: Qiu, Mei, et al.
Pubblicazione: (2024) -
SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference
di: Wang, Feng, et al.
Pubblicazione: (2023) -
Clinical Inspired MRI Lesion Segmentation
di: Yan, Lijun, et al.
Pubblicazione: (2025) -
SPFormer: Enhancing Vision Transformer with Superpixel Representation
di: Mei, Jieru, et al.
Pubblicazione: (2024)