Vision-Language-Action (VLA) Models: Concepts, Progress, Applications and Challenges
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sapkota, Ranjan, Cao, Yang, Roumeliotis, Konstantinos I., Karkee, Manoj |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The SAM2-to-SAM3 Gap in the Segment Anything Model Family: Why Prompt-Based Expertise Fails in Concept-Driven Image Segmentation
par: Sapkota, Ranjan, et autres
Publié: (2025)
par: Sapkota, Ranjan, et autres
Publié: (2025)
A Review of 3D Object Detection with Vision-Language Models
par: Sapkota, Ranjan, et autres
Publié: (2025)
par: Sapkota, Ranjan, et autres
Publié: (2025)
Generalization vs. Specialization: Evaluating Segment Anything Model (SAM3) Zero-Shot Segmentation Against Fine-Tuned YOLO Detectors
par: Sapkota, Ranjan, et autres
Publié: (2025)
par: Sapkota, Ranjan, et autres
Publié: (2025)
Object Detection with Multimodal Large Vision-Language Models: An In-depth Review
par: Sapkota, Ranjan, et autres
Publié: (2025)
par: Sapkota, Ranjan, et autres
Publié: (2025)
Plant Disease Detection through Multimodal Large Language Models and Convolutional Neural Networks
par: Roumeliotis, Konstantinos I., et autres
Publié: (2025)
par: Roumeliotis, Konstantinos I., et autres
Publié: (2025)
Generative AI in Agriculture: Creating Image Datasets Using DALL.E's Advanced Large Language Model Capabilities
par: Sapkota, Ranjan, et autres
Publié: (2023)
par: Sapkota, Ranjan, et autres
Publié: (2023)
YOLO11 and Vision Transformers based 3D Pose Estimation of Immature Green Fruits in Commercial Apple Orchards for Robotic Thinning
par: Sapkota, Ranjan, et autres
Publié: (2024)
par: Sapkota, Ranjan, et autres
Publié: (2024)
Ultralytics YOLO Evolution: An Overview of YOLO26, YOLO11, YOLOv8 and YOLOv5 Object Detectors for Computer Vision and Pattern Recognition
par: Sapkota, Ranjan, et autres
Publié: (2025)
par: Sapkota, Ranjan, et autres
Publié: (2025)
Comparing YOLOv11 and YOLOv8 for instance segmentation of occluded and non-occluded immature green fruits in complex orchard environment
par: Sapkota, Ranjan, et autres
Publié: (2024)
par: Sapkota, Ranjan, et autres
Publié: (2024)
YOLOE-26: Integrating YOLO26 with YOLOE for Real-Time Open-Vocabulary Instance Segmentation
par: Sapkota, Ranjan, et autres
Publié: (2026)
par: Sapkota, Ranjan, et autres
Publié: (2026)
Integrating YOLO11 and Convolution Block Attention Module for Multi-Season Segmentation of Tree Trunks and Branches in Commercial Apple Orchards
par: Sapkota, Ranjan, et autres
Publié: (2024)
par: Sapkota, Ranjan, et autres
Publié: (2024)
Improved YOLOv12 with LLM-Generated Synthetic Data for Enhanced Apple Detection and Benchmarking Against YOLOv11 and YOLOv10
par: Sapkota, Ranjan, et autres
Publié: (2025)
par: Sapkota, Ranjan, et autres
Publié: (2025)
Comparing YOLOv8 and Mask R-CNN for instance segmentation in complex orchard environments
par: Sapkota, Ranjan, et autres
Publié: (2023)
par: Sapkota, Ranjan, et autres
Publié: (2023)
Zero-Shot Automatic Annotation and Instance Segmentation using LLM-Generated Datasets: Eliminating Field Imaging and Manual Annotation for Deep Learning Model Development
par: Sapkota, Ranjan, et autres
Publié: (2024)
par: Sapkota, Ranjan, et autres
Publié: (2024)
Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey
par: Sapkota, Ranjan, et autres
Publié: (2025)
par: Sapkota, Ranjan, et autres
Publié: (2025)
Immature Green Apple Detection and Sizing in Commercial Orchards using YOLOv8 and Shape Fitting Techniques
par: Sapkota, Ranjan, et autres
Publié: (2023)
par: Sapkota, Ranjan, et autres
Publié: (2023)
AI Agents vs. Agentic AI: A Conceptual Taxonomy, Applications and Challenges
par: Sapkota, Ranjan, et autres
Publié: (2025)
par: Sapkota, Ranjan, et autres
Publié: (2025)
RF-DETR Object Detection vs YOLOv12 : A Study of Transformer-based and CNN-based Architectures for Single-Class and Multi-Class Greenfruit Detection in Complex Orchard Environments Under Label Ambiguity
par: Sapkota, Ranjan, et autres
Publié: (2025)
par: Sapkota, Ranjan, et autres
Publié: (2025)
YOLO26: Key Architectural Enhancements and Performance Benchmarking for Real-Time Object Detection
par: Sapkota, Ranjan, et autres
Publié: (2025)
par: Sapkota, Ranjan, et autres
Publié: (2025)
Vibe Coding vs. Agentic Coding: Fundamentals and Practical Implications of Agentic AI
par: Sapkota, Ranjan, et autres
Publié: (2025)
par: Sapkota, Ranjan, et autres
Publié: (2025)
3D Reconstruction and Information Fusion between Dormant and Canopy Seasons in Commercial Orchards Using Deep Learning and Fast GICP
par: Sapkota, Ranjan, et autres
Publié: (2025)
par: Sapkota, Ranjan, et autres
Publié: (2025)
VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
par: Ranjan, Ravi, et autres
Publié: (2026)
par: Ranjan, Ravi, et autres
Publié: (2026)
UAVs Meet Agentic AI: A Multidomain Survey of Autonomous Aerial Intelligence and Agentic UAVs
par: Sapkota, Ranjan, et autres
Publié: (2025)
par: Sapkota, Ranjan, et autres
Publié: (2025)
Comprehensive Performance Evaluation of YOLOv12, YOLO11, YOLOv10, YOLOv9 and YOLOv8 on Detecting and Counting Fruitlet in Complex Orchard Environments
par: Sapkota, Ranjan, et autres
Publié: (2024)
par: Sapkota, Ranjan, et autres
Publié: (2024)
ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models
par: Darabi, Nastaran, et autres
Publié: (2026)
par: Darabi, Nastaran, et autres
Publié: (2026)
EvoVLA: Self-Evolving Vision-Language-Action Model
par: Liu, Zeting, et autres
Publié: (2025)
par: Liu, Zeting, et autres
Publié: (2025)
Agentic AI with Orchestrator-Agent Trust: A Modular Visual Classification Framework with Trust-Aware Orchestration and RAG-Based Reasoning
par: Roumeliotis, Konstantinos I., et autres
Publié: (2025)
par: Roumeliotis, Konstantinos I., et autres
Publié: (2025)
QuoVLA: Quotient Space for Vision-Language-Action Models
par: Wang, Xuan, et autres
Publié: (2026)
par: Wang, Xuan, et autres
Publié: (2026)
FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models
par: Wang, Xin, et autres
Publié: (2025)
par: Wang, Xin, et autres
Publié: (2025)
QUAR-VLA: Vision-Language-Action Model for Quadruped Robots
par: Ding, Pengxiang, et autres
Publié: (2023)
par: Ding, Pengxiang, et autres
Publié: (2023)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
par: Li, Qiwei, et autres
Publié: (2026)
par: Li, Qiwei, et autres
Publié: (2026)
EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
par: Yang, Yantai, et autres
Publié: (2025)
par: Yang, Yantai, et autres
Publié: (2025)
VITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert Distillation
par: Dong, Shaoqi, et autres
Publié: (2025)
par: Dong, Shaoqi, et autres
Publié: (2025)
LLaDA-VLA: Vision Language Diffusion Action Models
par: Wen, Yuqing, et autres
Publié: (2025)
par: Wen, Yuqing, et autres
Publié: (2025)
PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
par: Liang, Wenqi, et autres
Publié: (2025)
par: Liang, Wenqi, et autres
Publié: (2025)
Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models
par: Chi, Haohan, et autres
Publié: (2025)
par: Chi, Haohan, et autres
Publié: (2025)
SpanVLA: Efficient Action Bridging and Learning from Negative-Recovery Samples for Vision-Language-Action Model
par: Zhou, Zewei, et autres
Publié: (2026)
par: Zhou, Zewei, et autres
Publié: (2026)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
par: Wen, Junjie, et autres
Publié: (2025)
par: Wen, Junjie, et autres
Publié: (2025)
VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models
par: Zhang, Borong, et autres
Publié: (2025)
par: Zhang, Borong, et autres
Publié: (2025)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
par: Zhang, Jianke, et autres
Publié: (2026)
par: Zhang, Jianke, et autres
Publié: (2026)
Documents similaires
-
The SAM2-to-SAM3 Gap in the Segment Anything Model Family: Why Prompt-Based Expertise Fails in Concept-Driven Image Segmentation
par: Sapkota, Ranjan, et autres
Publié: (2025) -
A Review of 3D Object Detection with Vision-Language Models
par: Sapkota, Ranjan, et autres
Publié: (2025) -
Generalization vs. Specialization: Evaluating Segment Anything Model (SAM3) Zero-Shot Segmentation Against Fine-Tuned YOLO Detectors
par: Sapkota, Ranjan, et autres
Publié: (2025) -
Object Detection with Multimodal Large Vision-Language Models: An In-depth Review
par: Sapkota, Ranjan, et autres
Publié: (2025) -
Plant Disease Detection through Multimodal Large Language Models and Convolutional Neural Networks
par: Roumeliotis, Konstantinos I., et autres
Publié: (2025)